🤖 具身智能 · 商业化观察

拒绝“造电话亭”式作秀:Sharpa 具身机器人入驻 DQ 门店,用 55 步长程任务重构落地标准

在上海吴江路 DQ 冰淇淋店,一台双臂机器人接过了暴风雪冰淇淋制作的最后一棒。在零环境改造的前提下,机器人独立跑完包含“翻腕倒杯不洒”在内的 55 步全流程长程任务,综合成功率达 90%。估值超 200 亿元的神秘具身巨头 Sharpa,正试图用一杯冰淇淋打破行业刷 Demo 的虚假繁荣。

来源:综合公开信息整理 2026-08 全文约 4 分钟读完
#Sharpa #具身智能 #人形机器人 #商业化落地
55 全流程长程任务规划
90% 真实场景实测成功率
200 亿 人民币企业最新估值

⚡ 30 秒速览

  • 落地突破:入驻上海吴江路 DQ 门店,全自动完成取杯、接浆、舀料、搅拌及“倒杯不洒”验货,零人为干预。
  • 硬核背书:适应 DQ 原装进口设备与严格物料,未对场地做任何反光点、贴签或环境减法改造
  • 团队与资本:禾赛科技三位联合创始人二次创业,完成超 45 亿人民币融资,股东涵盖阿里、美团、腾讯、京东等。
  • 行业标杆:旗下 Sharpa Wave 灵巧手(22 自由度、1000+触感单元)已成为英伟达 Isaac GR00T 等顶级实验室的默认终端。
  • 战略终局:以餐饮零售等复杂商业场景积累真实物理交互数据,倒推机器人最终进入家庭。

01打破搬运 Demo 真实场景下的 55 步长程考验

数年以前,机械臂接咖啡、接冰淇淋的演示已屡见不鲜。但大部分展会 Demo 本质上只是简易的“搬运”流水线,仅凭固定轨道的自动化机械臂即可完成,与真正需要感知和决策的 AI 毫无关系。

在 DQ 门店的实际作业中,机器人面对的是极高难度的物理交互链条:

消毒柜取杯圈抽取纸杯接取奶浆舀取配料高速搅拌翻腕倒杯不洒

🧠 55 步长程规划

步骤间存在强依赖关系,一步出错即导致任务终止。

✋ 98% 触觉参与度

依靠 CraftNet 精密触觉与力控算法,感知杯体握力与物料阻力。

🌐 全模态世界模型

结合分层记忆能力,连续精准完成多勺配料添加。

🔄 高度泛化能力

面对不同放置角度与物理扰动,无需重新标注即可自主调整动作。

注:实测成功率 90% 为现场密集连续测试数据;长程任务中任意细节微调(如刮净杯口、翻腕推门)均由系统实时决策生成。

02估值 200 亿的神秘玩家 Sharpa 的硬核底牌

完成这一落地的并非老牌具身厂商,而是成立仅一年多、在公关传播上极为克制的公司——Sharpa

Sharpa 成立于 2024 年底,三位联合创始人李一帆、向少卿、孙恺同时也是激光雷达上市公司禾赛科技的联合创始人。公司目前已完成超 45 亿人民币融资,估值突破 200 亿人民币,投资方涵盖阿里巴巴、美团、腾讯、京东、传音等产业巨头,以及红杉中国、启明创投等顶级机构。

传统 Demo 派路线

剪辑成功镜头、加速视频、环境贴标定位,甚至背后遥操作作秀。

Sharpa 全栈全能路线

手、脑、本体、数据全栈布局,以真实商业场景全流程打通为唯一标准。

其推出的 Sharpa Wave 灵巧手拥有 22 个主动自由度与 1000 多个触感单元,已成为英伟达 Isaac GR00T 参考人形本体的默认套件,在学术界与工业界极具口碑。

“主动频繁地传播融资,会让员工误认为融资才是公司的核心 KPI。而我希望我们的工程师能够感受到,公司会更关注更有意义的事情。我们希望打造一个纯粹的‘工程师乐园’”

—— 李一帆,Sharpa 联合创始人

03为什么选择固执的 DQ?拒绝“造电话亭”式降维

在具身智能行业,绝大多数落地 Demo 会主动为环境做“减法”:贴定位标签、固定货架位置、调整特定灯光亮度。这种改造本质上是因感知能力不足而妥协的产物。

DQ 品牌的设备与物料均要求从美国进口,连勺子颜色都不允许微调。Sharpa 放弃自建理想化实验室,强行接入 DQ 既有环境,正是为了背书其真正的“零改造”泛化能力

“本来我们追求的是一个完全通用的终极目标。如果因为能力不足,需要改造现有环境、工具和工作方法,这本身是在走捷径,是为了落地而落地,也是对泛化能力的一种阉割和妥协。而这种妥协一旦开始,就会一直妥协下去。”

—— 李一帆,Sharpa 联合创始人

🍦 暴风雪全流程交付标准商业化全套考验

  • 人能干的,机器全得能干:55 步流程中只要有 1 步需要人工补位,就没有真正节省人力。
  • 原子任务迁移性:开柜、舀取、搅拌、倾倒等基础动作天生具备高迁移度,便于后续扩展至其他餐饮与零售场景。
评价:避开“造电话亭”式的封闭自嗨,用难度极高的真实环境检验算法刚性。

“在具体场景里,机器人做不到全能,就是无能。”

—— 李一帆,Sharpa 联合创始人

04物理世界没有“GPT 瞬间”具身智能的健身房法则

行业过去一年历经了从 VLA 到世界模型的概念轮换,但在验收标准上依然缺乏共识。李一帆将具身智能的演进比喻为健身

数字世界的涌现如同“悟道”,基于已有的完整文本数据重新处理即可爆发;而物理世界的具身智能没有任何捷径,必须依靠肌肉和肌肉记忆的一小时一小时训练。

冰淇淋任务训练

首次跑通需数据积累:10,000 小时

泛化迁移至后续任务

同类任务降至 1,000 小时
做汉堡任务 100 小时
做拉面任务 50 小时

只有当跨场景训练时间呈现指数级收缩时,物理世界的通用智能才算真正迎来了属于自己的突破时刻。

编辑核心判断

当下具身智能进入商业现场,硬件成本短期内难以带来直接盈利。但敢于不改动任何环境、在真实商业线上一锤一锤刷高质量物理交互数据,是通往通用具身智能唯一无法绕过的正道。远离秀场 Demo,才是行业收敛共识的开始。