GEN-1.5 模型带来重要进展:一次物理提示成功率 59%,5 分钟数据可提至 83%,物理 AI 正在接近 GPT-3 时刻
深度分析 · 2026
核心论点
当机器人模型证明物理智能可以沿 scaling 曲线进步,新任务所需训练从数百次参数调整压缩到零次,物理 AI 正接近类似 GPT-3 的智能涌现时刻。
编辑部判断
物理 AI 的 GPT-3 时刻尚未完全到来,但 GEN-1.5 提供了迄今最接近这一时刻的实证:它把"让机器人看一次示范就学会新任务"从研究愿景变成了可测量、可沿 scaling 曲线推进的现象。真正值得关注的不是 59% 的一次提示成功率,而是新任务所需训练成本随数据规模增长而急剧下降的趋势。
◆
裁决
GEN-1.5 是机器人基础模型路线的重要里程碑。它没有解决部署和安全问题,却让行业第一次看到:机器人为每一种新用途重新学习的成本可能趋于零。物理智能的涌现,已经从"能不能"的问题,变成"还要多久、能做到多稳"的问题。
一、GEN-1.5 的核心突破:泛化、失误恢复与物理提示
GEN-1.5 的关键不是单项任务成功率,而是机器人开始从海量人类操作数据中天然存在的重复、失误与恢复中,学习到训练者没有逐项教过的动作,并出现类似大语言模型的智能涌现迹象。
少样本微调
83%
5 分钟数据 · 10 次参数调整
↓
从数百次参数调整压缩到零次或个位数调整
物理提示一次示范成功率
59%
10 项新任务,不进行微调、不更新参数;物体位置和初始状态会发生变化。GEN-1.5 在看一次 3 到 12 秒示范后、不更新任何参数的情况下达成。
少样本快速学习后的成功率
83%
使用约 5 分钟、10 到 50 次演示数据,并调整 1 到 10 次模型参数后,10 项任务的平均成功率提高到 83%。仍是训练,但已从过去数百次调整压缩到几次。
让机器人看一次示范,就立刻学会一项新任务,是机器人领域追寻多年的圣杯。
Ted Xiao · 曾参与 Google DeepMind Gemini Robotics 的研究者
二、物理提示:机器人的 prompt 接口
物理提示与给大语言模型一段 prompt 非常相似:示范没有被训练进模型,只是临时告诉机器人这一次要做什么;模型以 100Hz 输出动作轨迹,并在执行中继续观察和修正。
上下文与动作频率
30 秒上下文 / 100Hz 动作输出
模型同时处理视频、其他传感器、语言和机器人自身状态。GEN-1.5 将示范放入一个 30 秒的上下文窗口,其余空间持续加入机器人最新看到的画面,实现边执行边修正。
部署成本对比:从传统到物理提示
⚙
传统机器人部署
每增加一种用途,都要重新采集数据、训练模型、上机测试并反复修正;真正的昂贵之处在于让机器人在新现场可靠地做新工作。
▼
▶
Physical Prompting
人用简易夹爪演示 3 到 12 秒,机器人零参数更新,随即在新的物体位置和初始状态下尝试同一任务。
▼
⚡
分钟级微调
提供 1 到 5 分钟、约 10 到 50 次演示,调整 1 到 10 次参数,即可把新任务成功率从 59% 提升到 83%。
这更像是在提醒模型一件它几乎已经会做的事。
Generalist · GEN-1.5 发布说明
三、Generalist 是谁:不造明星机器人,押注底层智能的 scaling 路线
Generalist 不打算再造一款明星人形机器人,而是想训练一套可以进入不同机械臂、夹爪和工具的底层智能。它几乎把过去两年的全部赌注押在同一个判断上:物理智能也可以 scaling。
Generalist 与 Figure 的路线差异
Generalist
不生产像 Figure 那样不断出现在聚光灯下的人形机器人,而是为不同形态的机器人训练同一种底层智能,关心同一种智能能不能换一双手、换一台机器后仍然继续工作。
Figure
把模型和一具完整的人形身体一起交付,通过人形机器人演示获得公众知名度。
Generalist 拒绝简单将 GEN 系列称为 VLA 或 world model。它的公开展示方式更直接:看到当前画面和刚才的示范,持续决定下一步怎样动;模型内部很可能已经形成某种对物理世界的理解。
Generalist 规模数据聚合
GEN-0 数据规模
超 27 万小时
2025 年 11 月发布时已积累,并以每周超过 1 万小时的速度继续增加。扩大预训练后,16 组新任务的动作预测误差同时下降,真实机器人成功率随之提高。
GEN-1 数据规模
超 50 万小时
2026 年 4 月;简单任务成功率 99%,折盒和手机包装速度提升至约 3 倍。
模型路线选择
约 99% 参数从头训练
不依附 Gemini、GPT 或其他已读互联网图文的模型;主要从物理经验中建立能力。
数据采集方式
低成本手持设备 + 简易夹爪
已在不同地区部署数千套采集硬件;训练系统一天可读取相当于 6.85 年的人类操作经验。
工具泛化范围
多种末端工具 / 约 9000 种夹爪改装
GEN-1 已接入五指手、夹钳、电动螺丝刀、打蛋器等,以及约 9000 种标准夹爪的改装形态。
融资与估值
累计融资超 5 亿美元,估值 20 亿美元
2026 年 6 月完成 4 亿美元融资;Radical Ventures 领投,英伟达、Bezos Expeditions 等参与。
四、为什么是 GPT-3 时刻:智能涌现的早期接口
一次提示只有 59% 的成功率,并不足以部署,但它是 scaling 曲线上的一个新现象:随着模型看到更多物理经验,新任务需要的专门训练从数百次参数调整一路降到零。
参数变化幅度
不到 0.15%
GEN-1.5 与 GEN-1 几乎同时启动,连续预训练超过八个月;即便调整 10 次,模型内部参数的整体变化也不到 0.15%。Generalist 认为这已经不像从头学习,更像在提醒模型一件它几乎已经会做的事。
GPT-3 与 GEN-1.5:同一个现象的两种形态
🧠 GPT-3 的语言接口
只看一个例子,平均准确率约 45%;看到约 100 个例子后约 65%。它让世界第一次相信,同一个模型可以通过文本 prompt 临时学会许多不同任务。
45% → 65% (1例 → 100例)
🤖 GEN-1.5 的物理接口
一次物理提示在 10 项新任务上平均成功率 59%;使用约 5 分钟数据并调整 10 次参数后可达 83%。它展示的是 prompt 接口在物理世界里的早期形态。
59% → 83% (一次提示 → 分钟级微调)
对 GEN-1.5 的判断是谨慎乐观。人类数据中的重复和错误恢复很可能是关键;一次示范能不能成立,取决于新任务离预训练数据有多远。
Jim Fan · 英伟达机器人研究负责人
五、限制、行业影响与判断
限制同样清楚:10 项任务都比较简单,平均成功率只有 59%;物理提示对复杂柔性物体、长时间任务和完全陌生场景是否有效还没有答案;所有核心数字都来自 Generalist 自己,尚未公布足以完整复现的论文、参数和训练细节。
!
10 项任务均较为简单,平均成功率仅 59%,复杂柔性物体、长时间任务和完全陌生场景尚未验证。
!
所有核心数字由 Generalist 自行披露,暂无第三方复现验证。公司未公布 GEN-1.5 的准确参数规模、从头训练比例和完整训练配方。
!
物理提示未消除安全验证、现场集成和硬件维护等部署成本,仅改变了"每增加一种用途都重新教一遍机器人"这一环节。
✦ 关键洞察
物理提示指向的另一种可能,是把任务留在眼前:机器人不必为每一项工作永久改变参数,使用者只需要告诉它这一次要做什么。这不会消除安全验证、现场集成和硬件维护,但可能改变部署成本中最难下降的部分。
Generalist 和 Sunday Robotics 对行业的推动是巨大的:它们总能拿出一些此前少见、事后看来又很合理的设计。
陈哲 · 投资人
原本被认为难以迁移到机器人的人类数据,开始成为资本愿意下注的技术路线,也改变了投资人对路线的认可程度。
陈凯 · 深度机智创始人
物理提示指向的另一种可能,是把任务留在眼前:机器人不必为每一项工作永久改变参数,使用者只需要告诉它这一次要做什么。这不会消除安全验证、现场集成和硬件维护,但可能改变部署成本中最难下降的部分——每增加一种用途都重新教一遍机器人的代价。