🤖 具身智能 · 模型发布

乐聚发布垂域具身模型 KUAVO VLA:工业场景提效近一倍,成功率与过程分双榜第一

乐聚机器人推出面向工业场景的垂域具身智能模型 KUAVO VLA——以通用 VLA 基模为起点,用 600+ 小时同构型真机数据完成"中训练"。在 25 项任务评估中,整体成功率 48.27%、过程分 74.51%,两项均列参评模型第一。

来源:综合公开信息整理 全文约 3 分钟读完
#乐聚机器人 #KUAVO VLA #具身智能 #垂域模型
双榜第一 成功率 48.27% · 过程分 74.51%
600+ h KUAVO 同构型真机中训练数据
≈1 不少工业场景提效幅度

⚡ 30 秒速览

  • 新物种:KUAVO VLA 是通用基模与技能之间的"中间层",用 600+ 小时同构真机数据完成一次中训练。
  • 成绩单:25 项任务评估中,成功率 48.27%、过程分 74.51%,两项均列参评模型第一。
  • 提升幅度:较基模 Lingbot-VLA 2.0,成功率提升 32.0 个百分点,过程分提升 32.45 个百分点。
  • 落地实效:工业场景普遍提效约一倍,部分任务成功率可达 100%。
  • 生态价值:二次开发者从"重新学习"变为"在已有能力上快速适配",重复采集与算力浪费大幅减少。

01垂域模型:通用基模与技能之间的"中间层"

今天做具身智能,所有人谈的都是两件事:预训练,让大脑更聪明;后训练,让机器人在专门任务上做得更好。但乐聚发现,中间还有一段被行业普遍忽略的空白——中训练(Mid-train)

问题就藏在空白里。

预训练的 VLA 模型,到了具体场景未必能发挥全部智能;后训练又有时长和成本的门槛,动辄需要千条以上数据。乐聚的思路,是在两者之间插入一层针对工业场景的"中间模型"——垂域模型。用更通俗的话说:基础模型是具身大脑的"大学通识课",垂域模型则是工业领域的"专业课"。

通用基模(通识课)

面向开放场景泛化,数据体量巨大;跨本体样本混杂,进入新机器人需重新学习动作空间与控制规律;后训练成本高昂。

KUAVO VLA(专业课)

以通用 VLA 为起点,600+小时同构真机数据中训练;将 100 个工业共性能力沉淀进模型,新任务只需在已有能力上快速适配。

600+同构型真机训练小时
100工业共性能力
25评估任务(20工业+5公共)
100%部分任务成功率

注:垂域模型相当于在基模与技能间插入一轮针对工业场景的中训练——通用能力做减法,场景能力做加法。

这套方法到底管不管用?乐聚用一组评估数据给出了回答。

02Benchmark:两项核心指标均列第一 25 项任务实测

评估体系共设 25 项任务:20 项定制化工业任务,检验对工业物料、工位和流程的适应能力;5 项选自公共任务集 GM100,考察迁移与泛化表现。对照模型为 π 0.5、GR00T N1.7 与 Lingbot-VLA 2.0。

成功率25 项任务平均 · 线性映射
KUAVO VLA乐聚 · 垂域模型
48.27
Lingbot-VLA 2.0基模 · 对照
16.27
▲ 差距 +32.0 个百分点
过程分动作平滑性 · 决策稳定性 · 执行一致性
KUAVO VLA乐聚 · 垂域模型
74.51
Lingbot-VLA 2.0基模 · 对照
42.06
▲ 差距 +32.45 个百分点

注:条形自 0 起线性映射,如实展示差距。π 0.5 与 GR00T N1.7 参与对照评估,但原始报道未披露其具体得分。

成功率与过程分同步提升,说明垂域训练带来的收益不止于"任务有没有做完",还体现在执行过程本身——动作更平滑、决策更稳定,抖动、重复修正和决策迟滞明显减少。这对包含多步操作、连续抓放和狭小工位约束的工业任务尤为重要。

一个诚实的注脚:垂域模型的代价是泛化范围的收缩——能力深度绑定 KUAVO 单构型,跨本体、跨场景的通用性尚未被验证。

03它解决了什么?二次开发者的"苦工"困境

为什么要做垂域模型?答案藏在具身二次开发者的日常里。

⛏️ 二次开发者的三个"苦工"时刻 现状 · 痛点

  • 千条数据门槛——做好一次模型后训练,光数据就要千条以上,时间与算力成本双高。
  • 任务无法迁移——换一个任务类型,前面的工作清零重来,重复劳动与算力浪费严重。
  • 交付效果打折——模型与本体耦合不足,推理和控制能力发挥不出来,交付质量打折扣。
结论:不是开发者不努力,而是通用基模到技能之间,缺少了一门"专业课"。

🔧 KUAVO VLA 的解法 方案 · 路径

  • 能力起点更高——100 个工业共性能力(分拣、搬运、上下料、装配等)先行沉淀进模型,具体技能只需在已有能力上做差异适配。
  • 开发路径更短——新任务的开发逻辑,从"重新学习"转变为"在已有能力上快速适配",显著缩短从基模到技能落地的路径。
  • 数据需求更少——聚焦工位、物料、工艺流程做数据构建,大幅降低无关场景的数据采集、清洗与标注开销。
结果是:技能开发更快、门槛更低、浪费更少——二次开发者可以把精力集中在决定任务成败的关键差异上。

04为什么是乐聚做出来了?

环顾具身行业,能做出 KUAVO VLA 这种成果的公司其实不算多。乐聚凭的是什么?答案可以拆成四块。

01

技术判断力

先于行业发现后训练在落地时的掣肘,找到垂域模型这条中间路线。

02

工业 Know-how

真实产线经验积累几年,能归纳出机器人最有价值的"原子动作"。

03

数据资产

自建行业领先训练场,积累大量适合中训练的高质量真机数据。

04

开放生态

不绑定基础模型,开发者可在不同基模间自由迁移,并享受到性能提升。

"未来会有很多具身开发者要沉到行业里去,在场景里把相应的技能调出来——为了他们,乐聚提供的就是平台、模型和工具链。" ——乐聚常务副总裁 柯真东
编辑核心判断

垂域模型的价值不在参数竞赛,而在于把工业场景的共性经验沉淀进模型本体——它让具身开发从"劳动密集型苦工"变成"在已有能力上的快速适配"。

当更多二次开发者实打实尝到垂域模型的甜头,并靠平台赚到钱时,行业的数据飞轮才会真正转起来——那才是垂域方案成为"显学"的时刻。

如果你在做具身落地

KUAVO VLA 已通过乐聚的平台、模型与工具链开放给二次开发者,并提供端到端服务团队支持——沉到场景里,把技能调出来。

具身技能开发者 工业场景集成商 机器人应用创业者