乐聚发布垂域具身模型 KUAVO VLA:工业场景提效近一倍,成功率与过程分双榜第一
乐聚机器人推出面向工业场景的垂域具身智能模型 KUAVO VLA——以通用 VLA 基模为起点,用 600+ 小时同构型真机数据完成"中训练"。在 25 项任务评估中,整体成功率 48.27%、过程分 74.51%,两项均列参评模型第一。
乐聚机器人推出面向工业场景的垂域具身智能模型 KUAVO VLA——以通用 VLA 基模为起点,用 600+ 小时同构型真机数据完成"中训练"。在 25 项任务评估中,整体成功率 48.27%、过程分 74.51%,两项均列参评模型第一。
今天做具身智能,所有人谈的都是两件事:预训练,让大脑更聪明;后训练,让机器人在专门任务上做得更好。但乐聚发现,中间还有一段被行业普遍忽略的空白——中训练(Mid-train)。
问题就藏在空白里。
预训练的 VLA 模型,到了具体场景未必能发挥全部智能;后训练又有时长和成本的门槛,动辄需要千条以上数据。乐聚的思路,是在两者之间插入一层针对工业场景的"中间模型"——垂域模型。用更通俗的话说:基础模型是具身大脑的"大学通识课",垂域模型则是工业领域的"专业课"。
面向开放场景泛化,数据体量巨大;跨本体样本混杂,进入新机器人需重新学习动作空间与控制规律;后训练成本高昂。
以通用 VLA 为起点,600+小时同构真机数据中训练;将 100 个工业共性能力沉淀进模型,新任务只需在已有能力上快速适配。
注:垂域模型相当于在基模与技能间插入一轮针对工业场景的中训练——通用能力做减法,场景能力做加法。
这套方法到底管不管用?乐聚用一组评估数据给出了回答。
评估体系共设 25 项任务:20 项定制化工业任务,检验对工业物料、工位和流程的适应能力;5 项选自公共任务集 GM100,考察迁移与泛化表现。对照模型为 π 0.5、GR00T N1.7 与 Lingbot-VLA 2.0。
注:条形自 0 起线性映射,如实展示差距。π 0.5 与 GR00T N1.7 参与对照评估,但原始报道未披露其具体得分。
成功率与过程分同步提升,说明垂域训练带来的收益不止于"任务有没有做完",还体现在执行过程本身——动作更平滑、决策更稳定,抖动、重复修正和决策迟滞明显减少。这对包含多步操作、连续抓放和狭小工位约束的工业任务尤为重要。
一个诚实的注脚:垂域模型的代价是泛化范围的收缩——能力深度绑定 KUAVO 单构型,跨本体、跨场景的通用性尚未被验证。
为什么要做垂域模型?答案藏在具身二次开发者的日常里。
环顾具身行业,能做出 KUAVO VLA 这种成果的公司其实不算多。乐聚凭的是什么?答案可以拆成四块。
先于行业发现后训练在落地时的掣肘,找到垂域模型这条中间路线。
真实产线经验积累几年,能归纳出机器人最有价值的"原子动作"。
自建行业领先训练场,积累大量适合中训练的高质量真机数据。
不绑定基础模型,开发者可在不同基模间自由迁移,并享受到性能提升。
垂域模型的价值不在参数竞赛,而在于把工业场景的共性经验沉淀进模型本体——它让具身开发从"劳动密集型苦工"变成"在已有能力上的快速适配"。
KUAVO VLA 已通过乐聚的平台、模型与工具链开放给二次开发者,并提供端到端服务团队支持——沉到场景里,把技能调出来。