🏆 具身智能 · 榜单速递

智元全模态大模型 WITA-Omni 登顶 DailyOmni 全球榜,力压千问 Gemini 英伟达

智元自研全模态大模型 WITA-Omni Preview 以综合 85.21 分登顶具身全模态理解权威榜单 DailyOmni,八项细分指标中六项第一,超越千问、Gemini、豆包、英伟达等国内外领先模型,成为首家在"声画对位"核心交互赛道上跑赢通用大模型厂商的具身智能企业。

综合公开信息整理 2026-07-24 全文约 4 分钟读完
#智元机器人 #WITA-Omni #DailyOmni #全模态大模型 #具身智能
🥇 第 1 名 DailyOmni 全球榜 · 综合得分
85.21 综合成绩,登顶榜首
6 / 8 细分指标获得第一

⚡ 30 秒速览

  • 赢了多少:综合 85.21 分登顶 DailyOmni,音视频对齐 86.13、事件时序 84.64、综合推理 85.06,八项指标六项第一,超越千问、Gemini、豆包、英伟达。
  • 榜单硬在哪:DailyOmni 采用真实开放环境音视频,考察声画对应、事件时序、跨模态联合推理——必须同时调动声音和视觉信息才能答对,无法靠单一模态先验"作弊"。
  • 架构怎么赢:Thinker–Talker–Actor 原生架构,将"理解"和"表达"从串行变成同步——边说边动、边动边表达,替代传统"听完→想完→说完→再动"的级联延迟。
  • 深层信号:一家具身智能企业在全模态理解上跑赢通用大模型厂商,说明"从机器人原生交互场景出发构建全模态能力"正在证明其竞争力。

01总榜 Top 5 WITA-Omni 位居榜首,六项指标第一

🥇 WITA-Omni Preview智元机器人
85.21
千问 Qwen3.7-max阿里通义千问
Gemini 2.5 ProGoogle
豆包 Doubao-pro字节跳动
NVIDIA Nemotron-4英伟达

注:柱形长度示意相对差距,非精确比例。仅第一名综合得分为公开数据,其余模型排名基于公开榜单排序,具体分数未披露。八项指标中 WITA-Omni 在音视频对齐、事件时序、综合推理、比较理解、30秒视频理解、60秒视频理解六项上取得第一。

02DailyOmni:测的是"声画对位"的真功夫

DailyOmni 由行业权威机构推出,专门评测具身全模态理解能力。它与传统图文基准的区别非常直接:

传统图文基准(MMLU / GPQA)

考"模型知不知道"——答题式评测,依赖单一画面或语言先验,与真实交互距离较远。

DailyOmni

考"模型能不能在真实开放环境中同步理解声音和画面"——声画对位、事件时序、跨模态联合推理,缺一不可。

86.13音视频对齐
84.64事件时序
85.06综合推理
6项指标第一

注:三项核心维度分数均来自公开榜单。音视频对齐考察声画主体对应,事件时序考察先后顺序判断,综合推理考察必须同时结合声音和画面才能完成的跨模态推理。

更关键的一点:DailyOmni 大量采用真实开放环境的音视频素材——展厅嘈杂声、多人对话重叠、自然交互中的停顿与打断。这些场景恰恰是机器人进入家庭、工厂、服务空间时每天都要面对的真实挑战。

分数的胜负之外,这份排名更指向技术路线的选择。

站在 DailyOmni 榜单上的,是千问、Gemini、豆包、英伟达等通用大模型厂商的商用或旗舰模型。智元是其中少有的"具身智能赛道选手"。一家以机器人起家的公司,在全模态理解上跑赢了大模型大厂——这背后是从机器人原生交互场景出发构建全模态能力的差异化路径。

03它到底能做什么?三个真实交互场景

🎙️ 嘈杂展厅中的说话人识别与回应判断音视频对齐 · 第一

  • 机器人站在多人交谈的展厅中,从嘈杂声里精准识别谁在和自己说话,判断一句话是否需要回应。
  • 对方停顿时自然接过话头,被突然打断后能无缝续上,不会"断片"或重复。
  • 全程无需依赖视觉先验,仅凭声画联合推理完成主体定位与交互决策。
评分维度:声源定位 / 说话人识别 / 回应时机判断 / 打断处理 —— 均为满分或接近满分。

🔄 全双工对话:该说时说,该停时停事件时序 · 第一

  • 在 Big Bench Audio 语音推理基准上取得第一,超越 GPT-Realtime 等闭源商用模型。
  • Full Duplex Bench 子集评测覆盖停顿处理、轮次切换、打断处理、附和处理四项动态对话能力。
  • 能感知语速、停顿、重音和情绪变化,实时调整自己的回应节奏——不会抢话,也不会冷场。
LLM 评审结论:「交互节奏自然,接近真人对话水平」

🤖 边说边动:语音、手势、表情在同一条时间线上跨模态同步 · 领先

  • Actor 模块以 Talker 的音频隐变量为条件,使动作感知语速、停顿和情绪变化。
  • 机器人的手势和表情从语音生成的过程中实时响应——边说边动、边动边表达,语音与动作同步完成。
  • 传统架构中"嘴在笑、手却没跟上"的异步问题被彻底消除。
关键突破:动作和表情被提升为与语音并列的一级输出,而非事后附加的"装饰层"。

04Thinker–Talker–Actor:边想边说边动的原生架构

传统机器人交互像一条流水线:先识别语音、再理解语义、再生成回复、再合成语音、最后输出动作。每一步都有延迟,每换一棒都有损耗。

这种级联架构存在三重天然缺陷。

传统级联架构

多模块串行调用 → 延迟累积;信息跨模块转换 → 语义损失;语音、动作、表情独立生成 → 节奏与情绪不同步。最终每个模块都能工作,却不像一个协调的智能体。

WITA-Omni 原生架构

Thinker–Talker–Actor 在统一时间轴上同步推进,替代串行模式。理解与表达从两个步骤变成同一个生成过程的不同维度。

三个模块的分工与协同:

🧠 Thinker 多模态推理核心🗣️ Talker 流式语音生成🤖 Actor 动作与表情驱动

Thinker 把文本、图像、音频、音视频映射到统一表示空间,做跨模态联合推理;Talker 以 Thinker 的隐状态为条件流式生成自然语音;Actor 由动作头与表情头组成,不仅接收语义状态,还以 Talker 的音频隐变量为条件,使动作感知语速、重音和情绪变化。

跨流同步机制——这是整个架构最核心的设计。

Actor 以 Talker 的音频隐变量为条件,意味着机器人的手势和表情从语音生成的过程中就能实时响应,而非等到语音合成完成后再"配"动作。语音、动作和表情在同一条时间线上同步推进,理解与回应同时完成。

通用大模型厂商的全模态模型,大多优先适配线上数字内容交互;而智元从机器人原生交互需求出发,重新定义了全模态模型的结构。这既是工程架构的创新,也体现了具身智能公司独特视角带来的差异化竞争力。

05为什么是智元做出来了?

答案不复杂:智元一直围绕"三智一体"构建差异化竞争力。运动智能是物理载体的执行器,作业智能让机器人自主干活,交互智能让机器人自然交流。三者协同,才是机器人走进真实场景的真正门槛。

此前,智元已在 WorldArena 具身智能综合评测中拿下总分第一,作业智能的 GO 系列基础模型、运动智能的运控基座模型均已建立行业领先优势。WITA-Omni 在交互智能维度的全球登顶,让"三智一体"的完整能力版图浮出水面。

2026年,具身智能行业迎来从开发态向部署态的关键跨越。

机器人走进产线、门店和家庭,创造真实生产力。部署态的核心门槛,是三个智能的协同:运动智能决定能否走进场景,作业智能决定能否完成劳动,交互智能决定能否给人提供情绪价值、产生服务生产力。

智元在行业率先推出的七大生产力解决方案中,三智一体的完整能力栈是其底层支撑。WITA-Omni 此次登顶,让机器人距离真实世界的自然交互更近了一步,也让"既有本体、更有 AI"的定位落地为可验证的能力闭环。

编辑核心判断

具身智能的竞争正从"单项参数比拼"转向"三智协同的系统工程"。交互能力不再是锦上添花,而是决定机器人能否从工具变为伙伴的关键门槛。谁先打通"感知—推理—表达—交互"的全链路,谁就握住了下一阶段的入场券。

WITA-Omni Preview 已集成至智元机器人全系产品,支撑从工业制造到商业服务、家庭陪伴的多元场景。

三智齐备,机器人正在从"能干活"走向"能相处"。

— 让机器人与世界自然对话 —