腾讯混元多模态路线转向:姚顺雨靠拢梁文锋,远离李飞飞
蔺旭东加入、胡瀚离职、大模型部与多模态部合并成立基础模型部——腾讯混元多模态团队持续调整,路线从"生成内容"转向"理解世界",姚顺雨的 Agent 主线正在取代李飞飞的空间智能路线。
蔺旭东加入、胡瀚离职、大模型部与多模态部合并成立基础模型部——腾讯混元多模态团队持续调整,路线从"生成内容"转向"理解世界",姚顺雨的 Agent 主线正在取代李飞飞的空间智能路线。
过去一年,腾讯混元多模态团队经历了密集调整。关键节点如下:
注:时间线基于公开报道整理,部分节点为月份区间,精确日期以官方信息为准。
蔺旭东的加入,是理解这次路线转向的关键钥匙。
2018 年清华本科毕业后,蔺旭东赴哥伦比亚大学攻读博士,研究方向包括嵌入学习、视频分析和生成模型。博士期间参与哥伦比亚大学与 Facebook AI 合作的 Vx2Text 项目——这是理解他技术路线的起点。
Vx2Text 的核心逻辑:先把视频、声音等不同模态转换成类似"语言 token"的向量,再统一送入语言模型进行融合,最后由自回归解码器生成开放式文本。
Transformer 只能理解 token。AI 本质上不理解视频和音频这两种文件形式,更不可能直接将其转换成文字。Vx2Text 做的不是"生成",而是"翻译"——把多模态信息翻译成 AI 能理解的东西。
博士毕业后,蔺旭东进入 DeepMind 参与 Gemini 多模态预训练和后训练,2025 年加入 xAI 负责多模态理解方向。如今加入腾讯混元,负责多模态内容生成算法。他的加入,与其说是提升生成性能,不如说是为了解决一个困扰所有多模态的问题——理解。
以前的生成模型更像一个"画面制造器"——给提示词生成图片或视频,但遇到复杂场景就容易出错:人物在长视频里变了、物体形状前后不一致、摄像机运动不符合空间关系。这些问题的根源不是模型不会生成,而是它没有稳定地记住和理解世界。
腾讯混元多模态有四条核心产品线,覆盖从生成到理解的完整光谱:
注:Hy World 是腾讯在空间智能方向的代表产品,技术路线与李飞飞 World Labs 的"重建、生成、模拟3D世界"理念一致。
但路线转向的真正主角,是姚顺雨主导的 Hy3——一款将重点放在推理、智能体、长上下文和生产力任务上的旗舰模型。
注:柱形条为示意比例,非零起点,精确数值以标注为准。数据基于 WorkBuddy 内部办公场景测评。
Hy3 的目标并非"屠榜",而是让模型在真实产品里少出错、能理解上下文、能够把任务持续做下去。姚顺雨曾表示,AI 下半场的竞争壁垒不在模型参数量,而在 Context(上下文)。
在多模态这件事上,存在两条路线。一条以李飞飞为代表,认为世界模型是空间智能的核心,是 AGI 的重要分支;另一条以梁文锋为代表,认为多模态生成与智能主线没有太大关系。
姚顺雨选择了后者。
让 AI 感知、生成、推理并与三维空间中的世界互动。世界模型需要学习空间和时间的结构——光线如何落、物体如何运动、从未拍摄过的角度会是什么样。
"我们只做 AGI 主线——GPT、CoT、Agent。3D、视频生成、世界模型,跟智能的主线没有太大关系。"视觉模态只是服务于语言模型的工具,而非独立的智能方向。
DeepSeek 的 OCR 产品是梁文锋多模态观的具象化:把视觉模态当成工具,服务于语言模型。而蔺旭东的 Vx2Text 与之异曲同工——把多模态"翻译"成语言 token,再交给语言模型处理。
姚顺雨曾就职于 OpenAI,很可能在那里就确立了这个方向。他加入腾讯后的第一款旗舰产品 Hy3,把重点放在推理、智能体、长上下文和生产力任务上,而非多模态生成。
一个诚实的注脚:这并不足以证明李飞飞是错的。Hy World 的表现力依然惊人,空间智能也仍在快速发展。只是在姚顺雨看来,Agent 和上下文才是腾讯当前应该投入的主线。
当多模态路线从"生成内容"转向"理解世界",真正的护城河不是参数规模,而是系统架构与工程实现——这是姚顺雨从 OpenAI 带回的经验,也是腾讯混元接下来要证明的核心命题。路线本身没有对错,但选择决定了资源的流向。
Hy3 能力已通过 WorkBuddy 平台开放,登录腾讯混元官网或 WorkBuddy 即可体验任务 Agent 与多模态理解能力。
workbuddy.tencent.com → 体验 Hy3