🧩 组织变革 · 路线调整

腾讯混元多模态路线转向:姚顺雨靠拢梁文锋,远离李飞飞

蔺旭东加入、胡瀚离职、大模型部与多模态部合并成立基础模型部——腾讯混元多模态团队持续调整,路线从"生成内容"转向"理解世界",姚顺雨的 Agent 主线正在取代李飞飞的空间智能路线。

综合公开信息 2026-08-20 全文约 4 分钟读完
#腾讯混元 #姚顺雨 #多模态 #Agent #组织变革
3+ 位 关键人物变动:胡瀚离职、蔺旭东加入、田永龙加入、钟钊或将离开
4 条 核心产品线:HunyuanVideo / Image / 3D / World
90% WorkBuddy 任务解决率,从 72% 跃升 18 个百分点
1 个 新部门:基础模型部,大语言模型部与多模态模型部合并

⚡ 30 秒速览

  • 核心人事变动:前 xAI 多模态理解负责人蔺旭东加入腾讯混元,负责多模态内容生成算法;原多模态理解负责人胡瀚离职创业;前 OpenAI 研究员田永龙加入负责视觉语言模型。
  • 组织架构重组:大语言模型部与多模态模型部撤销,合并成立"基础模型部",姚顺雨任负责人,直接向 TEG 总裁卢山汇报。
  • 路线转向:姚顺雨认同梁文锋观点——多模态生成不是 AGI 主线,Agent 和上下文能力才是。路线从"生成内容"转向"理解世界并在其中行动"。
  • 技术路线具象化:Vx2Text 范式——把视频、声音等模态"翻译"成语言 token,让 AI 先理解再生成,而非直接做画面制造。
  • 产品验证:Hy3 + WorkBuddy 组合表现亮眼,任务解决率从 72% 跃升至 90%,耗时缩短 34%,用户数增长 6 倍。

01发生了什么 人事变动与组织重组时间线

过去一年,腾讯混元多模态团队经历了密集调整。关键节点如下:

2025 年 1 月 · 胡瀚全面接手多模态 腾讯杰出科学家胡瀚接替刘威,负责混元多模态大模型研发,同时担任 Tech Lead。
2025 年下半年 · 胡瀚调入大语言模型部 从多模态模型部调入"Frontier"前沿技术研究组,头衔变为多模态理解方向负责人,向姚顺雨汇报。
2026 年 3 月 · AI Lab 撤销 腾讯撤销成立近十年的 AI Lab,部分人员并入混元大语言模型部,转向姚顺雨汇报。
2026 年 7 月初 · 田永龙加入 前 OpenAI 研究员、姚顺雨清华本科校友田永龙加入腾讯,负责视觉语言模型方向。
2026 年 7 月 · 两部门合并成立基础模型部 TEG 正式发文撤销大语言模型部和多模态模型部,合并成立"基础模型部",姚顺雨任负责人。
2026 年 8 月 · 胡瀚离职创业,蔺旭东加入 胡瀚被曝离职创业;前 xAI 多模态理解负责人蔺旭东加入,负责多模态内容生成算法。

注:时间线基于公开报道整理,部分节点为月份区间,精确日期以官方信息为准。

02蔺旭东是谁 他带来的技术路线

蔺旭东的加入,是理解这次路线转向的关键钥匙。

2018 年清华本科毕业后,蔺旭东赴哥伦比亚大学攻读博士,研究方向包括嵌入学习、视频分析和生成模型。博士期间参与哥伦比亚大学与 Facebook AI 合作的 Vx2Text 项目——这是理解他技术路线的起点。

Vx2Text 的核心逻辑:先把视频、声音等不同模态转换成类似"语言 token"的向量,再统一送入语言模型进行融合,最后由自回归解码器生成开放式文本。

Transformer 只能理解 token。AI 本质上不理解视频和音频这两种文件形式,更不可能直接将其转换成文字。Vx2Text 做的不是"生成",而是"翻译"——把多模态信息翻译成 AI 能理解的东西。

博士毕业后,蔺旭东进入 DeepMind 参与 Gemini 多模态预训练和后训练,2025 年加入 xAI 负责多模态理解方向。如今加入腾讯混元,负责多模态内容生成算法。他的加入,与其说是提升生成性能,不如说是为了解决一个困扰所有多模态的问题——理解

🧪 Vx2Text 技术原理 理解先于生成

  • 输入:视频画面(V)+ 声音/语音/环境音(x)→ 分别提取特征
  • 转换:将不同模态的特征"翻译"成统一的语言 token 序列
  • 融合:统一送入语言模型进行跨模态对齐与理解
  • 输出:自回归解码器生成开放式文本描述
技术本质:用语言模型的 token 空间统一所有模态,让 AI 先理解世界,再生成内容。

以前的生成模型更像一个"画面制造器"——给提示词生成图片或视频,但遇到复杂场景就容易出错:人物在长视频里变了、物体形状前后不一致、摄像机运动不符合空间关系。这些问题的根源不是模型不会生成,而是它没有稳定地记住和理解世界

03产品矩阵与性能 从生成到理解的布局

腾讯混元多模态有四条核心产品线,覆盖从生成到理解的完整光谱:

Hunyuan
Video
文生视频 · 130亿→83亿参数
Hunyuan
Image
文生图 · 170亿→800亿参数
Hy 3D单体3D生成 · 1536³分辨率
Hy World3D世界生成 · 空间智能

注:Hy World 是腾讯在空间智能方向的代表产品,技术路线与李飞飞 World Labs 的"重建、生成、模拟3D世界"理念一致。

但路线转向的真正主角,是姚顺雨主导的 Hy3——一款将重点放在推理、智能体、长上下文和生产力任务上的旗舰模型。

🏆 Hy3 + WorkBuddy姚顺雨旗舰组合
90%
接入前任务解决率WorkBuddy 内部测评
72%
平均耗时缩短对比接入前
34%
主动选择 Hy3 用户增长WorkBuddy 平台数据

注:柱形条为示意比例,非零起点,精确数值以标注为准。数据基于 WorkBuddy 内部办公场景测评。

Hy3 的目标并非"屠榜",而是让模型在真实产品里少出错、能理解上下文、能够把任务持续做下去。姚顺雨曾表示,AI 下半场的竞争壁垒不在模型参数量,而在 Context(上下文)

04路线之争 姚顺雨为什么靠拢梁文锋

在多模态这件事上,存在两条路线。一条以李飞飞为代表,认为世界模型是空间智能的核心,是 AGI 的重要分支;另一条以梁文锋为代表,认为多模态生成与智能主线没有太大关系。

姚顺雨选择了后者。

李飞飞路线 · 空间智能

让 AI 感知、生成、推理并与三维空间中的世界互动。世界模型需要学习空间和时间的结构——光线如何落、物体如何运动、从未拍摄过的角度会是什么样。

梁文锋路线 · 上下文智能

"我们只做 AGI 主线——GPT、CoT、Agent。3D、视频生成、世界模型,跟智能的主线没有太大关系。"视觉模态只是服务于语言模型的工具,而非独立的智能方向。

DeepSeek 的 OCR 产品是梁文锋多模态观的具象化:把视觉模态当成工具,服务于语言模型。而蔺旭东的 Vx2Text 与之异曲同工——把多模态"翻译"成语言 token,再交给语言模型处理

姚顺雨曾就职于 OpenAI,很可能在那里就确立了这个方向。他加入腾讯后的第一款旗舰产品 Hy3,把重点放在推理、智能体、长上下文和生产力任务上,而非多模态生成。

"我们现在就像是拥有了一个万能的锤子,它可以去砸任何钉子。方法论已经变得非常成熟,相反,寻找真正有价值的问题,变得越来越困难。" —— 姚顺雨,在腾讯云 AI 产业应用大会与汤道生的对谈,2026 年 6 月

一个诚实的注脚:这并不足以证明李飞飞是错的。Hy World 的表现力依然惊人,空间智能也仍在快速发展。只是在姚顺雨看来,Agent 和上下文才是腾讯当前应该投入的主线

编辑核心判断

当多模态路线从"生成内容"转向"理解世界",真正的护城河不是参数规模,而是系统架构与工程实现——这是姚顺雨从 OpenAI 带回的经验,也是腾讯混元接下来要证明的核心命题。路线本身没有对错,但选择决定了资源的流向。

现在就能用

Hy3 能力已通过 WorkBuddy 平台开放,登录腾讯混元官网或 WorkBuddy 即可体验任务 Agent 与多模态理解能力。

workbuddy.tencent.com → 体验 Hy3