🔬 模型架构 · 技术突破

扩散模型首次拿到 Agent 入场券:蚂蚁开源 LLaDA2.2,七大基准追平自回归

蚂蚁 inclusionAI 团队开源 LLaDA2.2——一款千亿参数 MoE 扩散语言模型,原生支持 128K 上下文。在七大 Agent 基准上,LLaDA2.2-flash 平均得分 53.83,与顶尖自回归模型 Ling-2.6-flash 的 55.74 差距缩小到 2 分以内,成为全球首个在大规模 Agent 任务中追平自回归的扩散模型

来源:公开报道 2026-07-28 全文约 4 分钟读完
#扩散模型 #LLaDA2.2 #蚂蚁inclusionAI #AI Agent
53.83 vs 55.74 七大 Agent 基准平均分,差距 1.91 分
1.64× BF16 平均吞吐量,对标自回归模型
128K 原生上下文窗口,渐进式训练达成

⚡ 30 秒速览

  • 做到什么:七大 Agent 基准平均 53.83,与顶尖自回归 55.74 差距 <2 分;τ²-Bench、PinchBench、MCP-Atlas 三项交互式任务实现反超。
  • 技术三合一:Levenshtein 编辑(自删自补)+ L-EBPO 强化学习(看环境反馈)+ BlockRouting(工程部署),首次整合进同一套扩散 Agent 系统。
  • 单项效果:SWE-bench Verified 上仅开启 Levenshtein 编辑,35.8 → 44.4,+8.6 个百分点。
  • 效率优势:BF16 平均吞吐量达自回归模型 1.64 倍,FP8 量化再 +18.6%。
  • 深层信号:扩散不是替代自回归,而是 Agent 双轨并行中的另一条腿。
  • 去哪看:GitHub / HuggingFace 已开源,技术报告公开。

01七大 Agent 基准正面竞技 扩散 vs 自回归

LLaDA2.2-flash 与蚂蚁自研的顶尖自回归模型 Ling-2.6-flash 在七大 Agent 基准上正面对比:

LLaDA2.2-flash

扩散模型 · MoE
53.83
七大基准平均分

Ling-2.6-flash

自回归模型 · AR
55.74
七大基准平均分
平均分差距 1.91 分——严格来说尚未完全跑赢,但已处于相近水平
三项交互式任务反超 → τ²-Bench PinchBench MCP-Atlas

效率则是扩散架构的主场。在 11 类工作负载上:

1.64× BF16 平均吞吐量,对标 Ling-2.6-flash
+18.6% FP8 量化后吞吐量额外提升

注:评测覆盖七大 Agent 基准,包含交互式任务与代码工程任务。平均分为各基准等权平均。反超指 LLaDA2.2-flash 在对应单项上得分高于 Ling-2.6-flash。对标双方均为蚂蚁自研模型。

02三大技术拼图 怎么做到的

LLaDA2.2 的核心变化集中在三个方面。每一项单点突破固然重要,但三合一系统集成才是扩散模型拿到 Agent 入场券的关键。

拼图 01

Levenshtein 编辑范式:让模型自改自生

传统扩散模型块并行解码的最大问题是结构刚性——生成完一个 block,Token 就被钉死了,错了只能整段重来。LLaDA2.2 在块内支持四种原子操作,通过 LCS 最长公共子序列将草稿与目标对齐,动态生成编辑标签:

KEEP SUBSTITUTE DELETE INSERT

看到冗余内容直接 DELETE 切掉,发现缺了关键信息就在指定位置 INSERT 开口,后续去噪轮次往里填。这是业界第一次把 Levenshtein 编辑大规模集成到扩散模型去噪过程中。

+8.6 个百分点 · SWE-bench Verified
35.8 → 44.4(仅开启此一项)
拼图 02

L-EBPO:让模型学会看环境反馈

长程 Agent 交互中,早期 block 的微小偏差会被后续上下文不断放大——一旦返回错误结果,模型再用错误结果规划下一步,推理路径越走越窄。ICML 2026 最佳论文专门讨论过这个问题,学名叫「模型崩溃」(Model Collapse)。

常规修正方法是在错误外面包一层修正指令,治标不治本。LLaDA2.2 提出 L-EBPO(Levenshtein Editing Evidence Lower Bound Policy Optimization),将多轮交互中的 Levenshtein 编辑决策建模为强化学习问题——模型根据环境反馈,自主决策什么时候 DELETE 切除病灶、什么时候 INSERT 填补缺失。

如果说 Levenshtein 编辑给了扩散模型一双手,L-EBPO 就是添上了眼睛——实时看到错误,知道从哪里改。
拼图 03

BlockRouting:让模型支撑长程任务

Agent 任务普遍需要处理超长上下文。LLaDA2.2 通过渐进式长上下文训练,把原生窗口一步步撑大:

8K64K128K

随之而来的是 MoE 路由成本问题:标准 MoE 为 Token 级路由,每个 Token 独立选专家,激活集合极大,HBM 流量与通信开销暴涨。BlockRouting 的解法是先在 block 层面筛选 top-C 专家形成固定池,再内部执行 Token 级 top-k 路由,屏蔽池外专家——每块激活专家上限恒定,推理成本大幅降低。128K 原生上下文 + BlockRouting,让 Agentic 扩散模型真正具备工程部署价值。

03半年三代 从生成工具到行动架构

LLaDA2.2 的出现有迹可循。半年时间、三代模型,依次完成扩散架构从生成工具行动架构的递进:

LLaDA 2.0规模化

证明扩散模型不是只能停留在小参数实验阶段,也能与 MoE 架构结合,真正落地工程。

LLaDA 2.1边写边改

引入 Token-to-Token 编辑机制,在生成过程中判断哪些 Token 应保留、哪些需替换。

LLaDA 2.2智能体觉醒

三合一系统集成——Levenshtein 编辑 + L-EBPO + BlockRouting,实现边行动边纠错,扩散模型首次拿到 Agent 入场券。

编辑视角

本篇数据来自蚂蚁 inclusionAI 团队技术发布,评测为团队自测,尚未见第三方独立复测。对标对象 Ling-2.6-flash 同为蚂蚁自研模型,横向比较的公正性有待更多外部验证。不过技术报告与模型权重已全量开源,GitHub / HuggingFace 可查,具备复现条件。报道中提及的 ICML 2026 最佳论文对「模型崩溃」的讨论为 L-EBPO 的问题定义提供了学术背书,但原文未给出该论文具体引用。

扩散模型从生成工具进化为行动架构,意味着 Agent 时代的技术路线不再是自回归单选题——当部署成本和响应延迟成为落地瓶颈时,双轨并行将成为工程默认选项。

现在就能看

LLaDA2.2-flash 模型权重与技术报告已开源,可自行复现评测。