扩散模型首次拿到 Agent 入场券:蚂蚁开源 LLaDA2.2,七大基准追平自回归
蚂蚁 inclusionAI 团队开源 LLaDA2.2——一款千亿参数 MoE 扩散语言模型,原生支持 128K 上下文。在七大 Agent 基准上,LLaDA2.2-flash 平均得分 53.83,与顶尖自回归模型 Ling-2.6-flash 的 55.74 差距缩小到 2 分以内,成为全球首个在大规模 Agent 任务中追平自回归的扩散模型。
蚂蚁 inclusionAI 团队开源 LLaDA2.2——一款千亿参数 MoE 扩散语言模型,原生支持 128K 上下文。在七大 Agent 基准上,LLaDA2.2-flash 平均得分 53.83,与顶尖自回归模型 Ling-2.6-flash 的 55.74 差距缩小到 2 分以内,成为全球首个在大规模 Agent 任务中追平自回归的扩散模型。
LLaDA2.2-flash 与蚂蚁自研的顶尖自回归模型 Ling-2.6-flash 在七大 Agent 基准上正面对比:
效率则是扩散架构的主场。在 11 类工作负载上:
注:评测覆盖七大 Agent 基准,包含交互式任务与代码工程任务。平均分为各基准等权平均。反超指 LLaDA2.2-flash 在对应单项上得分高于 Ling-2.6-flash。对标双方均为蚂蚁自研模型。
LLaDA2.2 的核心变化集中在三个方面。每一项单点突破固然重要,但三合一系统集成才是扩散模型拿到 Agent 入场券的关键。
传统扩散模型块并行解码的最大问题是结构刚性——生成完一个 block,Token 就被钉死了,错了只能整段重来。LLaDA2.2 在块内支持四种原子操作,通过 LCS 最长公共子序列将草稿与目标对齐,动态生成编辑标签:
看到冗余内容直接 DELETE 切掉,发现缺了关键信息就在指定位置 INSERT 开口,后续去噪轮次往里填。这是业界第一次把 Levenshtein 编辑大规模集成到扩散模型去噪过程中。
长程 Agent 交互中,早期 block 的微小偏差会被后续上下文不断放大——一旦返回错误结果,模型再用错误结果规划下一步,推理路径越走越窄。ICML 2026 最佳论文专门讨论过这个问题,学名叫「模型崩溃」(Model Collapse)。
常规修正方法是在错误外面包一层修正指令,治标不治本。LLaDA2.2 提出 L-EBPO(Levenshtein Editing Evidence Lower Bound Policy Optimization),将多轮交互中的 Levenshtein 编辑决策建模为强化学习问题——模型根据环境反馈,自主决策什么时候 DELETE 切除病灶、什么时候 INSERT 填补缺失。
Agent 任务普遍需要处理超长上下文。LLaDA2.2 通过渐进式长上下文训练,把原生窗口一步步撑大:
随之而来的是 MoE 路由成本问题:标准 MoE 为 Token 级路由,每个 Token 独立选专家,激活集合极大,HBM 流量与通信开销暴涨。BlockRouting 的解法是先在 block 层面筛选 top-C 专家形成固定池,再内部执行 Token 级 top-k 路由,屏蔽池外专家——每块激活专家上限恒定,推理成本大幅降低。128K 原生上下文 + BlockRouting,让 Agentic 扩散模型真正具备工程部署价值。
LLaDA2.2 的出现有迹可循。半年时间、三代模型,依次完成扩散架构从生成工具到行动架构的递进:
证明扩散模型不是只能停留在小参数实验阶段,也能与 MoE 架构结合,真正落地工程。
引入 Token-to-Token 编辑机制,在生成过程中判断哪些 Token 应保留、哪些需替换。
三合一系统集成——Levenshtein 编辑 + L-EBPO + BlockRouting,实现边行动边纠错,扩散模型首次拿到 Agent 入场券。
本篇数据来自蚂蚁 inclusionAI 团队技术发布,评测为团队自测,尚未见第三方独立复测。对标对象 Ling-2.6-flash 同为蚂蚁自研模型,横向比较的公正性有待更多外部验证。不过技术报告与模型权重已全量开源,GitHub / HuggingFace 可查,具备复现条件。报道中提及的 ICML 2026 最佳论文对「模型崩溃」的讨论为 L-EBPO 的问题定义提供了学术背书,但原文未给出该论文具体引用。
LLaDA2.2-flash 模型权重与技术报告已开源,可自行复现评测。