🧠 模型 · 开源发布

124B 混构模型 11 项测试碾压万亿旗舰,蚂蚁百灵用 1/12 算力改写性价比规则

7 月 24 日,蚂蚁百灵正式发布新一代原生混合推理模型 Ling-3.0-flash。总参数 124B,激活仅 5.1B,在 12 项基准测试中 11 项超越自家万亿级旗舰 Ring-2.6-1T,综合均分与 DeepSeek-V4-Flash 并列第一,智能密度与智效比双料登顶。

综合公开信息整理 2026-07-29 全文约 4 分钟读完
#蚂蚁百灵 #Ling-3.0-flash #混合推理模型 #开源 #MoE
124B 总参数量
5.1B 激活参数量
11/12 超越万亿旗舰
15 34 维度中 15 个第一
⚡ 30 秒速览
  • 以小搏大:124B 总参、5.1B 激活,12 项测试 11 项超越万亿级旗舰 Ring-2.6-1T,智能密度 0.5、智效比 13.2 双料第一。
  • 架构创新:原生混合线性注意力(5:1 比例交替 KDA 与 MLA)+ 1/64 稀疏 MoE,每 Token 只激活最相关的少数专家,算力精准投放。
  • 能力实测:SWE-Bench Pro 56.6% 第一,ArtifactsBench 77.0% 断层领先,BFCL-v4 73.0% 并列第一,LIFEBench 77.3% 第一。
  • 开源承诺:7 月 24 日开放限时免费 API,8 月 3 日免费期结束后正式开源,模型权重全面开放。

01成绩单 12 项测试 11 项超越万亿旗舰

Ling-3.0-flash 在 34 个评测维度中拿下 15 个第一、19 个第二,综合均分与 DeepSeek-V4-Flash 并列第一,领先万亿级旗舰 Ring-2.6-1T 近 8 分。以下为关键测试排名:

🥇 SWE-Bench Pro代码修复 · 56.6%
第 1
🥇 ArtifactsBench完整组件生成 · 77.0%
第 1
🥇 BFCL-v4函数调用 · 73.0%
第 1
🥇 GDPVal v2-AA端到端 Agent · 1107 分
第 1
🥇 LIFEBench长程指令遵循 · 77.3%
第 1
Multi-IF多轮指令 · 87.7%
第 2
MRCR_256K长上下文 · 81.1%
优异
MiniAppBench一句话生成 APP · 25.3%
持平

注:柱形长度为相对排名示意,非精确分数映射;精确分数以标注为准。榜首与第二名在多测试中分差明显,ArtifactsBench 领先第二名 10 余分。

一个诚实的注脚:在 WideSearch 搜索 Agent 测试中,Ling-3.0-flash 以 73.6% 位列第三,并非全能。但多智能体协作模式下,BrowseComp 达到 82.0%,与 Claude-Sonnet-4.6 的 82.1% 基本持平——框架能力弥补了单点不足。

02架构拆解 混合线性注意力 + 1/64 稀疏 MoE

"小身材大能量"的背后,是模型架构上的系统性重构。Ling-3.0-flash 从预训练阶段即对计算架构进行了重新设计,放弃了单纯堆砌参数的思路。

接收 Token路由分配1/64 专家激活混合注意力计算输出结果

推理链路:每 Token 仅激活 5.1B 参数,算力精准投放

KDA 线性注意力

Delta Rule 状态更新 + 细粒度对角门控,不同特征通道拥有独立的保留、衰减与写入控制。长文档与大型代码库中不易"迷失"。

MLA 低秩压缩

通过低秩压缩将 KV Cache 大幅缩减,降低推理显存占用。与 KDA 以 5:1 比例交替堆叠,协同跃升。

1/64 稀疏 MoE

每个 Token 的专家激活比例由前代 1/32 压缩至 1/64。124B 总参仅激活 5.1B,算力精准投放到当前任务最需要的少数专家。

三级缓存架构

借鉴 CPU 三级缓存设计:GPU 内存 (L1) / 主机内存 (L2) / 分布式存储 (L3)。长输入场景 TTFT 降低 60%–80%,避免重复计算。

Ling Scaling Law 认为:更低的专家激活比例带来更高的"效率杠杆"。1/64 的稀疏比例意味着——每次推理只需调动最相关的少数专家,将算力精准投放到当前任务最需要的地方。

03能力实测 快、稳、省,三个场景验证

基准测试终究是"考试",模型好不好用,得看它能不能在实际场景中帮人把事办成。Ling-3.0-flash 的定位非常清晰:不是要取代超大参数规模的通用推理模型,而是做那个可以帮你做事的 AI。

🎱 3D 台球模拟器 结对编程 · 快速迭代

  • 三轮对话完成一个可交互的 3D 台球模拟器,控制白球击球角度与力度。
  • 彩色球被撞击后的路径基本符合物理规律,模型反应速度极快,几乎不需要思考。
  • 能够精准定位 BUG 并进行迭代优化,多轮对话中维持工程架构的一致性。
实测评价:不丢上下文、不跑偏架构、不陷入死循环——结对编程场景下的可靠协作者。

📊 办公自动化:Excel → Word 跨应用流程 稳定工具调用

  • 用户下达单次指令后,模型自动在 Excel 中填入数据并生成透视表。
  • 随后提取核心图表插入 Word 文档并完成排版,全程无需人工介入。
  • 通过底层协议直接驱动软件,不依赖易出错的 GUI 模拟操作。
关键能力:长程任务稳定性 + 多系统协同调度,在严格约束下保持输出质量与格式一致性。

🔬 多智能体科研工作流 集团军作战

  • Scientist 提出假说 → Data Analyst 检索与验证 → CrossValidator 交叉质询 → Archivist 归档沉淀 → Writer 自动产出论文与 Slide。
  • 各 Agent 角色各司其职,通过分工协作、相互校验,减少单一模型在长程任务中"跑偏"的风险。
  • Ling Multi-Agent 架构让模型从单点执行器升级为可支撑多角色协同的"集团军"作战平台。
架构价值:多智能体协同显著提升了复杂任务的完成质量与可靠性,为高频线上服务与真实业务落地提供支撑。

04开源意义 技术普惠的新路径

硅谷还在争论"该不该开源""该不该踩刹车"的时候,中国 AI 圈的开源步伐从未停歇。从 DeepSeek 到智谱,从阿里通义到蚂蚁百灵——开源和前进似乎从来就不是一道选择题。

Ling-3.0-flash 代表的不是单纯新增一个模型,而是一条轻量化高性价比的技术路线。

传统堆参数路线

追求更大总参数量,推理成本高,部署门槛高,企业落地困难。

蚂蚁百灵路线

极致稀疏 + 混合注意力,用 1/12 激活算力逼近旗舰表现,兼顾性能与成本。

0.5 智能密度(均分/总参)
13.2 智效比(均分/激活参)
4.1% 激活参数占比
↓60–80% TTFT 降低幅度

智能密度与智效比由蚂蚁百灵同步提出,Ling-3.0-flash 在可比模型中双双登顶。

当开源模型兼顾实用性、效果与成本优势,技术普惠才有落地的现实基础。5 月开源万亿级 Ling-2.6-1T、Ring-2.6-1T,7 月推出 Ling-3.0-flash 并计划 8 月 3 日开源——蚂蚁百灵的开源节奏持续提速。

编辑核心判断

Ling-3.0-flash 证明了:在 Agent 时代,极致稀疏架构与系统工程能力的组合,正在让"小模型"以极低的推理成本逼近甚至超越万亿级旗舰——性价比优势,本身就是一种技术壁垒。

现在就能用

Ling-3.0-flash 已在 OpenRouter 与百灵官方平台同步开放限时免费 API 调用,免费期截至 8 月 3 日 23:00。模型权重将在免费期结束后正式开源。

访问百灵官方平台 → 免费体验