124B 混构模型 11 项测试碾压万亿旗舰,蚂蚁百灵用 1/12 算力改写性价比规则
7 月 24 日,蚂蚁百灵正式发布新一代原生混合推理模型 Ling-3.0-flash。总参数 124B,激活仅 5.1B,在 12 项基准测试中 11 项超越自家万亿级旗舰 Ring-2.6-1T,综合均分与 DeepSeek-V4-Flash 并列第一,智能密度与智效比双料登顶。
7 月 24 日,蚂蚁百灵正式发布新一代原生混合推理模型 Ling-3.0-flash。总参数 124B,激活仅 5.1B,在 12 项基准测试中 11 项超越自家万亿级旗舰 Ring-2.6-1T,综合均分与 DeepSeek-V4-Flash 并列第一,智能密度与智效比双料登顶。
Ling-3.0-flash 在 34 个评测维度中拿下 15 个第一、19 个第二,综合均分与 DeepSeek-V4-Flash 并列第一,领先万亿级旗舰 Ring-2.6-1T 近 8 分。以下为关键测试排名:
注:柱形长度为相对排名示意,非精确分数映射;精确分数以标注为准。榜首与第二名在多测试中分差明显,ArtifactsBench 领先第二名 10 余分。
一个诚实的注脚:在 WideSearch 搜索 Agent 测试中,Ling-3.0-flash 以 73.6% 位列第三,并非全能。但多智能体协作模式下,BrowseComp 达到 82.0%,与 Claude-Sonnet-4.6 的 82.1% 基本持平——框架能力弥补了单点不足。
"小身材大能量"的背后,是模型架构上的系统性重构。Ling-3.0-flash 从预训练阶段即对计算架构进行了重新设计,放弃了单纯堆砌参数的思路。
推理链路:每 Token 仅激活 5.1B 参数,算力精准投放
Delta Rule 状态更新 + 细粒度对角门控,不同特征通道拥有独立的保留、衰减与写入控制。长文档与大型代码库中不易"迷失"。
通过低秩压缩将 KV Cache 大幅缩减,降低推理显存占用。与 KDA 以 5:1 比例交替堆叠,协同跃升。
每个 Token 的专家激活比例由前代 1/32 压缩至 1/64。124B 总参仅激活 5.1B,算力精准投放到当前任务最需要的少数专家。
借鉴 CPU 三级缓存设计:GPU 内存 (L1) / 主机内存 (L2) / 分布式存储 (L3)。长输入场景 TTFT 降低 60%–80%,避免重复计算。
Ling Scaling Law 认为:更低的专家激活比例带来更高的"效率杠杆"。1/64 的稀疏比例意味着——每次推理只需调动最相关的少数专家,将算力精准投放到当前任务最需要的地方。
基准测试终究是"考试",模型好不好用,得看它能不能在实际场景中帮人把事办成。Ling-3.0-flash 的定位非常清晰:不是要取代超大参数规模的通用推理模型,而是做那个可以帮你做事的 AI。
硅谷还在争论"该不该开源""该不该踩刹车"的时候,中国 AI 圈的开源步伐从未停歇。从 DeepSeek 到智谱,从阿里通义到蚂蚁百灵——开源和前进似乎从来就不是一道选择题。
Ling-3.0-flash 代表的不是单纯新增一个模型,而是一条轻量化高性价比的技术路线。
追求更大总参数量,推理成本高,部署门槛高,企业落地困难。
极致稀疏 + 混合注意力,用 1/12 激活算力逼近旗舰表现,兼顾性能与成本。
智能密度与智效比由蚂蚁百灵同步提出,Ling-3.0-flash 在可比模型中双双登顶。
当开源模型兼顾实用性、效果与成本优势,技术普惠才有落地的现实基础。5 月开源万亿级 Ling-2.6-1T、Ring-2.6-1T,7 月推出 Ling-3.0-flash 并计划 8 月 3 日开源——蚂蚁百灵的开源节奏持续提速。
Ling-3.0-flash 证明了:在 Agent 时代,极致稀疏架构与系统工程能力的组合,正在让"小模型"以极低的推理成本逼近甚至超越万亿级旗舰——性价比优势,本身就是一种技术壁垒。
Ling-3.0-flash 已在 OpenRouter 与百灵官方平台同步开放限时免费 API 调用,免费期截至 8 月 3 日 23:00。模型权重将在免费期结束后正式开源。
访问百灵官方平台 → 免费体验