蚂蚁百灵开源 Ling-3.0-tiny:1.3B 激活参数拿下 25 分,紧咬 26B 大模型
8 月 11 日,蚂蚁百灵开源轻量级混合推理 MoE 模型 Ling-3.0-tiny。总参数 7.9B,推理时仅激活 1.3B,在 Artificial Analysis Intelligence Index 拿下 25 分——仅比 Gemma-4-26B-A4B 低 1 分,同时超越 gpt-oss-120B(high)、Qwen3.5-9B 等多款更大体量模型。
8 月 11 日,蚂蚁百灵开源轻量级混合推理 MoE 模型 Ling-3.0-tiny。总参数 7.9B,推理时仅激活 1.3B,在 Artificial Analysis Intelligence Index 拿下 25 分——仅比 Gemma-4-26B-A4B 低 1 分,同时超越 gpt-oss-120B(high)、Qwen3.5-9B 等多款更大体量模型。
25 分 vs 26 分,只差 1 分。
但一方是 1.3B 激活参数的轻量模型,另一方是 26B 总参的 MoE。Ling-3.0-tiny 用约 1/20 的激活规模,逼近了 26B 量级对手的综合评分。
Intelligence Index 从真实任务、工具使用、代码、科学推理、知识可靠性、长上下文等九个方向,综合衡量模型的跨任务能力。
注:柱形自 24 分起缩放,非零起点;分差以标注分数为准。其余被超越模型未公布具体分数,以下方标签呈现。
一个诚实的注脚:单项分数无法覆盖全部能力,Tiny 模型也无法取代所有大型模型。但从评测看,它已具备进入代码辅助、知识工作流、工具调用和本地 Agent 应用的能力基础。
Ling-3.0-tiny 的架构设计,直接借鉴了两家前沿实验室的技术路线。
每 4 层中,3 层用 KDA(月之暗面自研的 Kimi 增量注意力),1 层用 MLA(DeepSeek 自研的多头潜在注意力)。两者按 3:1 交替堆叠,配合由 128 个路由专家组成的稀疏 MoE 前馈网络。
每个 Token 仅激活 8 个路由专家和 1 个共享专家,以较小的激活参数量承载完整模型能力。
月之暗面自研,侧重长上下文建模效率,减少重复计算。
DeepSeek 自研,通过潜在注意力降维,显著降低 KV 缓存开销。
这套混合线性架构的直接收益有三:减少推理计算资源、降低本地部署门槛、让轻量模型接入真实 Agent 工作流。
原生混合推理机制更让模型"可快可慢"——常规任务快速响应,复杂任务多步思考,由同一模型完成。
激活参数小,直接转化为更短的等待时间。
输出 500 个 Token 端到端用时约 18 秒,已包含模型思考过程。较小的激活规模提升了 Agent 连续执行任务时的响应效率。
Agentic Index 16 分,高于 Gemma-4-31B;GDPval-AA v2 772 Elo,τ³-Banking 20.80——在任务理解、工具调用和流程推进方面表现突出。
轻量级模型的竞争,已经从"装得下"转向"做得到"。
三个精度版本已同步上架 Hugging Face 与 ModelScope,开发者可按硬件条件选择部署。
Hugging Face → ModelScope →