🧠 模型开源 · 轻量级 MoE

蚂蚁百灵开源 Ling-3.0-tiny:1.3B 激活参数拿下 25 分,紧咬 26B 大模型

8 月 11 日,蚂蚁百灵开源轻量级混合推理 MoE 模型 Ling-3.0-tiny。总参数 7.9B,推理时仅激活 1.3B,在 Artificial Analysis Intelligence Index 拿下 25 分——仅比 Gemma-4-26B-A4B 低 1 分,同时超越 gpt-oss-120B(high)、Qwen3.5-9B 等多款更大体量模型。

来源:综合公开信息整理 2026-08-11 全文约 4 分钟读完
#蚂蚁百灵 #Ling-3.0-tiny #混合推理MoE #本地部署
7.9B / 1.3B 总参数 / 每 Token 激活参数
25 Intelligence Index,仅比 26B 低 1 分
3 精度版本:BF16 / FP8 / INT4

⚡ 30 秒速览

  • 多大算力:7.9B 总参数,每 Token 仅激活 1.3B——以 1/6 的激活规模,进入主流 4B-12B 级模型的能力区间。
  • 评分多高:Intelligence Index 25 分,仅比 Gemma-4-26B-A4B 低 1 分,高于 gpt-oss-120B(high)、Qwen3.5-9B、Gemma-4-12B、Gemma-4-E4B。
  • 架构配方:KDA(月之暗面)×3 + MLA(DeepSeek)×1 交替堆叠,配 128 个路由专家,每 Token 激活 8 个路由 + 1 个共享专家。
  • 原生混合推理:enable_thinking 参数单次请求可开关思考模式,兼顾快速响应与多步推理。
  • 去哪部署:DGX Spark、MacBook、Mac mini 三端已验证,FP8 下 DGX Spark 吞吐 100-105 tokens/s。

01一个数字,两种解读 25 分与 26 分之间

25 分 vs 26 分,只差 1 分

但一方是 1.3B 激活参数的轻量模型,另一方是 26B 总参的 MoE。Ling-3.0-tiny 用约 1/20 的激活规模,逼近了 26B 量级对手的综合评分。

Intelligence Index 从真实任务、工具使用、代码、科学推理、知识可靠性、长上下文等九个方向,综合衡量模型的跨任务能力。

Ling-3.0-tiny蚂蚁百灵 · 激活 1.3B
25
Gemma-4-26B-A4BGoogle · 激活 ≈4B
26

注:柱形自 24 分起缩放,非零起点;分差以标注分数为准。其余被超越模型未公布具体分数,以下方标签呈现。

被 LING-3.0-TINY 超越的更大体量模型

gpt-oss-120B (high) Qwen3.5-9B Gemma-4-12B Gemma-4-E4B

一个诚实的注脚:单项分数无法覆盖全部能力,Tiny 模型也无法取代所有大型模型。但从评测看,它已具备进入代码辅助、知识工作流、工具调用和本地 Agent 应用的能力基础。

02站在两家肩膀上 KDA + MLA 的 3:1 配方

Ling-3.0-tiny 的架构设计,直接借鉴了两家前沿实验室的技术路线。

每 4 层中,3 层用 KDA(月之暗面自研的 Kimi 增量注意力),1 层用 MLA(DeepSeek 自研的多头潜在注意力)。两者按 3:1 交替堆叠,配合由 128 个路由专家组成的稀疏 MoE 前馈网络。

输入 TokenKDA ×3 + MLA ×1 交替128 路由专家激活 8 路由 + 1 共享输出

每个 Token 仅激活 8 个路由专家和 1 个共享专家,以较小的激活参数量承载完整模型能力。

KDA · Kimi 增量注意力

月之暗面自研,侧重长上下文建模效率,减少重复计算。

MLA · 多头潜在注意力

DeepSeek 自研,通过潜在注意力降维,显著降低 KV 缓存开销。

这套混合线性架构的直接收益有三:减少推理计算资源、降低本地部署门槛、让轻量模型接入真实 Agent 工作流。

原生混合推理机制更让模型"可快可慢"——常规任务快速响应,复杂任务多步思考,由同一模型完成。

03三台设备,三种玩法 从工作站到个人电脑

🖥️ DGX Spark:单机撑起小规模本地服务 FP8 · 100-105 tokens/s

  • 模型权重 7.85GB,单台 DGX Spark 即可运行,无需搭建集群。
  • 2K 输入下单请求稳态解码 100-105 tokens/s,两路并发聚合吞吐约 161 tokens/s
  • 适合企业内部知识助手、研发团队代码助手、特定业务流程任务智能体。
已实机演示:模型驱动移动设备,理解任务、调用工具、执行自动化操作并验证。

💻 MacBook:首 Token 响应低于 100ms 36GB 内存实机

  • 在 36GB 内存 MacBook Pro 上复刻 Infinite Wiki 核心体验:点击词语生成上下文解释卡片,支持多层知识下钻。
  • 全程本地推理,无云端调用,首 Token 响应 <100ms
  • 所有数据留存设备端,不产生云端 API 计费——接近原生速度的本地知识引擎。
FP8 版本可将持续生成速度再提高约 30%,改善多轮交互体验。

🖱️ Mac mini:低功耗常驻式智能节点 离线运行

  • 划词翻译、语法纠错、文本改写——无需上传云端,离线提供低延迟响应。
  • 适合作为个人或小型团队的常驻本地模型 API 服务
  • 与 MacBook 互补:MacBook 侧重移动办公,Mac mini 侧重持续值守。

04性能快照 小参数,快响应

激活参数小,直接转化为更短的等待时间。

100-105tokens/s · DGX Spark FP8
86-90tokens/s · M4 Pro MacBook
>160tokens/s · 输出速度
8.34GiB · 8K 上下文峰值内存

输出 500 个 Token 端到端用时约 18 秒,已包含模型思考过程。较小的激活规模提升了 Agent 连续执行任务时的响应效率。

Agentic Index 16 分,高于 Gemma-4-31B;GDPval-AA v2 772 Elo,τ³-Banking 20.80——在任务理解、工具调用和流程推进方面表现突出。

05编辑判断

编辑核心判断

轻量级模型的竞争,已经从"装得下"转向"做得到"。

蚂蚁用 KDA+MLA 的混合架构证明:1.3B 激活参数可以进入 4B-12B 的能力区间。架构创新正在取代参数规模,成为新的胜负手。但官方也承认,下一步仍需补强事实准确性和长程 Agent 稳定性——"以小博大"之后,还有"小而可靠"的功课。

下载体验

三个精度版本已同步上架 Hugging Face 与 ModelScope,开发者可按硬件条件选择部署。

Hugging Face ModelScope