🔓 开源 · 基座模型

蚂蚁百灵开放6个训练checkpoints,7.9B与124B两款Base模型同步开源

8月20日,蚂蚁百灵发布 Ling-3.0-tiny-baseLing-3.0-flash-base,同步开放预训练、中期训练和WSM合并三个阶段共 6个checkpoints,为开发者提供多个可继续训练的起点,支持从轻量验证到大规模扩展的训练路径。

综合公开信息整理 2026-08-20 全文约 3 分钟读完
#蚂蚁百灵 #Ling-3.0 #Base模型 #开源 #MoE
6 开放checkpoints · 覆盖三个阶段
7.9B / 1.3B Ling-3.0-tiny-base 总参/激活参
124B / 5.1B Ling-3.0-flash-base 总参/激活参

⚡ 30 秒速览

  • 开放了什么:Ling-3.0-tiny-base(7.9B/1.3B)和 Ling-3.0-flash-base(124B/5.1B),各提供预训练、中期训练、WSM合并后共6个checkpoints。
  • 为什么重要:开发者可自由选择训练起点,无需从零开始;先在小模型上验证策略,再迁移到大模型。
  • 适合谁用:代码领域持续预训练、预算敏感的强化学习研究、专业领域微调(金融、医疗、科研)、MoE消融实验。
  • 统一训练方案:两款模型采用相同预训练管线,Tiny 作为 Flash 的“低成本验证沙盒”。
  • 去哪获取:已开源至 Hugging Face 和 ModelScope,搜索“Ling-3.0”即可获取全部权重。

01两款Base模型深度对比 轻量验证 vs 大规模扩展

Ling-3.0-tiny-base 和 Ling-3.0-flash-base 均采用稀疏 MoE 架构,但定位截然不同。Tiny 主打低成本验证,Flash 面向生产级后训练。下表直观看清差异:

Ling-3.0-tiny-base

总参 7.9B · 激活 1.3B
适合:代码领域训练、强化学习 rollouts、高校教学、模型行为研究、MoE消融实验。

Ling-3.0-flash-base

总参 124B · 激活 5.1B
适合:大型代码库、复杂推理、长上下文、金融/医疗/科研等专业领域持续训练。

7.9BTiny 总参数量
1.3BTiny 激活参数
124BFlash 总参数量
5.1BFlash 激活参数

注:参数量对比基于官方发布数据。Tiny 总参仅为前代 Ling-2.5-mini-base 的一半,但在多数评测中取得更高成绩,代码能力尤为突出。Flash 在总参约2–3倍的同级模型中仍具竞争力。

026个checkpoints:从预训练到后训练的完整“原料”

传统开源只放最终模型权重,而蚂蚁百灵这次把训练过程的关键节点也开放了。每个模型提供三个阶段的checkpoint:

预训练 checkpoint 中期训练 checkpoint 最终 Base checkpoint(WSM合并后)

这三个状态分别对应:大规模预训练结束但未做中期训练中期训练结束但未做WSM合并WSM合并后但未做后训练。开发者可根据自身数据、任务和研究目标,选择不同的训练起点。

其中,WSM(Warmup-Stable and Merge)是蚂蚁百灵自研的学习率方案:用多个checkpoints加权合并代替传统学习率衰减,使得模型更适合持续预训练动态扩展数据。研究者甚至可以在训练结束后离线探索不同的“衰减曲线”。

注:WSM合并后的Base模型尚未进行指令对齐,不建议直接部署为面向终端用户的聊天服务。用于生产环境前,还需完成针对具体任务的后训练、评估和验证。

03它到底能做什么?三个典型使用场景

💻 代码领域持续预训练 Tiny 验证 → Flash 扩展

  • 先用 Ling-3.0-tiny-base 在代码语料上做小规模预训练实验,验证数据配比与训练策略。
  • 确认有效后,将同套方案迁移至 Ling-3.0-flash-base,启动大规模代码预训练。
  • 两个模型采用统一训练方案,策略可直接复用,无需重复调参。
核心价值:从实验到生产,训练成本降低一个数量级。

🧪 预算敏感的强化学习后训练 Tiny-base 理想选择

  • 7.9B 总参、1.3B 激活的Tiny模型,非常适合在GPU资源有限的场景下开展RL rollout与后训练研究。
  • 可用于偏好优化、PPO/DPO等算法实验,探索奖励模型与策略更新的最佳组合。
  • 高校研究团队和独立开发者可低成本复现前沿RL训练流程。
核心价值:降低强化学习研究门槛,让更多团队参与对齐研究。

🏥 金融/医疗领域监督微调 Flash-base 生产级底座

  • 124B 总参、5.1B 激活的Flash-base,具备充足的参数容量与稀疏激活设计,适合专业领域知识注入。
  • 在财报分析、病历理解、科研文献检索等任务上,可基于Flash-base进行领域监督微调,构建专用模型。
  • 由于使用了WSM方案,模型在持续预训练过程中对新增数据有更好的适应性。
核心价值:为专业领域模型提供强大且可塑的基座,减少从头训练的高昂成本。

04为什么蚂蚁百灵选择开放训练节点?

直接原因来自社区反馈。在 Ling-3.0-tiny 的 Hugging Face 社区中,多位开发者明确表达了需求:“相比已完成后训练的模型,我们更需要一个能够继续塑造的Base Model。” 他们认为,Tiny的规模和稀疏架构对预算有限的研究者很有吸引力,但只有Base模型才能灵活适配不同下游任务。

蚂蚁百灵在8月初陆续开源了Ling-3.0-flash和Ling-3.0-tiny的完整版本,但社区对Base版本的呼声持续高涨。仅9天后,团队就同步开放了tiny和flash的Base版本,并且额外释放了预训练和中期训练阶段的checkpoints——这比仅开放最终Base模型更进一步。

一个诚实的注脚:

Base模型并非成品。蚂蚁百灵在公告中明确提醒,未经后训练的Base模型不适合直接面向终端用户提供服务,也不建议用于安全关键型应用。开放训练节点的本质是把“塑形权”交给开发者——他们需要自己完成后续的指令对齐、安全评估与部署优化。

编辑核心判断

开源从“给鱼”走向“给渔具”——开放训练节点比开放模型权重更能推动社区创新,但也要求开发者具备更强的技术能力。这种“半成品开源”模式,正在成为大模型生态的新趋势。

现在就能用

两款Base模型及全部6个checkpoints已开源至 Hugging Face 和 ModelScope,搜索“Ling-3.0”即可获取。

Hugging Face / ModelScope → 搜索 Ling-3.0