蚂蚁百灵开放6个训练checkpoints,7.9B与124B两款Base模型同步开源
8月20日,蚂蚁百灵发布 Ling-3.0-tiny-base 和 Ling-3.0-flash-base,同步开放预训练、中期训练和WSM合并三个阶段共 6个checkpoints,为开发者提供多个可继续训练的起点,支持从轻量验证到大规模扩展的训练路径。
8月20日,蚂蚁百灵发布 Ling-3.0-tiny-base 和 Ling-3.0-flash-base,同步开放预训练、中期训练和WSM合并三个阶段共 6个checkpoints,为开发者提供多个可继续训练的起点,支持从轻量验证到大规模扩展的训练路径。
Ling-3.0-tiny-base 和 Ling-3.0-flash-base 均采用稀疏 MoE 架构,但定位截然不同。Tiny 主打低成本验证,Flash 面向生产级后训练。下表直观看清差异:
总参 7.9B · 激活 1.3B
适合:代码领域训练、强化学习 rollouts、高校教学、模型行为研究、MoE消融实验。
总参 124B · 激活 5.1B
适合:大型代码库、复杂推理、长上下文、金融/医疗/科研等专业领域持续训练。
注:参数量对比基于官方发布数据。Tiny 总参仅为前代 Ling-2.5-mini-base 的一半,但在多数评测中取得更高成绩,代码能力尤为突出。Flash 在总参约2–3倍的同级模型中仍具竞争力。
传统开源只放最终模型权重,而蚂蚁百灵这次把训练过程的关键节点也开放了。每个模型提供三个阶段的checkpoint:
这三个状态分别对应:大规模预训练结束但未做中期训练、中期训练结束但未做WSM合并、WSM合并后但未做后训练。开发者可根据自身数据、任务和研究目标,选择不同的训练起点。
其中,WSM(Warmup-Stable and Merge)是蚂蚁百灵自研的学习率方案:用多个checkpoints加权合并代替传统学习率衰减,使得模型更适合持续预训练和动态扩展数据。研究者甚至可以在训练结束后离线探索不同的“衰减曲线”。
注:WSM合并后的Base模型尚未进行指令对齐,不建议直接部署为面向终端用户的聊天服务。用于生产环境前,还需完成针对具体任务的后训练、评估和验证。
直接原因来自社区反馈。在 Ling-3.0-tiny 的 Hugging Face 社区中,多位开发者明确表达了需求:“相比已完成后训练的模型,我们更需要一个能够继续塑造的Base Model。” 他们认为,Tiny的规模和稀疏架构对预算有限的研究者很有吸引力,但只有Base模型才能灵活适配不同下游任务。
蚂蚁百灵在8月初陆续开源了Ling-3.0-flash和Ling-3.0-tiny的完整版本,但社区对Base版本的呼声持续高涨。仅9天后,团队就同步开放了tiny和flash的Base版本,并且额外释放了预训练和中期训练阶段的checkpoints——这比仅开放最终Base模型更进一步。
一个诚实的注脚:
Base模型并非成品。蚂蚁百灵在公告中明确提醒,未经后训练的Base模型不适合直接面向终端用户提供服务,也不建议用于安全关键型应用。开放训练节点的本质是把“塑形权”交给开发者——他们需要自己完成后续的指令对齐、安全评估与部署优化。
开源从“给鱼”走向“给渔具”——开放训练节点比开放模型权重更能推动社区创新,但也要求开发者具备更强的技术能力。这种“半成品开源”模式,正在成为大模型生态的新趋势。
两款Base模型及全部6个checkpoints已开源至 Hugging Face 和 ModelScope,搜索“Ling-3.0”即可获取。
Hugging Face / ModelScope → 搜索 Ling-3.0