仅改 4B 参数反超基座,中国 Neo Lab 用「持续学习」拿下 6 项 SOTA
7 月 21 日,初创团队 Mind Lab 开源模型 Macaron-V1 正式版:在冻结 GLM-5.2 的 744B 基座参数、仅微调自研 4B LoRA 参数 的前提下,12 项基准测试中拿下 6 个 SOTA,性能反超基座及 GPT-5.4、Claude Opus 4.6。它押注的「持续学习」路线,正是图灵奖得主 Sutton、DeepSeek 近期共同指向的下一代模型核心能力。
7 月 21 日,初创团队 Mind Lab 开源模型 Macaron-V1 正式版:在冻结 GLM-5.2 的 744B 基座参数、仅微调自研 4B LoRA 参数 的前提下,12 项基准测试中拿下 6 个 SOTA,性能反超基座及 GPT-5.4、Claude Opus 4.6。它押注的「持续学习」路线,正是图灵奖得主 Sutton、DeepSeek 近期共同指向的下一代模型核心能力。
Macaron-V1 旗舰版 Venti 的参数构成很直接:744B 冻结的 GLM-5.2 基座 + 4B 自研 LoRA。这 4B 拆分为四组各约 1B 的专家模块,分别负责 Chat、Agent、Coding 和生成 UI 界面四类能力。
它没有重训基座,而是用 MoL(Mixture-of-LoRA)的方式做后训练——执行不同任务时,系统动态切换到最适合的专家模块;用户长时间使用沉淀的数据,也能积累出一个专属 LoRA,随调用持续更新。
团队曾用 200 份不同数据分别训练 200 个 LoRA 挂载协作,得出两个关键发现:
团队由此判断:单一 LoRA 无法全面提升模型能力,MoL 可能是突破智能上限的有效办法。
注:上述 25% 提升及 log 线性增长数据,均来自团队内部实验披露,未见第三方独立复测。
2025 年 12 月,Mind Lab 在 Kimi K2(万亿参数 MoE 模型)上跑通端到端 LoRA 强化学习训练,仅用 64 张 H800,实现接近全参数训练的效果,GPU 消耗只有传统全参数 RL 的 10% 左右。
难点在于:强化学习对基础设施精度要求极高,训练与推理精度不一致会带来偏差漂移,导致结果无法收敛。团队的解法是设计一套 混合协同并行引擎:
并引入 截断重要性采样 修正分布差异,让 LoRA 在 MoE 架构上稳定运行。基于此,今年 1 月推出 LoRA 训推基础设施平台 MinT,能管理 上百万个 LoRA 模型,实时加载速度提升近十倍。
从头训模型成本极高,算力消耗大,周期长。
参数足够大且稀疏时,LoRA 可达全参训练效果,算力降至 10%。
创始人陈锴杰将现阶段持续学习方案归为四类。前三类各有硬伤,团队选择直接改参数的第四条路:
团队将这套思路总结为 「经验智能」:模型从经历中学习,经验转化为新能力,新能力解决更难问题,更难问题带来更丰富经验——智能由此成为持续生长的过程。
本文核心数据(6 项 SOTA、25% 性能提升、10% 算力消耗)均来自 企业单方披露,未见第三方独立复测,读者宜带「通稿验证中」视角看待具体数字。但技术路径本身有迹可循:团队联合创始人 Andrew Chen 曾与姚顺雨共同发表 FireAct 论文,其独立选定的 LoRA-RL 路线,与 OpenAI 前高管创立的 Thinking Machines Lab 在《LoRA Without Regret》中得出的结论一致——足够大的 MoE 模型上用 LoRA 做 RL,性能无损失。
当 Sutton、DeepSeek、智谱唐杰相继为「持续学习」背书,后训练正从「预训练的收尾工序」升级为「定义模型能力上限的主战场」——谁能把模型放进经验里持续生长,谁就握住了下一代 AI 的入场券。
Macaron-V1 已开源,C 端个人 Agent 应用「马卡龙」可体验长记忆与持续学习;B 端可通过 MinT 平台训练自有 LoRA。
github.com/MindLab-ai → Macaron-V1