🧠 模型 · 持续学习

仅改 4B 参数反超基座,中国 Neo Lab 用「持续学习」拿下 6 项 SOTA

7 月 21 日,初创团队 Mind Lab 开源模型 Macaron-V1 正式版:在冻结 GLM-5.2 的 744B 基座参数、仅微调自研 4B LoRA 参数 的前提下,12 项基准测试中拿下 6 个 SOTA,性能反超基座及 GPT-5.4、Claude Opus 4.6。它押注的「持续学习」路线,正是图灵奖得主 Sutton、DeepSeek 近期共同指向的下一代模型核心能力。

来源:企业通稿与公开报道 2026-07-29 全文约 4 分钟读完
#Mind Lab #持续学习 #LoRA #后训练
6/12 基准测试 SOTA,其余接近前沿
4B 自训 LoRA 参数,基座 744B 全冻结
10% 万亿参数 RL 训练 GPU 消耗占比

⚡ 30 秒速览

  • 做了什么:开源 Macaron-V1,含旗舰版 Venti(总参 748B,基于 GLM-5.2)与轻量版 Tall(总参 50B,基于 Qwen3.6),均原生支持 200 万 token 上下文。
  • 技术路径:用 MoL(Mixture-of-LoRA)做后训练,系统按任务类型动态切换专家模块;用户长期使用沉淀的数据,能积累出持续更新的专属 LoRA。
  • 核心发现:200 个 LoRA 协作,性能较单 LoRA 提升 约 25%,且随协作数量呈 log 线性增长。
  • 商业进展:商业化启动 2 周,ARR 达 1000 万美金;母公司累计融资 6000 万美元,美团战投领投 A 轮。
  • 行业坐标:全球能在万亿参数上跑通 LoRA-RL 的团队,国内仅此一家,海外仅 OpenAI 前高管创立的 Thinking Machines Lab。

014B 参数,凭什么反超 744B 基座

Macaron-V1 旗舰版 Venti 的参数构成很直接:744B 冻结的 GLM-5.2 基座 + 4B 自研 LoRA。这 4B 拆分为四组各约 1B 的专家模块,分别负责 Chat、Agent、Coding 和生成 UI 界面四类能力。

它没有重训基座,而是用 MoL(Mixture-of-LoRA)的方式做后训练——执行不同任务时,系统动态切换到最适合的专家模块;用户长时间使用沉淀的数据,也能积累出一个专属 LoRA,随调用持续更新。

基座冻结挂载多 LoRA按任务动态路由数据沉淀专属 LoRA

团队曾用 200 份不同数据分别训练 200 个 LoRA 挂载协作,得出两个关键发现:

  • 发现一:参与协作的 LoRA 数量提升后,模型任务表现呈 log 线性增长——越多 LoRA 协作,效果越好。
  • 发现二:200 个 LoRA 协作,比用 200 份数据训出的单 LoRA,模型表现提升约 25%

团队由此判断:单一 LoRA 无法全面提升模型能力,MoL 可能是突破智能上限的有效办法

注:上述 25% 提升及 log 线性增长数据,均来自团队内部实验披露,未见第三方独立复测。

02万亿参数 RL:GPU 只花传统十分之一

2025 年 12 月,Mind Lab 在 Kimi K2(万亿参数 MoE 模型)上跑通端到端 LoRA 强化学习训练,仅用 64 张 H800,实现接近全参数训练的效果,GPU 消耗只有传统全参数 RL 的 10% 左右

难点在于:强化学习对基础设施精度要求极高,训练与推理精度不一致会带来偏差漂移,导致结果无法收敛。团队的解法是设计一套 混合协同并行引擎

张量并行+流水线并行+专家并行+序列并行

并引入 截断重要性采样 修正分布差异,让 LoRA 在 MoE 架构上稳定运行。基于此,今年 1 月推出 LoRA 训推基础设施平台 MinT,能管理 上百万个 LoRA 模型,实时加载速度提升近十倍。

传统全参 RL

从头训模型成本极高,算力消耗大,周期长。

LoRA-RL 路径

参数足够大且稀疏时,LoRA 可达全参训练效果,算力降至 10%。

03持续学习的四种解法团队为何选最硬的一条

创始人陈锴杰将现阶段持续学习方案归为四类。前三类各有硬伤,团队选择直接改参数的第四条路:

① 聊天上下文窗口内理解

  • 模型在对话窗口内反复理解用户意图,受限于上下文长度,无法跨会话沉淀。

② External Memory(RAG 外挂)检索瓶颈

  • 要记的东西越来越多,数据库快速膨胀,模型能力直接与检索能力挂钩

③ Harness / Loop EngineeringToken 消耗大

  • 复杂的 Harness 能适配场景,但消耗大量 Token,速度变慢,无法根治问题。

④ 直接改模型参数团队所选路径

  • 从底层把模型变成垂直模型,根本上改变表现。LoRA 属于此类——明确场景需要额外学习后,才启用 LoRA 模式
  • 不同模型间 99% 参数可共享,那 1% 决定差异。

团队将这套思路总结为 「经验智能」:模型从经历中学习,经验转化为新能力,新能力解决更难问题,更难问题带来更丰富经验——智能由此成为持续生长的过程。

04编辑视角

⚠️ 阅读提示与独立判断

本文核心数据(6 项 SOTA、25% 性能提升、10% 算力消耗)均来自 企业单方披露,未见第三方独立复测,读者宜带「通稿验证中」视角看待具体数字。但技术路径本身有迹可循:团队联合创始人 Andrew Chen 曾与姚顺雨共同发表 FireAct 论文,其独立选定的 LoRA-RL 路线,与 OpenAI 前高管创立的 Thinking Machines Lab 在《LoRA Without Regret》中得出的结论一致——足够大的 MoE 模型上用 LoRA 做 RL,性能无损失

当 Sutton、DeepSeek、智谱唐杰相继为「持续学习」背书,后训练正从「预训练的收尾工序」升级为「定义模型能力上限的主战场」——谁能把模型放进经验里持续生长,谁就握住了下一代 AI 的入场券。

现在就能用

Macaron-V1 已开源,C 端个人 Agent 应用「马卡龙」可体验长记忆与持续学习;B 端可通过 MinT 平台训练自有 LoRA。

github.com/MindLab-ai → Macaron-V1