刚被索赔 1.4 万亿,Meta 连夜开源 30B 小钢炮:扎克伯格点名 DeepSeek、Qwen、Kimi
8 月 10 日,Meta Superintelligence Labs 在加州等四州 1.4 万亿美元 天价诉讼的阴影下,突然开源 Muse Glimmer——一个 30B 参数的 Agent 模型,Apache 2.0 许可证,Muse 系列第一次拿出权重。
8 月 10 日,Meta Superintelligence Labs 在加州等四州 1.4 万亿美元 天价诉讼的阴影下,突然开源 Muse Glimmer——一个 30B 参数的 Agent 模型,Apache 2.0 许可证,Muse 系列第一次拿出权重。
先放下那场官司,把模型规格摆在桌面上。
这不是一个聊天机器人。
Muse Glimmer 由 Meta Superintelligence Labs 训练,官方定位是 always-on local agent——常驻本地的 Agent,不上云也能干活。
发布当天的适配速度,也说明这是一次有备而来的开源:
30B 全精度要 55GB 以上内存,RTX 5090 都装不下。
Meta 用了两板斧。
55GB+ 内存占用,基本只有数据中心跑得动。
语言模型本体缩到 20GB 以内,24GB / 32GB 消费级设备可跑。
第一板斧是量化。权重压到约 4-bit,省出来的显存留给 KV cache、视觉编码器和投机解码的小模型。官方称,压缩对 Agent 任务性能几乎无损。
第二板斧是投机解码。传统解码是一个词一个词往外蹦,每一步都要把 30B 参数完整过一遍。Glimmer 配了一个基于 DFlash 的轻量 drafter——小模型先「瞎猜」一大段,主模型一次前向验完:猜对的白赚,猜错的改掉。
注:速度对比基于官方公开数据,均为消费级设备;批量吞吐为 SGLang + NVFP4 + DFlash 组合成绩。
说白了,Meta 用工程手段把一个 60GB 级的模型压进 24GB 级设备,还跑得足够快。本地 Agent 最怕的「想五分钟憋一句话」,算是正面解决了。
能力从哪来?
答案是自家闭源旗舰。
预训练:用 Muse Spark 的输出做 logit 蒸馏——老师模型连「每个候选词的信心分布」都手把手教过去。
中训:加长上下文,塞入更密集的 Agent 交互数据。
后训练:监督微调 + on-policy 蒸馏 + 强化学习。
复杂推理链路和 Agent 交互数据,全部由那个庞然大物生成,再灌进 30B 的小身板。这套流程砸出来的能力清单,很 Agent 向:
这套清单拉出来,是一名合格的「数字打工人」。
不过这里得泼点冷水。
工具调用链路确实是强项——MCP Atlas 榜单上,Glimmer 拿到 75.5 分,压过 Qwen3.6-27B 的 62.5 和 Gemma4-31B 的 54.2:
注:图为 MCP Atlas 工具调用榜单,柱形自 45 分起缩放,非零起点,差距以标注分数为准。
时间点选得很微妙。三条线,拧在一起。
扎克伯格同日发布 14 页长文《The Future is for Everyone》,主张超级智能交到每个人手里,明确点名DeepSeek、Qwen、Kimi 是开源领域的领先者。去年春天 Meta 一度收回开源脚步,现在等于公开承认:这块地盘被中国模型占了,得抢回来。
Muse Spark 上个月刚开始卖 API,公开榜单仍落后于 Anthropic 和 OpenAI 旗舰。Meta 的策略是打价格 + 开源引流——与 DeepSeek、月之暗面、阿里用宽松许可证打市场的路数如出一辙。Muse Spark 1.2 的开源权重版也已预告在路上。
四个州按「受影响青少年 × 法定罚款上限」算出 1.4 万亿美元,Meta 反击称这是「博头条的数字」。8 月奥克兰开庭在即,此时高举「开源」「隐私」「个人超级智能」的旗帜,叙事上的收益显而易见。
Glimmer 验证的可是一条可复制的产品路线:云端旗舰定上限,本地蒸馏承接,量化 + 投机解码塞进消费级硬件——文件、日历、代码、聊天记录这些高频又私密的活,迟早要留在设备上跑。
但比模型更值得玩味的信号在发布会之外:当扎克伯格需要点名三家中国实验室来论证开源的重要性时,开源大模型的重心在哪里,已经不需要更多解释了。
权重已在 Hugging Face 开放,Ollama 0.32.7 起 day-0 支持。24GB 显存就是门槛,设备端优化覆盖 AMD / Arm / Intel / NVIDIA。
在 Ollama 上运行 Muse Glimmer →