🔥 开源 · 模型发布

刚被索赔 1.4 万亿,Meta 连夜开源 30B 小钢炮:扎克伯格点名 DeepSeek、Qwen、Kimi

8 月 10 日,Meta Superintelligence Labs 在加州等四州 1.4 万亿美元 天价诉讼的阴影下,突然开源 Muse Glimmer——一个 30B 参数的 Agent 模型,Apache 2.0 许可证,Muse 系列第一次拿出权重。

来源:公开报道 8 月 10 日 全文约 4 分钟读完
#Meta #Muse Glimmer #开源模型 #本地 Agent
30B 稠密多模态 · 官方定位「常驻本地 Agent」
233 tok/s RTX 5090 实测解码 · 较基线提速 3.1 倍
Apache 2.0 商用 · 修改 · 再分发,基本不设门槛
⚡ 30 秒速览
  • 冰火两重天:四个州索赔 1.4 万亿美元(≈Meta 总市值),同一天实验室突然开源 Muse Glimmer。
  • 两板斧塞进 24GB:4-bit 量化把主模型压到 20GB 内 + DFlash 投机解码,RTX 5090 上 233 tok/s。
  • 蒸馏自旗舰:Muse Spark 当老师,logit 蒸馏 + 强化学习;工具调用链在 MCP Atlas 拿到 75.5 分。
  • 诚实的短板:OSWorld-Verified、TerminalBench 2.1、SWE-Bench Verified 上,同尺寸 Qwen3.6-27B 反超。
  • 扎克伯格长文:14 页宣言点名 DeepSeek、Qwen、Kimi 是开源领先者,主张放松开源 AI 限制。

01发生了什么 Muse 系列第一次开源

先放下那场官司,把模型规格摆在桌面上。

这不是一个聊天机器人。

Muse Glimmer 由 Meta Superintelligence Labs 训练,官方定位是 always-on local agent——常驻本地的 Agent,不上云也能干活。

参数规模
30B 稠密多模态(27.9B 文本 + 1.9B ViT 视觉编码器)
架构
52 层 Transformer,GQA:32 个 Q 头对 2 个 KV 头
上下文
混合滑动窗口,128k+(局部 RoPE + 全局 NoPE)
许可证
Apache 2.0,权重与 GGUF / Unsloth 变体同步开放

发布当天的适配速度,也说明这是一次有备而来的开源:

llama.cpp HF Transformers Ollama 0.32.7 LM Studio SGLang MLX / vLLM 随后跟进 AMD / Arm / Intel / NVIDIA 设备端优化

0230B 怎么塞进 24GB 显卡

30B 全精度要 55GB 以上内存,RTX 5090 都装不下。

Meta 用了两板斧。

全精度 FP16

55GB+ 内存占用,基本只有数据中心跑得动。

4-bit 量化

语言模型本体缩到 20GB 以内,24GB / 32GB 消费级设备可跑。

第一板斧是量化。权重压到约 4-bit,省出来的显存留给 KV cache、视觉编码器和投机解码的小模型。官方称,压缩对 Agent 任务性能几乎无损。

第二板斧是投机解码。传统解码是一个词一个词往外蹦,每一步都要把 30B 参数完整过一遍。Glimmer 配了一个基于 DFlash 的轻量 drafter——小模型先「瞎猜」一大段,主模型一次前向验完:猜对的白赚,猜错的改掉。

233RTX 5090 单用户 tok/s,3.1×
1452SGLang 批量吞吐 tok/s
50M5 Max MacBook tok/s,1.8×
20量化后权重体积(GB)

注:速度对比基于官方公开数据,均为消费级设备;批量吞吐为 SGLang + NVFP4 + DFlash 组合成绩。

说白了,Meta 用工程手段把一个 60GB 级的模型压进 24GB 级设备,还跑得足够快。本地 Agent 最怕的「想五分钟憋一句话」,算是正面解决了。

03打工人素质,是蒸馏出来的

能力从哪来?

答案是自家闭源旗舰。

预训练:用 Muse Spark 的输出做 logit 蒸馏——老师模型连「每个候选词的信心分布」都手把手教过去。

中训:加长上下文,塞入更密集的 Agent 交互数据。

后训练:监督微调 + on-policy 蒸馏 + 强化学习。

复杂推理链路和 Agent 交互数据,全部由那个庞然大物生成,再灌进 30B 的小身板。这套流程砸出来的能力清单,很 Agent 向:

能力清单

  • 精确 schema 的工具调用,不靠「猜格式」
  • 多步推理,工具失败后自己诊断报错并重试
  • 读截图、读图表的多模态输入
  • 100 多种语言,兼容 OpenClaw 编排框架

这套清单拉出来,是一名合格的「数字打工人」。

不过这里得泼点冷水。

工具调用链路确实是强项——MCP Atlas 榜单上,Glimmer 拿到 75.5 分,压过 Qwen3.6-27B 的 62.5 和 Gemma4-31B 的 54.2:

Muse GlimmerMeta Superintelligence Labs
75.5
Qwen3.6-27B阿里通义千问
62.5
Gemma4-31BGoogle
54.2

注:图为 MCP Atlas 工具调用榜单,柱形自 45 分起缩放,非零起点,差距以标注分数为准。

诚实的注脚:在 OSWorld-Verified、TerminalBench 2.1、SWE-Bench Verified 上,反超的恰恰是 Qwen3.6-27B。这个「小钢炮」在工具调用链路上很强;真到电脑操作和终端写代码的硬碰硬,同尺寸的国产模型还站在它前面。

04为什么偏偏是现在

时间点选得很微妙。三条线,拧在一起。

路线开源攻守易形

扎克伯格同日发布 14 页长文《The Future is for Everyone》,主张超级智能交到每个人手里,明确点名DeepSeek、Qwen、Kimi 是开源领域的领先者。去年春天 Meta 一度收回开源脚步,现在等于公开承认:这块地盘被中国模型占了,得抢回来。

生意商业布局

Muse Spark 上个月刚开始卖 API,公开榜单仍落后于 Anthropic 和 OpenAI 旗舰。Meta 的策略是打价格 + 开源引流——与 DeepSeek、月之暗面、阿里用宽松许可证打市场的路数如出一辙。Muse Spark 1.2 的开源权重版也已预告在路上。

舆情诉讼叙事

四个州按「受影响青少年 × 法定罚款上限」算出 1.4 万亿美元,Meta 反击称这是「博头条的数字」。8 月奥克兰开庭在即,此时高举「开源」「隐私」「个人超级智能」的旗帜,叙事上的收益显而易见。

还有个小细节:据公开报道,Meta 内部还有一个代号 Watermelon 的更强模型,开源与否没有定论。所以 Glimmer 的定位很清晰——开源的是旗舰的蒸馏产物,看家本事还攥在手里。
编辑核心判断

Glimmer 验证的可是一条可复制的产品路线:云端旗舰定上限,本地蒸馏承接,量化 + 投机解码塞进消费级硬件——文件、日历、代码、聊天记录这些高频又私密的活,迟早要留在设备上跑。

但比模型更值得玩味的信号在发布会之外:当扎克伯格需要点名三家中国实验室来论证开源的重要性时,开源大模型的重心在哪里,已经不需要更多解释了。

想自己跑一把?

权重已在 Hugging Face 开放,Ollama 0.32.7 起 day-0 支持。24GB 显存就是门槛,设备端优化覆盖 AMD / Arm / Intel / NVIDIA。

在 Ollama 上运行 Muse Glimmer →