Meta 开源 30B 本地 Agent 模型,消费级显卡可运行,12 项测试拿下 SOTA
8 月 11 日,Meta 发布 300 亿参数本地 Agent 模型 Muse Glimmer,开放权重,量化后体积不到 20GB,可在 24GB 显存显卡上本地运行,无需网络连接即可执行任务。这是 Meta 成立超级智能实验室后首次开放模型权重,扎克伯格高调宣布开源路线,杨立昆点赞。
8 月 11 日,Meta 发布 300 亿参数本地 Agent 模型 Muse Glimmer,开放权重,量化后体积不到 20GB,可在 24GB 显存显卡上本地运行,无需网络连接即可执行任务。这是 Meta 成立超级智能实验室后首次开放模型权重,扎克伯格高调宣布开源路线,杨立昆点赞。
Muse Glimmer 是 Meta 超级智能实验室成立后首个开放权重的模型。它的核心指标让本地部署成为可能:
注:完整精度下模型需 55GB+ 内存,经 4 比特量化压缩至 20GB 以下,配合 KV 缓存优化可在单张消费级显卡上运行。数据来自 Meta 技术博客及开发者实测。
这组数字意味着什么?一台配备 RTX 4090 的游戏 PC,就能运行一个具备 Agent 能力的 300 亿参数模型。而在此之前,同等规模的模型几乎只能在云端运行。
但参数只是入场券。真正衡量 Agent 能力的,是它在真实任务中的表现。
Meta 将 Muse Glimmer 与参数规模相近的 Gemma 4 31B、Qwen 3.6 27B 进行了对比。在 22 项 Agent、编程、多模态和通用能力测试中,Muse Glimmer 拿下 12 项 SOTA,优势集中在 Agent 任务与推理测试。
注:柱形为 SOTA 数量相对值,非百分比。Muse Glimmer 在 MCP Atlas、DeepSearch QA、AIME 2026 等测试中均位列第一。安全测试方面,Gemma 4 以更低违规率领先。
一个诚实的注脚:Muse Glimmer 并未全面领先。Qwen 3.6 在桌面操作、部分编程和多模态测试中表现更好;Gemma 4 在两项安全测试中取得更低的违规率和攻击成功率。
基准测试是一面镜子。但开发者真正关心的,是它能不能在自己的电脑上跑起来、干成事。
模型发布后,多位开发者第一时间在个人设备上验证了 Muse Glimmer 的真实能力。以下是三组有代表性的实测:
Muse Glimmer 的部署门槛之所以能降到消费级硬件,依赖三项关键技术协同工作:
完整精度 55GB+,需要云端 A100/H100 等企业级显卡,个人用户无法本地运行。
知识蒸馏 + 4 比特量化 + DFlash 推测解码,压缩至 20GB,解码速度提升 3.1 倍。
具体来说:Meta 以更大的 Muse Spark 作为教师模型,通过 logit 蒸馏传递能力;中期训练加入长上下文、Agent 任务和推理轨迹;后训练结合监督微调、在线蒸馏和强化学习。最终将完整精度超过 55GB 的模型压缩至不到 20GB,同时利用配套草稿模型提高输出速度。
注:DFlash 推测解码通过草稿模型并行生成候选 token,再由主模型验证,在保持输出质量的同时提升速度。加速效果因硬件而异。
Meta 表示,Ollama、LM Studio、Unsloth 将提供支持,llama.cpp、ExecuTorch、MLX 等框架的优化集成也将陆续上线。AMD、Arm、戴尔、英特尔、英伟达正在参与性能优化。
技术解决了「能不能跑」的问题。但扎克伯格想做的,远不止一个模型。
Muse Glimmer 发布当日,扎克伯格发表长文,系统阐述了 Meta 的超级智能愿景。核心信息是:超级智能不应集中在少数公司或个人手中。
他提出三个具体方向,与 Muse Glimmer 的定位形成呼应:
每个人都可以拥有一个了解自身目标和偏好的 Agent,用于健康、职业、财务、学习等场景,通过手机、电脑和 AI 眼镜使用。需要更多算力的用户可付费购买,Meta 还考虑采用动态竞价机制。
即使 Meta 也无法读取用户信息或将其提供给其他机构。本地运行的 Muse Glimmer 正符合这一方向——个人文件及任务数据无需上传至云端。
除 Muse Glimmer 外,Meta 将开放最新基础模型 Muse Spark 1.2 的权重。扎克伯格呼吁美国减少对开源 AI 模型的限制,批评部分厂商通过封闭模型控制技术和用户。
此外,扎克伯格宣布设立「未来属于每个人」基金,初始规模 10 亿美元,用于支持 Meta 在美国建设和运营数据中心的社区,支持当地教师、急救人员以及能源和水务基础设施。
在模型治理方面,Meta 计划引入独立董事会审查发布标准,并在训练期间向政府提供中间检查点。扎克伯格同时支持继续限制先进芯片对华出口,认为这一政策可以减缓竞争对手的训练速度。
本地 Agent 模型的竞争,正在从云端算力比拼转向个人设备上的执行效率与隐私保护能力。当模型能力不再依赖网络连接,AI 的竞争将从参数规模转向系统工程的精密度——而 Meta 正在用开源赌一个更大的用户基数。
Muse Glimmer 权重已开放下载,可在 Hugging Face 获取,支持 Ollama、LM Studio 等本地部署工具。
Hugging Face → 下载模型权重