🔥 开源 · 本地智能体

Meta 开源 30B 本地 Agent 模型,消费级显卡可运行,12 项测试拿下 SOTA

8 月 11 日,Meta 发布 300 亿参数本地 Agent 模型 Muse Glimmer,开放权重,量化后体积不到 20GB,可在 24GB 显存显卡上本地运行,无需网络连接即可执行任务。这是 Meta 成立超级智能实验室后首次开放模型权重,扎克伯格高调宣布开源路线,杨立昆点赞。

综合公开信息整理 2026-08-12 全文约 3 分钟读完
#Meta #Muse Glimmer #开源 #本地 Agent #消费级硬件
300 亿 参数规模 · 稠密模型
20 GB 量化后体积,完整精度 55GB+
12 / 22 项测试拿下 SOTA(Agent 领先)

⚡ 30 秒速览

  • 开源:Muse Glimmer 采用 Apache 2.0 协议开放权重,可在 24GB 显存显卡上本地运行,无需联网。
  • 性能:22 项 Agent、编程、多模态测试中拿下 12 项 SOTA,Agent 任务表现尤为突出。
  • 实测:离线操作 Mac 应用、生成可运行游戏,单卡 RTX 4090 支持 13 万 token 上下文。
  • 技术:知识蒸馏 + 4 比特量化 + DFlash 推测解码,体积从 55GB 压缩至 20GB,解码速度提升 3.1 倍。
  • 愿景:扎克伯格提出免费个人 Agent、完全私密模式,设立 10 亿美元基金支持社区。

01模型硬核数据 一个能装进口袋的 Agent

Muse Glimmer 是 Meta 超级智能实验室成立后首个开放权重的模型。它的核心指标让本地部署成为可能:

30B参数(稠密)
20GB量化后体积
24GB最低显存要求
13万token 上下文(RTX 4090)

注:完整精度下模型需 55GB+ 内存,经 4 比特量化压缩至 20GB 以下,配合 KV 缓存优化可在单张消费级显卡上运行。数据来自 Meta 技术博客及开发者实测。

这组数字意味着什么?一台配备 RTX 4090 的游戏 PC,就能运行一个具备 Agent 能力的 300 亿参数模型。而在此之前,同等规模的模型几乎只能在云端运行。

但参数只是入场券。真正衡量 Agent 能力的,是它在真实任务中的表现。

02基准测试:12 项 SOTA Agent 任务领先

Meta 将 Muse Glimmer 与参数规模相近的 Gemma 4 31B、Qwen 3.6 27B 进行了对比。在 22 项 Agent、编程、多模态和通用能力测试中,Muse Glimmer 拿下 12 项 SOTA,优势集中在 Agent 任务与推理测试。

🥇 Muse Glimmer 30BMeta · 12 项 SOTA
12 SOTA
Qwen 3.6 27B阿里通义千问
7 SOTA
Gemma 4 31BGoogle
6 SOTA
75.5MCP Atlas(工具调度)
74.6DeepSearch QA(深度检索)
51.2SWE-Bench Pro(编程)
94.7AIME 2026(数学)

注:柱形为 SOTA 数量相对值,非百分比。Muse Glimmer 在 MCP Atlas、DeepSearch QA、AIME 2026 等测试中均位列第一。安全测试方面,Gemma 4 以更低违规率领先。

一个诚实的注脚:Muse Glimmer 并未全面领先。Qwen 3.6 在桌面操作、部分编程和多模态测试中表现更好;Gemma 4 在两项安全测试中取得更低的违规率和攻击成功率。

基准测试是一面镜子。但开发者真正关心的,是它能不能在自己的电脑上跑起来、干成事。

03开发者实测:三场压力测试 从 Mac 到 4090

模型发布后,多位开发者第一时间在个人设备上验证了 Muse Glimmer 的真实能力。以下是三组有代表性的实测:

💻 离线操作 Mac 应用:备忘录与提醒事项「首次感到可用」

  • 通过 Cua Driver 结合 macOS 辅助功能接口与屏幕图像识别,完成新建清单添加日程提醒等操作。
  • 搭载苹果自研芯片的消费级设备上仍存在较高延迟,但任务执行全程无需网络连接
  • 开发者称这是首款愿意推荐用于「启动后无需持续监督」工作流的本地模型。
实测评价:「离线操作电脑真正具备了可用性」——但工具定义与屏幕截图占用上下文较多,需优化接口。

🎮 生成三款复古街机游戏全部可运行

  • 在 RTX 5090(32GB 显存)上,根据相同提示词一次生成《太空侵略者》《俄罗斯方块》《打砖块》。
  • 三款游戏均可正常运行:敌机加速、方块消除、砖块击碎,没有卡死或崩溃
  • 但 token 消耗为 8.34 万,耗时 17.7 分钟,明显高于 Qwen 3.6(2.37 万 / 5.4 分钟)和 Gemma 4(1.78 万 / 4.5 分钟)。
实测评价:生成质量最高,但效率有待提升——在速度敏感场景中需权衡。

⚡ 单卡 13 万 token 上下文RTX 4090 满血运行

  • 在单张 RTX 4090 上运行 UD-Q4_K_XL 量化版本,不量化 KV 缓存、不开启 DFlash 推测解码。
  • 可配置 13 万 token 上下文,占用约 19.34 GB 显存,输入预处理速度超 3100 token/s。
  • 加入 DFlash 草稿模型后,输出速度从 50 token/s 提升至 75 token/s,基本用满 24GB 显存。
实测评价:通过共享注意力缓存,在消费级显卡上实现了长上下文——KV 缓存优化是关键。

04技术路线:让 55GB 模型住进 20GB 空间

Muse Glimmer 的部署门槛之所以能降到消费级硬件,依赖三项关键技术协同工作:

传统部署方式

完整精度 55GB+,需要云端 A100/H100 等企业级显卡,个人用户无法本地运行。

Muse Glimmer 优化方案

知识蒸馏 + 4 比特量化 + DFlash 推测解码,压缩至 20GB,解码速度提升 3.1 倍。

知识蒸馏4 比特量化DFlash 推测解码本地部署

具体来说:Meta 以更大的 Muse Spark 作为教师模型,通过 logit 蒸馏传递能力;中期训练加入长上下文、Agent 任务和推理轨迹;后训练结合监督微调、在线蒸馏和强化学习。最终将完整精度超过 55GB 的模型压缩至不到 20GB,同时利用配套草稿模型提高输出速度。

3.1×RTX 5090 解码加速
1.8×M5 Max 解码加速
1.5×M4 Max 解码加速
20GB量化后体积

注:DFlash 推测解码通过草稿模型并行生成候选 token,再由主模型验证,在保持输出质量的同时提升速度。加速效果因硬件而异。

Meta 表示,Ollama、LM Studio、Unsloth 将提供支持,llama.cpp、ExecuTorch、MLX 等框架的优化集成也将陆续上线。AMD、Arm、戴尔、英特尔、英伟达正在参与性能优化。

技术解决了「能不能跑」的问题。但扎克伯格想做的,远不止一个模型。

05扎克伯格的个人超级智能路线

Muse Glimmer 发布当日,扎克伯格发表长文,系统阐述了 Meta 的超级智能愿景。核心信息是:超级智能不应集中在少数公司或个人手中。

他提出三个具体方向,与 Muse Glimmer 的定位形成呼应:

🆓

免费或低价的个人 Agent

每个人都可以拥有一个了解自身目标和偏好的 Agent,用于健康、职业、财务、学习等场景,通过手机、电脑和 AI 眼镜使用。需要更多算力的用户可付费购买,Meta 还考虑采用动态竞价机制。

🔒

完全私密模式

即使 Meta 也无法读取用户信息或将其提供给其他机构。本地运行的 Muse Glimmer 正符合这一方向——个人文件及任务数据无需上传至云端

🌐

继续开放模型权重

除 Muse Glimmer 外,Meta 将开放最新基础模型 Muse Spark 1.2 的权重。扎克伯格呼吁美国减少对开源 AI 模型的限制,批评部分厂商通过封闭模型控制技术和用户。

此外,扎克伯格宣布设立「未来属于每个人」基金,初始规模 10 亿美元,用于支持 Meta 在美国建设和运营数据中心的社区,支持当地教师、急救人员以及能源和水务基础设施。

在模型治理方面,Meta 计划引入独立董事会审查发布标准,并在训练期间向政府提供中间检查点。扎克伯格同时支持继续限制先进芯片对华出口,认为这一政策可以减缓竞争对手的训练速度。

🔓 开放权重,可下载部署:Muse Glimmer 已上传至 Hugging Face,采用 Apache 2.0 协议。开发者可在 Ollama、LM Studio 等工具中直接使用。
编辑核心判断

本地 Agent 模型的竞争,正在从云端算力比拼转向个人设备上的执行效率与隐私保护能力。当模型能力不再依赖网络连接,AI 的竞争将从参数规模转向系统工程的精密度——而 Meta 正在用开源赌一个更大的用户基数。

现在就能用

Muse Glimmer 权重已开放下载,可在 Hugging Face 获取,支持 Ollama、LM Studio 等本地部署工具。

Hugging Face → 下载模型权重