架构与显存:GQA + Local/Global Attention如何把KV Cache压到1.7GiB
Muse Glimmer采用约30B参数 / 52层 Dense Transformer 架构(Hidden Size 6656,32个 Query Head,但只有2个 KV Head)。模型用 Dense Transformer + GQA + 混合注意力,同时压低 KV Cache 和长上下文计算成本;这不是单一新架构,而是组合式取舍。(信息来源:企业披露)
注意力模式采用 3 个 Local Attention + 1 个 Global Attention 的循环配置,Local Window 为 2048 Token。在全部 52 层中包含 39 个 Local 层与 13 个 Global 层。若按 BF16 估算,保存完整 128K 传统 MHA 占用超过 20 GiB(超越 24GB 单卡承受极限);即便是标准 GQA 保存完整 128K 仍需 6.5 GiB;而通过 Local/Global 混合后,理论 KV Cache 占用被成功压缩至约 1.7 GiB。
针对硬件部署,项目提供 K Quant(适合 24GB 设备,视觉模块 1.4GB + DFlash 1.6GB + 权重 16.8GB,合计接近 20GB)与 Dynamic K Quant(面向 32GB 设备)。在 15 项 Benchmark 平均评测中,K Quant 精度损失约 1.0%,Dynamic K Quant 损失约 0.2%。
视觉感知与上下文管理:128K不是长期Memory
视觉能力负责读取环境状态,但 Agent 仍需要主动管理截图历史;128K 只是工作空间,而不是无尽的记忆系统。
训练方法:从Logit Distillation到On-Policy Distillation
Agent 能力不是靠单次 SFT 获得,而是通过 Teacher 分布蒸馏、完整轨迹训练和 Student 自身 Rollout 的错误状态覆盖来建立任务恢复能力。
真正的 Agent 风险不是某一步产生错误,而是模型没有意识到错误并继续执行,导致偏差不断积累;因此 Failure Recovery(失败恢复)是整套训练流程的重中之重。
解码速度:DFlash用Block Diffusion把Decode从74.9拉到233.4 Token/s
高 Reasoning Strength 会生成大量推理 Token。DFlash 通过 Speculative Decoding 的变体 Block Diffusion,显著减少了 30B 主模型的 Decode Step。
在 K Quant 17GB、RTX 5090 测试环境下,生成 10000 Token 的纯 Decode 时间约从 134 秒大幅降至 43 秒(发布会演示,待第三方复测)。Reasoning Strength 分为 low / medium / high / xhigh 四档,公开 Benchmark 统一使用 high 档。
Benchmark能力分布与安全边界
Muse Glimmer 在需要长执行链的 Research/Agent 任务上表现更强,但在纯 GUI、终端和部分 Coding 场景仍有明显短板;Agent Benchmark 分数不能脱离 Scaffold 与 Prompt 单独解释。
在安全维度,本地运行虽解决了数据传输路径隐私问题,但无法自动解决 Prompt Injection、错误 Tool Call、权限越界以及不可逆操作风险。真实部署环境仍需增加 Guardrail 与 Human in the Loop 机制。
系统性结论:四个约束放进同一套设计
Muse Glimmer 把显存、上下文、环境状态感知和推理速度四个硬约束放在同一套系统中对冲,证明 30B 本地 Agent 的终局是系统级工程,而不是单点模型规模。