🤖 编程智能体 · 定价博弈

Meta 突然发布编程智能体 Muse Code,定价只有对手十分之一

扎克伯格亲自宣布推出首款编程智能体 Muse Code,搭载专用模型 Muse Spark 1.2,在 Terminal-Bench 上得分 82.9%,逼近 Anthropic 最高分,但定价低至 0.10 美元/百万输入 token,仅为 Claude 的 1/30。

综合公开信息整理 2026-07-22 全文约 4 分钟读完
#Meta #Muse Code #编程智能体 #定价博弈 #开源转向
💲 0.10 美元/百万输入 token · 贡献者层级
82.9% Terminal-Bench 2.1 得分,超越 GPT-5.6
24 小时 长周期 GPU 内核优化持续发现改进

⚡ 30 秒速览

  • 定价策略激进:标准层 1.25/4.25 美元(输入/输出百万 token),贡献者层 0.10/0.20 美元——比 DeepSeek 还便宜,但需以数据换取。
  • 性能差距:Terminal-Bench 2.1 得分 82.9%,超越 GPT-5.6 Terra(81.8%),但落后于 Claude Opus 5 在 Claude Code 中的 86.7%。
  • 架构创新:异步后台智能体在整个会话期间保持存活,避免重复探索代码库;崩溃后可精确恢复,不丢失工作。
  • 开源转向:Muse Code 和 Muse Spark 1.2 均为专有模型,无权重下载,无自托管,扎克伯格仅模糊回应"很快有更多消息"。
  • 数据换折扣:贡献者层要求开发者选择加入以帮助改进模型,企业可选零数据保留但需额外付费。

01编程基准:逼近榜首,但未超越

Muse Spark 1.2 在三个编程基准上均展现出代际提升,但一个诚实的注脚是:在所有三个图表中,Claude Opus 5 都位居榜首。

Terminal-Bench 2.1 · 端到端软件工程任务

🥇 Claude Opus 5 (Claude Code)Anthropic
86.7
Muse Spark 1.2 (Muse Code)Meta
82.9
GPT-5.6 Terra (Codex)OpenAI
81.8
Grok 4.5 (Grok Build)xAI
81.6

DeepSWE 1.1 · 深度软件工程

🥇 Claude Opus 565.0%
65.0
GPT-5.6 Terra64.8%
64.8
Muse Spark 1.259.3%
59.3

注:柱形宽度按比例缩放,Terminal-Bench 以 Claude 86.7% 为 100%,DeepSWE 以 Claude 65.0% 为 100%。分差以标注数字为准。

代际提升是实实在在的:Muse Spark 1.2 在 Terminal-Bench 上比 1.1 提高了 6.7 个百分点,在 DeepSWE 上提高了 6.3 个百分点。但在 Meta 自己的内部编程基准上,Muse Spark 1.2 的 70.6% 仍落后于 Opus 5 的 79.4% 近 9 个百分点。

02定价策略:用数据换折扣,比 DeepSeek 还便宜

价格是 Meta 最锋利的武器。Muse Code 提供两个层级,标准层定价已低于 Anthropic 的 Sonnet 5,而贡献者层定价更是低至对手的 1/30。

标准层级

$1.25 / 百万输入 token
$4.25 / 百万输出 token

数据不用于训练,速率限制 3000 次请求/分钟/团队。对标 Anthropic Sonnet 5($3/$15)。

贡献者层级

$0.10 / 百万输入 token
$0.20 / 百万输出 token

比 DeepSeek-V4-Flash 更便宜。需选择加入数据改进,速率限制 60 次请求/分钟,面向个人和小型实验。

这个定价时机耐人寻味。就在前几天,DeepSeek 刚刚宣布计划整体上调 API 服务定价,预计涨幅较大。Meta 选择了在对手涨价的节点上,推出一个更便宜的选择。

但代价是数据。贡献者层级要求开发者以自身代码数据"补贴"模型改进。Meta 明确表示,企业客户可选择零数据保留选项,但需额外付费。这代表了"一项对企业客户很重要的重大企业级功能"。

03架构设计:异步后台智能体,长跑不怕崩溃

Muse Code 中最值得关注的技术创新,是其异步后台智能体架构。与大多数竞品工具为每个任务临时生成辅助智能体的模式不同,Muse Code 会让一组专门的后台智能体在整个会话期间持续存活

主智能体后台智能体(持续存活)独立子智能体(并行)隔离 git 工作树

这意味着:一个已经了解代码库的智能体,无需在每次开发者提出新需求时重新探索代码库。当任务规模足够大时,Muse Code 会分发到独立的子智能体进行并行处理,每个子智能体都在自己隔离的 git 工作树中,开发者的工作副本永远不会被触及。

第二个设计选择是可审计性。如果 Muse Code 在长时间运行的任务进行 20 小时后崩溃,它会从停止的地方精确恢复,不会丢失工作,也无需重新提示。每个模型调用、工具运行、审批和编辑在执行前都会被追加到本地事件日志中,Meta 称这一单一事实来源使运行时具有"可精确重放和重启安全"的特性。

一个令人印象深刻的案例:24 小时 GPU 内核优化

⚡ NVIDIA Hopper 硬件上持续 24 小时、超千次工具调用 持续发现改进

  • 智能体在 Triton 中工作,不能封装现有第三方库。
  • 最终在 KDA 和 MLA 内核上取得了实质性改进,包括非直观的优化如重新中心化门控累积衰减。
  • 扎克伯格称:"它在初始探索阶段之后仍在持续发现实质性改进。"
长周期自主探索能力:体现异步后台架构带来的持续学习优势。

04开源战略彻底转向?小扎留下悬念

三年来,Meta 凭借 Llama 系列将自己塑造成开放 AI 的旗手。从 2023 年 2 月 LLaMA 泄露掀起消费级 AI 热潮,到 Llama 2 的商业许可,再到 4050 亿参数的 Llama 3.1 及扎克伯格的"开源 AI 是前进之路"宣言,Meta 一直向开发者承诺前沿权重应免费下载、自托管和微调。

裂痕从 Llama 4 开始。2025 年 4 月推出的 Llama 4 评价平平,最终承认基准结果存在虚报,而 DeepSeek、阿里巴巴、智谱 AI 等中国开源模型迅速崛起,到 2025 年底已占 Hugging Face 下载量的约 41%,侵蚀了 Llama 的领导地位。

今年 4 月 8 日,Llama 时代实质终结。MSL 发布了首个专有模型 Muse Spark,无可下载权重,无自托管,仅限云端 API。四个月后的今天,Muse Code 的发布没有任何开源承诺——既无权重也无许可证,发布博文和扎克伯格的帖子中从未出现"开源"一词。

这一转向尤为尖锐,因为竞争对手正朝相反方向移动。OpenAI 在 Apache 2.0 许可下开源了 Codex CLI,并推出 gpt-oss 开放权重模型;Google 的 Gemini CLI 同样采用 Apache 许可证。Meta 如今更接近 Anthropic 的专有姿态,而曾经高呼开源是前进之路的公司,现在要求开发者按 token 付费使用模型。

新推出的贡献者层级在某种程度上成为 Llama 策略的继承者:不再以免费权重换取市场份额,而是以廉价 token 换取训练数据。用户需以自身数据"补贴"模型。

编辑核心判断

Meta 的专有转身暴露了一个残酷现实:当开源模型开始侵蚀你的市场份额时,数据护城河比社区好感度更优先。贡献者层是 Llama 精神的变体——但这是以数据换折扣,而非以自由换生态。

现在就能用

Muse Code 目前提供测试版,访问 Meta 官网或 X 平台即可获取体验信息。

查看官方公告