🧠 模型迭代 · 旗舰发布

Meta 多智能体推理模型大版本更新,首度开放 API 并实测百万级上下文

Meta 超级智能实验室发布多模态推理模型 Muse Spark 1.1。新模型主打智能体任务编排,在工具调用、代码开发与计算机操作上较前代大幅提升,并首次通过全新 Meta Model API 向开发者开放公测。

来源:官方发布 2026 全文约 3 分钟读完
#Meta #MuseSpark #AI Agent #多智能体
1M Tokens 主动管理的上下文窗口,支持长链路记忆与压缩
多智能体 主 Agent 规划委派,子 Agent 执行并上报
API 公测 开发者首次可基于 Muse Spark 构建应用

⚡ 30 秒速览

  • 核心升级:从单点推理转向端到端智能体编排,能自主拆解任务、跨应用操作电脑、处理复杂代码库。
  • 架构突破:能同时扮演"主控"与"执行"角色,主动管理百万 Token 上下文,对早期工作保持记忆并按需压缩。
  • 操作电脑:不再逐次点击,能判断何时写脚本自动化、何时直接交互,并批量生成操作动作。
  • 安全合规:通过 Meta 前沿 AI 扩展框架评估,在化生、网络安全、失控风险三大类均在安全余量内。
  • 怎么获取:Meta AI 应用内"Thinking"模式可用;开发者可通过 Meta Model API 公测接入。

01从"回答问题"到"调度系统"多智能体编排架构

Muse Spark 1.1 最大的变化不在单次推理能力,而在于它被训练成一个任务调度中心。面对复杂项目,它能够零样本泛化到新的原生工具、MCP 服务器和自定义技能。

模型能在"主控"与"执行"两种角色间无缝切换,通过多智能体系统优化端到端延迟:

主 Agent 收集上下文制定计划委派并行子 Agent子 Agent 遇阻上报

作为子 Agent 时,它会严格遵守职责边界,理解可用工具,并知道何时该把问题升级回主控。这种分层架构使其处理复杂项目的速度显著快于前代 Muse Spark。

传统长上下文模型

被动填充窗口,早期信息易被稀释,长链路任务后期常丢失关键步骤。

Muse Spark 1.1 主动管理

主动记忆动作、检索早期工作,并按需压缩以保留后续所需的关键步骤。

02会判断"怎么操作最快"的电脑使用者

在计算机操作场景中,Muse Spark 1.1 展现出一种此前少见的"元认知":它不再逐步推理每一次点击,而是判断何时该写脚本自动化、何时该直接交互,并在每一步生成批量动作。

🛒 动态场景:组织晚宴派对自适应执行

  • 下单过程中出现新的上下文变化(如宾客忌口、餐厅缺货),模型能自主察觉并更新订单,无需用户干预。
  • 跨多个应用维持会话上下文,适应不断变化的需求,在陌生界面中仅需极少人工介入。
核心能力:感知变化 → 自主调整 → 继续执行,而非中断等待新指令。

💻 代码工程:企业级系统调试与迁移多轮诊断

  • 在 OpenCode 环境中构建聊天 Web 应用,自动截图识别用户可见的故障,回溯到相关代码实施修复并验证。
  • 无缝融合编码、多模态理解与工具调用;支持规划模式、目标条件化、子 Agent 委派等主流智能体编码特性。
  • 在 Meta 内部编码评测(Internal Coding Bench)上较前代大幅提升,与领先竞品竞争力相当。
Meta 内部开发者和研究人员已在日常使用该模型加速构建,并用于自动化模型开发与评测任务

03感知与行动合一,安全在框内多模态落地与前沿风险评估

Muse Spark 1.1 的多模态能力强调感知与行动同时发生:能检查视觉与音频、在长工作流中保留细节,并在代用户操作电脑时调用这些细节。

📱 实战:用一段视频生成二手商品挂链视觉转行动

  • 用户用手机拍一段视频,模型从中提取有用照片并推理产品信息。
  • 随后操作用户的浏览器,自动在 Facebook Marketplace 创建商品挂链。
能力闭环:非结构化视觉输入 → 结构化推理 → 跨应用操作交付

部署前,Meta 依据其前沿 AI 扩展框架对模型进行了广泛安全评估:

化学与生物风险
安全余量内
未越过部署阈值
网络安全风险
安全余量内
未越过部署阈值
失控风险
安全余量内
未越过部署阈值

注:上述结论为 Meta 单方面依据其内部"前沿 AI 扩展框架"评估得出,该框架定义了评测方法、威胁模型与部署阈值;目前未见独立第三方复测数据。

在对抗性测试中,模型对直接越狱、来自不可信数据的间接提示注入攻击及开发者提示攻击表现出更强抵抗力,幻觉率与谄媚倾向均有降低。

04早期合作方怎么看来自 Replit、Cline、Box 等的反馈

"Muse Spark 最令人印象深刻的是它把多少能力塞进了一个模型:百万 Token 上下文、完整多模态支持(图像、视频、PDF)、内置带引用的搜索、强推理、顶级编码能力(尤其是前端与设计)、结构化输出与并行工具调用——一个完整的智能体基座。"

—— Amjad Masad,Replit CEO

"Meta 显然在为严肃的智能体编码而构建——强大的工具调用能力,加上一个让大规模运行真实编码工作负载在经济上可行的价格点。这种组合很罕见。"

—— Saoud Rizwan,Cline CEO

"在 Box 的企业工作评测集上测试,Muse Spark 交付了与当今领先前沿模型相当的企业能力。结合其在结构化、程序化工作流上的优势,对专业服务、公共部门和工业运营等行业的组织极具吸引力。"

—— Yashodha Bhavnani,Box AI 产品副总裁
编辑视角

本篇报道源自 Meta 官方博客,属企业通稿性质。文中所列能力提升与安全结论均为单方面披露:安全评估框架由 Meta 自身定义,评测集(如 Internal Coding Bench)细节未全量开源,目前未见独立第三方复测数据。读者宜将其视为"官方能力声明"而非中立验证结果。

外部引语来自 Replit、Cline、Box 等早期合作方,其反馈正面但存在商业合作背景,需注意利益相关性。建议结合后续独立评测与实际 API 调用数据综合判断。

当大模型竞争的焦点从"单次推理跑分"转向"多智能体端到端延迟"与"上下文主动管理",行业正在悄然更换赛道:决定胜负的不再只是参数规模,而是系统工程与架构编排能力。

现在就能用

模型已在 Meta AI 应用及 meta.ai 上线"Thinking"模式;开发者可通过全新 Meta Model API 公测接入。

meta.ai → 切换 Thinking 模式