⚡ 模型发布 · 第一梯队观察

大模型竞争再换座次:Grok 4.6挤进第一梯队,却仍难稳定完成长任务

8 月 12 日,Grok 4.6 发布。它在综合智能、编程榜单和 API 价格上同时打出强牌:能力已接近 OpenAI 与 Anthropic 的旗舰模型,部分编程测试领先,价格却明显更低。但在真正接近生产环境的长链条 Agent 任务中,理解与启动并不等于稳定交付

事件时间:2026-08-12 全文约 5 分钟读完
#Grok 4.6 #大模型竞争 #Agent #模型价格
61 综合智能指数 · 与 GPT-5.6 Sol 同分
69.9% CursorBench 3.2 · Grok 4.6 High
$2 / $6 每百万输入 / 输出 Token 起价

30 秒速览

  • 发生了什么:Grok 4.6 在 35 天内接替 Grok 4.5,进入美国大模型竞争的第一梯队。
  • 强在哪里:综合智能指数 61 分,CursorBench 3.2 得分 69.9%,超过 GPT-5.6 Sol 的 67.2%。
  • 短板是什么:DeepSWE 得分 65.9%,TerminalBench 仅 26%,长链条任务中的连续执行与收尾仍不稳定。
  • 它能做什么:能拆解《奥德赛》的历史与诗学冲突,也能搭出电影制片计算器;但“估算 208 个工作日”不是实际交片证明。
  • 真正的竞争:客户购买的不是 Token 单价,而是一次可复现、少返工、低人工介入的成功交付。

01发生了什么?先看 35 天内的版本跃迁

马斯克给 Grok Imagine 立下的目标,是在年底前制作一部完整的《奥德赛》。三分钟短片已经具备盔甲、海岸和人物特写的电影预告片质感,但一部九十分钟长片还需要几千个镜头、连续的人物状态,以及一套能处理废片、重做和人工审核的生产系统。

所以,真正的问题不是“能不能生成一个漂亮镜头”。

Grok 4.5 开始推送

上一代模型进入公开使用阶段,也成为下一轮训练与 Agent 优化的基础。

Grok 4.6 发布

距离 4.5 仅 35 天,模型在综合能力、编程任务和 API 价格上形成新的组合优势。

Grok 4.7 仍停留在预告阶段

马斯克称其拥有 2.1 万亿参数、Token 效率更高,但参数与能力目前都只是单方面说法。

注:时间线按已发布事件与预告排列;最后一项属于尚未兑现的产品计划,不能与已测成绩等量齐观。

马斯克要求电影“符合历史、忠于荷马艺术”。这个目标本身就存在冲突:青铜时代考古、史诗中的混合时间层、作品诗学和现代电影改编,并不是同一套约束。

Grok 4.6 的表现之所以值得拆开看,是因为它没有把问题简化成“查资料并写答案”,而是尝试把争议拆成不同层次,再为每一层安排证据边界。它还纠正了一个常见误引:“让千艘战船起航的面孔”出自马洛,而不是荷马。

02为什么可信?榜单同时给出优势与断点

单一榜单的领先,往往只能说明模型擅长某种题型。Grok 4.6 这次更有信息量的地方,在于它在编程任务上表现强劲,同时在长链条 Agent 测试中暴露出明显落差。两组数字放在一起,才接近它当前的真实位置。

评测项目
Grok 4.6
GPT-5.6 Sol
Claude Fable 5
综合智能指数
61
61
62
CursorBench 3.2
69.9%
67.2%
DeepSWE
65.9%
73%
70%
TerminalBench
26%
34.6%
34.1%
单次任务成本
$2.34
$5.69

注:分数越高越好,单次任务成本越低越好;横向短条只作相对阅读辅助,精确数值以表格标注为准。

上桌牌:编程与性价比

在 CursorBench 3.2 上,Grok 4.6 High 以 69.9% 超过 Sol 的 67.2%;一次任务成本约为后者的四成。

断点牌:长链条可靠性

TerminalBench 只有 26%,明显低于 Sol 的 34.6% 和 Fable 5 的 34.1%,说明它仍容易在连续执行中失速。

这组结果更像一张能力雷达,而不是一张总成绩单:Grok 4.6 已经很会理解需求、启动项目和搭建框架,但在处理意外、持续调用工具并把结果收尾时,仍没有形成稳定优势。

03它到底能做什么?两个测试,比口号更接近生产

📜 任务一:读懂《奥德赛》的内部冲突 结构化拆解

  • 将问题拆成四层:青铜时代考古、荷马史诗中的混合时间层、作品自身的诗学,以及现代电影改编。
  • 提出约束原则:考古负责器物、服装和地理;荷马负责人物、叙事和诗学,避免用考古证据去证明神话人物真实存在。
  • 识别并纠正“千艘战船起航的面孔”这一常见错误,将其出处指向马洛而非荷马。
编辑观察:它展示的不是资料堆积,而是把互相冲突的判断拆开,再为不同观点构造证据边界。

🎬 任务二:搭建一套 AI 电影制片计算器 系统化建模

  • 将成片时长、平均镜头长度、首轮可用率、复杂镜头占比、并发任务数、人工审核时间、成本和工期设为可调参数。
  • 按照默认参数计算,九十分钟长片需要约 208 个工作日,并进一步建议先制作一部 12 至 20 分钟的荷马选篇。
  • 计算器可以回答“如果镜头更复杂、返工率更高,工期会怎样变化”,而不是只给出一个静态结论。
诚实注脚:208 天是模型假设下的估算,不是实测交片时间。连续性失败率、每个可用镜头的生成次数和人工审核负担,都还没有被真实生产验证。

这两个任务说明,Grok 4.6 已经能够从文本理解走向工程拆解:它会建立层次、定义参数、写出流程。但真正的电影生产还需要让数千个镜头中的脸、服装、船只、空间和叙事保持一致。

会搭系统,距离系统能稳定运行,中间还隔着返工率。

04为什么能做到?算力、数据与后训练形成流水线

Grok 4.6 的快速迭代并不是单靠某一次模型架构跃迁。更合理的解释是:算力基础设施、实时信息入口、真实编程任务和后训练环境开始互相喂养,版本更新因此可以从“重新训练一代模型”变成“持续修正一个系统”。

Colossus 扩张 GPU 集群,提供训练与推理算力
X 提供实时信息、用户反馈与分发入口
Cursor 提供真实编程任务与工具调用轨迹
后训练 监督微调、强化学习与 Agent 环境
Grok 产品 API、订阅与 Agent 产生新反馈

注:箭头表示信息与能力的循环路径,不代表所有数据可以无条件跨产品共享;组织边界、隐私和监管仍会限制闭环速度。

基础设施建设速度尤其激进:首期约 10 万张 Hopper GPU 的 Colossus 用时 122 天,随后扩展至 20 万张又用了 92 天;服务器到场 19 天后,集群便开始运行训练任务。这类部署速度,解释了为什么 Grok 可以在短周期内持续获得算力支持。

2025 年
$12.7B · 61%
2026 Q1
$7.7B · 76%
2026 Q2
$15.828B · 86%
2026 上半年
$23.6B

注:金额为报道中的 AI 业务资本开支口径;条形长度主要表示占公司资本开支比例,2026 年上半年一项为累计金额,不宜与单季比例直接比较。

代价也同样清楚:2025 年 AI 分部收入约 32 亿美元、经营亏损 64 亿美元,资本开支 127 亿美元;2026 年上半年 AI 资本开支累计达到 236 亿美元。模型必须留在第一梯队,才能把这套重资产基础设施向 API、订阅和 Agent 等更高附加值业务延伸。

05怎么判断?Token 价格只是第一层账本

当头部模型能力差距只剩几个百分点,价格会先被看见。Grok 4.6 的 API 起价为每百万输入 Token 2 美元、输出 Token 6 美元,确实比一次任务 5.69 美元的 Sol 更有成本吸引力。但市场正在进入更复杂的计分规则:能力决定能否上桌,可靠性决定客户敢不敢交活,单位任务成本决定客户能用多少次。

Grok 4.6 API

输入 / 输出 Token 起价

$2输入 / 百万 Token
$6输出 / 百万 Token

一次任务成本

CursorBench 任务估算

$2.34Grok 4.6
$5.69Sol

DeepSeek V4 Flash

$0.14 / $0.28 输入 / 输出

Grok 4.6

$2 / $6 输入 / 输出

GPT-5.6 Luna

$0.2 / $1.2 输入 / 输出

GPT-5.6 Terra

$2 / $12 输入 / 输出

注:价格按报道所述阶段性公开价格整理,单位均为每百万 Token;不同模型的上下文、推理策略与调用次数不同,不能仅凭单价推断最终成本。

能力能不能上桌
可靠性敢不敢交活
成本能不能规模化
渠道能不能卖出去

如果一个模型便宜一半,却需要更多步骤、更频繁重试,或者总在最后 20% 失败,省下的推理费用很快会被返工和人工审核吃掉。Grok 4.6 的企业化短板也不只在分数:安全、稳定性、透明度、品牌风险和成熟销售渠道,都不会因为一次榜单上升而自动消失。

它的另一张牌是组合能力:Colossus 提供算力,X 提供实时信息和用户,Cursor 提供真实编程任务与开发者反馈,Grok 再把这些资源转成 API、订阅和 Agent 产品。但自动驾驶、机器人、X 与 Grok 之间究竟能共享多少数据和客户,仍受公司边界、隐私与监管约束。

编辑核心判断

Grok 4.6 已经证明自己有资格坐上第一牌桌,却还没有证明自己能稳定把长任务交付完。对企业客户而言,低价只有在成功率、重试次数和人工审核都可控时才是真便宜;因此,Grok 下一阶段要补的不是一张更漂亮的榜单,而是“从启动到收尾”的可靠性。

一部九十分钟电影如此,一次代码部署、财务分析或企业流程自动化也如此。大模型商业竞争的计价单位,正在从 Token 转向一次成功交付。

给读者的验证入口

原始报道没有提供明确的公开体验地址,因此本文不虚构链接。若你已有 Grok 或相关 API 使用权限,可以用一次真实任务检验它,而不是只看榜单。

01 · 选一条长任务 例如:读取多份文档、写入文件、运行代码并输出最终报告。
02 · 记录真实成本 记下调用次数、Token、耗时、失败重试和人工介入次数。
03 · 看最后 20% 重点检查交付物是否完整、格式是否可用、异常是否能自行恢复。
判断标准很简单:不是它能否给出一个惊艳的开场,而是能否在较少返工的情况下,把任务带回终点。