大模型竞争再换座次:Grok 4.6挤进第一梯队,却仍难稳定完成长任务
8 月 12 日,Grok 4.6 发布。它在综合智能、编程榜单和 API 价格上同时打出强牌:能力已接近 OpenAI 与 Anthropic 的旗舰模型,部分编程测试领先,价格却明显更低。但在真正接近生产环境的长链条 Agent 任务中,理解与启动并不等于稳定交付。
8 月 12 日,Grok 4.6 发布。它在综合智能、编程榜单和 API 价格上同时打出强牌:能力已接近 OpenAI 与 Anthropic 的旗舰模型,部分编程测试领先,价格却明显更低。但在真正接近生产环境的长链条 Agent 任务中,理解与启动并不等于稳定交付。
马斯克给 Grok Imagine 立下的目标,是在年底前制作一部完整的《奥德赛》。三分钟短片已经具备盔甲、海岸和人物特写的电影预告片质感,但一部九十分钟长片还需要几千个镜头、连续的人物状态,以及一套能处理废片、重做和人工审核的生产系统。
所以,真正的问题不是“能不能生成一个漂亮镜头”。
上一代模型进入公开使用阶段,也成为下一轮训练与 Agent 优化的基础。
距离 4.5 仅 35 天,模型在综合能力、编程任务和 API 价格上形成新的组合优势。
马斯克称其拥有 2.1 万亿参数、Token 效率更高,但参数与能力目前都只是单方面说法。
注:时间线按已发布事件与预告排列;最后一项属于尚未兑现的产品计划,不能与已测成绩等量齐观。
Grok 4.6 的表现之所以值得拆开看,是因为它没有把问题简化成“查资料并写答案”,而是尝试把争议拆成不同层次,再为每一层安排证据边界。它还纠正了一个常见误引:“让千艘战船起航的面孔”出自马洛,而不是荷马。
单一榜单的领先,往往只能说明模型擅长某种题型。Grok 4.6 这次更有信息量的地方,在于它在编程任务上表现强劲,同时在长链条 Agent 测试中暴露出明显落差。两组数字放在一起,才接近它当前的真实位置。
注:分数越高越好,单次任务成本越低越好;横向短条只作相对阅读辅助,精确数值以表格标注为准。
在 CursorBench 3.2 上,Grok 4.6 High 以 69.9% 超过 Sol 的 67.2%;一次任务成本约为后者的四成。
TerminalBench 只有 26%,明显低于 Sol 的 34.6% 和 Fable 5 的 34.1%,说明它仍容易在连续执行中失速。
这组结果更像一张能力雷达,而不是一张总成绩单:Grok 4.6 已经很会理解需求、启动项目和搭建框架,但在处理意外、持续调用工具并把结果收尾时,仍没有形成稳定优势。
这两个任务说明,Grok 4.6 已经能够从文本理解走向工程拆解:它会建立层次、定义参数、写出流程。但真正的电影生产还需要让数千个镜头中的脸、服装、船只、空间和叙事保持一致。
会搭系统,距离系统能稳定运行,中间还隔着返工率。
Grok 4.6 的快速迭代并不是单靠某一次模型架构跃迁。更合理的解释是:算力基础设施、实时信息入口、真实编程任务和后训练环境开始互相喂养,版本更新因此可以从“重新训练一代模型”变成“持续修正一个系统”。
注:箭头表示信息与能力的循环路径,不代表所有数据可以无条件跨产品共享;组织边界、隐私和监管仍会限制闭环速度。
基础设施建设速度尤其激进:首期约 10 万张 Hopper GPU 的 Colossus 用时 122 天,随后扩展至 20 万张又用了 92 天;服务器到场 19 天后,集群便开始运行训练任务。这类部署速度,解释了为什么 Grok 可以在短周期内持续获得算力支持。
注:金额为报道中的 AI 业务资本开支口径;条形长度主要表示占公司资本开支比例,2026 年上半年一项为累计金额,不宜与单季比例直接比较。
代价也同样清楚:2025 年 AI 分部收入约 32 亿美元、经营亏损 64 亿美元,资本开支 127 亿美元;2026 年上半年 AI 资本开支累计达到 236 亿美元。模型必须留在第一梯队,才能把这套重资产基础设施向 API、订阅和 Agent 等更高附加值业务延伸。
当头部模型能力差距只剩几个百分点,价格会先被看见。Grok 4.6 的 API 起价为每百万输入 Token 2 美元、输出 Token 6 美元,确实比一次任务 5.69 美元的 Sol 更有成本吸引力。但市场正在进入更复杂的计分规则:能力决定能否上桌,可靠性决定客户敢不敢交活,单位任务成本决定客户能用多少次。
输入 / 输出 Token 起价
CursorBench 任务估算
注:价格按报道所述阶段性公开价格整理,单位均为每百万 Token;不同模型的上下文、推理策略与调用次数不同,不能仅凭单价推断最终成本。
如果一个模型便宜一半,却需要更多步骤、更频繁重试,或者总在最后 20% 失败,省下的推理费用很快会被返工和人工审核吃掉。Grok 4.6 的企业化短板也不只在分数:安全、稳定性、透明度、品牌风险和成熟销售渠道,都不会因为一次榜单上升而自动消失。
它的另一张牌是组合能力:Colossus 提供算力,X 提供实时信息和用户,Cursor 提供真实编程任务与开发者反馈,Grok 再把这些资源转成 API、订阅和 Agent 产品。但自动驾驶、机器人、X 与 Grok 之间究竟能共享多少数据和客户,仍受公司边界、隐私与监管约束。
Grok 4.6 已经证明自己有资格坐上第一牌桌,却还没有证明自己能稳定把长任务交付完。对企业客户而言,低价只有在成功率、重试次数和人工审核都可控时才是真便宜;因此,Grok 下一阶段要补的不是一张更漂亮的榜单,而是“从启动到收尾”的可靠性。
一部九十分钟电影如此,一次代码部署、财务分析或企业流程自动化也如此。大模型商业竞争的计价单位,正在从 Token 转向一次成功交付。原始报道没有提供明确的公开体验地址,因此本文不虚构链接。若你已有 Grok 或相关 API 使用权限,可以用一次真实任务检验它,而不是只看榜单。