🚀 模型 · 竞赛突破

AI逆袭的同一条河流:编程Agent如何让后发者追上第一梯队

Grok 4.6 以智能指数 61 分追平 ChatGPT-5.6 Sol,每任务成本仅 0.84 美元,不到竞品一半。五个月前它还濒临解散,逆袭的钥匙是一把编程编辑器——而腾讯 WorkBuddy 与混元,正沿着同一条路径加速追赶。

综合公开信息整理 2026-08-?? 全文约 3 分钟读完
#Grok 4.6 #Co-design Loop #编程Agent #腾讯混元 #WorkBuddy
61 分 智能指数 · 追平第一梯队
$0.84/任务 Grok 4.6 推理成本
↓ 64% 相比 Opus 5 的成本优势

⚡ 30 秒速览

  • Grok 4.6 追平第一梯队:智能指数 61 分,与 ChatGPT-5.6 Sol 持平,紧贴 Fable 5 Max(62 分);每任务成本 0.84 美元,仅为 Sol 的 68%、Opus 5 的 36%。
  • 逆袭钥匙:收购 Cursor。3 月 Grok 4.3 失败、10 位联合创始人离职;随后收购编程编辑器 Cursor,用真实编程行为轨迹训练模型,形成正反馈循环。
  • 腾讯走通同一条路:WorkBuddy 月访问 2097 万,国内桌面 AI 办公第一;与混元形成 Co-design Loop,Hy3 正式版以 295B 参数进入国产第一梯队。
  • 系统比模型更重要:Co-design Loop 被验证为可持续的复利系统——用户数据→模型迭代→产品力提升→更多用户,Meta 已快速跟进。
  • 一个诚实的注脚:Grok 4.6 的 61 分是"智能指数",综合速度与成本后自称"客观第一";纯智能维度与 Sol 并列,仍有追赶空间。

01智能指数 Top 5 Grok 4.6 追平第一梯队,成本优势显著

独立评测机构 Artificial Analysis 的数据显示,Grok 4.6 在智能维度拿下 61 分,与 ChatGPT-5.6 Sol 并列,仅次于 Fable 5 Max 的 62 分。但真正拉开差距的,是成本。

🥇 Fable 5 MaxAnthropic
62
🥈 Grok 4.6SpaceXAI
61
🥈 ChatGPT-5.6 SolOpenAI
61
Claude Opus 5Anthropic
58
Gemini 3.0 UltraGoogle
56

注:智能指数为 Artificial Analysis 综合评分,柱形自 50 分起缩放,非零起点。分差以标注分数为准。Grok 4.6 与 Sol 同分并列,与榜首差 1 分。

但真正的杀手锏,藏在成本里。
Grok 4.6
$0.84 /任务
基准成本
ChatGPT-5.6 Sol
$1.23 /任务
比 Grok 贵 46%
Claude Opus 5
$2.34 /任务
比 Grok 贵 179%

注:每任务成本基于 Artificial Analysis 标准测试集,包含推理与工具调用开销。Grok 4.6 的综合性价比在参评模型中位列第一。

02逆袭配方:Co-design Loop 一条被验证的正反馈回路

Grok 的逆袭不是偶然。3 月,Grok 4.3 远落后于第一梯队,10 位联合创始人全部离职,马斯克公开承认"第一次构建失败了"。同一天,两位 Cursor 的高级产品工程负责人加入,直接向他汇报。

随后 SpaceX 收购 Cursor,并披露了联合训练模式:用户用 Grok 编程 → Cursor 记录行为轨迹 → 失败与成功数据加工为训练集 → 模型迭代 → 产品力提升 → 更多用户。这是一条完整的正反馈回路。

用户使用轨迹记录数据加工模型训练产品升级更多用户

这条回路的核心是:真实任务中的失败案例,比 benchmark 里的错误更有价值——它告诉模型"为什么失败"。

效果来得很快。7 月,Grok 4.5 编程能力追平 GPT-5.5,价格仅一半;一个月后,Grok 4.6 在智能维度追平 Sol。马斯克放话:Grok 4.7 将超越当前所有模型

同样的配方,腾讯也在用。

传统训练模式

依赖静态数据集和人工标注,训练与产品使用脱节,迭代周期长,难以覆盖真实世界的边缘场景。

Co-design Loop

产品使用数据直接回流训练,真实任务轨迹成为训练与评估素材,模型与产品深度协同,迭代速度成倍提升。

腾讯 WorkBuddy 从内部编程智能体 CodeBuddy 改造而来,6 月月访问量已达 2097 万,在国内桌面 AI 办公中排名第一,超过第二、第三名之和。姚顺雨在重建混元之初就提出 Co-design 方法,让模型与产品深度协同优化。

刘炽平在财报电话会上明确表示,这种"模型-产品 Co-design"让混元得以验证精度、识别边缘场景、实现更快迭代。混元 Hy3 正式版以 295B 参数进入国产第一梯队,Hy4 已明确剑指 SOTA。

03两个逆袭故事 Grok 与腾讯,同一条河流

他们路径相似,但场景不同。一个从编程切入,一个从办公起步,最终都指向同一个方向:用真实任务数据驱动模型迭代

🚀 SpaceXAI · Grok + Cursor 编程→通用

  • 3 月 12 日:Grok 4.3 失败,创始团队清零;Cursor 两位产品工程负责人加入,直接向马斯克汇报。
  • 4 月:SpaceX 与 Cursor 签署算力与联合开发协议,启动联合训练。
  • 6 月 16 日:SpaceX 宣布收购 Cursor,披露联合训练模式——编程行为轨迹成为训练数据。
  • 7 月:Grok 4.5 编程能力追平 GPT-5.5,价格仅为一半。
  • 8 月:Grok 4.6 智能指数 61 分,追平 ChatGPT-5.6 Sol,成本优势明显。
一条时间线,五个月从濒临解散到追平第一梯队。关键转折点:用真实编程任务替代静态数据集

🧩 腾讯 · WorkBuddy + 混元 办公→通用

  • 3 月:内部小团队趁"龙虾热"将 CodeBuddy 改造为 WorkBuddy,定位 AI 办公智能体。
  • 4 月底:混元 Hy3 Preview 亮相,姚顺雨主导的 Co-design 方法首次落地。
  • 6 月:WorkBuddy 月访问 2097 万,国内桌面 AI 办公第一,超过第二、第三名之和。
  • 7 月:混元 Hy3 正式版发布,295B 参数进入国产第一梯队,Agent、推理、编码能力显著提升。
  • Q2 财报:刘炽平确认 Hy4 将更大规模、剑指 SOTA;算力优先供给混元和 WorkBuddy,放弃短期转售利润。
放弃唾手可得的 30% 算力转售利润,押注一套系统——"模型-产品 Co-design"被视为更长期的战略。

两个案例的共同点:都用真实产品使用数据驱动模型迭代,都形成了"用户→数据→模型→产品"的飞轮。Meta 的 Muse Codem 已跟进,贡献者版价格低 95%,条件是用编程数据训练。

04系统胜利:为什么 Co-design Loop 比参数更重要

大模型竞赛打了两年多,大家发现:光有大力未必能出奇迹。Grok 4.6 和混元 Hy3 的逆袭,指向同一个结论——能产生持续反馈循环的系统,正在超越单纯的模型参数比拼

5 个月Grok 从低谷到追平
2097 万WorkBuddy 月访问
295B混元 Hy3 参数
95%Meta 贡献者版折扣

这套系统之所以强大,是因为它同时解决了三个问题:

第一,数据从哪里来。真实用户任务产生的行为轨迹,比任何人工标注都更贴近实际需求。一次失败的操作,往往比 benchmark 里一个错误更有价值,因为它暴露了模型的真实短板。

第二,评估怎么做。传统评测依赖静态题库,而 Co-design Loop 用真实任务结果作为评估信号——用户是否成功完成任务,本身就是最直接的反馈。

第三,商业回报在哪。腾讯首席战略官詹姆斯在财报会上说,在所有算力变现渠道里,WorkBuddy 产生的 Token 计费业务"能创造最持久的经济回报"。这解释了为什么腾讯愿意放弃短期转售利润,押注长期系统。

一个诚实的注脚:

Grok 4.6 的 61 分是"智能指数",纯智能维度与 Sol 并列,并非绝对领先。马斯克"综合速度与成本后客观第一"的说法,有其商业立场。但真正值得关注的不是分数,而是让分数持续增长的系统——Co-design Loop 让后发者看到了持续追赶、甚至反超的可能性。

编辑核心判断

大模型竞赛的下半场,能构建"用户→数据→模型→产品"飞轮的公司,将比只堆参数的公司走得更远。系统能力正在取代单点突破,成为新的护城河。

这条河流,正在变宽

Grok 4.6 已通过 SpaceXAI 平台开放,腾讯 WorkBuddy 集成于企业办公套件。Co-design Loop 不再只是理论——它已被两家公司、两个场景、两种路径同时验证。

下一个通过这条河流追上来的,会是谁?