🔧 模型 · 评测揭秘

两个 API 设置,让 GPT-5.6 Sol 在 ARC-AGI-3 得分翻三倍

OpenAI 公开一项反直觉发现:GPT-5.6 Sol 在 2D 游戏推理基准 ARC-AGI-3 上初始得分仅 7.8%,远低于人类 48% 的平均线。启用两个已在 ChatGPT、Codex 中使用的 API 设置——保留推理压缩——后,公开任务集得分跃升至 38.3%,输出 token 同时减少 6 倍。基准评测测的不只是模型,还有 API 设置、harness 设计与提示工程。

来源:官方发布 2026-07 全文约 3 分钟读完
#OpenAI #GPT-5.6 Sol #ARC-AGI-3 #智能体评测
3× 公开任务集得分提升倍数
6× 输出 token 减少倍数
48% 人类平均基线(RHAE 口径)

⚡ 30 秒速览

  • 反差有多大:GPT-5.6 Sol 解过数学界未解之谜「圈双覆盖猜想」、通关 Pokémon FireRed,却在 ARC-AGI-3 上只得 7.8%;上一代 GPT-5.5 仅 0.4%。
  • 问题不在模型:低分源于官方评测 harness 的默认设置丢掉了模型在多步交互中的推理记忆。
  • 两个开关:「保留推理」让模型记住上一步的思考;「压缩」对长上下文做摘要,保留关键信息、丢弃冗余。
  • 结果:公开任务集得分从 13.3% 跃升至 38.3%,输出 token 减少 6 倍,逼近人类 48% 的平均线。
  • 深层信号:同一模型、同一任务,仅换 harness 设置就能差三倍——基准评测的「隐藏变量」正在浮出水面。

01同一模型,分数差三倍 官方 harness vs 启用两设置

下表对比 GPT-5.6 Sol 在 ARC-AGI-3 公开任务集上的得分,评分口径为 RHAE(相对人类动作效率)——以人类测试者平均表现为基线换算。

GPT-5.6 Sol + 两设置OpenAI Responses API harness
38.3
GPT-5.6 Sol 官方 harness公开任务集得分
13.3
GPT-5.6 Sol 初始未优化设置
7.8
GPT-5.5上一代模型
0.4
人类平均官方 gameplay logs 估算
48.0

注:为便于直观对比,柱形按相对长度缩放,以人类 48% 为满格基准;GPT-5.5 的 0.4% 柱形已做最小可见处理,不代表实际比例。模型全程不被告知评分方式,也无法看到自己的分数——动作只返回每一帧的文本表示与当前关卡。

02两个设置,各自解决了什么

这两个设置并非新功能,而是 ChatGPT 与 Codex 后台早已在用的工程配置。OpenAI 发现的问题在于:官方 ARC-AGI-3 评测 harness 没有启用它们。

默认关闭

保留推理

智能体在多步交互中,每一步的推理过程默认不会带到下一步——每帧都像「失忆」重新开始。

启用后

保留推理

模型记住上一步的思考与尝试,能在前序推理基础上继续推进,而非每步从零推断游戏规则。

默认关闭

压缩

长交互下上下文无限增长,模型被冗余信息淹没,关键线索被稀释,输出 token 成本线性飙升。

启用后

压缩

对长上下文做摘要压缩,保留关键信息、丢弃冗余,输出 token 减少 6 倍,模型聚焦于真正有用的线索。

两个设置叠加后,模型在同一游戏、同一关卡上的表现发生质变:官方 harness 下没有任何前沿模型能通过第一关之后的任何关卡;启用两设置后,GPT-5.6 Sol 在示例游戏 cd82 上通关全部六关

03ARC-AGI-3:考的是「无说明书玩游戏」

ARC-AGI-3 由 ARC Prize 基金会推出,专门测量 AI 智能体的学习与推理能力。智能体被丢进陌生的 2D 游戏世界,没有任何使用说明,必须通过探索推断游戏规则——这正是人类儿童面对新游戏时的本能。

25公开 demo 游戏
6每游戏关卡数
RHAE相对人类动作效率

评分指标 RHAE 将模型表现与人类基线对比换算。基于官方 gameplay logs 估算,人类平均测试者得分约 48%。模型不被告知评分方式,动作只返回每一帧的文本表示与当前关卡——它必须在「盲玩」中学习。

这种设计直指当前大模型的一个软肋:能在考试题上拿高分,不等于能在没有说明书的世界里活下来。ARC-AGI-3 的难度,恰恰在于没有现成答案可检索、没有固定模板可套用。

04编辑视角

来源与立场提示

本文核心数据来自 OpenAI 官方博客,属单方披露:得分对比、token 减少倍数、人类基线估算均来自 OpenAI 自家测试,未见第三方独立复测。读者宜将其视为「OpenAI 对自家模型 + 自家 API 设置的工程经验分享」,而非中立基准评测。

值得注意的细节:OpenAI 在文中主动承认 GPT-5.6 Sol 初始得分 7.8%「令人困惑」——这种主动暴露短板的姿态,与其通常的发布节奏有所不同,也使后续「翻三倍」的结论更具说服力。但「官方 harness 未启用自家最优设置」这一前提,也意味着其他参评模型可能同样存在未被释放的潜力。

基准评测的下一个竞争维度,已从「模型参数」转向「harness 工程」——同一模型在不同 API 配置下能差三倍,意味着排行榜上的分数差距,可能有一半来自未被公开的工程设置。

现在就能试

ARC Prize 官网提供 25 个公开 demo 游戏,可亲自上手体验智能体面对的「无说明书」挑战。