两个 API 设置,让 GPT-5.6 Sol 在 ARC-AGI-3 得分翻三倍
OpenAI 公开一项反直觉发现:GPT-5.6 Sol 在 2D 游戏推理基准 ARC-AGI-3 上初始得分仅 7.8%,远低于人类 48% 的平均线。启用两个已在 ChatGPT、Codex 中使用的 API 设置——保留推理与压缩——后,公开任务集得分跃升至 38.3%,输出 token 同时减少 6 倍。基准评测测的不只是模型,还有 API 设置、harness 设计与提示工程。
OpenAI 公开一项反直觉发现:GPT-5.6 Sol 在 2D 游戏推理基准 ARC-AGI-3 上初始得分仅 7.8%,远低于人类 48% 的平均线。启用两个已在 ChatGPT、Codex 中使用的 API 设置——保留推理与压缩——后,公开任务集得分跃升至 38.3%,输出 token 同时减少 6 倍。基准评测测的不只是模型,还有 API 设置、harness 设计与提示工程。
下表对比 GPT-5.6 Sol 在 ARC-AGI-3 公开任务集上的得分,评分口径为 RHAE(相对人类动作效率)——以人类测试者平均表现为基线换算。
注:为便于直观对比,柱形按相对长度缩放,以人类 48% 为满格基准;GPT-5.5 的 0.4% 柱形已做最小可见处理,不代表实际比例。模型全程不被告知评分方式,也无法看到自己的分数——动作只返回每一帧的文本表示与当前关卡。
这两个设置并非新功能,而是 ChatGPT 与 Codex 后台早已在用的工程配置。OpenAI 发现的问题在于:官方 ARC-AGI-3 评测 harness 没有启用它们。
智能体在多步交互中,每一步的推理过程默认不会带到下一步——每帧都像「失忆」重新开始。
模型记住上一步的思考与尝试,能在前序推理基础上继续推进,而非每步从零推断游戏规则。
长交互下上下文无限增长,模型被冗余信息淹没,关键线索被稀释,输出 token 成本线性飙升。
对长上下文做摘要压缩,保留关键信息、丢弃冗余,输出 token 减少 6 倍,模型聚焦于真正有用的线索。
两个设置叠加后,模型在同一游戏、同一关卡上的表现发生质变:官方 harness 下没有任何前沿模型能通过第一关之后的任何关卡;启用两设置后,GPT-5.6 Sol 在示例游戏 cd82 上通关全部六关。
ARC-AGI-3 由 ARC Prize 基金会推出,专门测量 AI 智能体的学习与推理能力。智能体被丢进陌生的 2D 游戏世界,没有任何使用说明,必须通过探索推断游戏规则——这正是人类儿童面对新游戏时的本能。
评分指标 RHAE 将模型表现与人类基线对比换算。基于官方 gameplay logs 估算,人类平均测试者得分约 48%。模型不被告知评分方式,动作只返回每一帧的文本表示与当前关卡——它必须在「盲玩」中学习。
这种设计直指当前大模型的一个软肋:能在考试题上拿高分,不等于能在没有说明书的世界里活下来。ARC-AGI-3 的难度,恰恰在于没有现成答案可检索、没有固定模板可套用。
本文核心数据来自 OpenAI 官方博客,属单方披露:得分对比、token 减少倍数、人类基线估算均来自 OpenAI 自家测试,未见第三方独立复测。读者宜将其视为「OpenAI 对自家模型 + 自家 API 设置的工程经验分享」,而非中立基准评测。
值得注意的细节:OpenAI 在文中主动承认 GPT-5.6 Sol 初始得分 7.8%「令人困惑」——这种主动暴露短板的姿态,与其通常的发布节奏有所不同,也使后续「翻三倍」的结论更具说服力。但「官方 harness 未启用自家最优设置」这一前提,也意味着其他参评模型可能同样存在未被释放的潜力。
ARC Prize 官网提供 25 个公开 demo 游戏,可亲自上手体验智能体面对的「无说明书」挑战。