GPT-5.6 Sol 登顶编码智能体榜,成本不及 Claude Fable 5 一半
OpenAI 推出 GPT-5.6 模型家族,旗舰 Sol 在 Artificial Analysis Coding Agent Index 上超越 Anthropic 的 Claude Fable 5,而推理成本不到后者一半。这不是又一场参数比拼——它第一次把"前沿智能"和"前沿效率"压到了同一条曲线上。
OpenAI 推出 GPT-5.6 模型家族,旗舰 Sol 在 Artificial Analysis Coding Agent Index 上超越 Anthropic 的 Claude Fable 5,而推理成本不到后者一半。这不是又一场参数比拼——它第一次把"前沿智能"和"前沿效率"压到了同一条曲线上。
Artificial Analysis Coding Agent Index 衡量的是模型在真实编码智能体任务中的综合表现。GPT-5.6 Sol(max reasoning 模式)在此榜上超越 Anthropic 的 Claude Fable 5——且推理成本不到后者一半。
成本基准 100%
编码智能体榜 · 被 Sol 超越
成本 < 50%
编码智能体榜 · 排名第一
注:成本对比口径为 OpenAI 官方披露的推理单价折算,未含长上下文与批量调用差异;榜单完整排名与评分细节以 Artificial Analysis 官方页面为准。
GPT-5.6 不是单一模型,而是一个按"智能-成本"曲线分层的家族。OpenAI 的设计目标明确:在每一个成本点上,给出最高的智能密度。
三档共享同一套训练目标:每个 token 完成更多工作。训练时同时优化任务成功率与效率,让模型在任务中走更直接的路径,而非绕弯。
GPT-5.6 的效率提升不只在模型层。OpenAI 在两大系统层做了叠加优化——任何一处的改进看似有限,层层叠加后才撑起了"前沿智能 × 前沿效率"。
值得一提的是,GPT-5.6 Sol 本身也参与了这些优化的落地——它被用于自主完成部分工程任务,模型既是产品,也是优化工具。
本文源自 OpenAI 官方博客,属企业通稿性质。文中"超越 Claude Fable 5""成本不到一半"等结论均为单方披露,截至发稿未见 Anthropic 方面或第三方机构复测回应;Artificial Analysis Coding Agent Index 的评测口径、任务集构成与成本折算方式,读者宜以官方页面原始数据为准。
另外需注意:OpenAI 服务 10 亿用户与 200 万企业的规模,意味着其效率优化的边际收益天然放大——小团队照搬同样打法未必等比例生效。
GPT-5.6 模型家族已上线,官方技术博客含完整效率优化拆解。
openai.com → 官方原文