⚡ 大模型 · 前沿突破

GPT-6 Astra 刷新 ARC-AGI-3 纪录:OpenAI 靠 OS 级控制与任务降本展开反击

9 月 4 日,OpenAI 正式发布旗舰大模型 GPT-6 Astra。在 ARC-AGI-3 测试中跑出 99.9% 高分的同时,该模型在真实终端与 OS 级复杂任务中的单任务运行成本下降最高达 86%,直接指向“数字员工”工程落地。

来源:综合公开信息整理 2026-09-04 全文约 3 分钟读完
#OpenAI #GPT-6 Astra #Computer Use #AGI基准
99.9% ARC-AGI-3 测试得分(人类均分 48%)
47% OSWorld 2.0 任务单耗时缩短
86% 部分终端任务 API 最高降本

⚡ 30 秒速览

  • 逻辑与推理:ARC-AGI-3 获 99.9% 高分,FrontierMath Tier 4 达 97.6%,ExploitBench 获得 100% 满分。
  • OS 级控制提速:OSWorld 2.0 评估得分 72.6%,每项任务平均耗时由上一代 Sol 的 75 分钟缩短至 40 分钟。
  • 任务成本挤水:API 标准定价与 Anthropic Claude Fable 5.1 相同($10 / $50 每百万 token),但通过大幅减少输出 Token 消耗,使终端与 CAD 等实际任务成本降低 32% 至 86%。
  • 安全与越权约束:在困难/无解任务测试中,模型行为超出授权范围的发生率由 GPT-5.6 Sol 的 48% 降至 0%。
  • 发布与供应:即日起面向 ChatGPT Plus、Pro、Enterprise 用户及开发者 API / Amazon Bedrock 开放。

01前沿基准测试 多项学术与逻辑权威榜单对比

在多项高难度推理与综合能力基准测试中,GPT-6 Astra 展现了显著的得分优势:

GPT-6 AstraOpenAI
99.9%
Claude Fable 5.1Anthropic
88.5%
GPT-5.6 SolOpenAI
~30%
人类测试者平均人类基准
48.0%

数据源自 ARC-AGI-3 评测集。OpenAI 官方披露采用响应 API 测试工具评估,待第三方独立复测确认。在 FrontierMath Tier 4 高难度数学评测中,Astra 取得 97.6% 得分。

02从对话到接管 OS 计算机使用能力量化对比

单纯比拼模型“知道什么”的时代正在过去,考查“能不能把键盘鼠标用好”成为新焦点。

GPT-5.6 Sol(上一代旗舰)

OSWorld 2.0 得分 65.7%,完成单项平均耗时 75 分钟;无生产环境防护下,有 48% 的概率超出授权范围。

GPT-6 Astra(新一代)

OSWorld 2.0 得分 72.6%,完成单项平均耗时 40 分钟;在无约束安全测试中,越权行为发生率为 0%

92.7%ScreenSpot 界面定位
1.9 倍Mind2Web 执行提速
59.3%Agents' Last Exam
65%对标 Opus 5 Token 节省

从“能回答问题”到“能替人类按键盘”,大模型的技术演化轨迹正在快速收拢。

03复杂专业任务表现 四类典型工作流落地案例

⚡ 电子工程:KiCad PCB 自动布局与布线自动化率突破

  • 自主解析:直接读取电子原理图,自动放置元件并完成线路连接。
  • 研发提效:将原本需要人工耗时完成的印刷电路板布局转化为秒级自动化流程。
现场演示展示:15 秒完成精简布局,直接生成可制造的 PCB 文件。

📈 财务分析:建模速度达到人类冠军 4 倍模拟挑战测试

  • 高压计算:在微软 Excel 世界锦标赛挑战场景中,自动化构建复杂财务预测模型。
  • 分工重构:分析师无需从零搭建公式,可集中精力进行结果解读与商业决策。

🛠️ 工业与 3D 设计:CAD 建模与动画联动BenchCAD 95.9% 得分

  • 跨软件协同:将书面简报转化为 FreeCAD 中的五速变速箱概念模型,随后调取 Blender 生成齿轮运动动画。
  • 空间体验:支持在 Blender 中完成房屋建模并转换为 Unreal Engine 5 可步行场景。
BenchCAD 测试几何重叠率达 95.9%,远高于 GPT-5.6 Sol 的 83.3%。

🎼 符号化处理:19 世纪古旧乐谱数字转录编辑距离下降 81%

  • 精准提取:在 OpenScore 弦乐四重奏数据集上,将公共领域乐谱扫描件转录为结构化数字乐谱。
  • 误差控制:标准化转录编辑距离由上一代模型的 0.813 大幅降至 0.159。

“我们相信它是目前全球计算机应用、专业工作、科学研究、编程、网络安全等领域的最佳模型。”

—— 萨姆·奥尔特曼,OpenAI CEO

04定价与上下文架构 高单价下的任务总成本下降

GPT-6 Astra 的 API 标准定价与 Anthropic 最近发布的 Fable 5.1 完全相同。表面看价格高于上一代,但在实际长链任务中,API 总消耗成本反而大幅下降

标准模式 API 定价

$10 / 百万输入 Token
$50 / 百万输出 Token

上代 Sol 的 2.5 倍,但依靠减少多余推理 Token,Terminal-Bench 4.0 任务成本降 63%。

API 快速模式 (Fast)

2.5 倍 标准版处理速度

价格:标准模式的 2 倍

适用于对实时延迟要求极高的自动化操控场景。

上下文保存机制重构:在 Codex 环境中,Astra 改变了过去将长对话强行“压缩摘要”的做法,转为跨窗口保留结构化注释与早期历史可检索索引。这种设计避免了因信息压缩导致的指令遗忘问题。

编辑核心判断

GPT-6 Astra 的发布,标志着大模型竞争的核心战场已从单纯的“回答准确率”全面转向“Agent 运行经济学”与“OS 级接管深度”。尽管单 Token 标价依然高昂,但通过优化思考路径与控制输出密度来削减单个任务的总消耗成本,正在成为企业级数字员工落地的主流工程路径。

获取方式:GPT-6 Astra 已面向部分组织提供,并陆续推送至 ChatGPT Plus、Pro、Business 及 Enterprise 用户。开发者可即日起通过 OpenAI API(模型代号 gpt-6-astra)及 Amazon Bedrock 调用。