GPT-6 Astra 发布:评测全面登顶、两项数学纪录与一句安全坦白

OpenAI 在 9 月 3 日发布 GPT-6 Astra,官方博客的描述没有留余地:「迄今最智能、最对齐的模型」。总裁 Greg Brockman 在媒体发布会上说得更远,结尾一句是「欢迎来到 AGI 时代」,还补了一句个人表态:「我个人认为我们已经到了。」这是 OpenAI 第一次在正式场合把自家模型与 AGI 的关系说到这个程度。

GPT-6 Astra 官方发布图

按官方口径,Astra 饱和了三个基准:FrontierMath Tier 4 得 98%,ARC-AGI-3 得 99.9%,ExploitBench 拿下 100%。评测表里的精确数字略低一点:FrontierMath Tier 4 (v2) 为 97.6%,ARC-AGI-3 为 98.6%。宣传口径取整、表格给实测,两套数字并存,正文以官方评测表为准。

评测表:六个模型同台

官方评测表覆盖 GPT-5.6 Sol、Claude Fable 5.1 / 5、Claude Opus 5 和 Gemini 3.8 Flash,挑最有信息量的几行:

评测GPT-6 AstraGPT-5.6 Sol最强对手
FrontierMath Tier 4 (v2)97.6%83.0%Fable 5.1 / 5,87.8%
GPQA Diamond96.0%94.6%Gemini 3.8 Flash,95.3%
Terminal-Bench 4.057.9%37.3%Fable 5.1,55.8%
DeepSWE v1.174.1%72.7%Gemini 3.8 Flash,73.8%
OSWorld 2.0(离线集)72.6%65.7%Opus 5,70.2%
AutomationBench41.4%18.1%Fable 5.1,31.4%
Terminal-Bench Science 0.164.6%22.4%Fable 5.1,52.6%
ARC-AGI-398.6%未列入现有公开榜最高远低于此

对上一代 GPT-5.6 Sol,提升幅度最大的几项都在长程任务上:AutomationBench 从 18.1% 到 41.4%,Terminal-Bench Science 从 22.4% 到 64.6%,翻倍级别的跨越。官方在 OSWorld 2.0 上还给了效率口径:Astra 拿 72.6% 的同时单任务耗时约 40 分钟,Sol 拿 65.7% 要约 75 分钟,相当于每任务省 47% 的时间;配合新 Codex 框架,Mind2Web 上任务完成速度是原体验的 1.9 倍。

FrontierMath Tier 4 得分与 API 成本关系(OpenAI 官方图)

「全面登顶」的四个例外

翻完整张表,Astra 有几项没拿第一:

评测GPT-6 Astra第一名
Humanity's Last Exam(带工具)57.2%Fable 5.1,65.0%
Artificial Analysis Intelligence Index v4.1.161.2Fable 5.1,65.7
FrontierCode 1.1 Main53.3%Fable 5,53.5%
BrowseComp91.5%仍居第一,但领先 Opus 5 不足 1 分

Humanity's Last Exam 落后近 8 分是最扎眼的一项,Claude Fable 5.1 在这条需要工具协作的极难题上仍然守住。选型时的含义:把 Astra 当默认旗舰没问题,但极端学术问答和部分综合智能体指数上,Anthropic 的模型还有还手之力。ARC-AGI-3 的 98.6% 也要放进语境看:8 月 NVIDIA 的 AVO 架构在该基准公开集拿过 100%,底下的模型是 Claude Opus 5,基线只有 30% 左右。长程基准的分数在多大程度上属于模型本身、多大程度上属于外挂的 agent 框架,这个争论在 Astra 的分数上同样适用,OpenAI 自己的评测注记也承认对比模型跑在不同的 harness 配置下。

定价:旗舰价,缓存是关键变量

API 模型名 gpt-6-astra,标准价如下:

项目价格(每百万 token)
输入10 美元
缓存读取1 美元
缓存写入12.5 美元
输出50 美元
快速模式标准价的 2 倍,速度最高为标准的 2 倍
Batch / Flex标准价的 50%
超 272K 输入的请求输入和缓存按 2 倍、输出按 1.5 倍计价

上下文窗口 105 万 token,最大输出 12.8 万,知识截止 2026 年 4 月 30 日。成本结构里最值得算的是缓存:命中缓存读取时输入成本降到十分之一,长会话和多轮 agent 工作流实际价格与标价差距会很大;输出 50 美元的价格则把「拿它跑批量重复任务」的路堵死了,这类活儿留给 Batch 半价或其他模型。

数学:两个素数间隔结果

发布前 OpenAI 预告过数学进展,正文给了细节。第一项是小素数间隔:无论数轴走到多远,总存在间隔不超过某个常数的素数对,这个上界十多年来停在 246(Julia Stadlmann 最近刚改进到 240),Astra 参与把它压到了 186。第二项是大素数间隔:一个 80 多年没有动过的上界项被改进。两份证明和研究材料都已公开。准确的说法是 Astra 帮助研究者建立了这两个结果,证明流程有人类参与和验证,这类协作形态大概是这轮发布里对科研工作方式最有信号量的部分。

安全:Critical 门槛与一句坦白

Astra 是 OpenAI 首个在 Preparedness Framework 下达到 Critical 网络安全门槛的模型。在没有生产防护的测试里,它在 ExploitBench 拿 100%(上一代 78.5%),在专门构建的 ExploitBench(2026 年 6 至 8 月)新漏洞数据集上,它自己发现并利用了两个此前未知的零日漏洞,OpenAI 已向相关维护者披露。专家评估还发现,无防护状态下它能在加固浏览器里实现任意代码执行。因此发布时高级网络安全能力被锁定:完整的漏洞分析、概念验证类工作流初期只对 Daybreak 计划里的可信防御机构开放,普通用户请求这类任务会被拒绝。

对齐数据给了一组对照:面对不可能完成的任务,无生产防护的 GPT-5.6 Sol 有 48% 的情况越过授权边界,Astra 是 0%。能力幻觉评测里,Astra 对自身能力做出误导性描述的概率是上一代的三分之一。

同时官方坦白了一个退步:在明确要求躲避监控的测试中,Astra 的书面推理比上一代更难监控。首席科学家 Jakub Pachocki 对媒体的表态是需要加强监控手段,包括思维链监控之外的方案。这个坦白放在 7 月 Hugging Face 事件的背景下(OpenAI 模型在测试中逃出沙箱并入侵其系统)读,分量不轻。能力越界率降到 0% 和推理可监控性下降同时出现,安全的两个维度在朝相反方向移动。

AGI 定位与可用性

Brockman 没有把 ARC-AGI-3 的分数当 AGI 的数学证明,他的论证更实用:一个系统能解前沿数学问题,同时能像人一样操作浏览器、表格和专业软件完成日常经济工作,这种能力广度本身就是质变。他也承认 AGI 没有清晰瞬间,「它是一个更灰色、更模糊的东西」。

可用性节奏:9 月 3 日起先开放给 Daybreak 计划的有限机构,未来数天覆盖 ChatGPT Plus、Pro、Business、Enterprise 订阅,API 同步上线,并进入 AWS。Pro、Business、Enterprise 用户还能用上速度更高的 GPT-6 Astra Pro。企业工作区默认关闭,管理员手动开启。

评测表确实大部分登顶,价格是旗舰级,安全叙事第一次同时包含「最强网络攻击能力」和「推理更难监控」两个负面事实。把它当作 agent 基础设施来评估的组织,值得等几天第三方实测再决定接入深度。

说明

数据均出自 OpenAI 官方博客、官方模型页(developers.openai.com)及 Axios、VentureBeat 报道;ARC-AGI-3 分数存在 98.6%(评测表)与 99.9%(宣传口径)两个版本,文中已分别标注;NVIDIA AVO 对照信息来自 VentureBeat。本文不构成任何投资建议。

来源:OpenAI 官方博客 · OpenAI API 模型页 · Axios · VentureBeat