OpenAI 的 GPT-6 Astra 在 FrontierMath 上得分为 97.6%,而内部版本开始时得分仅为 17%
核心要点
- 从 17% 的内部数学分数跃升到近乎完美的基准测试结果,说明了 AI 推理模型的发展速度有多快 OpenAI 的最新推理模型 GPT-6 Astra 于 9 月 3 日推出,在 FrontierMath Tier 4 (v2) 上得分为 97.6%。
- 这个数字会让你三思而后行,尤其是当你了解到该模型的

从 17% 的内部数学分数跃升到近乎完美的基准测试结果,说明了 AI 推理模型的发展速度有多快
OpenAI 的最新推理模型 GPT-6 Astra 于 9 月 3 日推出,在 FrontierMath Tier 4 (v2) 上得分为 97.6%。这个数字会让你三思而后行,尤其是当你了解到该模型的早期内部版本在数学能力评估方面只能勉强达到 17% 时。
从内部 17% 到 47%,然后在公共基准上接近完美的轨迹,将通常需要数年的进展压缩到一个开发周期中。
格洛丽亚 拥有这个故事中的任何名字吗?了解今天的走势对您的投资组合有何实际影响。在格洛丽亚开业 →
基准闪电战
在 OpenAI 自己的评估工具中测量的 ARC-AGI-3 上,Astra 得分为 99.9%。在ExploitBench上,它达到了完美的100%。研究生水平的科学推理基准 GPQA Diamond 得分为 96.0%。 Terminal-Bench Science 0.1 的得分为 64.6%。
不过,FrontierMath Tier 4 (v2) 的结果才是头条新闻。 Astra 的前身 GPT-5.6 Sol 在同一基准测试中得分为 83.0%。 Astra 的 97.6% 提高了 14.6 个百分点。
从17%到世界一流
该模型的早期版本(即后来的 Astra)在数学能力评估方面得分约为 17%。通过迭代改进,在模型进一步完善并公开发布之前,这一数字攀升至 47% 左右。
OpenAI 还认为 Astra 对素数间隙贡献了新的见解,素数间隙是数论中众所周知的困难领域,几个世纪以来一直困扰着人类数学家。
谁可以访问以及何时访问
Astra 的推出采用了分阶段的方法。部分组织在发布当天就获得了访问权限,不久之后,ChatGPT Plus、Pro、Business 和 Enterprise 订阅者就获得了更广泛的可用性。 API 访问可直接通过 OpenAI 以及 Azure 和 AWS Bedrock 进行。
竞争格局
独立评估已将 Astra 列为目前可用的表现最好的人工智能模型之一,尽管一些评估指出,Anthropic 的某些 Claude 变体在更广泛的智力测试中处于领先地位。
在一代模型中,FrontierMath 的正确率从 83.0% 上升到 97.6%,这表明人工智能数学推理的上限(如果有的话)尚未达到。
