GPT-6 Astra 领先 Epoch 能力指数,ECI 为 166
核心要点
- OpenAI 的最新模型在 Epoch AI 的综合基准测试中领先 249 个竞争对手,尽管软件工程方面的明显弱点让事情变得有趣 OpenAI 的 GPT-6 Astra 在 Epoch 能力指数中名列前茅,综合得分为 166,超过了该研究组织目前跟踪的所有 249 个模型。
- 该模型于 2026 年

OpenAI 的最新模型在 Epoch AI 的综合基准测试中领先 249 个竞争对手,尽管软件工程方面的明显弱点让事情变得有趣
OpenAI 的 GPT-6 Astra 在 Epoch 能力指数中名列前茅,综合得分为 166,超过了该研究组织目前跟踪的所有 249 个模型。该模型于 2026 年 9 月 3 日开始推出,代表了 Epoch AI 有史以来最高的单分性能记录,超过了 GPT-5.5 Pro(162)和 Anthropic 的 Claude Fable 5.1(164)。
但数字中隐藏着一个陷阱。 Astra 的软件工程得分在 MirrorCode 基准测试中仅为 47%,而 Claude Fable 5.1 在这一类别中得分为 73%。对于一个自诩为地球上最强大的人工智能系统的模型来说,这种差距是难以忽视的。
格洛丽亚 你所拥有的可能比你想象的更多。凯莱金融会仔细检查您的资金并确定您隐藏的真实风险敞口。检查您的曝光度 →
数字实际表明了什么
Epoch能力指数并不是单一的测试。它将 37 至 59 个基准测试的性能汇总为一个综合分数,对结果进行标准化,以便跨代模型的比较有意义。 ECI 量表上大约 10 分的差异被认为具有统计显着性,这意味着 Astra 相对于 Claude Fable 5.1 的两分领先是值得注意的,但并不完全是井喷。
Astra 真正擅长的领域是数学、持续学习和游戏益智类别。该模型在 FrontierMath Tier 4 基准测试中达到 98%,在 GPQA Diamond 测试中达到 96%。
还有报告表明,Astra 在 ECI 上的得分可能高达 169,具体取决于综合计算中包含哪些基准。 Epoch AI 定期更新其基准套件,不同的纳入标准可以使综合分数向任一方向移动几个点。
人工智能、科技及其所推动的市场——每日简报。日常的。自由的。加入加密货币、金融和政策领域 34,000 多名读者的行列。电子邮件地址 免费订阅 我们尊重您的隐私。随时取消订阅。
Astra 如何接触用户
OpenAI 遵循的主要版本已成为其标准剧本。 GPT-6 Astra 最初只提供给特定组织,然后向 ChatGPT Plus、Pro、Business 和 Enterprise 级别的更广泛用户群开放。
根据 Epoch AI 的推荐定价页面,定价为每百万个输入代币 10 美元,每百万个输出代币 50 美元。
竞争格局日趋紧张
Claude Fable 5.1 的 164 分让 Anthropic 触手可及。标准化综合指数的两点差距已经足够接近,任何一家公司发布的下一款车型都可能会扭转排名。 Claude 对 MirrorCode 的支持率为 73%,而 Astra 的支持率为 47%,这让 Anthropic 在开发者市场上有了一个明显的卖点。
GPT-5.5 Pro 的 162 分现在看起来像是一个过渡检查点。从 5.5 Pro 到 Astra 的四点改进表明 OpenAI 仍在各个版本之间找到有意义的收益。
