Astra 以 169 分创下新的 ECI 记录,在数学、编码和网络安全基准方面表现出色
核心要点
- OpenAI 的最新模型在 Epoch AI 综合指数上超越了 GPT-5,成为第一个达到“关键”网络安全级别的模型 OpenAI 的 Astra 刚刚在 Epoch 能力指数上取得了 169 的成绩,该指数是由独立研究机构 Epoch AI 维护的综合基准。
- Astra 在 ExploitBench

OpenAI 的最新模型在 Epoch AI 综合指数上超越了 GPT-5,成为第一个达到“关键”网络安全级别的模型
OpenAI 的 Astra 刚刚在 Epoch 能力指数上取得了 169 的成绩,该指数是由独立研究机构 Epoch AI 维护的综合基准。该分数汇总了涵盖数学、编码、科学和代理任务的超过 37 项单独评估的表现,代表了所有 AI 模型在该指数上取得的最高分数。
客观地说:Claude 3.5 Sonnet 在同一等级上得分为 130,而 GPT-5 得分为 150。
这些数字实际上是什么样的
该综合得分背后的原始基准测试结果本身就令人震惊。 Astra 在 ExploitBench 上获得了 100% 的完美成绩,这是一项网络安全评估,旨在测试模型识别和利用软件漏洞的能力。当通过 Provider Adapter 工具(一项旨在测量抽象推理和模式识别的测试)运行时,它在 ARC-AGI-3 上达到 99.9%。它在 FrontierMath Tier 4 上得分为 98%,这是为挑战前沿模型而建立的数学基准中要求最高的一层。
Astra 在数学、解谜和编码套件方面也取得了不错的成绩,尽管这些个人评估的具体分数并未以同样的细节列出。
最重要的网络安全里程碑
也许比 ECI 的标题数字更重要的是隐藏在结果中的一项更安静的成就。 Astra 是第一个在该公司自己的网络安全准备框架下达到“关键”级别的 OpenAI 模型。这一称号意味着 Astra 已经展示了发现零日漏洞并在无需人工干预的情况下执行漏洞利用链的自主能力。
OpenAI 于 2026 年 9 月 1 日发布的“Path to Astra”更新详细介绍了这些功能以及新的保障措施。其中:增强的思想链监控,这种技术允许安全团队实时检查模型的推理过程。该公司表示将分阶段推出,特别强调敏感领域的负责任使用,这表明并非所有用户都能在第一天就获得完整的网络安全功能。
综合基准告诉了我们什么,没有告诉我们什么
正是因为AI行业存在基准饱和问题,ECI作为衡量工具变得越来越重要。当一个模型在测试中得分为 99%,并且其后继者得分为 99.5% 时,这种改进是真实的,但在个人层面上几乎是看不见的。通过将 37 多项评估合并为一个重新调整的数字,Epoch AI 为研究人员和观察者提供了整体能力增长的更清晰的信号。
参考点的选择在这里很重要。将 Claude 3.5 Sonnet 设为 130,将 GPT-5 设为 150,创建了一个熟悉的感觉音阶,但值得注意的是,这是任意标准化,而不是 IQ 测试。这些数字可以进行比较,而不是绝对测量。
