OpenAI 计划发布第一个模型来满足其“关键”网络安全阈值
核心要点
- OpenAI 已确认其即将推出的 Astra 模型符合其准备框架下的关键网络安全阈值。
- OpenAI 表示:“与 GPT-5.6 Sol 相比,Astra 代表了网络安全能力的显着增强:它的代币效率显着提高,并且在漏洞识别和漏洞利用开发方面能力更强。
- 该公司计划很快推出 Astra。

OpenAI 已确认其即将推出的 Astra 模型符合其准备框架下的关键网络安全阈值。该公司计划在发布时提供保障措施并限制对高级网络功能的访问。 Astra 是 OpenAI 放置在该级别的第一个模型。该称号意味着该模型可以识别强化系统中的未知缺陷,并在没有人工指导的情况下进行工作漏洞利用。关键评级涵盖的内容 准备框架为关键阈值设置了两个条件。如果模型能够在无需人工干预的情况下在许多强化的现实系统中识别和开发功能性零日漏洞,那么该模型就合格。如果它能够仅基于高级目标来计划和执行针对强化目标的新颖的端到端攻击,那么它也符合资格。 根据该公司的评估,Astra 在 ExploitBench 上的得分为 100%。在一组 20 个高严重性 V8 漏洞上,它达到了比 GPT-5.6 Sol 更高的代码执行率,同时使用的代币少得多。在那次运行中,Astra 发现并利用了两个以前未知的漏洞。 OpenAI 表示正在向受影响的维护人员披露这两项信息。专家测试人员还观察了该模型构建的浏览器妥协链。它逃离了沙箱并在主机上执行命令。 OpenAI 表示:“与 GPT-5.6 Sol 相比,Astra 代表了网络安全能力的显着增强:它的代币效率显着提高,并且在漏洞识别和漏洞利用开发方面能力更强。” 在 X 上,了解最新消息 整个夏天,我们一直在安全优先事项上冲刺;能力和保障措施的共同进步比以往任何时候都更加重要。我们还有更多工作要做,但已经取得了很大进展。我们也将很快推出我们的下一个型号。存在明显的紧张关系…… — Sam Altman (@sama) 2026 年 9 月 1 日 OpenAI 发布前的层防护 该公司暂停了 Astra 的部分开发,同时加强了保护。新的安全保障要求生效后,它于 8 月 28 日重新启动了大规模的前沿强化学习运行。 OpenAI 表示,Astra 在其网络越狱评估中拒绝了 91.5% 的请求。 GPT-5.6 Sol 在同一组中拒绝了 59%。被评估为较高风险的账户面临更严格的拒绝界限。 OpenAI 还部署了思维链监控来检测并阻止潜在的不一致行为。在蜜罐测试中,GPT-5.6 Sol 在没有生产保障措施的情况下,试图破坏 56% 样本中的周围基础设施。阿斯特拉没有做出这样的尝试。该公司计划很快推出 Astra。对其最先进网络安全功能的访问将更加有限,首先是一组测试人员,然后通过 Daybreak Blue 扩展以支持防御用途。该公司承认,这些保障措施将在发布时产生摩擦。订阅我们的 YouTube 频道,观看领导者和记者提供的专家见解 OpenAI 计划发布第一个模型来满足其“关键”网络安全阈值一文首先出现在 BeInCrypto 上。
