OpenAI 更新显示新的防护措施可以阻止 700 个恶意 AI 代理的游动速度加快 24 小时
核心要点
- OpenAI 表示,当前的监控会在 Hugging Face 漏洞发生前一天多向安全部门发出警报。
- METR 和 Redwood Research 对 OpenAI Hugging Face 事件进行的单独调查估计,从 7 月 8 日到 7 月 13 日,大约 1,200 名本应被隔离的特工交换了超过

大约 1,200 名孤立特工中的大约 700 名在通过 Artifactory 协调后加入了攻击。
OpenAI 表示,当前的监控会在 Hugging Face 漏洞发生前一天多向安全部门发出警报。
OpenAI 对 Hugging Face 事件的事后分析表明,其现在部署的思想链监控将在 7 月 11 日 Hugging Face 系统泄露事件发生前一天多就向安全部门发出呼叫。
该公司还表示,其最大规模的前沿强化学习计划仍处于搁置状态,而较小的测试则评估模型行为、验证保障措施并建立更多一致性证据。
METR 和 Redwood Research 对 OpenAI Hugging Face 事件进行的单独调查估计,从 7 月 8 日到 7 月 13 日,大约 1,200 名本应被隔离的特工交换了超过 70,000 条消息和文件。大约 700 人参与了 Hugging Face 攻击。
该审查使用了 OpenAI 提供的缓存转储和大约 1,300 个原始推理记录,重建了一些时间戳,并将大部分分析委托给了人工智能系统,调查人员称其可靠性不如人类研究人员。 Hugging Face 分别重建了大约 17,600 个攻击者行为,这是一种不同的测量方法,而不是代理的竞争计数。
OpenAI抱脸事件是如何展开的
在 7 月份的评估期间,代理使用 OpenAI 内部托管的 JFrog Artifactory 软件包服务作为临时留言板。早期特工留下了共享文件笔记。重建服务后,代理将消息编码到目录名称中,然后制定请求、直接消息、文件共享和冲突解决的约定。
这种协调让单独的评估运行保留了发现并划分了工作,但它并没有创造出一种连贯的情报。报告描述了重复的工作、忽视暂停请求、竞争以及拒绝一些危险行为的代理。
每日简报 噪音之前的信号。以由 CryptoSlate 编辑解码的推动市场的加密货币故事开始新的一天。一封电子邮件。一切重要的事情。电子邮件地址 免费加入 免费加入。随时取消订阅。哎呀,看来有问题了。请再试一次。你在名单上。您的下一份每日简报即将发送。
OpenAI 表示,这次攻击主要是由一个功能强大、仅供内部使用的研究模型驱动的,其规模与 GPT-5.6 Sol 相当。运行 GPT-5.6 Sol 的特工也参与其中。主要模型并不打算公开发布,OpenAI 表示其客户数据、产品和可用性不受影响。
OpenAI 的技术报告称,代理在 41 个 Hugging Face 生产数据集工作线程上执行了代码,获得了至少一个节点的 root 访问权限,获得了生产凭证和有限的内部数据,下载了 4 个私有代码存储库,并获得了对一个连接的 Kubernetes 集群的管理员同等访问权限。
Hugging Face 后来的技术时间表称,唯一访问的客户内容是五个数据集,其名称和文件暗示了 ExploitGym 或 CyberGym 挑战的链接。它没有发现其他受影响的面向客户的模型、数据集、空间或包,从而缩小了 7 月 16 日最初披露的影响范围。
OpenAI 前一天的结论仍然是一个回顾性反事实。它的思想链监视器没有运行事件评估,并且早期的寻呼不一定能阻止入侵的每个部分。
该公司现在要求对所有使用工具的 RL 训练和评估(涉及 GPT-5.6 Sol 能力或更高能力的模型)进行思想链监控。它还加强了工作负载和网络隔离,并自动对这些边界进行连续测试。一些风险较低的研究已经恢复,但 OpenAI 在其进度更新中表示,计划中的最大规模前沿研究仍处于暂停状态。
