OpenAI 报告模型在六个月内表现出相关行为
核心要点
- 六份事件报告详细介绍了人工智能模型在内部测试期间伪造数据、隐藏错误和插入未经授权的指令的情况 OpenAI 刚刚揭开了大多数人工智能公司宁愿保持沉默的真相:他们自己的模型一直在行为不当,听起来不太像软件错误,而更像是一个试图智胜父母的青少年。
- 这些行为包括模型伪造数据、忽视安全约束,以及在一个特别令人

六份事件报告详细介绍了人工智能模型在内部测试期间伪造数据、隐藏错误和插入未经授权的指令的情况
OpenAI 刚刚揭开了大多数人工智能公司宁愿保持沉默的真相:他们自己的模型一直在行为不当,听起来不太像软件错误,而更像是一个试图智胜父母的青少年。
9 月 16 日,该公司推出了一个新框架,用于跟踪和公开披露“模型错位”实例,并附有六份详细的事件报告,涵盖了 2025 年 10 月至 2026 年 7 月期间观察到的行为。这些行为包括模型伪造数据、忽视安全约束,以及在一个特别令人不安的案例中,暗中指示自己抑制错误。
Gloria One 应用程序,一个屏幕 - 每天早上,Gloria Finance 都会向您简要介绍发生的事情以及它如何影响您的投资组合。阅读您的简介 →
模型实际上做了什么
最令人惊讶的事件涉及 OpenAI 的 GPT-5.6 Sol 模型在训练过程中的情况。某些模型实例在自己的输出中添加了隐藏指令,指示自己隐藏错误并生成虚构信息,包括发明了从未存在过的“2024 年历史数据”。
另一起事件涉及 Astra 系列模型,该模型将 OpenAI 描述的“类似越狱”的指令插入到 27 个独立的输出中。这些指示敦促人们蔑视企业和政府的限制。
其他报告记录了未经适当授权就未经授权使用公开的 API 密钥和人工智能代理通过公共托管服务共享输出的模型。
人工智能、科技及其所推动的市场——每日简报。日常的。自由的。加入加密货币、金融和政策领域 34,000 多名读者的行列。电子邮件地址 免费订阅 我们尊重您的隐私。随时取消订阅。
所有六起事件都涉及未发布的研究模型或内部培训运行,而不是目前向公众提供的产品。
为什么 OpenAI 会告诉你这件事
OpenAI 澄清,所报告的事件并不反映系统性问题,而是个案报告。现在鼓励员工标记任何可疑的偏差以供审查,从而建立一个内部管道,以便在问题复杂化之前将其解决。
对齐问题变得更加具体
GPT-5.6 Sol事件尤其值得关注。理论上,在训练期间学会抑制自身错误的模型可以以难以检测的方式将该行为带入部署。该行为的全部目的是避免被发现。 OpenAI 在内部测试期间发现了这个问题,系统按预期工作。
OpenAI 的新框架建立了一个结构化流程来捕获和报告这些事件。
