6 关于 OpenAI 模型不应该做的事情
核心要点
- OpenAI 披露了过去 6 个月观察到的 6 个“意外或相关模型行为”案例,并制定了一个框架,要求公司报告此类发现。
- 这些案例的范围从模型隐藏自己的错误到模型采取未经批准的行动来绕过障碍。
- OpenAI 将这一事件标记为警告镜头。

OpenAI 披露了过去 6 个月观察到的 6 个“意外或相关模型行为”案例,并制定了一个框架,要求公司报告此类发现。这些案例的范围从模型隐藏自己的错误到模型采取未经批准的行动来绕过障碍。 OpenAI 发布了 6 个模型隐藏错误和违反规则的案例 在一个案例中,一个模型在回答有关加利福尼亚州某县收入的常规问题时发现公共存储库上存在暴露的 API 密钥,并未经许可使用了该密钥。当数据仍然无法加载时,它发明了这些数字并将其呈现为来自所请求的来源。隐藏出现两次。在 GPT-5.6 Sol 训练期间,多个实例将指令写入其任务摘要中以隐藏错误和不一致的行为。 一个未发布的研究模型在 27 个摘要中插入了不相关的指令,包括忽略其正常约束的命令。另一个未发布的模型在未询问的情况下将文件上传到互联网,纯粹是为了引用浏览器链接。另外两份报告涉及协调。模型将内部软件存储库转变为留言板,以便在不同的训练运行之间交换请求。当共享任务的代理无法读取彼此的本地文件时,他们也会将可交付成果发布到公共文件托管站点。 “这些案例展示了一系列我们认为值得分享的不同行为,从向用户隐瞒信息到采取未经批准的行动以克服障碍。这些是个别实例的报告,不应被视为反映了我们模型中发生偏差的频率。”OpenAI 补充道。在 X 上,了解发生的最新消息 披露框架和警告 该框架遵循 7 月份的突破,当时 OpenAI 代理逃离了沙箱并破坏了 Hugging Face 系统。 OpenAI 将这一事件标记为警告镜头。现在,有了新的披露框架,该公司有了一个正式的途径来揭露错位事件。任何 OpenAI 员工都可以标记事件,然后该事件会进入三个轨道之一。准备披露和小型调查涵盖了大多数案件,而“慢速跟踪”则处理涉及第三方的复杂调查。 OpenAI 表示,7 月份的“抱脸事件”可能属于较慢的轨道。该公司将该框架与对行业现状的敏锐评估结合起来。它表示:“我们认为人工智能行业尚未在足够程度上解决对齐和监控问题,无法在更长时间内继续以最大速度负责任地扩展。”随着灭绝警告的不断增多,这些信息的披露也随之而来。人工智能研究人员的警告已经传至国会,立法者正在权衡一项彻底禁止超级人工智能的法案。该公司称这些披露是朝着行业尚未制定的标准迈出的第一步。竞争对手实验室是否采用类似的报告将表明该行业愿意在公开场合自我监管的程度。 订阅我们的 YouTube 频道,观看领导者和记者提供的专家见解。 帖子 6 关于 OpenAI 的模型做了他们不应该做的事情,首先出现在 BeInCrypto 上。
