研究人员通过 Anthropic 的 Claude 破解 OpenAI 赚取了 6,500 美元
核心要点
- 竞争对手自己的人工智能模型最终在针对 OpenAI 的攻击中承担了重任。
- Claude 如何帮助研究人员通过违反 OpenAI 赚取 6,500 美元。
- 研究人员与 Anthropic 的 Claude 一起突破 OpenAI 赚了 6,500 美元的帖子首先出现在 BeInCrypto 上。

竞争对手自己的人工智能模型最终在针对 OpenAI 的攻击中承担了重任。 Hacktron AI 的研究人员使用 Anthropic 的 Claude 编写了有效的漏洞利用代码。整个入侵过程持续了不到 72 小时。一旦团队证明他们已经获得了其私有源代码,OpenAI 最终支付了 6,500 美元的赏金。图像上传如何演变成全面破坏攻击链始于一些平凡的事情:OpenAI 社区帮助论坛上的图像上传功能,该功能在名为 Discourse 的第三方软件上运行。安全过滤器应该可以筛选上传的文件。不过,它根本无法识别某些照片格式,从而让它们不受检查地通过。然后,这些文件到达一个单独的图像处理库,该库带有已知的内存损坏缺陷。 Hacktron 的三人团队由 Harsh Jaiswal、Mohan Pedhapati 和 Rahul Maini 组成,他们在 7 月下旬试图将这一缺陷武器化。克劳德的早期模型与旨在随机化内存位置的安全保护措施作斗争。几个小时后,新模型生成了功能性攻击代码,并对其进行了调整以匹配论坛的确切配置。在 X 上,了解最新动态。 Claude 如何帮助研究人员通过违反 OpenAI 赚取 6,500 美元。来源:Hacktron AI 仅此一项仅授予对论坛服务器的访问权限,而不是对 OpenAI 本身的访问权限。 OpenAI 单点登录设置中的第二个不相关的缺陷改变了这一点。由于论坛登录同时作为 ChatGPT 和 Codex 帐户的身份验证,因此劫持单个员工的会话可以直接访问 OpenAI 的私有代码存储库。几天后,Discourse 修复了该图像错误,其严重程度为 8.8 分(满分 10 分)。OpenAI 在向其错误赏金计划提交报告后大约 14 小时内修复了身份验证缺陷。为什么人工智能实验室不断面对自己的创造这一事件并不是孤立发生的。 OpenAI 在 7 月份已经披露了一起单独的事件,其中内部模型逃脱了测试沙箱并到达了外部系统。 Anthropic 则承认,克劳德在网络安全评估期间损害了真实的组织,该评估意外地进行了实时互联网访问。微软人工智能负责人穆斯塔法·苏莱曼(Mustafa Suleyman)本周提到了同样一群未经授权的代理,公开警告说,日益自主的模型变得越来越难以遏制。 “这是一次警告……显然现在是实验室之间进行协调的时候了,这样我们就可以确保我们控制这项技术,”苏莱曼告诉路透社。 Hacktron 案例引人注目的原因并不在于新颖性。几十年来,安全研究人员一直在追踪软件漏洞。改变的是速度:一旦有足够能力的模型进入循环,曾经需要长时间专业人类专业知识的任务就被压缩到一个晚上。订阅我们的 YouTube 频道,观看领导人和记者提供的专家见解。研究人员与 Anthropic 的 Claude 一起突破 OpenAI 赚了 6,500 美元的帖子首先出现在 BeInCrypto 上。
