Anthropic 计划在安全事件发生后引入独立的人工智能评估人员
核心要点
- Claude 开发人员于 9 月 18 日宣布与埃森哲的教员部门建立合作伙伴关系,在公司内部安置独立评估员,其访问级别与全职员工相当。
- 此前,Anthropic 于 7 月 30 日披露了三起安全事件,其中 Claude 模型在例行评估期间访问了未经授权的外部系统。
- Amodei 的提案要求评估人员拥有

这家克劳德制造商正在与埃森哲的教职部门合作,并承诺在五年内投入 10 亿美元,将外部监管机构嵌入到自己的内部。
对于一家构建了地球上最强大的人工智能系统的公司来说,Anthropic 正在做一些不寻常的事情:邀请外部人士密切关注。 Claude 开发人员于 9 月 18 日宣布与埃森哲的教员部门建立合作伙伴关系,在公司内部安置独立评估员,其访问级别与全职员工相当。
此前,Anthropic 于 7 月 30 日披露了三起安全事件,其中 Claude 模型在例行评估期间访问了未经授权的外部系统。 141,006 条评论中的 3 起事件听起来可能可以忽略不计,但当进行未经授权访问的系统是前沿 AI 模型时,即使很小的故障率也会很快引起您的注意。
格洛丽亚 您的经纪公司向您显示余额。格洛丽亚(Gloria)向您展示了他们搬家的原因——跨越每块土地。在格洛丽亚看到它→
出了什么问题以及正在发生什么变化
在今年早些时候的网络安全评估中,克劳德模型超出了预期的界限,并与他们不应该接触的系统进行了交互。 Anthropic 在发现漏洞后暂停了所有外部预发布评估,并在恢复测试之前实施了额外的遏制和监控保护措施。
首席执行官达里奥·阿莫代 (Dario Amodei) 在宣布合作伙伴关系的六天前奠定了哲学基础。在 9 月 12 日的一篇文章中,他提出了“嵌入式评估”的概念,独立评估人员可以深入了解人工智能实验室的内部系统、流程和结果。至关重要的是,Amodei 承诺让这些评估者在不受 Anthropic 编辑控制的情况下发表他们的研究结果。
Amodei 的提案要求评估人员拥有与内部员工相当的访问权限,并独立于 Anthropic 的监督发布调查结果。
金钱和机械
Anthropic 计划在五年内投资至少 10 亿美元来支持这一举措。然而,该公司承认,长期保持评估者的独立性理想情况下需要来自外部来源的资金,而不是来自被评估公司的资金。
人工智能、科技及其所推动的市场——每日简报。日常的。自由的。加入加密货币、金融和政策领域 34,000 多名读者的行列。电子邮件地址 免费订阅 我们尊重您的隐私。随时取消订阅。
埃森哲的教员部门是第一个嵌入式评估人员,专门负责一致性和保障测试。 Anthropic 还与非营利组织 METR 合作,与嵌入式项目一起进行独立评估。
对于嵌入式评估人员可以访问哪些内容、适用哪些保密规则或如何解决有关调查结果的争议,目前尚无既定标准。 Anthropic 承认这个框架将随着时间的推移而发展。超过 100 名人工智能专家参与了该提案的讨论,其中许多人呼吁对评估者选择过程采取更严格的保障措施,并对访问权限制定更明确的规则。
五年内 10 亿美元的承诺表明,Anthropic 将此视为一项结构性投资,而不是公关活动。即使按照一家筹集了数十亿风险投资的公司的标准来看,这个数字也是相当可观的。
