Anthropic 的 Amodei 提议为人工智能公司提供持续的评估者访问权限
核心要点
- 这家人工智能安全公司希望为独立审查人员提供员工级别的访问权限,以访问其办公室、笔记本电脑和开发环境 Anthropic 首席执行官达里奥·阿莫迪 (Dario Amodei) 制定了一项计划,将独立的第三方评估员直接嵌入人工智能实验室,为他们提供通常为全职员工保留的访问权限。
- 询问格洛丽亚 → 也许该

这家人工智能安全公司希望为独立审查人员提供员工级别的访问权限,以访问其办公室、笔记本电脑和开发环境
Anthropic 首席执行官达里奥·阿莫迪 (Dario Amodei) 制定了一项计划,将独立的第三方评估员直接嵌入人工智能实验室,为他们提供通常为全职员工保留的访问权限。该提案在 2026 年 9 月 12 日题为“我们必须与前沿同行”的文章中概述,代表了人工智能公司迄今为止做出的最具体的自治承诺之一。
Anthropic 实际提供什么
根据提议的模型,外部审核员将获得 Anthropic 办公室的办公桌、公司访问徽章和笔记本电脑。他们将按照通常与内部员工相关的集成水平运行,保持对公司人工智能开发环境的持续访问,而不是空降进行定期检查。
凯莱 询问有关任何股票的任何问题 — 凯莱财经在几秒钟内为您提供完整的、有数据支持的答案。询问格洛丽亚 →
也许该承诺中最值得注意的部分是:评估人员将能够以最少的编辑来发布他们的发现,并且无需 Anthropic 对结果进行编辑控制。
Amodei特别指定人工智能安全评估机构METR作为该框架下潜在的嵌入式评估者。
从情景评估到持续评估的转变是这里的关键架构变化。传统的第三方审计会捕获系统在特定时刻的快照。相反,嵌入式评估人员会观察开发过程的展开,在潜在问题融入部署模型之前发现它们,而不是在事后标记它们。
为什么这在 Anthropic 的围墙之外很重要
Anthropic 长期以来一直将自己定位为安全第一的人工智能实验室,这一声誉自前 OpenAI 研究人员创立以来就已建立起来。该公司此前曾主张对高风险人工智能功能进行强制性独立评估和部署前测试。这项最新提案采纳了这些立场,并将其从谈话要点转化为行动承诺。
阿莫迪的文章将嵌入式评估器模型描述为在仅靠自我报告的信任越来越不够的环境中创建“可验证的安全承诺”的一种方式。
竞争和监管的考量
关于这在实践中如何运作存在合理的问题。访问徽章和笔记本电脑是具体的,但评估人员可以实际检查的范围、他们可以深入探索专有培训方法的界限,以及在商业敏感信息受到威胁时是否保持最小程度的“最小编辑”,将决定这是真正的治理创新还是精心设计的公关活动。
人工智能安全社区可能会密切关注实施情况,特别是 METR 或其他评估者在没有隐性压力的情况下运作的程度。管理出版权的合同条款将受到严格审查,因为“可以以最少的修改进行发布”和“可以发布任何有意义的内容”之间的差距可能很大。
