Anthropic 选择埃森哲在减速计划中进行嵌入式人工智能评估
核心要点
- Anthropic 选择埃森哲作为其首个“嵌入式评估者”合作伙伴,从对独立监督的广泛承诺转向旨在跟上快速发展的人工智能模型开发步伐的具体安全计划。
- 要点 Anthropic 表示,作为其嵌入式评估计划的一部分,它将与埃森哲学院合作评估模型、进行红队合作并测试保障措施。
- “嵌入式评估”将涵盖哪些内容 An

Anthropic 选择埃森哲作为其首个“嵌入式评估者”合作伙伴,从对独立监督的广泛承诺转向旨在跟上快速发展的人工智能模型开发步伐的具体安全计划。在此之前,Anthropic 首席执行官达里奥·阿莫迪 (Dario Amodei) 早些时候呼吁在全行业范围内采取措施,减缓人工智能进步的“前沿”,并为保障措施创造空间。
在 9 月 12 日发布的三步提案中,Amodei 认为人工智能系统可以通过递归的自我改进来加速进步——如果不加以控制,这种效应可能会超出人类理解和控制该技术的能力。他补充说,保障措施应与发展同时实施,而不是事后才考虑。
Anthropic 表示,作为其嵌入式评估计划的一部分,它将与埃森哲学院合作评估模型、进行红队合作并测试保障措施。
埃森哲预计将为评估人员提供类似员工的访问权限,这反映了 Amodei 迈向更强有力、独立监督的第一步。
根据 Anthropic 的公告,Anthropic 和埃森哲预计在未来五年内分别投资至少 10 亿美元。
根据 Anthropic 的公告,未来五年内。该项目的机制仍在最终确定中,因为嵌入式评估被描述为一个新领域。
Anthropic 表示,它将在短期内直接资助埃森哲的工作,理由是缺乏现有的独立评估融资系统。
从阿莫代的减速提案到具体的评估者
Amodei 于 9 月 12 日提出的提案是围绕安全问题提出的,这些问题随着模型的快速迭代而加剧。他强调了人工智能能力可以加速下一代人工智能的创造的动态,称之为递归自我改进。他认为,这一过程可能会产生比治理和控制机制发展更快的成果。
尽管该提案引起了整个人工智能行业的关注,但反应却褒贬不一。巧合的是,根据原始报道中引用的社交帖子,OpenAI 首席执行官萨姆·奥尔特曼 (Sam Altman) 和 SpaceX 首席执行官埃隆·马斯克 (Elon Musk) 对 Amodei 的做法做出了积极回应。然而,据报道,Nvidia 首席执行官黄仁勋 (Jensen Huang) 认为,正如源材料中引用的 CNBC 简介所指出的那样,此类监管是不必要的。
在此背景下,Anthropic 宣布埃森哲成为第一个嵌入式评估机构,最好将其理解为尝试实施 Amodei 计划的一部分。关键思想是,独立评估的访问模式应该更接近内部团队的访问模式,以便评估人员可以在现实条件下测试系统,而不是依赖有限或纯粹的外部审查。
“嵌入式评估”将涵盖哪些内容
Anthropic表示,埃森哲及其人工智能业务部门Faculty将帮助“评估和红队模型,进行一致性评估和测试模型保障措施”。该公司还表示,该计划的实施细节仍在制定中,强调嵌入式评估是一种新兴做法。
对于投资者和建筑商来说,强调发展很重要,因为这表明该框架尚未标准化。对于试图满足安全期望的公司来说,缺乏成熟的程序可能会给实践中的“良好”评估带来不确定性,尤其是当评估包括一致性检查和保障测试时。
它还强调了一个实际转变:该合作伙伴关系的目标不是将安全测试视为一个孤立的阶段,而是建立可与模型开发同时运行的评估能力。源材料还指出,嵌入式评估已经在 Anthropic 的内部路线图上,但与埃森哲的合作旨在加速执行。
资金、准入以及接下来会发生什么
Anthropic 的声明将财务支持置于该计划的核心位置。根据该公司的声明,Anthropic 和埃森哲预计在未来五年内分别投资至少 10 亿美元。该合作伙伴关系也被描述为非排他性的,Anthropic 预计在未来几周内任命更多评估员。
该公司进一步表示,目前尚未建立独立评估的资助机制,长期支持可能需要来自汇集资源或政府来源。尽管如此,考虑到 Anthropic 所描述的紧迫性,它计划在短期内直接资助埃森哲的工作。
对于市场参与者来说,这种结构提出了一个重要问题:独立评估是否会成为一种可扩展的、持续的“行业功能”,还是仍然依赖于少数资源充足的实验室和承包商? Anthropic 的计划表明它打算推动前者,但承认现有的资助体系不存在表明该领域仍然存在制度差距。
埃森哲通过其领导层的声明,将这项工作定位为建设下一代评估能力的一部分。该公告称,埃森哲的教师拥有为主要人工智能实验室测试和评估模型以及开发旨在通过构建更安全的复杂人工智能系统的经验。
为什么这比人工智能头条新闻更重要
尽管故事的重点是人工智能,但根本问题——如何比能力发展更快地建立可信的监督——也与加密货币市场广泛相关。许多区块链和去中心化系统越来越依赖人工智能辅助的自动化、监控和工具。当安全和评估框架不断变化时,将人工智能集成到财务或基础设施工作流程中的团队可能会面临额外的合规和风险问题。
Anthropic 选择资助和实施嵌入式评估也标志着更广泛的技术堆栈内竞争动态的转变:安全不再被视为政策承诺,而更像是具有可衡量活动(例如红队、一致性评估和保障测试)的工程计划。这是否成为行业规范可能取决于随着时间的推移,嵌入式评估方法的标准化和验证程度如何。
读者应该关注 Anthropic 是否将该计划扩展到埃森哲之外,聘请更多的评估人员,以及该合作伙伴关系是否发布了足够的细节,供外部人士评估“类似员工的访问”在实践中是如何实施的。最大的公开不确定性是方法上的:嵌入式评估是新的,保障措施的有效性将取决于项目规模扩展时的结构方式。
