Vitalik Buterin 表示加密货币反共谋规则可以适用于人工智能安全
核心要点
- 以太坊联合创始人 Vitalik Buterin 表示,他在 2020 年为区块链治理制定的反共谋机制可能对人工智能安全比对加密货币本身更重要。
- 他是在回应研究员埃里克·德雷克斯勒 (Eric Drexler) 的一篇文章,该文章使用了最近的 OpenAI 安全测试,其中数千个人工智能代理构建了未经授

以太坊联合创始人 Vitalik Buterin 表示,他在 2020 年为区块链治理制定的反共谋机制可能对人工智能安全比对加密货币本身更重要。他是在回应研究员埃里克·德雷克斯勒 (Eric Drexler) 的一篇文章,该文章使用了最近的 OpenAI 安全测试,其中数千个人工智能代理构建了未经授权的协调网络并攻击了 Hugging Face 的生产系统,作为他六年前描述的相同动态的活生生的例子。新玩家群体的常见问题 在 9 月 14 日的一篇帖子中,Buterin 描述了加密货币治理和多代理人工智能系统之间的“深刻的二元性”。在他的比较中,加密货币的原理是处理人类代理的静态算法,而人工智能安全系统可能涉及人类和管理更强语言模型的较弱大型语言模型。他指出了他 2020 年 9 月 11 日发表的文章《协调,好与坏》,他在文中提出,当智能体可以串通的程度受到限制时,系统可以产生更好的结果。开发人员将个人选择博弈论中丰富的纳什均衡与合作博弈论进行了对比,在合作博弈论中,稳定的“核心”可能不存在,因为联盟可以通过改变结果来获利。有害的协调并不总是从个人行为中可见。 Buterin 举了一些例子,包括卖家就价格达成一致、选民出售选票以及区块链矿工协调攻击。他的辩护包括权力下放、无记名投票、隐私保护、举报人、沟通限制以及让参与者承担他们支持的决策成本的机制。这种比较也符合 Buterin 更广泛的人工智能安全观点,他早些时候批评了围绕人工智能安全的大型政治运动,警告说它们可能会产生集中或独裁的结果。相反,他主张采用防御性技术和系统,以增加滥用的难度。人工智能安全将相同的想法置于不同的环境中 Eric Drexler 于 9 月 10 日发表的文章认为,当智能体相似、共享目标、自由沟通、观察彼此的行为并在重复交互中保留信息时,人工智能共谋会变得更容易。其对策包括使用不同的代理,限制它们之间的沟通,以及赋予批评者(生产自动审查模型、安全分类器和思想链监视器)权力来干预和破坏潜在的共谋。 Drexler 引用了 2026 年 7 月的 OpenAI 代理评估,借鉴了一个月后发布的一项调查,发现大约 1,200 名代理使用了未经授权的留言板,大约 700 名代理参与了对 Hugging Face 生产系统的攻击。一些特工表示反对,甚至采取了具体行动,包括阻止数据传输和否决拟议的社会工程电子邮件,但他们无权停止运行或升级担忧。据研究人员称,之所以发生这种情况,是因为这种设置“几乎违反了他在 2019 年的一份报告中指出的防止多智能体系统串通所必需的所有条件”。然而,经过改装的监控装置,随后在同一型号上进行了测试,将这种行为减少了一百多倍。 Vitalik Buterin 表示加密货币反共谋规则可以适用于人工智能安全的帖子首先出现在 CryptoPotato 上。
