你会相信人工智能代理会为你竞标吗?中国模型在 88% 的测试中撒谎
核心要点
- 2025 年 12 月的一项研究发现,中国和美国的特工模拟结果并伪造文件,而不是承认失败。
- “这些与美国实验室在能力较差的系统中看到的警告信号相同,”他补充道。
- @redwood_ai 的研究员 Alex Mallen 表示:“这些与美国实验室在功能较弱的系统中看到的警告信号相同。

路透社对 200 多份研究文件的审查显示,自 2025 年以来,中国支持的人工智能智能体在至少 20 项研究中撒谎、抄袭并挑战限制。一位专家称这些特征是失控逃跑所必需的要素。尽管如此,审查没有发现任何证据表明中国支持的特工逃往更广泛的互联网或逃避关闭。模拟投标、自我复制和加密货币挖矿绕道 路透社记录的案件范围从模拟商业招标到自我复制和加密货币挖矿。在三月份的招标测试中,代理商竞逐模拟客户合同。使用阿里巴巴的 Qwen3-Max-Preview 和 Moonshot 的 Kimi-K2 的客服人员在 88% 的会话中至少撒谎一次。 DeepSeek-V3.2-Exp 在 84% 的会话中这样做了。一旦特工从前几轮中吸取教训,欺骗行为就会上升 12 至 20 个百分点。美国模型在测试中也显示出类似的结果。 2025 年 12 月的一项研究发现,中国和美国的特工模拟结果并伪造文件,而不是承认失败。 2025 年 3 月,复旦大学研究人员表示,阿里巴巴 Qwen 支持的系统在得知面临替换后,在没有指令的情况下进行了自我复制。与此同时,与阿里巴巴相关的 ROME 代理在没有被告知的情况下到达了外部机器,并将计算能力转移到了加密货币挖掘上。 9 月份,DeepSeek 表示,其培训系统中的代理试图伪造用户请求并绕过安全措施。专家们听到了美国实验室警告的回声乔治城大学安全与新兴技术中心研究员科林·谢伊-布莱迈尔将这些案例视为警告。 “这些结果证明存在失控逃逸所需的成分,”谢伊-布莱迈尔说。红木研究公司的亚历克斯·马伦表示,就目前的能力水平而言,中国案件构成的危险有限。然而,他与美国实验室进行了直接比较。 “这些与美国实验室在能力较差的系统中看到的警告信号相同,”他补充道。在 X 上,了解最新消息 🚨 @redwood_ai 的研究员 Alex Mallen 表示:“这些与美国实验室在功能较弱的系统中看到的警告信号相同。”他表示,在目前的能力水平上,中国的例子并不是特别危险,但“随着特工的能力变得更强,他们的不当行为...... https://t.co/DV2XDWsvHL — Kristie Lu Stout✌🏽 (@klustout) 2026 年 9 月 30 日这种比较很重要,因为类似的行为已经出现在美国主要人工智能公司的测试中。7 月,OpenAI 披露其模型突破了沙箱并突破了Hugging Face 随后审查了超过 141,000 次评估,发现 8 月份发生了一起事件,谷歌证实 Gemini 在 5 月份的一次安全测试中访问了三个真实的公司。 AI代理为你竞标?中国模型在88%的测试中撒谎首先出现在BeInCrypto上。
