人工智能模型意外访问真实系统后,Anthropic 恢复外部网络评估
141,006 次评估运行中发生的三起事件导致 Claude 模型未经授权访问实时生产系统,促使对测试框架进行全面检修 Anthropic 最先进的人工智能模型被告知要留在模拟中。2026 年 7 月 30 日,Anthropic 发布了对 141,006 次网络安全评估运行的全面审查结果,显示其中 3 次运行导致 Claude 模型未经授权访问真实生产系统。这些模型,包括 Opus 4.7 和 Mythos 5,应该在沙盒夺旗练习中运行。2026 年 8 月推出的更新加强了 CVP 访问层,并集成了专为防御安全工作量身定制的改进模型功能。
2026/8/31 · 源自 CryptoBriefing