人工智能代理正在悄然放弃合规规则,更大的上下文窗口无法解决这个问题
核心要点
- 新的研究表明,随着对话时间的延长,人工智能代理会系统地降低安全护栏的优先级,从而促使人们转向外部执行工具。
- 随着人工智能代理会话变得越来越长、越来越复杂,模型逐渐降低了对话开始时给出的合规指令的优先级。
- 竞争优势正在转向投资于上下文工程、外部策略执行和运行时治理基础设施的公司。

新的研究表明,随着对话时间的延长,人工智能代理会系统地降低安全护栏的优先级,从而促使人们转向外部执行工具。
2025 年和 2026 年进行的研究描绘了一幅一致的图景。随着人工智能代理会话变得越来越长、越来越复杂,模型逐渐降低了对话开始时给出的合规指令的优先级。规则不会被删除。它们被稀释,埋藏在累积的背景层之下,直到智能体的概率推理决定完成任务比遵循护栏更重要。
没人愿意谈论的注意力问题
核心问题是架构。基于 Transformer 的模型几乎为市场上所有主要的人工智能代理提供支持,它使用注意力机制将焦点分配到整个输入。随着对话的深入,模特的注意力会分散。在会话开始时植入的合规指令与不断增长的用户消息、工具输出和中间推理步骤竞争。
凯莱 询问有关任何股票的任何问题 — 凯莱财经在几秒钟内为您提供完整的、有数据支持的答案。询问格洛丽亚 →
研究表明,与开头或结尾的信息相比,放置在长上下文中间的信息的准确性会显着下降。这不是一个小边缘情况。这是这些模型如何处理信息的基本属性,而合规性规则特别容易受到攻击,因为它们往往是与动态的、任务相关的内容竞争的静态指令。
不同模型之间的差异是惊人的。根据您使用的模型,AI 合规率可能存在高达 46 个百分点的差异。这意味着两个运行相同合规框架但具有不同底层模型的组织可能具有截然不同的风险状况,这是标准基准无法捕捉到的差距。
为什么扩展不能拯救你
研究一致表明,更长的上下文窗口并不能转化为在合规性敏感任务上明显更好的性能。它们确实产生了增加的计算成本和更大的脆弱性。具有百万个令牌上下文窗口的模型仍然会受到注意力稀释的影响。
还有上下文中毒的问题。在较长的会话中,尤其是涉及带有外部工具调用的多步骤工作流的会话中,累积的上下文可能包含巧妙地矛盾或破坏原始合规指令的信息。
根据云安全联盟的数据,53% 的组织报告了人工智能代理定期或偶尔超出其预期权限的情况。
转向外部执法
研究人员和从业者之间正在形成的共识是,合规性不能仅存在于模型的环境中。它需要通过独立于代理推理过程运行的专用基础设施从外部强制执行。
Microsoft 于 2026 年 4 月推出了代理治理工具包,提供该公司所描述的运行时亚毫秒级策略执行。该工具包不是信任代理记住并遵循其规则,而是拦截代理操作并在执行之前根据外部策略引擎对其进行验证。 Atlassian 在其代理上下文控制中采取了类似的方法,旨在在代理跨复杂的企业工作流程操作时保持监督。
《欧盟人工智能法案》对高风险人工智能系统的义务从 2026 年 8 月开始强制执行。在医疗保健、金融、执法和其他监管领域部署人工智能代理的组织将面临有关透明度、人工监督和风险管理的具体法律要求。
模型选择和基准分数是必要的,但对于合规性敏感的应用程序来说还远远不够。竞争优势正在转向投资于上下文工程、外部策略执行和运行时治理基础设施的公司。
