微软研究表明代理长时间运行暴露出严重的可靠性问题
核心要点
- 新基准显示,人工智能模型在扩展工作流程中失去了大约一半的文档保真度,超过 80% 的测试场景发生了灾难性损坏 微软研究院发布了一项使用其 DELEGATE-52 基准的研究,该基准量化了从业者长期以来所怀疑的事情:前沿人工智能模型在执行扩展的多步骤工作流程时会显着退化。
- 标准评估测试短期、孤立任务的模

新基准显示,人工智能模型在扩展工作流程中失去了大约一半的文档保真度,超过 80% 的测试场景发生了灾难性损坏
微软研究院发布了一项使用其 DELEGATE-52 基准的研究,该基准量化了从业者长期以来所怀疑的事情:前沿人工智能模型在执行扩展的多步骤工作流程时会显着退化。仅 20 次委托迭代后,平均文档保真度损失就达到约 25%。缩小所有测试的模型和领域,退化数字攀升至大约 50%。
打破幻想的基准
DELEGATE-52 旨在测量大多数 AI 基准测试很容易忽略的东西。标准评估测试短期、孤立任务的模型。相反,微软的基准测试评估模型在长链委托工作中保存文档内容的效果,模拟模型必须跨 52 个专业领域迭代编辑、转换和重建文档或代码的现实场景。
Gloria 准确了解巴菲特、索罗斯和潘兴广场正在购买什么——然后在 Gloria Finance 中反映明智的资金。跟随伟人 →
测试的模型包括一些功能最强大的系统:Gemini 3.1 Pro、Claude 4.6 Opus 和 GPT 5.4。所有人都愣住了。
灾难性损坏(定义为保真度分数降至 80% 或更低)出现在超过 80% 的评估模型域组合中。
有一个领域脱颖而出,成为难得的亮点。 Python 工作流程保持了显着的稳定性,在长时间运行中性能下降不到 1%。
Gemini 3.1 Pro 被认为适用于基准测试涵盖的 52 个专业领域中的 11 个领域。
工具只会让事情变得更糟,而不是更好
为代理提供更多功能,例如文件读/写访问和代码执行,实际上使可靠性问题变得更糟。代理工具的使用使文档保真度平均降低了 6%。
该研究还指出,验证和编排方法(通常为让代理保持在正轨上而部署的护栏团队类型)并没有解决问题。可靠的长期授权仍然是一个根本性的挑战,而不仅仅是更好的提示可以解决的工程上的不便。
为什么短期基准会产生误导
公司用于营销其人工智能模型以及企业用于评估它们的性能指标绝大多数来自短期基准。在五步任务上得分 95% 的模型可能在实际上相同工作的 20 步版本上得分 50%。
业界的并行努力凸显了这个问题正在得到广泛的认识。 AgentRx 等框架和 SentinelBench 等监控工具专门用于解决扩展代理操作的可靠性问题。
