谷歌研究显示程序图可以提高 LLM 代理的表现
核心要点
- 一个新的研究框架将程序知识组织成可编辑的图形结构,在 24 个基准设置中的 21 个中提高了长任务的成功率。
- Gemini 3.1 Pro 在 EnterpriseArena 上的生存率提高了 28 个百分点,EnterpriseArena 是旨在测试代理处理扩展、多步骤业务流程的性能的基准之一。

一个新的研究框架将程序知识组织成可编辑的图形结构,在 24 个基准设置中的 21 个中提高了长任务的成功率。
让 AI 智能体遵循 15 个步骤的流程,而不会中途丢失情节,一直是大型语言模型开发中的顽固难题之一。谷歌研究人员与佐治亚理工学院和北京大学的合作者一起工作,认为他们已经找到了一种结构性解决方案:程序图。
这篇题为“Procedural Graphs: Self-Evolving Execution Structures for LLM Agents”的论文于 9 月 8 日提交给 arXiv,描述了一个在 24 个模型基准设置中的 21 个中排名第一或并列第一的框架。企业模拟中的长期生存率从 6% 跃升至 34%。
格洛丽亚 拥有这个故事中的任何名字吗?了解今天的走势对您的投资组合有何实际影响。在格洛丽亚开业 →
程序图实际上是如何工作的
核心思想借鉴了大多数数据工程师已经知道的概念:知识图谱。传统知识图将事实存储为三元组,例如(巴黎、法国首都)。过程图将相同的逻辑应用于过程,将知识组织为(过程、关系、过程)三元组,并在每条边上附加特定条件和指导。
两个组成部分使这项工作在实践中发挥作用。首先,定位机制识别程序图中的哪个节点当前处于活动状态。其次,指导模型将本地子图(即周围的步骤及其关系)转换为为 LLM 代理量身定制的建议。结果是逐步的情景指导,而不是模糊的提示告诉模型“遵循程序”。
也许最有趣的设计选择是:图表自学。自我进化机制使用 LLM 优化器从成功和失败的轨迹中学习。该系统只接受明显提高性能的修改,验证门可以防止未经检查的自我修改带来的偏差。作者发现,这种自动化方法生成的图形结构与手工设计的图形结构相匹配或优于手工设计的图形结构,这对于减少手动工程开销非常重要。
人工智能、科技及其所推动的市场——每日简报。日常的。自由的。加入加密货币、金融和政策领域 34,000 多名读者的行列。电子邮件地址 免费订阅 我们尊重您的隐私。随时取消订阅。
基准测试结果
研究人员使用四个不同的法学硕士(包括 Gemini 3.1 Pro 和 Claude Sonnet 4.6)在七个基准测试中测试了 PG。
在 BFCL v3 函数调用基准测试中,PG 实现了 9 个百分点的改进。
企业模拟结果更加引人注目。 Gemini 3.1 Pro 在 EnterpriseArena 上的生存率提高了 28 个百分点,EnterpriseArena 是旨在测试代理处理扩展、多步骤业务流程的性能的基准之一。从 6% 的长期生存率上升到 34% 是一种技术从“有趣的研究”到“实际可部署”的飞跃。
为什么这对人工智能代理领域很重要
PG 通过提供结构指导而不是依赖模型从存储的记忆中重建上下文,从而提供了一种根本不同的架构。
作者身份值得注意。该研究的主要作者 Yushing Lu 来自 Google、佐治亚理工学院和北京大学,合著者 Yi Cheng Chen、Shanchan Wu 和 Sercan Arık 均来自 Google。跨机构合作以及谷歌自己的 Gemini 模型也在测试中这一事实表明,该框架可能会影响谷歌设计下一代代理基础设施的方式。
