Google 的 Dream-RSI 将发现代理调用减少了 162 倍
核心要点
- Dream-RSI 是由 Google DeepMind、马里兰大学和弗吉尼亚大学的团队开发的框架,它将基准优化任务所需的发现代理调用数量从 51,200 次减少到 317 次。
- 一起看看→ Dream-RSI 的实际运作原理 该框架按三阶段循环运行,每个阶段都建立在最后一个阶段之上。
- 在 Gemini

一个新的框架让人工智能代理可以从自己的搜索历史中学习,而不是消耗昂贵的计算周期
谷歌研究人员构建了一个系统,可以让人工智能发现代理变得更加聪明,而无需实际做更多的工作。 Dream-RSI 是由 Google DeepMind、马里兰大学和弗吉尼亚大学的团队开发的框架,它将基准优化任务所需的发现代理调用数量从 51,200 次减少到 317 次。大约减少了 162 倍。
这篇论文在 arXiv 上发表为 arXiv:2609.14858,描述了一个系统,该系统本质上教会人工智能代理重播并从自己之前的搜索中学习,而不是每次都从头开始运行新的搜索。
Gloria Stocks 在一个应用程序中,加密货币在另一个应用程序中,钱包无处不在?凯莱金融将您的整个投资组合一目了然。一起看看→
Dream-RSI 的实际运作原理
该框架按三阶段循环运行,每个阶段都建立在最后一个阶段之上。首先,系统运行在线探索的初始阶段,生成研究人员所说的“发现树”。这些是特工所采取的每条搜索路径的结构化记录,包括死胡同和突破口。
在第二阶段,这些历史轨迹被转化为重播模拟器。系统无需再次调用底层编码代理,而是根据已有的数据重建决策环境。
第三阶段是“梦想”发生的阶段。一个单独的大型语言模型评估和细化探索策略,例如分支策略、批处理规则以及何时停止搜索,所有这些都是离线的。无需新的昂贵的代理电话。编排层针对重放模拟器测试不同的方法,找出最有效的方法,并锁定未来运行的改进策略。
结果是递归自我改进,而无需更新核心模型的权重。代理人不需要重新培训。
人工智能、科技及其所推动的市场——每日简报。日常的。自由的。加入加密货币、金融和政策领域 34,000 多名读者的行列。电子邮件地址 免费订阅 我们尊重您的隐私。随时取消订阅。
数字讲述故事
在 Lasso 路径求解器任务中,SimpleTES 基线需要 51,200 次发现代理调用。在 Gemini-3.1-Pro 上运行的 Dream-RSI 将其降至 317。平均运行时间从 3,587.1 毫秒降至 2,931.0 毫秒。
Dream-RSI 生成的解决方案在六个保留数据集上的性能优于 sklearn 和 glmnet 等现有库。即使与使用 550 次调用的递归固定探索方法相比,Dream-RSI 的 317 次调用也代表了有意义的改进。
在 KernelBench 上,Dream-RSI 实现了与现有方法同等的性能,同时在 VGG16 上生成的代数减少了 2.43 倍,在 LayerNorm 上生成的代数减少了 1.79 倍。
为什么这比基准分数更重要
实验中使用Gemini-3.1-Pro和Gemini-3.7-Flash,没有任何微调或权重更新。 Dream-RSI 作为编排层位于现有模型之上。
由 Tong Cheng 领导的研究团队,包括来自 Google DeepMind 和合作大学的 Xidong Wu 和 Cheng Zhang 等贡献者,已经建立了一个项目网站和 GitHub 存储库。据报道,该代码正在准备对外发布。
