Salesforce 利用 DarwinX 框架将 AI 代理性能提升至 93%
核心要点
- 一种新的进化方法在不影响模型权重的情况下优化了 AI 代理工具,在 1,260 个任务中产生了显着的基准收益 Salesforce AI Research 刚刚发布了一个框架,将 AI 代理优化视为自然选择。
- WebArena-Infinity 基准测试衡量人工智能代理完成实际基于网络的任务的能力。

一种新的进化方法在不影响模型权重的情况下优化了 AI 代理工具,在 1,260 个任务中产生了显着的基准收益
Salesforce AI Research 刚刚发布了一个框架,将 AI 代理优化视为自然选择。它被称为 DarwinX,围绕语言模型、提示、工具、技能和控制流发展脚手架,同时完全不影响模型自身的权重。结果是:在 1,260 个任务基准上,实际任务通过率从 43.5% 跃升至 93.0%。
WebArena-Infinity 基准测试衡量人工智能代理完成实际基于网络的任务的能力。
Gloria One 应用程序,一个屏幕 - 每天早上,Gloria Finance 都会向您简要介绍发生的事情以及它如何影响您的投资组合。阅读您的简介 →
DarwinX 的实际工作原理
DarwinX 维护着一组“harness 变体”,每个变体代表代理与世界交互方式的不同配置。它将基于群体的自然选择应用于这些变体,保留有效的内容并结合来自不同谱系的成功特征。
该框架在由 12 位作者组成的研究团队所称的“保留和扩展”合同下运行。只有能够明显提高性能的变化才能延续到下一代。先前谱系的档案为重组提供了遗传物质,防止系统在探索新功能时失去来之不易的能力。
健身不是通过氛围来判断的。每个变体都通过特定的基准验证器进行评估,自动检查确认代理是否真正完成了分配的任务。
重要的数字
WebArena-Infinity 的标题数字(43.5% 到 93.0% 的审核通过@1)本身就足够引人注目。但第二个指标讲述了一个同样重要的故事。无效轨迹(即智能体基本上偏离轨道并产生无法使用的输出的情况)从大约 23.5% 下降到仅 1.4%。
人工智能、科技及其所推动的市场——每日简报。日常的。自由的。加入加密货币、金融和政策领域 34,000 多名读者的行列。电子邮件地址 免费订阅 我们尊重您的隐私。随时取消订阅。
在 Terminal-Bench 2.1(专注于命令行任务完成的基准测试)上,DarwinX 将性能提升了 7.7 个百分点,达到 83.2%。这与基本模型的本机性能相匹配。当研究人员在更强大的基础模型上运行相同的进化工具时,它达到了 84.7%,实际上超过了基础模型的分数。
在所有测试的基准套件中,平均改进约为 17 个点。
泛化,而不是记忆
在 Terminal-Bench 2.1 上发展的线束直接转移到 SWE-bench Verified,这是一个完全不同的基准,无需任何修改。
该论文于 2026 年 7 月 31 日发表在 arXiv 上(论文 ID:2608.07545),由张一凡、戴雨桐和谭俊涛领导的 12 名研究人员团队撰写。
这对企业人工智能意味着什么
对于 Salesforce 来说,DarwinX 代表了企业人工智能代理市场中潜在的重大竞争优势。该公司一直在积极构建 Agentforce 平台,该框架无需昂贵的模型再训练即可显着提高代理可靠性,从而降低大规模部署 AI 代理的成本和复杂性。
微调大型语言模型需要大量的计算预算、专业知识和灾难性遗忘的风险,其中模型会失去以前学到的功能。 DarwinX 通过完全在线束级别运行来回避所有三个问题。
有一个值得注意的警告。 DarwinX 现阶段仍属于一项研究计划。该论文没有包含有关生产部署的详细信息,也没有发布对结果的独立验证。
