Nvidia 研究人员通过判断模型提高人工智能代理的可靠性
核心要点
- 一种名为 Mid-Harness 的新方法有一个验证器模型在终端代理运行任何内容之前选择最佳命令 Nvidia 研究人员针对不可靠的人工智能代理找到了一种相当人性化的解决方案:打字前三思。
- 他们的新方法称为 Mid-Harness,让代理生成几种可能的动作,然后让一个单独的判断模型选择实际运行的动作。

一种名为 Mid-Harness 的新方法有一个验证器模型在终端代理运行任何内容之前选择最佳命令
Nvidia 研究人员针对不可靠的人工智能代理找到了一种相当人性化的解决方案:打字前三思。他们的新方法称为 Mid-Harness,让代理生成几种可能的动作,然后让一个单独的判断模型选择实际运行的动作。
在一个基准测试中,额外的深思熟虑将首次尝试的成功率从 50.00% 提高到 68.03%。对于在命令行内运行的软件来说,一个错误的命令可能会导致整个任务失败,这一点很重要。
中线束带的工作原理
Mid-Harness 有一个生成器模型在每个步骤中对多个候选动作进行采样,第二个模型(验证器)对它们进行评分。只有最佳选择才会被转发执行。
目标是研究人员所说的终端代理。这些是在命令行界面中工作或调用外部工具、在真实环境中输入真实命令的人工智能系统。
这些环境是随机的,这意味着每次运行的结果可能会发生不可预测的变化。特工通常可能知道正确的命令,但在最糟糕的时刻仍然会笨手笨脚地执行。
该论文将其视为生成与可靠执行之间的差距。模型能够生成有用的命令,而无需在重要时持续生成命令。
Mid-Harness 的目标是在不重新训练发电机的情况下缩小这一差距。它只是在思考和行动之间添加了一个过滤器。
人工智能、科技及其所推动的市场——每日简报。日常的。自由的。加入加密货币、金融和政策领域 34,000 多名读者的行列。电子邮件地址 免费订阅 我们尊重您的隐私。随时取消订阅。
TerminalBench-Lite 上的数字
该团队在 TerminalBench-Lite(终端代理任务基准)上测试了该方法。他们的主要结果是将 TMAX-9B 生成器与 GPT-5.6 Sol 配对作为验证器。
通过每步 8 个采样动作,Pass@1 从 50.00% 攀升至 68.03%。 Pass@1 衡量代理在第一次也是唯一一次尝试中成功的频率,这是生产中最重要的场景。
根据研究结果,当TMAX-9B同时充当生成器和验证器,对自己的作业进行评分时,最有效的结果出现了。这表明模型可能更擅长识别良好的命令,而不是在第一次尝试时就可靠地生成命令。
研究人员还比较了两种花费额外计算的策略。动作缩放(Mid-Harness 方法)在每个单独步骤中对许多选项进行采样。相反,轨迹缩放会多次运行整个任务尝试并选择最佳的整体运行。
根据研究结果,与单独的轨迹扩展相比,行动扩展以更低的代币成本提供了更好的结果。这两种方法也能很好地协同工作。该研究报告了不同模型和基准的持续改进,而不仅仅是单一的标题配对。
背景:Nvidia 推动代理可靠性
该论文于 2026 年 12 月 16 日发表,作者包括 Nvidia 的 Minki Kang 和 Ehsan Hosseini-Asl。 2026 年初,Nvidia 推出了 ACES,这是一个于 2026 年 8 月左右发布的框架,用于衡量代理技能对运行时的实际影响。随后于 2026 年 9 月推出了开放代理安全平台。
这意味着什么
正如研究结果所表明的那样,如果行动级验证在代币效率方面击败了轨迹级重试,那么它提供了一条更便宜的途径来提高可靠性。检查每个步骤的成本低于重做整个工作的成本。
如果一个 90 亿参数的模型能够有效地判断自己的候选动作,那么团队可能不需要花钱购买第二个更大的模型来充当裁判,从而简化部署并降低成本。
有一些警告。 68.03% 的 Pass@1 率是一个真正的进步,但这仍然意味着大约三分之一的任务在第一次尝试时失败。基准也是受控设置,Mid-Harness 在更混乱的现实环境、更长的任务和不同的工具链中的表现还有待测试。
