斯坦福大学和 Nvidia 的 CLM-8B 模型的运行速度比 Jev 快 9 倍
核心要点
- CLM-8B 于 9 月 23 日发布,是第一个公开可用的对比语言模型,该类别在本文落地之前并不存在。
- 该模型在多个基准测试中与 TypeSafe AI 专有的 Jev 模型的性能相匹配,同时将延迟减少到一小部分。
- 在 T-Rex 游戏基准测试中,CLM-8B 每次决策的时间为 16.5 毫秒,而 Je

一种新的开源“对比语言模型”缓存代理操作,将决策延迟从 150 毫秒减少到 17 毫秒以下,并且适合单个 GPU
斯坦福大学和英伟达刚刚放弃了一个人工智能模型,该模型的实时代理决策速度比当前领先系统快大约九倍。 CLM-8B 于 9 月 23 日发布,是第一个公开可用的对比语言模型,该类别在本文落地之前并不存在。
该模型在多个基准测试中与 TypeSafe AI 专有的 Jev 模型的性能相匹配,同时将延迟减少到一小部分。在 T-Rex 游戏基准测试中,CLM-8B 每次决策的时间为 16.5 毫秒,而 Jev 为 149.8 毫秒。
对比学习如何改变游戏规则
它不是从头开始生成响应,而是使用对比学习来构建一个共享的嵌入空间,其中状态和动作并存。当模型需要决定下一步做什么时,它会根据候选动作与嵌入空间中当前状态的匹配程度来对它们进行评分。
该架构位于冻结的 Qwen3-8B 主干之上。关键的创新在于投影头,这是一个小型可训练模块,每个模块约有 2000 万个参数,可以学习将输入映射到对比空间中。基本模型的权重保持锁定,这使得计算成本易于管理,而轻量级头部则负责动作选择的繁重工作。
由研究员 Jacky Kwok 领导的团队将这些模型称为“系统一”模型,该术语借用了 Daniel Kahneman 的框架来表示快速、直观的思维与缓慢、深思熟虑的推理。
人工智能、科技及其所推动的市场——每日简报。日常的。自由的。加入加密货币、金融和政策领域 34,000 多名读者的行列。电子邮件地址 免费订阅 我们尊重您的隐私。随时取消订阅。
大规模培训,基准很重要
该模型经历了三个不同的训练阶段。预训练使用 6000 万个问答对来建立基线理解。训练中期引入了 3000 万个合成硬底片。训练后完善了 100 万条代理轨迹上的所有内容。
在测试软件工程能力的编码基准 DeepSWE 上,CLM-8B 得分为 81.6%。在 Terminal-Bench 2.1 上,它达到了 87.6%。两者都代表了该参数范围内模型的最先进性能。
除了编码之外,该模型在计算机使用、超级马里奥和维基赛车等游戏环境中的任务中还表现出了与 Jev 相当的零样本性能。每个测试领域都具有速度优势,而不仅仅是 9 倍数字所来自的 T-Rex 基准测试。
开放权重、单 GPU、Apache 2.0
CLM-8B 在 Apache 2.0 许可证下附带开放式配重。代码和模型文件可在 GitHub 上获取。您可以使用 vLLM 在单个 Nvidia GPU 上自行托管整个内容。
名为 CLM-35B 的多式联运后继产品已经在开发中,预计于 2026 年 10 月上旬发布。
