Uno 通过将扩散连接到现有模型,将法学硕士的吞吐量提高了 2.5 倍
核心要点
- 一种名为 Uno 的新方法声称打破了这种权衡,与标准自回归模型相比,吞吐量提高了 3 倍,同时保持了每个生成令牌的质量。
- 自回归权重保持完整并处理最终验证,因此输出质量与基本模型本身生成的质量相匹配。
- Uno 的架构中,自回归模型对令牌选择拥有最终决定权,旨在保证输出与基本模型的分布完全匹配。

轻量级扩散适配器可让大型语言模型并行生成多个标记,而不会牺牲输出质量
让大型语言模型思考得更快通常意味着让它思考得更糟。一种名为 Uno 的新方法声称打破了这种权衡,与标准自回归模型相比,吞吐量提高了 3 倍,同时保持了每个生成令牌的质量。
该技术在 2026 年 9 月 3 日发表的题为“通过离散扩散解锁 LLM 中的无损加速”(arXiv:2609.04010) 的论文中有详细介绍,其工作原理是将轻量级扩散权重移植到现有的自回归模型上。它没有取代原始架构,而是对其进行了增强,让模型并行生成候选令牌块,同时基础模型充当质量裁判。
格洛丽亚 今天有数以千计的头条新闻影响着市场。凯莱财经向您展示对您的投资组合最重要的三个因素。看看什么重要→
Uno 的实际工作原理
Uno 的主要作者 Subham Sekhar Sahoo 和合作者介绍了他们所谓的 Psi-Spec 采样器,它使用基于扩散的适配器同时生成多个候选令牌。自回归权重保持完整并处理最终验证,因此输出质量与基本模型本身生成的质量相匹配。
关键的见解是扩散模型本质上是并行的。虽然自回归生成本质上是顺序的(令牌 B 取决于令牌 A),但扩散可以一次性细化嘈杂的令牌块。 Uno 在不放弃自回归模型优势的情况下利用了这一特性。
其结果是,系统使用任何同类加速方法中最少的附加参数,同时提供比 EAGLE-3 和 DFlash 等领先推测解码器更高的总吞吐量。
Uno-Qwen 8B 变体建立在 Qwen 80 亿个参数模型之上,在批量大小为 1 时实现了大约 2.5 倍的加速。在较大批量大小时,提升幅度缩小至约 1.6 倍。与基本自回归模型相比,系统吞吐量上限高达 3 倍。
在代理、编码和长上下文基准测试中,8B 参数 Uno 模型的性能优于 26B 参数模型 DiffusionGemma。 Uno 还声称比竞争的加速方法更低的峰值内存使用量。
开源,但未经验证
该团队已在 GitHub 上的存储库 ifm-ai/uno 下发布了代码和检查点,并在 Hugging Face (s-sahoo/uno-qwen3-8B) 上提供了模型权重。该版本包括训练配方,并支持通过 Nano-vLLM 使用线性和树采样器进行推理。
截至 2026 年 9 月上旬,对 Uno 声称的业绩的独立核实仍有待进行。该论文是预印本,尚未经过同行评审。 Uno 的架构中,自回归模型对令牌选择拥有最终决定权,旨在保证输出与基本模型的分布完全匹配。
为什么这对人工智能基础设施很重要
如果在生产环境中保持不变,吞吐量提高 2.5 倍意味着用大约 40% 的 GPU 来服务相同数量的请求。事实上,Uno 作为适配器而不是替代品,意味着已经微调和部署自回归模型的组织不需要从头开始,他们可以将 Uno 的扩散权重固定到现有基础设施上。
