微软与康奈尔大学推出免费暂停令牌方法,用于高效的语言模型训练
核心要点
- 该技术从大型语言模型中挤出更好的预测,而不会在推理时减慢它们的速度 微软和康奈尔大学的研究人员发布了一种新的训练技术,可以使大型语言模型在预测下一个标记方面表现得更好,同时保持推理速度基本不变。
- 它描述了一个与模型的主状态流共享权重的并行预测流,在训练接近结束时添加额外的计算,而不会出现架构更改带来的

该技术从大型语言模型中挤出更好的预测,而不会在推理时减慢它们的速度
微软和康奈尔大学的研究人员发布了一种新的训练技术,可以使大型语言模型在预测下一个标记方面表现得更好,同时保持推理速度基本不变。这种方法被称为“免费暂停令牌”,代表了人工智能研究中罕见的改进之一,在这种方法中,你几乎不花钱就能得到一些东西。
这篇题为“Free Pause Tokens”(也称为“Almost Free State Prediction Separation”)的论文于 9 月 3 日提交给 arXiv。它描述了一个与模型的主状态流共享权重的并行预测流,在训练接近结束时添加额外的计算,而不会出现架构更改带来的常见惩罚。
格洛丽亚 关闭应用——格洛丽亚财经持续关注。设置监视器并仅在发生重大变化时才收到反馈。设置监视器 →
免费暂停令牌实际上有什么作用
之前 2023 年和 2024 年的研究试图通过在输入序列中插入显式“暂停标记”来解决 Transformer 模型的固定计算约束。这些为模型提供了额外的思考步骤,但它们也带来了代价:更长的上下文长度、更大的键值缓存和更慢的推理。
免费暂停令牌方法完全回避了这些问题。它不是在输入序列中添加标记,而是在训练期间创建轻量级并行预测流。该流通过共享门控前馈网络 (FFN) 与主模型共享权重,因此额外的参数和计算量很少。在推理过程中,预测流基本上可以被忽略,这意味着模型的运行速度与标准变压器大致相同。
10 亿个参数模型的性能提升使得下一个令牌预测提高了大约 2 到 3 厘纳。分是一种信息单位,用于衡量模型预测下一个标记的效果。
使其发挥作用的工程细节
三种特定的技术选择可降低培训开销。首先,该团队使用了一种称为两遍分割的技术,该技术保持了与广泛采用的内存高效注意力算法 FlashAttention 的兼容性。其次,他们采用 w=0 的预测窗口,这意味着预测流不需要以会使架构复杂化的方式进行预测。第三,共享门控 FFN 允许预测流搭载主模型的现有参数,而不需要自己的专用层。
结果是训练时间仅为标准优化管道的 1.09 至 1.14 倍。研究人员报告说,与传统 Transformer 相比,isoflop、isoparameter 和 isotoken 指标有所改进,这意味着无论您保持计算预算、参数计数或训练数据大小不变,Free Pause Tokens 都会产生更好的模型。
为什么这在实验室之外很重要
免费暂停令牌的实际吸引力在于它不需要什么。没有额外的上下文长度意味着不需要重新设计现有的部署基础设施。没有额外的键值缓存开销意味着内存受限的服务环境可以采用该技术而无需升级硬件。无需额外的解码步骤意味着对延迟敏感的应用程序不会出现响应时间下降的情况。
