微软论文揭示了 GPT-5.4-mini 的高效技能蒸馏
核心要点
- 微软研究人员找到了一种方法,可以让更便宜的人工智能模型胜过其昂贵的推理模式,而这个技巧的成本大约相当于一杯拿铁咖啡。
- 无需模型重新训练。
- 在基准测试中,技能增强模型使用的输出标记比推理模式少 2.7 到 6 倍。

从过去的任务中学到的一些规则可以取代昂贵的推理过程,将代币成本降低多达 6 倍,同时匹配或超越完整的推理性能。
微软研究人员找到了一种方法,可以让更便宜的人工智能模型胜过其昂贵的推理模式,而这个技巧的成本大约相当于一杯拿铁咖啡。
8 月 11 日发表的一篇论文,题为“广泛推理,而非深度推理:将推理溢价摊销为蒸馏技能”,介绍了一种被动技能蒸馏方法,该方法可以从少量任务示例中提取紧凑的规则集。这些规则以简单的降价形式编写,被注入到模型的系统提示中,并有效地教授它绕过昂贵的思维链推理的需要的捷径。本例中的目标型号:GPT-5.4-mini,于 3 月份推出。
Gloria 牛市情况、熊市情况或打破牛市情况的催化剂 — Gloria Finance 一键运行整个研究。运行剧本 →
它是如何运作的
这个过程看似简单。编码代理会审查 35 到 50 个任务轨迹,本质上是记录模型如何完成特定任务,有时会失败。从这些轨迹中,智能体提取出 40 到 130 行 Markdown 的自然语言“技能”文档。这些不是抽象的嵌入或微调的权重调整。它们是可读、可审计的规则,源自错误和正确的情况。
一旦该技能文档被折叠到非推理模型的系统提示中,就会发生一些有趣的事情。该模型弥补了通常区分推理和非推理模式的性能差距的 55% 到 100% 以上。更简单地说,廉价模式开始像昂贵模式一样运行,有时甚至更好。
生成每个领域的技能文档的计算成本在 1 到 3 美元之间。无需模型重新训练。
基准讲述故事
由 Agamdeep Singh、Srishti Gautam、Priyanshu Gupta、Nikita Mehrotra、Tanmay Bakshi 和 Sumit Gulwani 领导的研究团队通过四个代理基准(包括 ALFWorld 和 SpreadsheetBench-Verified)评估了该方法。
在 ALFWorld 上,技能增强型 GPT-5.4-mini 获得了 0.787 的分数。全推理模式得分0.713。因此,更便宜、更快的版本不仅仅缩小了差距。它吹过了它。
在基准测试中,技能增强模型使用的输出标记比推理模式少 2.7 到 6 倍。
以 SkillOpt 为基础
本文直接基于微软 6 月份发布的 SkillOpt 框架,该框架将代理技能重新定义为可训练参数,而不是静态模型权重。 SkillOpt 在六个基准测试中展示了 GPT-5.5 的平均增益 23.5 点,为技能可以独立于底层模型进行优化奠定了理论基础。
新的蒸馏方法采用了这一概念,并使其变得更加容易理解。由于技能文档只是通过系统提示注入的 Markdown 文件,因此它们可以与现有的部署策略配合使用。没有自定义推理基础设施。没有专门的硬件。无需重新训练。
