腾讯论文揭示多模态 AI 模型中非思维模式导致响应失败高达 48%
核心要点
- 一个名为 PatternEval 的新基准揭示了混合思维人工智能系统中的快捷推理模式如何产生明显更明显的错误,即使准确度分数在纸面上看起来很好。
- 腾讯研究人员量化了多模式人工智能模型的重度用户可能注意到的一些轶事:当这些系统跳过“思考”步骤并直接跳到答案时,事情会更频繁地发生故障。
- 根据该团队在 arXiv 上发表的新论文,旗舰模型中思考和非思考推理失败率之间的差距高达 48.64%。
- 这项题为“超越正确性:混合思维 MLLM 中的基准测试和调整响应行为”的研究引入了名为 PatternEval 的诊断基准。

一个名为 PatternEval 的新基准揭示了混合思维人工智能系统中的快捷推理模式如何产生明显更明显的错误,即使准确度分数在纸面上看起来很好。
腾讯研究人员量化了多模式人工智能模型的重度用户可能注意到的一些轶事:当这些系统跳过“思考”步骤并直接跳到答案时,事情会更频繁地发生故障。根据该团队在 arXiv 上发表的新论文,旗舰模型中思考和非思考推理失败率之间的差距高达 48.64%。
这项题为“超越正确性:混合思维 MLLM 中的基准测试和调整响应行为”的研究引入了名为 PatternEval 的诊断基准。它旨在捕捉传统准确性指标完全遗漏的内容。一个模型可以在正确性方面得分很高,同时产生充满矛盾、重复和推理的响应,这些响应看起来很复杂,但毫无用处。
PatternEval 实际测量什么
PatternEval 由分布在多个任务类别的 2,415 个多模式提示组成。该基准不是简单地询问“模型是否得到了正确的答案”,而是评估响应本身的质量和连贯性。
研究人员发现了四种困扰非思考输出的主要失败模式。当内部推理的碎片渗透到本应干净、直接的答案中时,就会发生思想链泄漏。响应重复正如其听起来的那样:模型陷入循环,重申相同的信息。逻辑矛盾意味着模型在单个响应中断言了不相容的主张。执行推理描述了模仿逻辑分析结构但不实际执行任何操作的输出。
思想链泄漏和响应重复的平均触发率分别约为 12.75% 和 8.49%。
混合思维模型,即可以在深度推理和快速直接答案之间切换的模型,在非思维模式下不一定更容易出错。他们只是以用户立即可见且令人沮丧的方式出错。基准仪表板上的准确度数字可能看起来相当,但实际体验却相差很大。
在不破坏准确性的情况下解决问题
识别疾病是一回事。腾讯团队还提出了两种治疗方案。第一个是 PatternRM,是一个响应级奖励模型,经过训练可以检测和惩罚四种失败模式。第二个是 PatternRL,它更进一步,将特定于模式的惩罚直接嵌入到用于微调这些模型的强化学习过程中。
PatternRL 的早期结果看起来确实很有希望。该技术应用于Qwen3-VL-4B,将非思考故障触发率降低了13.08个百分点。较大的 Qwen3-VL-8B 变体的改进更大,达到 14.35 个百分点。至关重要的是,在这两种情况下,准确率波动都保持在 1 个百分点以内。
这篇论文在 7 月下旬发表后不久就获得了 Hugging Face 顶级论文的认可。
