谷歌研究揭示了 GPT-5 和 Gemini-3 等前沿模型的召回局限性
核心要点
- 一个名为“知识剖析”的新框架表明,大多数人工智能幻觉源于检索失败,而不是知识缺失 你的人工智能模型知道答案。
- 事实就在模型的参数中。
- 在一些测试的模型中,召回失败占所有事实错误的 70% 以上。

一个名为“知识剖析”的新框架表明,大多数人工智能幻觉源于检索失败,而不是知识缺失
你的人工智能模型知道答案。它只是找不到它。
这是谷歌研究中心和以色列理工学院一项新研究的核心发现,该研究分析了 13 个大型语言模型的超过 400 万条回复,发现当前沿模型产生幻觉时,问题通常不是它们缺乏相关事实。事实就在模型的参数中。当被问到时,模型根本无法将它们拉出来。
钥匙丢失问题
这篇题为“空架子还是丢失钥匙?召回是参数事实性的瓶颈”的论文介绍了一个团队称之为“知识剖析”的框架。该框架区分了两种不同的功能:编码(模型是否存储了事实)和召回(模型是否可以在生成过程中实际显示该事实)。
研究人员使用源自维基百科的名为 WikiProfile 的基准,发现领先模型在存储部分表现得非常出色。 Gemini-3-Pro 和 GPT-5 在基准测试中的实际编码都达到了 95-98% 的饱和度。
检索方面则讲述了一个截然不同的故事。 26-34% 的编码事实无法直接回忆。即使启用了思维链推理,它仍然会遗漏 11-12% 的已知知识。
在一些测试的模型中,召回失败占所有事实错误的 70% 以上。
缩放并不能解决这个问题
召回失败并不是随机的。它们是系统性的,对长尾事实和反向查询产生不成比例的影响。长尾事实是那些晦涩难懂、不常遇到的信息,很少出现在训练数据中。反向查询翻转了问题的典型方向:而不是问“法国的首都是什么?”你问“巴黎是哪个国家的首都?”尽管底层知识是相同的,但模型在第二种表述上遇到了更多困难。
使模型变大主要是改善编码,而不是回忆,这表明当前基于变压器的模型组织和访问存储信息的方式对常见的前向检索有内在的偏见。
这项研究背后的研究团队包括来自谷歌研究院和以色列理工学院的 Nitay Calderon,以及 Gal Yona、Eyal Ben-David、Zorik Gekhman 和 Eran Ofek。 2026 年 6 月的一篇题为“Thinking to Recall”的补充论文发现,推理策略可以通过潜在计算来恢复一些回忆失败,本质上是让模型通过中间步骤来访问隐藏的知识。但这个过程可能会引入自己的幻觉,因为模型有时会在得出答案的过程中产生错误的中间事实。
这对人工智能开发和投资意味着什么
如果召回而不是编码是瓶颈,那么该行业在更大的训练运行和数据集上的巨额支出可能会导致事实准确性的回报递减。减少幻觉的下一个前沿可能涉及更好的检索架构、推理时间技术以及模型如何在内部组织参数知识的新方法。
这一发现还对检索增强生成(RAG)方法产生了影响,该方法已成为整个行业的标准实践。 RAG 系统在推理时将外部文档提供给模型,基本上完全绕过参数内存。这项研究表明,RAG 可能是在补偿召回问题而不是知识问题,如果召回机制本身能够得到改进,这将为潜在的轻量级解决方案打开大门。
