Arena 研究表明,58% 的情况下,AI 模型更喜欢自己的答案
核心要点
- 一项检查大型语言模型中自我偏好偏差的新研究发现,在成对比较中,人工智能法官在大约 58% 的情况下倾向于自己生成的答案。
- 产生较低困惑度输出的模型往往在质量基准上得分较高,而这些相同的模型往往表现出更强的自我偏好。
- 其模型被用作法官的人工智能提供商可能具有固有的优势,无论是通过熟悉自己的输出模式,还是通

对自动判断的新研究表明,大型语言模型表现出持续的自恋倾向,引发了人们对影响人工智能发展的排行榜的质疑
当你要求人工智能评判一场写作比赛,而其中一名参赛者就是他自己时,事情就会变得尴尬。一项检查大型语言模型中自我偏好偏差的新研究发现,在成对比较中,人工智能法官在大约 58% 的情况下倾向于自己生成的答案。
这些发现切中了人工智能行业日益增长的依赖性的核心:使用模型来评估其他模型。像 Chatbot Arena 这样的平台让人工智能系统在盲目的正面对决中相互竞争,已经成为衡量进展的事实上的基准。
自恋问题
这种偏见有时被称为自我中心或自恋偏见,在行业大腕中始终存在。 OpenAI的GPT、Anthropic的Claude和Google的Gemini在担任评委时都表现出了这种倾向。
研究表明,观察到的自我偏好中有 40% 到 96% 可能源于所比较的输出的实际质量差异。换句话说,某些模型可能确实更喜欢自己的答案,因为从某些指标来看,这些答案更好。
研究人员试图区分这一点的一种方法是通过困惑度,衡量模型对给定文本的惊讶程度。产生较低困惑度输出的模型往往在质量基准上得分较高,而这些相同的模型往往表现出更强的自我偏好。
另一个值得注意的怪癖是:人工智能法官很少宣布关系。在人类的评价中,联系是很常见的。人工智能模型似乎对这种结果几乎过敏,即使两个响应之间的质量差距可以忽略不计,它也会始终如一地选出获胜者。
人工智能、科技及其所推动的市场——每日简报。日常的。自由的。加入加密货币、金融和政策领域 34,000 多名读者的行列。电子邮件地址 免费订阅 我们尊重您的隐私。随时取消订阅。
为什么排行榜会让你紧张
自我偏好偏差以特定的方式使这一假设变得复杂。如果进行评判的模特也在接受评判的模特之中,那么这个过程中就会存在结构性利益冲突。
竞技场式评估的批评者还指出了数据不对称的问题。其模型被用作法官的人工智能提供商可能具有固有的优势,无论是通过熟悉自己的输出模式,还是通过其训练数据和评估标准之间的微妙一致性。
随着模型能力的增强,自我偏好效应似乎也会增强。更强大的模型表现出更倾向于支持自己的输出的倾向。
接下来会发生什么
研究人员计划在 2025 年和 2026 年重点开展工作,将合理的自我偏好与有害的偏见区分开来。目标是构建数据集,可能来自 Chatbot Arena 等平台,这可以帮助区分更喜欢自己的输出的模型,因为它确实更好,和更喜欢自己的输出的模型,因为它可以识别文本中熟悉的模式。
这种区别非常重要。如果 90% 的自我偏好反映了真实的质量差距,那么这种偏见虽然令人恼火,但却是可以控制的。如果只有 40% 的人这样做,那么自动化评估系统就需要进行重大的重新设计,然后才能被信任作为模型质量的仲裁者。
一种潜在的缓解措施包括使用不同模型的小组作为法官而不是单一评估员,从而稀释整个群体中任何单个模型的自我偏好。另一种方法探索事后校准已知偏差,应用民意调查人员调整抽样误差的方式进行统计修正。
