前沿和开放权重 AI 模型之间的差距已扩大至 29 Elo 点
核心要点
- Arena AI 的最新数据显示,Anthropic、OpenAI 和 Google DeepMind 的封闭模型以近两年来的最大优势领先于开放权重竞争对手。
- 在 2025 年 1 月的短暂而美好的时刻,开放权重人工智能模型赶上了闭源竞争对手。
- 根据 Arena AI 的评估数据,截至 2026 年 9

Arena AI 的最新数据显示,Anthropic、OpenAI 和 Google DeepMind 的封闭模型以近两年来的最大优势领先于开放权重竞争对手。
在 2025 年 1 月的短暂而美好的时刻,开放权重人工智能模型赶上了闭源竞争对手。 Arena 众包排行榜上的 Elo 评分差距为零。平价。
那一刻结束了。根据 Arena AI 的评估数据,截至 2026 年 9 月,最佳封闭前沿模型与其顶级开放权重竞争对手之间的差距已扩大到 29 Elo 点。 Claude Opus 5 Max 的评分为 1505,而 Moonshot AI 的 Kimi K3 Max(最强的开放重量竞争者)落后近 30 分。 Arena 的人工智能能力主管 Peter Gostev 一直是跟踪和可视化这种差异的中心人物。
这些数字的实际含义是什么
该轨迹讲述了一个比任何单一快照更有趣的故事。从 2025 年 1 月的零点到 2026 年 9 月的 29 点,对于开放权重拥护者来说,趋势线正朝着错误的方向移动。 Epoch AI 的分析从另一个角度强化了这一观点:在最具挑战性的任务上,开放权重模型现在比封闭权重模型落后大约四个月。这比 2025 年底观察到的三个月滞后有所上升。
Arena 每月处理超过 1000 万次评估,利用大量真实用户交互而不是综合基准。当数百万匿名用户始终更喜欢一个模型的输出而不是另一个模型的输出时,该信号就更难以忽视。
测量人工智能的业务
Arena 本身已经成为一个引人入胜的商业故事。 2023 年,加州大学伯克利分校的一个研究项目开始发展成为一家年收入达 1 亿美元的企业。在推出付费评估服务后的短短八个月内,它就达到了这一运行率。
Gostev 的具体贡献集中在使模型的弱点变得清晰易读。他的工作强调了领域专家与普通用户评估模型时的表现之间的紧张关系,这一区别对于企业部署非常重要。
开放模式的地缘政治
最活跃的开放权重模型开发已大量转向中国实验室。 Moonshot AI 的 Kimi 系列、Zhipu 的 GLM、DeepSeek 和阿里巴巴的 Qwen 代表了公开可用的前沿。但差距依然存在。 Anthropic、OpenAI 和 Google DeepMind 继续进一步、更快地推动他们的封闭模型。
