Anthropic 的 Fable 5.1 以 1,765 分位居 Code Arena 的 WebDev 排行榜榜首
核心要点
- Anthropic 的新模型比阿里巴巴的 Qwen3.8 Max 领先 77 个百分点,标志着人工智能编码战争的转变。
- Anthropic 最新的人工智能模型刚刚登上了业内最受关注的编码基准的榜首。
- 引擎盖下有什么 Claude Fable 5.1 建立在 Anthropic 于 2026 年 6 月发

Anthropic 的新模型比阿里巴巴的 Qwen3.8 Max 领先 77 个百分点,标志着人工智能编码战争的转变。
Anthropic 最新的人工智能模型刚刚登上了业内最受关注的编码基准的榜首。 2026 年 9 月 1 日推出的 Claude Fable 5.1 (Max) 以 1,765 分的成绩在 Code Arena: WebDev 排行榜上排名第一,与最接近的竞争对手之间有 77 分的差距。
亚军是阿里巴巴的 Qwen3.8 Max,得分为 1,688 分。
Code Arena 实际衡量的是什么
Code Arena:WebDev 并不是典型的综合基准,模型在真空中解决教科书问题。该平台根据现实世界的前端 Web 开发任务评估人工智能模型,根据社区反馈而不是单独的自动化测试套件对它们进行排名。
截至 2026 年 9 月初,Code Arena 已收集了 124 个 AI 模型的超过 640,000 票。
引擎盖下有什么
Claude Fable 5.1 建立在 Anthropic 于 2026 年 6 月发布的 Fable 5 的基础上,后者已经在前端和代理编码基准测试中占据了强大的地位。该模型的核心升级集中在长期代理编码上,这意味着它可以更有效地处理多步骤编码工作流程。
增强的视觉功能也是该软件包的一部分,与 Web 开发相关,其中模型需要解释设计模型、UI 错误的屏幕截图以及代码旁边的视觉参考。
在基准测试方面,该模型在 Terminal Bench Science 0.1 上得分为 52.6%,这是一个跟踪复杂、多步骤科学计算任务性能的指标。
Anthropic 将《神鬼寓言 5.1》的混合定价定为每百万代币约 40 美元,并将缓存读取成本削减了 75%。该模型还附带了 Anthropic 所谓的企业前沿保障措施,使组织能够对数据保留进行明确的控制。
竞争格局
来自阿里巴巴的 Qwen3.8 Max 获得第二名提醒人们,这不是一场单匹马的竞赛。 Kimi K3等其他中国车型也成为了有力的竞争者。 Anthropic的快速迭代策略,从6月的《神鬼寓言5》到9月的《神鬼寓言5.1》,反映了该领域的竞争节奏。
