OpenAI 的 GPT-6 Astra 以 1,797 分位居 Code Arena:WebDev 榜首
核心要点
- OpenAI 的最新模型在社区驱动的编码排行榜上以 35 分的优势击败了 Anthropic 的 Claude Fable 5.1 OpenAI 的 GPT-6 Astra 以 1,797 分位居 Code Arena 的 WebDev 排行榜榜首,与 Anthropic 的 Claude Fabl

OpenAI 的最新模型在社区驱动的编码排行榜上以 35 分的优势击败了 Anthropic 的 Claude Fable 5.1
OpenAI 的 GPT-6 Astra 以 1,797 分位居 Code Arena 的 WebDev 排行榜榜首,与 Anthropic 的 Claude Fable 5.1(1,762 分)相差 35 分。该模型于 2026 年 9 月 3 日正式发布两天后,就已经改写了人工智能辅助 Web 开发的顺序。
由 Arena.ai 运营的排行榜并不是典型的静态基准。它使用众包的 Elo 式评级系统,与国际象棋竞技中使用的排名机制相同,社区成员对人工智能模型处理现实世界前端编码任务的能力进行投票。 126 个模型已记录了超过 650,000 个投票,这使得本次评估成为 AI 领域中最稳健的社区评估之一。
该基准有何不同
传统的人工智能基准测试倾向于针对具有预定正确答案的固定数据集来测试模型。 Code Arena 采用了一种根本不同的方法。模型根据多步骤推理、工具利用和迭代编码工作流程进行评估,本质上是实际 Web 开发涉及的混乱、非线性过程。
GPT-6 Astra 的 1,797 分代表了该特定排行榜上所有型号所取得的最高分。 Anthropic 的最新竞争者 Claude Fable 5.1 一直保持在 1,762 的强劲水平。
竞争格局日趋拥挤
OpenAI 和 Anthropic 并不是唯一争夺位置的玩家。 9月份排行榜的早期快照显示,中国开发商的模型正在向两家公司的最高排名发起挑战。
GPT-6 Astra (Max) 和 Claude Fable 5.1 (Max) 的定价相同,均为每百万输入代币 10 美元,每百万输出代币 50 美元。两者都提供 100 万个令牌的上下文窗口。
OpenAI 将 GPT-6 Astra 定位为其软件工程和相关应用程序的最先进模型。该模型目前可供 ChatGPT 订阅者以及精选 API 和云合作伙伴使用。
