Anthropic 的 Claude Fable 5.1 和 OpenAI 的 GPT-6 Astra 扩大了开源模型之间的网络开发差距
核心要点
- 总的来说,这些版本将 Web 开发基准测试中的专有优势扩大到比开放权重同行大约 1,800 点。
- Astra 可以更流畅地与开发环境交互,使其更适合模型需要运行测试、读取错误输出并自主迭代修复的代理编码会话。
- 据估计,开源模型在编码和代理基准方面落后于专有前沿大约四个月。

两大 AI 巨头接连推出的产品将编码基准方面的专有领先优势推至近 1,800 点,使开源替代方案比以往任何时候都更加落后。
相隔两天,两则公告,一条消息:如果您正在使用开源人工智能模型构建软件,那么您现在已经落后了前沿近四个月。 Anthropic 于 2026 年 9 月 1 日发布了 Claude Fable 5.1,OpenAI 随后于 9 月 3 日发布了 GPT-6 Astra。总的来说,这些版本将 Web 开发基准测试中的专有优势扩大到比开放权重同行大约 1,800 点。
克劳德寓言 5.1 带来了什么
Anthropic 的最新模型配备了 100 万个令牌上下文窗口和 128K 最大输出,这些数字使开发人员可以将整个代码库输入到单个提示中,并获得连贯的、存储库感知的响应。
格洛丽亚 一只你不拥有的股票刚刚移动——而两只你确实依赖它。凯莱财经看到了其他人所忽视的联系。查看连接 →
在 SWE-bench Pro(旨在测试真实软件工程任务的基准测试)上,Fable 5.1 的得分为 81.2%。这代表了对之前版本《克劳德寓言 5》的有意义的改进。
定价也朝着正确的方向发展。 Anthropic 将费率设置为每百万输入令牌 10 美元,每百万输出令牌 50 美元,缓存读取降至仅 0.25 美元。计算结果比其前身便宜约 25%。
GPT-6 Astra 进入擂台
OpenAI 在 48 小时后回复。 GPT-6 Astra 被定位为用于软件工程和复杂工作流程的专业级工具,其基准数据也证明了这一点。
Astra 在 Terminal-Bench 4.0 上得分为 57.9%,在 DeepSWE v1.1 上得分为 74.1%,这两项评估测试了模型导航真实编码环境和解决深层软件工程问题的能力。 OpenAI 还强调代币效率,这意味着模型在推理上花费的每一美元可以完成更多有用的工作。
增强的计算机使用功能使该套件更加完善。 Astra 可以更流畅地与开发环境交互,使其更适合模型需要运行测试、读取错误输出并自主迭代修复的代理编码会话。
早期用户对这两种模型的反馈凸显了一个共同的主题:通过更少的迭代来达到正确的解决方案。
开源差距不断扩大
截至 2026 年中期,在智力指数综合指数(推理和编码能力的广泛衡量标准)上,专有模型比开放权重替代品平均高出 8.5 点。据估计,开源模型在编码和代理基准方面落后于专有前沿大约四个月。
这对人工智能开发市场意味着什么
Anthropic 的定价策略尤其值得关注。在提高性能的同时削减 25% 的成本是加速企业采用的举措。它降低了小型开发商店的障碍,这些商店以前无法证明高级人工智能编码工具的费用是合理的。
