Fable 5.1 在 ARC-AGI 基准测试中每项任务的成本降低了 32%
核心要点
- 最重要的数字是:ARC-AGI-2 基准测试的覆盖率达到 90%,而每项任务的成本比其前身《神鬼寓言 5》(每项任务的经验证价格为 5.45 美元)低 32%。
- 基准收益的背景 《神鬼寓言 5.1》在 ARC-AGI-2 上的覆盖率达到 90%,较《神鬼寓言 5》的验证分数 89.2% 显着提高。

Anthropic 最新的 Claude 模型将 ARC-AGI-2 覆盖率提升至 90%,同时大幅削减每项任务的成本并显着提高科学基准
Anthropic 于 9 月 1 日发布了 Claude Fable 5.1,将其定位为该公司针对复杂推理任务最有能力且最具成本效益的模型。最重要的数字是:ARC-AGI-2 基准测试的覆盖率达到 90%,而每项任务的成本比其前身《神鬼寓言 5》(每项任务的经验证价格为 5.45 美元)低 32%。
基准收益的背景
《神鬼寓言 5.1》在 ARC-AGI-2 上的覆盖率达到 90%,较《神鬼寓言 5》的验证分数 89.2% 显着提高。在 Terminal-Bench 4.0 上,《神鬼寓言 5.1》的得分为 55.8%,而《神鬼寓言 5》的得分为 42.0%。提升了 13.8 个百分点,按原始得分计算大约提高了 33%。
最近推出的科学推理评估 Terminal-Bench-Science 0.1 讲述了一个更引人注目的故事。 《神鬼寓言 5.1》的收视率为 52.6%,而《神鬼寓言 5》的收视率为 24.7%。该模型在科学任务上的表现是其前身的两倍多。
《神鬼寓言 5.1》还在 2026 年多项智力和代理指数中名列前茅,其中最大努力条件下的人工分析得分为 66。该模型配备了 100 万个令牌上下文窗口、128K 最大输出以及具有五个不同努力级别的自适应推理系统。
成本节省实际上来自哪里
每个任务的成本降低了 32%,部分原因在于更智能的缓存。 Anthropic 将缓存读取定价降低了 75%,降至每百万代币 0.25 美元。对于典型操作,缓存定价变化可节省大约 25%。对于模型频繁从缓存读取的复杂、多步骤工作流程,节省率高达 45%。
基本定价结构本身保持不变。标准任务仍然每百万代币运行 10 美元,复杂任务每百万代币运行 50 美元。
《神鬼寓言 5》于 2026 年 6 月 9 日推出后不到三个月,《神鬼寓言 5.1》就发布了。《神鬼寓言 5.1》可立即通过 Anthropic 的 API 和主要云提供商获得。与此同时,《神鬼寓言 5》仍在 ARC-AGI-3 基准测试中进行测试,这提醒人们,这些先进系统的验证流程随着模型本身的不断发展而不断发展。
