Claude Fable 5.1 机器人任务性能提升 8 倍
核心要点
- Anthropic 的最新模型将拾放成功率从 5% 跃升至 40%,同时将缓存成本降低了 75%,为企业自动化采用提供了有力的案例。
- 该模型在机器人拾放任务上的成功率达到了 40%,而其前身 Claude Fable 5 的成功率为 5%。
- Terminal-Bench-Science、OSWorld

Anthropic 的最新模型将拾放成功率从 5% 跃升至 40%,同时将缓存成本降低了 75%,为企业自动化采用提供了有力的案例。
机械臂在拾取东西方面表现不佳,这一点有据可查。 Anthropic 的 Claude Fable 5.1 于 2026 年 9 月 1 日发布,刚刚在这个问题上取得了重大进展。
该模型在机器人拾放任务上的成功率达到了 40%,而其前身 Claude Fable 5 的成功率为 5%。
引擎盖下发生了什么变化
《神鬼寓言 5.1》专为长期代理工作而设计,在此类任务中,模型需要在无需人工干预的情况下跨多个步骤进行规划、执行和恢复。编码管道、科学研究工作流程和复杂的业务自动化是目标领域。
基准数据反映了这一重点。在 Terminal-Bench-Science 上,《神鬼寓言 5.1》的得分为 52.6%,而《神鬼寓言 5》的得分为 24.7%。OSWorld 2.0 的严格完成度从 36.1% 攀升至 41.7%。测试多步骤软件自动化的AutomationBench从17.1%上升到31.4%。
发布后的客户反馈与基准故事相呼应。企业用户特别指出,运行数小时而不是几分钟的项目的可靠性得到了提高,该模型使用比以前版本更少的令牌完成这些任务。
定价数学比看起来更有趣
Fable 5.1 的基本定价稳定在每百万输入代币 10 美元和每百万输出代币 50 美元,与之前的模型相同。
缓存读取成本下降了 75%,降至每百万令牌 0.25 美元。 Anthropic 估计,缓存减少可以使典型工作负载节省大约 25%。对于更复杂的代理管道,节省可达 45%。
该模型可供 Pro、Max、Team 和 Enterprise 用户使用,并可通过 API 和主要云市场访问。
为什么机器人技术值得单独讨论
取放改进是主要数据,但值得思考为什么该特定基准很重要。拾取和放置是物理世界接地的代表:人工智能模型能否将抽象推理转化为精确的、现实世界的运动命令?该任务涉及对象识别、空间推理、抓取规划以及出现问题时的错误恢复。
5% 的成功率本质上是噪音。对于无监督的工业部署来说,40% 的比率还不够好,但它跨越了门槛,使该技术可以作为人类辅助层而不是好奇心发挥作用。
竞争环境
《克劳德·寓言 5.1》发布后不久,独立评估者将其智力指数评为或高于之前的领先者。 Terminal-Bench-Science、OSWorld 2.0 和 AutomationBench 的改进模式表明,Anthropic 的目标是运行复杂、多步骤、多小时工作流程的企业客户,而不是提出快速问题的消费者。
