Fable 5.1到底升级了什么?AI模型竞争正在从“智商”转向“系统能力”
核心要点
- 行业竞争正从模型跑分转向系统能力,未来AI可能从问答工具进化为数字工作系统,关键在于模型能否像研究员一样自主拆解问题、调用工具并交付结果。
- 而现在的模型越来越需要完成一个完整任务链:理解需求、检索信息、调用工具、生成内容、检查结果,再根据执行反馈进行修改。
- 如果一个模型能够完成过去需要半小时人工操作的任

Claude Fable 5.1在ARC-AGI-2基准上取得90%高分,但更值得关注的是其推理成本下降32%。模型已从单纯问答转向复杂任务执行,内置工具从30个增至46个,功能涵盖图表展示、网页预览等,并在生成黑洞视频测试中表现出接近初级工程团队的工作流程。在破解370年密码的案例中,模型耗时44分钟、17.6万Token完成历史密码分析,体现了假设验证的研究能力。27万字符系统提示词泄露事件揭示AI能力已不仅由模型权重决定,而是包含工具调度、记忆管理、安全规则等复杂系统工程。安全设计从简单拒绝回答转向在边界内提供有效帮助。不过用户仍抱怨Token消耗快、未降价,这表明能力提升与成本存在矛盾,AI产品需解决单位成本创造可验证价值的问题。行业竞争正从模型跑分转向系统能力,未来AI可能从问答工具进化为数字工作系统,关键在于模型能否像研究员一样自主拆解问题、调用工具并交付结果。
一、90%的ARC-AGI-2之外,更值得看的是推理成本
据相关公开测试信息,Claude Fable 5.1在ARC-AGI-2上的成绩达到90.0%,单任务成本约为3.12美元;在ARC-AGI-1上的成绩达到97.5%,单任务成本约为1.40美元。与此同时,相关信息显示,Fable 5.1通过提升Token效率,使平均推理成本较上一代降低约32%。
这些数字之所以重要,并不只是因为分数更高。
过去几年,大模型竞争很容易被压缩成几个简单指标:参数规模有多大、跑分有多高、上下文有多长。但当模型逐渐进入真实工作场景后,企业真正关心的问题开始发生变化:一个任务究竟需要多少Token?需要调用多少次工具?完成一次复杂工作到底需要多少钱?如果模型能够持续执行几十分钟甚至更长时间,成本能不能控制在可接受范围?
这也是Fable 5.1此次表现值得关注的地方。
一个模型即使在基准测试中取得不错成绩,如果完成真实任务需要消耗大量Token,或者频繁触发使用上限,那么它距离大规模商业应用仍然存在距离。反过来,如果模型能够在保持能力的同时降低单位任务成本,那么开发者才更有动力把它接入代码开发、数据分析、内容生产以及自动化工作流。
换句话说,AI竞争正在从“模型有多聪明”,逐渐转向“模型能以多低的成本完成多少工作”。
二、真正的变化,是Claude越来越像一套“工作系统”
从公开的系统提示词和相关测试来看,Fable 5.1此次升级并不只是模型权重层面的变化。
据相关信息,其内置工具数量从此前的30个增加到46个,新增能力涉及图表展示、轮播内容、地点信息、网页预览以及历史对话读取等。单独看,这些功能并不算令人意外,但放在一起后,意义就不同了。
过去的AI助手更多是在“回答”。
用户提出问题,模型生成文字;用户要求代码,模型输出代码;用户需要分析,模型提供分析。
而现在的模型越来越需要完成一个完整任务链:理解需求、检索信息、调用工具、生成内容、检查结果,再根据执行反馈进行修改。
素材中关于Fable 5.1生成黑洞视频的测试,就是一个比较典型的例子。
相关测试显示,模型没有直接生成一个视觉上“看起来像黑洞”的动画,而是先根据广义相对论构建光线追踪渲染器,再处理相对论多普勒效应、引力红移等因素,并通过低分辨率测试发现问题后继续修改,最终再进行完整渲染。
这里最值得注意的不是最后生成了一段视频,而是模型表现出的工作方式。
它开始接近一个初级工程团队的工作流程:先制定方案,再执行,再发现问题,然后修正,最后验证结果。
这也是Agent类AI正在改变软件形态的原因。
当模型能够持续调用工具并根据中间结果调整策略,它的价值就不再局限于“生成一段文本”,而是开始向“完成一项工作”转移。
三、370年密码案例,说明AI开始改变解决问题的路径
Fable 5.1被用于破解“Cyphral Distich”经典密码的案例,也值得单独观察。
据Vals AI相关信息,该模型耗时约44分钟、使用约17.6万个Token,在没有人类持续干预的情况下完成了对这段历史密码的分析,并进一步推导出另一组密码的解法。
真正有意思的并不是“44分钟”这个数字,而是它采用的方法。
相关测试显示,模型并没有简单地对64个数字进行暴力枚举,而是回到密码所在的历史文本,从作者此前的32篇短文、数字结构以及诗歌内容中寻找关联,再提出“数字对应文本索引”的假设,并通过解码结果与作者历史背景进行交叉验证。
如果这一过程能够被独立重复验证,那么它体现的并非单纯计算能力,而是一种更加接近研究工作的能力:提出假设、寻找证据、验证假设,再根据结果调整方向。
这也是当前AI能力进化中非常值得关注的一条线。
很多现实问题并不存在一个明确的“标准答案”,甚至连正确的问题都需要研究者自己定义。历史研究、科研、程序调试、商业分析都属于这一类型。
未来AI的价值,或许越来越不是替人完成已经定义好的任务,而是帮助人从大量碎片信息中找到隐藏的关系。
四、27万字符系统提示词泄露,暴露的是另一场竞争
Fable 5.1发布后不久,知名越狱研究者Pliny the Liberator公开了一份据称超过27万字符的系统提示词,引发大量讨论。
需要强调的是,相关内容来自第三方公开材料,并不意味着其中所有内容都已经得到Anthropic官方确认。
但无论具体内容是否完整,这件事情本身仍然值得关注。
原因在于,超长系统提示词已经说明,现代AI产品的能力越来越不是单纯由模型权重决定的。
系统需要告诉模型如何使用工具、如何处理版权内容、什么时候拒绝请求、如何管理记忆、如何处理敏感信息,以及不同工具之间应该如何协同。
也就是说,今天的“大模型”实际上越来越像一个复杂的软件系统。
其中模型权重是核心,但系统提示词、工具路由、记忆机制、安全规则、检索能力以及执行环境同样决定最终体验。
这也解释了为什么Fable 5.1与Mythos 5.1即便共享相同模型权重,也可以面向不同用户群体采取不同的能力边界。
一个更开放的研究版本与一个面向普通用户的产品版本,并不一定需要两个完全不同的模型。
真正决定它们差异的,可以是模型之外的那一整套控制系统。
