GPT-6 Astra 在 ARC-AGI-3 上得分为 98.6% 的说法经不起审查
核心要点
- ARC-AGI-3 排行榜上的顶级模型目前得分约为 30%,这使得病毒式传播的 98.6% 的说法看起来与现实完全脱节 社交媒体上流传的说法称,OpenAI 的 GPT-6 Astra 在 ARC-AGI-3 基准测试中得分为 98.6%,如果属实,这将是有史以来人工智能能力最重大的飞跃之一。

ARC-AGI-3 排行榜上的顶级模型目前得分约为 30%,这使得病毒式传播的 98.6% 的说法看起来与现实完全脱节
社交媒体上流传的说法称,OpenAI 的 GPT-6 Astra 在 ARC-AGI-3 基准测试中得分为 98.6%,如果属实,这将是有史以来人工智能能力最重大的飞跃之一。问题是:没有经过验证的证据支持它。
ARC-AGI-3 基准测试于 2026 年 3 月 25 日推出,专门用于测试人工智能模型是否可以在没有指令或预定义目标的情况下导航交互式环境。当模型第一次遇到基准测试时,分数低于 1%。
排行榜实际显示的内容
目前 ARC-AGI-3 上表现最好的是 Anthropic 的 Claude Opus 5,大约占 30.2%。
OpenAI 自己的 GPT-5.6 Sol 是其经过验证的基准测试结果的最新模型,在官方测试条件下的成绩为 7.78%。当 OpenAI 使用其自定义响应 API 设置时,该数字攀升至 38.3%。
对于名为 Astra 的模型,尚无确认的 ARC-AGI-3 分数。截至 2026 年 9 月上旬,OpenAI 甚至尚未确定 GPT-6 的确认发布日期或官方品牌。
我们对阿斯特拉的实际了解
OpenAI 于 2026 年 8 月 1 日左右预览了 Astra。该模型因解决大约 10 个开放数学问题而获得认可,这些问题一直困扰着数学家。
Astra 展示的功能与声称的 98.6% 分数之间的差距表明了两种情况之一。该声明要么混淆或夸大了 GPT-5.6 Sol 的结果,要么源自未经验证的来源,在没有数据支持的情况下对 Astra 的性能做出断言。
为什么 ARC-AGI-3 很重要
ARC 奖基金会将 ARC-AGI-3 设计为基准测试早期版本的后继者,每次迭代都变得更难通过记忆或模式匹配进行游戏。该基准使用一种称为相对人类行动效率(RHAE)的评分方法,可以在交互环境中对人工智能模型与人类基线进行比较评估。
当初始模型得分低于 1% 时,就凸显了该基准测试的难度。 Claude Opus 5 在大约六个月内取得了 30.2% 的进步,这代表着有意义但渐进的进步。
竞争格局和市场影响
Anthropic 的 Claude Opus 5 保持着目前 ARC-AGI-3 的领先地位,而 OpenAI 的 GPT-5.6 Sol 在优化条件下显示出具有竞争力的性能。
Astra 的数学推理成就值得注意,特别是 OpenAI 在 ARC-AGI-3 中的地位(基于现有数据)使其落后于 Anthropic 的领先模型。
