Epoch 将首个 AI 解决方案列为 FrontierMath 基准测试的重大进步
核心要点
- OpenAI 的 GPT-6 Astra 在最难的数学问题上得分接近 98%,而就在 14 个月前,这些问题还困扰着所有 AI 模型 当 Epoch AI 于 2025 年 7 月推出其 FrontierMath 基准测试第 4 层时,地球上最好的人工智能模型可以解决大约 5% 的问题。
- 14 个月后

OpenAI 的 GPT-6 Astra 在最难的数学问题上得分接近 98%,而就在 14 个月前,这些问题还困扰着所有 AI 模型
当 Epoch AI 于 2025 年 7 月推出其 FrontierMath 基准测试第 4 层时,地球上最好的人工智能模型可以解决大约 5% 的问题。 14 个月后,OpenAI 的 GPT-6 Astra 几乎破解了所有难题,为 AI 生成的数学解决方案赢得了 Epoch 有史以来第一个“重大进展”分类。
该模型在第 4 级(基准测试最困难的类别)的所有 43 个问题上实现了 97.6% 到 98% 的准确率。
Gloria 牛市情况、熊市情况或打破牛市情况的催化剂 — Gloria Finance 一键运行整个研究。运行剧本 →
本来是无解的问题
最后一个下降的 Tier 4 问题是由组合学家 Jay Pantone 撰写的。它是专门为抵制早期人工智能模型用来夸大其他 FrontierMath 问题得分的捷径而设计的。
无论如何,GPT-6 Astra 解决了这个问题,这正是 Epoch 将结果提升为“重大进展”状态的原因。分类不仅仅是为了得到正确的答案。它反映了 Epoch 的评估,即该解决方案展示了真正新颖的数学推理能力,而不是模式匹配技巧。
这是人工智能系统首次获得 Epoch FrontierMath 项目的这一称号。
人工智能、科技及其所推动的市场——每日简报。日常的。自由的。加入加密货币、金融和政策领域 34,000 多名读者的行列。电子邮件地址 免费订阅 我们尊重您的隐私。随时取消订阅。
FrontierMath 实际测量什么
FrontierMath 不是标准数学测试。 Epoch AI 将其设计为跨越多个难度级别的研究级数学问题的集合,其中第 4 层作为接近人类数学研究前沿的问题位于顶部。
经过 2026 年 6 月的修正后,该基准现在包含 1 至 3 层的约 295 个问题,以及第 4 层的 43 个问题。
Tier 4 的快速饱和已经促使 Epoch 转移其重点。该组织目前正在构建更具挑战性的集合,包括所谓的 FrontierMath Erdős 集合,该集合以传奇般多产的数学家 Paul Erdős 的名字命名。
