NEAR AI 的精益代理以 111 美元解决每个普特南问题,比竞争对手便宜 250 倍
核心要点
- NEAR Protocol 的开源定理证明代理以竞争对手花费的一小部分完成了全部 672 个 PutnamBench 问题 解决数学最艰巨的基准测试中的每一个问题通常需要花费数万美元。
- 2026 年 9 月 6 日,NEAR Protocol 联合创始人 Alex Skidanov 宣布该项目的开源精

NEAR Protocol 的开源定理证明代理以竞争对手花费的一小部分完成了全部 672 个 PutnamBench 问题
解决数学最艰巨的基准测试中的每一个问题通常需要花费数万美元。 NEAR AI 只花了 111 美元就做到了。
2026 年 9 月 6 日,NEAR Protocol 联合创始人 Alex Skidanov 宣布该项目的开源精益代理已经解决了 PutnamBench 基准测试中的所有 672 个问题,该基准测试套件来自 William Lowell Putnam 数学竞赛。总账单:111 美元。已知第二便宜的提交费用贵了 250 倍。
格洛丽亚 关闭应用——格洛丽亚财经持续关注。设置监视器并仅在发生重大变化时才收到反馈。设置监视器 →
PutnamBench 到底是什么以及它为何重要
普特南竞赛是北美最负盛名的本科生数学竞赛。即使对于优秀的学生来说,获得零分也并不罕见。考试的目的就是让你崩溃。
PutnamBench 于 2024 年推出,继承了难度的传统,并将其转变为人工智能定理证明者的正式评估套件。该基准测试包含用 Lean 4 编码的 672 个问题,Lean 4 是一种证明辅助语言,要求以机器可验证的精度编写数学参数。逻辑上马虎的证明会被彻底拒绝,不会得到部分认可。
在 NEAR AI 得出结果之前,尝试 PutnamBench 的代理经常需要对每个问题进行数千次推理调用。计算成本增加得很快,导致领先系统的完整基准运行总支出在 10,000 美元到 25,000 美元之间。
NEAR AI 的 Lean 代理以 111 美元的价格完成了整个 672 个问题集。
为什么成本差距是真实的情况
每次完整运行的费用为 10,000 到 25,000 美元,只有少数组织有能力迭代、实验和改进其定理证明流程。如果是 111 美元,这个计算就完全颠倒了。
PutnamBench 结果在 2025 年至 2026 年间的快速进步已经受到将大型语言模型与 Lean 校对引擎相结合的代理工作流程的推动。 NEAR AI 的方法扩展了这种模式,但增加了基准社区以前从未见过的效率。
NEAR AI 将这一成就置于更广泛的基础设施愿景中,该愿景以“IronClaw”为中心,这是一个围绕机密和可验证的人工智能的框架。形式验证能力直接符合这个框架:如果你能证明数学论证在机器层面是正确的,你就为人工智能系统奠定了基础,其输出可以被独立审计,而不是完全信任。
NEAR Protocol 将 Lean Agent 开源的决定更加具有重要意义。提供 250 倍成本优势的专有工具往往会保持专有性。开源代理意味着该方法可供任何人检查、扩展和使用。
