Vals AI 进行了一项测试,看看人工智能模型是否可以创造自己的继任者,结果令人着迷
核心要点
- 该公司的递归自我改进指数(RSI Index)试图量化迄今为止主要存在于理论担忧领域的问题:当今的前沿模型在进行建立其继任者所需的研究和开发方面的能力有多大?
- 该指数中表现最好的模型是 Claude Fable 5.1,得分为 35.03%。
- 一起看看→ RSI 指数实际上是如何运作的 Vals AI

递归自我改进指数提供了第一个衡量人工智能系统是否能够自主推进自身发展的标准化方法。
如果你想知道我们离能够设计出更好版本的人工智能系统有多远,Vals AI 刚刚构建了记分板。该公司的递归自我改进指数(RSI Index)试图量化迄今为止主要存在于理论担忧领域的问题:当今的前沿模型在进行建立其继任者所需的研究和开发方面的能力有多大?
该指数中表现最好的模型是 Claude Fable 5.1,得分为 35.03%。在您了解其规模之前,这听起来很低。
Gloria Stocks 在一个应用程序中,加密货币在另一个应用程序中,钱包无处不在?凯莱金融将您的整个投资组合一目了然。一起看看→
RSI 指数实际上是如何运作的
Vals AI 围绕五个具体任务设计了该指数,这些任务反映了人工智能开发的真实工作流程。模型是在固定的计算和时间限制下进行评估的,这意味着它们不能通过消耗无限的资源来暴力破解以获得好分数。
评分系统基于参考点而不是任意等级。 0 分代表基线,0.5 代表已发表研究中记录的绩效水平,理论最佳值为 1。
Claude Fable 5.1 的得分为 35.03%,这意味着它的表现有意义,但仍低于研究人员已知的复制技术。这些模型在实验执行中可以优于现有技术,但在产生新技术方面通常落后。
为什么现在这很重要
RSI 指数由 Vals AI 和 CoreWeave 于 2026 年 8 月合作推出,同时该公司还进行了 4000 万美元的 A 轮融资。该轮融资对 Vals AI 的估值为 4 亿美元。
首席执行官 Rayan Krishnan 将该指数定位为填补关键空白。主要的人工智能实验室已经开始在其模型卡中引用递归自我改进的潜力,但由于没有标准化的比较框架,这些参考文献缺乏共同的评估基础。
在本轮融资后的六个月内,Vals AI 的收入比 2025 年全年增长了 8 倍。其客户群翻了一番。其员工数量增加了两倍。
治理问题
克里希南一直直言不讳地谈论 RSI 指数对监管的影响。人们担心的并不是得分为 35% 的模型会失控。从 35% 到更高分数的轨迹可能会很陡,而且这些能力的开发是在少数外部可见性有限的实验室内进行的。
克里希南强调国际治理结构需要跟上这些进步的步伐。 RSI 指数为其提供了实证基础:当你可以指出一个具体指标来显示自主自我改进方面可衡量的进展时,就更难驳回监督的呼声。
