AIRA 2 在机器学习基准测试中名列前茅,比之前的代理高出 9 个百分点
核心要点
- 由 Meta FAIR、伦敦大学学院和牛津大学构建的人工智能研究代理在结构化机器学习竞赛中超越了数千名人类竞争对手 一名 AI 代理刚刚在自己的游戏中击败了大约 3,992 支人类队伍。
- AIRA 是一款由 Meta 的 FAIR 实验室、伦敦大学学院和牛津大学的研究人员开发的自主人工智能研究代理,在

由 Meta FAIR、伦敦大学学院和牛津大学构建的人工智能研究代理在结构化机器学习竞赛中超越了数千名人类竞争对手
一名 AI 代理刚刚在自己的游戏中击败了大约 3,992 支人类队伍。 AIRA 是一款由 Meta 的 FAIR 实验室、伦敦大学学院和牛津大学的研究人员开发的自主人工智能研究代理,在专注于人工智能推理的 Kaggle 竞赛中,在 4,000 个团队中排名第 8,并在此过程中获得了金牌。
AIRA 实际做什么
AIRA 系列代理(名称代表 AI 研究代理)旨在自主解决复杂的机器学习工程问题。 AIRA 不是仅仅运行单个模型并希望得到最好的结果,而是使用在 8 个 Nvidia H200 GPU 上运行的异步多 GPU 执行策略。
该系统采用了研究团队所说的“隐藏一致性评估”协议,这是一种防止代理玩弄自己的测试分数的方法。该代理还使用动态 ReAct 式运算符,这意味着它可以逐步推理问题、动态调整其方法,并同时在多个处理器上执行代码。
在 MLE-bench-30(根据 30 场真实 Kaggle 比赛构建的结构化基准)上,AIRA 2 经过 24 小时的计算后达到了 81.5% 的平均百分位排名。 72 小时后,这个数字攀升至 83.1%。其他代理的最佳先前基线为 72.7%,这使得 AIRA 的改进比竞争对手高出约 9 个百分点。
为什么这比吹牛的权利更重要
在 AIRS-Bench 评估中,AIRA 2 在 20 项任务中的 6 项上超过了人类最先进的表现。它还在 Kaggle 个人任务中赢得了金牌,而早期版本的代理根本未能获得任何奖项。
该框架建立在团队所谓的 AIRA-dojo 方法的基础上,该方法是专门为解决早期代理的局限性而设计的。这些限制包括有限的计算吞吐量、评估过度拟合、不同问题类型之间的泛化差距,以及阻止代理在任务中调整其策略的静态操作约束。
竞争激烈的人工智能研究格局
Meta FAIR、伦敦大学学院和牛津大学之间的合作因其机构影响力而闻名。研究团队通过 arXiv 预印本(尖端人工智能研究的标准渠道)传播其研究结果。
