AI4AI-Bench:用智能體設計訓練演算法來評估遞歸自我改進能力
這篇論文聚焦遞歸自我改進(RSI)中最關鍵也最被忽視的一環:一個 AI 系統能否改進生成 AI 系統的訓練演算法。作者指出,更好的目標函數或更新規則能提升每一次運行的算力與能力交換率,因此 RSI 是否可行,取決於智能體是否具備設計訓練演算法的能力。現有的評測套件無法孤立地衡量這種能力,因為它們要么靠收集數據取勝,要么靠調超參數,無法區分「改變執行方式」與「改變模型學習方式」的差異。為此作者提出 AI4AI-Bench,包含 10 個凍結的研究倉庫,涵蓋 10 類訓練演算法。每個任務中智能體在一張 B300 上有 4 小時重寫訓練演算法,代码隨後從頭重跑最多 12 小時,由對智能體隱藏的统一评分器打分。29 組配置、6 個系統、10 個任務上的平均分為 0.166,最強系統達到 0.250。多數提交根本沒改變模型學習方式,而少數改變的平均分為 0.226 對 0.126。增加推理努力主要買來的是「願意去改」的意願,把改變比例從 8% 提升到 64%。作者開源了任務套件、評估器與所有打分提交。
递归自我改进是 AI 安全与能力前沿最核心的命题之一:它要求一个 AI 系统能够改进那个生产 AI 系统的过程,使下一个系统直接继承这项改进。而那个过程本质上就是训练算法——一个更好的目标函数或更新规则,会让每一次运行都获得更优的算力与能力交换率,包括生成下一个智能体本身的那一次运行。因此 RSI 是否可行,最终取决于一个智能体是否具备设计训练算法的能力。这篇论文的核心贡献正是把这种能力从空泛的讨论拉到一个可被精确测量的尺度上。作者指出,现有的评测套件都无法孤立地衡量这种能力:它们要么靠收集数据取胜,要么靠调整超参数取胜,因而无法把「改变一次运行是如何被执行的」与「改变模型是如何学习的」区分开来。为了填补这一空白,作者提出 AI4AI-Bench,由 10 个冻结的研究仓库组成,覆盖 10 类训练算法家族。冻结仓库是关键设计:它保证了除训练算法外其余条件固定,从而让评分真正反映训练算法本身的优劣。
每个任务中,智能体在一张 B300 上有 4 小时去重写训练算法,其代码随后被从头重跑最多 12 小时,并由一个对智能体隐藏的统一评分器打分,对照该仓库原始算法在同一流程下的表现。这种设计把评测从「智能体写得好不好」提升到了「智能体训练得好不好」,是本文区别于一切既有 benchmark 的根本所在。在技术方法上,本文最精巧的部分是跨指标的归一化。由于 10 个任务各自使用不同的训练算法家族,其指标彼此不可公度,无法直接相加或比较。为此每个任务都被映射到同一尺度上:0 代表一个无信息量的模型,0.1 代表该仓库实际随附的算法,1.0 代表该任务的最优解。这一设计让不同任务的结果可以横向比较,也让「智能体离最优还有多远」变得一目了然。评测流程同样经过严格约束:智能体只接触训练算法这一变量,评分器在任务全程对其隐藏,代码从头重跑以排除缓存或历史状态的干扰,对照实验则在同一流程下用原始算法跑一遍。
训练策略层面,论文强调推理努力的作用,并专门考察了增加推理预算如何影响智能体的行为选择。实验覆盖 29 组配置、6 个系统、全部 10 个任务,从而在系统多样性与任务多样性两个维度上都给出稳健结论。消融式的发现进一步揭示:多数提交根本没改变模型的学习方式,而少数真正去改的,其均分达到 0.226,其余则只有 0.126。这说明拉开差距的关键不在于智能体写了多少代码,而在于它是否愿意去动训练算法本身。在实验设置与关键结果上,本文在 10 个冻结仓库、10 类训练算法家族上展开,每个任务统一采用 4 小时编写、最多 12 小时重跑、隐藏评分器打分的流程。跨 29 组配置、6 个系统、10 个任务,平均分为 0.166,最强系统达到 0.250。这一数字的含义很刺眼:即便是最强的系统,也只走完了从现有算法到最优解之间不到五分之一的距离。
进一步拆解「这段距离花在了哪里」,作者发现大多数提交根本没有改变模型的学习方式,而少数真正改变了的,其均分为 0.226,其余则只有 0.126。更值得注意的推理努力实验显示,增加推理预算主要买到的是「愿意去改」的意愿:真正改变学习方式的提交比例从 8% 跃升到 64%,平均分也从 0.094 提升到 0.196。这一发现把讨论从「智能体能力不足」转向了「智能体是否愿意尝试」,暗示在递归自我改进的语境下,意愿与勇气可能比单纯的技巧更为关键。消融层面的对比进一步验证了归一化尺度的有效性,也让不同任务、不同系统之间的比较具备了可比性。在行业意义与潜在影响上,本文的价值首先在于它把递归自我改进这一常被当作口号的命题,落地为一个可重复、可测量的工程问题。作者开源了任务套件、评估器以及每一个打分的提交,使得随着这些系统的演进,测量可以被不断重复与对照。对开源社区而言,冻结仓库与隐藏评分器的组合提供了一种可复现的评测范式,任何新系统都能在同一标尺上被检验。对工业落地而言,它提醒团队:训练算法本身才是算力与能力交换率的关键杠杆,而让智能体去改进训练算法,恰恰是最难但也最有杠杆的一环。对后续研究而言,本文揭示的「意愿优先于技巧」现象,为如何设计更强的训练算法智能体指明了方向——或许提升推理努力、鼓励智能体真正去动训练算法,比单纯堆砌代码生成能力更有效。总之,AI4AI-Bench 不仅是一套 benchmark,更是一次对 AI 能否改进自身的可量化追问,它为这个关乎未来的问题建立了一把可被反复校准的尺子。
Sources
FAQ
AI4AI-Bench 到底测试什么能力?
它测试智能体能否重写生成 AI 系统的训练算法。作者用 10 个冻结仓库,让智能体在 B300 上用 4 小时重写训练算法,代码从头重跑最多 12 小时,再对隐藏评分器打分。
为什么这个 benchmark 很重要?
大多数提交根本没改变模型的学习方式,真正去改的只有少数,均分 0.226 对 0.126。连最强系统也只到 0.250,离最优解不到五分之一,说明训练算法才是算力与能力交换的关键杠杆。
接下来值得关注什么?
增加推理预算主要买来「愿意去改」的意愿,真正改变学习方式的提交从 8% 升到 64%,显示意愿比技巧更关键。任务套件、评估器与所有打分提交都已开源,可反复校准。