AI4AI-Bench:エージェントが訓練アルゴリズムを設計することで再帰的-self-improvement能力を評価

Published 2026-08-20 · AI Daily — AI-assisted deep research, methodology & disclosure

本論文は、再帰的-self-improvement(RSI)で最も重要でありながら最も見過ごされている側面に焦点を当てる。それは、AIシステムがAIシステムを生成する訓練アルゴリズムを改善できるかどうかである。著者は、より良い目的関数や更新則が各実行で計算能力と能力の交換率を高め得るため、RSIの実現可能性はエージェントが訓練アルゴリズムを設計できるかに依存すると指摘する。既存の評価スイートは、データ収集で勝つのかハイパーパラメータ調整で勝つのかによってこの能力を単独で衡量できず、「実行方法の変更」 と「モデルの学習方法の変更」を区別できない。この問題を解決するため、著者はAI4AI-Benchを提案する。これは10個のフリーズされたリサーチリポジトリで、10種類の訓練アルゴリズムをカバーする。各タスクでエージェントは1枚のB300GPUで4時間、訓練アルゴリズムを書き換える。その後、コードは最大12時間ゼロから再実行され、エージェントには非公開の統一スコアラーにより採点される。29組の構成、6つのシステム、10のタスクでの平均点は0.166、最強システムは0.250に達した。ほとんどの提出はモデルの学習方法を変更せず、変更した少数は0.226対0.126であった。推論努力の増加は主に「変更する意欲」を買ったに過ぎず、変更率は8%から64%に高まった。著者はタスクスイート、評価器、採点されたすべての提出をオープンソース化した。

背景と概要

再帰的-self-improvement(RSI)は、AIの安全性と能力の最前線で最も重要な命題の一つとされてきた。あるAIシステムが、AIシステムを生み出すプロセスそのものを改善できなければならず、次の世代がその改善をそのまま受け継ぐという考え方だ。そのプロセスの本質は訓練アルゴリズムにある。より良い目的関数や更新則が、次のエージェント自身を生み出す実行を含め、すべての実行で計算能力と能力の交換率を高める。したがってRSIが実現可能かどうかは、エージェントが訓練アルゴリズムを設計できるかに依存する。

既存の評価スイートはこの能力を単独で衡量できない。データ収集で勝つのか、ハイパーパラメータ調整で勝つのかによって、実行方法の変更とモデルの学習方法の変更を混同してしまう。この混同が、RSIが依存する正確な能力を隠してしまうため、著者はAI4AI-Benchを提案した。これは10個のフリーズされたリサーチリポジトリで、10種類の訓練アルゴリズムファミリーをカバーする。

深掘り分析

リポジトリをフリーズすることは決定的な設計だ。訓練アルゴリズム以外の条件をすべて固定することで、採点が設定の偶然の差異ではなくアルゴリズムそのものを反映する。各タスクでエージェントは、一枚のB300 GPUで4時間、訓練アルゴリズムを書き換える。その後、コードは最大12時間ゼロから再実行され、エージェントには非公開の統一スコアラーで採点される。対照実験では、同じパイプラインで元のアルゴリズムが走らされる。

技術的に最も精巧なのは、指標間の正規化だ。10のタスクは互換性のない指標を使うため、生じた結果をそのまま足したり比較したりできない。各タスクは共有スケールにマッピングされる。0が無情報量のモデル、0.1がリポジトリ付属のアルゴリズム、1.0がそのタスクの最適解を表す。これにより各エージェントが最適解からどれだけ離れている一目了然になる。

29組の構成、6つのシステム、10のタスクでの平均点は0.166、最強システムは0.250に達した。この数字は刺眼的だ。最強システムでさえ、既存アルゴリズムから最適解までの距離の5分の1も満たない。消融実験では、ほとんどの提出はモデルの学習方法を変更せず、変更した少数の均分が0.226であるのに対し、その他は0.126にとどまった。

業界への影響

推論努力の実験はこの知見を鋭くした。推論予算を増やすことは、主に「変更する意欲」を買ったに過ぎない。学習方法を変更する提出の割合は8%から64%に跳ね上がり、平均点は0.094から0.196に高まった。これは議論を「能力の不足」から「試す意欲の不足」へ転換させる。再帰的-self-improvementの文脈では、動機と勇気が純粋な技巧よりも重要かもしれない。

オープンソースコミュニティにとって、フリーズされたリポジトリと非公開のスコアラーの組み合わせは、新しいシステムが同じスケールで检验できる再現可能な評価パラダイムを提供する。著者はタスクスイート、評価器、採点されたすべての提出をオープンソース化した。これにより、システムが進化するにつれ、測定を繰り返し対照できる。

今後の展望

工業チームにとって、この研究は訓練アルゴリズムそのものが計算能力と能力の交換率の重要なレバーであること、そしてそのアルゴリズムを改善することが同時に最も難しく、最もレバー効果の大きいステップであることを想起させる。今後の研究にとって、意欲が技巧に先立つこのパターンは、より強い訓練アルゴリズム用エージェントの設計を指向する。推論努力を高め、エージェントに単にコード生成能力を積み重ねるのではなく、訓練アルゴリズムに本当に取り組むよう促す道だ。

AI4AI-Benchはベンチマークを超えている。AIが自身を改善できるかどうかという定量化可能な問いであり、最も重要な命題の一つに対して、繰り返し再校正できる尺を立てた。これは将来に関わる問いに対する、信頼性の高い检验基盤を提供するものだ。

Sources

FAQ

AI4AI-Bench は何を評価するのですか?

エージェントが AI システムを生成する訓練アルゴリズムを書き換えられるかを評価します。10 個のフリーズリポジトリで、エージェントは B300 で 4 時間書き換え、最大 12 時間再実行し、非公開のスコアラーで採点されます。

なぜこのベンチマークは重要なのですか?

ほとんどの提出は学習方法を変更せず、変更した少数の均分は 0.226 対 0.126 でした。最強システムも 0.250 で、最適解までの距離の 5 分の 1 未満です。訓練アルゴリズムが計算と能力の交換の鍵です。

今後どんな点に注目すべきですか?

推論努力を増やすと「変更する意欲」だけが 8% から 64% に高まり、意欲が技術より重要である示唆します。タスクスイート、評価器、採点された提出すべてがオープンソース化されています。