FrugalEvo:コストを意識した LLM 誘導型プログラム進化
FrugalEvo は、コストを意識した LLM 誘導型の進化フレームワークです。強いモデルが解法の戦略を探り、安価なモデルがそれを実装してコードを改良します。プロンプトの先頭部分を共有してキャッシュの再利用も高めます。累積コストに対する解の品質を測る指標 BA-AUC も提案されました。要旨によれば、10 個の数学・システム最適化タスクで基線に並ぶか上回り、9 タスクで BA-AUC が高く、円充填は 0.55〜1.68 ドルで達成しました。
背景と課題の所在
AlphaEvolve に代表される LLM 誘導型の進化的手法は、円充填のような難しい計算最適化問題に対する有力な手段になっています。基本の流れは単純です。言語モデルが既存プログラムへの変更案を出し、評価関数が新しいプログラムを採点し、良いものを候補集団に残して次の反復に進みます。 これまでの研究は、固定された反復回数での性能向上を比べるのが一般的でした。この比べ方には見落としがあります。費用を見ていないことです。反復回数が同じでも、かかる金額は同じではありません。強いモデルは一回の呼び出しが高く、推論も長く、文脈も膨らみやすいのです。予算を反復回数で固定すると、こうした差が隠れます。
FrugalEvo の著者は、より実際的な目標を掲げます。固定回数での利得ではなく、単位コストあたりの利得を最大化することです。要旨が示す対比ははっきりしています。多エージェント手法の CORAL や SwarmResearch は、円充填で平均約 50 ドルかかります。FrugalEvo は 1.68 ドルと 0.55 ドルで、同等かそれ以上の結果を報告しています。この数字が成り立つなら、問いは「良い解が見つかるか」から「良い解にいくら払うか」へ変わります。 なお、本稿は論文の要旨だけに基づいています。要旨にない詳細、たとえば具体的なプロンプト、キャッシュヒット率、各タスクの絶対スコアは、ここでは推測しません。
コアアーキテクチャと技術原理
要旨は、互いに組み合わさる三つの設計を述べています。 一つ目は、二つのモデルによる役割分担です。強くて高価な LLM が解法の戦略を探ります。どの方向へ進むかを決める役です。安価な LLM は、その戦略をコードとして実装し、後続の反復でコードを繰り返し改良します。この分担は、進化の各段階が同じ能力を必要としない、という前提に立っています。戦略の選択には判断力が要ります。コードの実装や微調整は、安い試行を数多く重ねるほうが効きます。高価な呼び出しを少数の重要な判断に絞ることが、節約の主な源です。
二つ目は、キャッシュ効率の高い進化プロセスです。LLM のサービスは、同じ入力の先頭部分(プレフィックス)をキャッシュすることが多く、キャッシュに当たった入力は安く速くなります。FrugalEvo では、ハーネスとプロンプトを、異なる進化ステップ間でできるだけプレフィックスを共有するように作っています。工学的な工夫ですが、コストに敏感な場面では請求額に直結します。 三つ目は、新しい指標 BA-AUC(予算考慮型の曲線下面積)です。累積 LLM コストを横軸に、これまでの最良スコアを縦軸にとり、予算上限までの曲線下面積を測ります。この指標は二つを評価します。最終スコアが高いことと、早い段階で良いスコアに届くことです。最終スコアだけの比較では、少しの向上のために十倍の費用をかける手法が有利に見えかねません。BA-AUC はその差を見えるようにします。
実用性と検証結果
要旨によると、評価は 10 個の数学・システム最適化タスクに及びます。FrugalEvo は最終解の品質で OpenEvolve、ShinkaEvolve、AdaEvolve、EvoX といった最新の基線に並ぶか上回り、そのうち 9 タスクで BA-AUC が高くなっています。裏返せば、BA-AUC で先行しないタスクが一つあります。要旨はどれかを述べていません。
ALE-Bench-Lite の 10 個のアルゴリズム最適化タスクでも、平均性能はこれらの基線を上回っています。
最も目を引く結果は円充填です。GPT-5.6 の Terra と Luna の組み合わせでは費用が 1.68 ドル、GLM-5.3 とその Flash 版では 0.55 ドルです。どちらの構成も、すべての基線に並ぶか上回り、このタスクで新たな最高水準を達成したと報告されています。ただし二点、慎重に見る必要があります。「最高水準」は論文自身の主張であり、独立した再現が要ります。また、多エージェント手法の 50 ドルは平均値です。手法間で費用の数え方が完全に比較可能かどうかは、本文の実験設定を見なければ分かりません。
業界への影響と今後の展望
この研究の価値は、特定のスコアよりも、評価の枠組みにコストを組み込んだ点にあります。進化的なプログラム探索は、アルゴリズム発見、システム調整、研究支援でますます使われています。一回の実験に数十ドルかかるなら、資金のあるチームしか回せません。一、二ドルなら、個人の研究者や小さなチームでも探索を一通り回せます。
実務者が持ち帰れる点は三つあります。強いモデルと安いモデルの階層化は、進化探索に限らない一般的な節約手段です。プロンプトのプレフィックスの安定性は、後付けの最適化ではなく、最初からの設計制約にすべきです。自動探索システムを評価するときは、最終スコアだけでなくコスト曲線も報告すべきです。
限界も明らかです。10 件と 10 件というタスク数は多くなく、より開かれた問題にどこまで通じるかは分かりません。最適なモデルの組み合わせは現行の価格に依存し、価格が変われば変わり得ます。BA-AUC の値も、予算上限の選び方に左右されます。今後は、独立した再現、より多様なタスク、そして戦略モデルと実装モデルの間で情報がどう渡されるかに注目すべきです。
Sources
FAQ
FrugalEvo は二つのモデルにどう役割を分けますか。
強くて高価な LLM が解法の戦略を探り、安価な LLM がそれをコードとして実装し、後続の反復で改良します。
BA-AUC とは何ですか。
累積 LLM コストに対する最良スコアの曲線について、予算上限までの曲線下面積を測る指標です。最終スコアの高さと、早く良いスコアに届くことの両方を評価します。
要旨が報告する円充填のコストは。
GPT-5.6 の Terra と Luna で 1.68 ドル、GLM-5.3 と Flash 版で 0.55 ドルです。CORAL や SwarmResearch などの多エージェント手法は平均約 50 ドルとされています。