ProgRouter:質量とコストのトレードオフにおけるマルチエージェントワークフローのオンライン進度誘導オーケストレーション
本論文は、マルチエージェント大言語モデル(LLM)ワークフローが複雑なエンドツーエンドのタスクを解決する際に生じる高い運用コストの問題に対して解決策を提案する。既存のカスケードルーティング方法は、一度きりのクエリレベルの判断しか行わず、各ステップでどのLLMを選ぶかが進化するタスク進度、残存難易度、コスト効率要件に依存する多ステップワークフローの動的・状態依存性に対応できない。著者は、時間とコストの予算を遵守しつつ、ワークフローの各ステップでLLMエージェントを適応的に選択して解決品質を維持するオンライン進度誘導のルーティングフレームワークであるProgRouterを提案する。その中核には、粗粒度のワークフロー結果状態と細粒度のサブタスク完了・進度傾向・ワークフロー状態品質を組み合わせる多視点タスク進度スコアラー、および各候補LLMの進度増分を推定する二経路タスク進度予測器と適応型メタゲート機構が含まれる。HumanEval Plus、MBPP、MATH-500、ASQAなどのベンチマークでの実験は、ProgRouterが主要ベースライン相较に運用コストを大幅に削減しつつ、強いタスクパフォーマンスを維持していることを示している。
背景と概要
マルチエージェント大言語モデル(LLM)ワークフローは、専門化されたLLMエージェント間の協調推論によって複雑なオープンエンドのタスクを解決する主要な范式となっている。しかし各ステップでLLMを繰り返し呼び出し、長文コンテキストを累積するため、運用コストは著しく上昇する。本論文が取り組む核心的なジレンマは、時間とコストの予算を維持しつつ、どうやってタスクの解決品質を確保乃至向上させるかである。
既存のカスケードルーティング方法は一度きりのクエリレベルの判断しか行わない。ルーティングをワークフロー全体への単発的判断とみなすため、多ステップワークフローの動的・状態依存性に対応できない。各ステップでどのLLMを選ぶかは、進化するタスクの進度、残存難易度、コスト効率要件に依存するが、これらは流程の進行とともに絶えず変化する。\n\n## 深掘り分析\n\n著者はProgRouterを提案する。これはオンライン進度誘導のルーティングフレームワークで、ワークフローの各ステップで最適なLLMエージェントを適応的に選択する。ルーティングを静态的な一次判断から、タスク状態の進化に従って継続的に調整する動的なオーケストレーションへと転換する点が最大の特徴だ。方法論はタスク進度の知覚と予測を中心に構成される。\n\n多視点タスク進度スコアラーは、粗粒度のワークフロー結果状態と細粒度の信号を組み合わせる。細粒度信号にはサブタスクの完了度、進度傾向、ワークフローの状態品質が含まれ、現在地点の進度をより立体的に描く。この進度表征を得た後、框架は二経路タスク進度予測器と適応型メタゲート機構を用いて、各候補LLMがもたらす進度増分を推定する。\n\n二経路設計により予測は単一信号に依存せず、複数の角度から各モデルが現状でタスクをどれだけ前進させ得るか総合的に判断する。適応型ゲートはリアルタイムの状態に応じて候補経路を動的に加重する。ProgRouterは段階的にオンラインで判断し、進度増分、タスクの時間予算、長期のコスト効率の三者を权衡する。\n\n## 業界への影響\n\n実験はHumanEval PlusとMBPPによるエージェントのコード生成能力、MATH-500による数学推論、ASQAによる検索増長の長文问答を網羅する。この跨タスクの選択により、異なる推論モードにおけるProgRouterの汎用性が反映される。実験結果は、ProgRouterが主要ベースライン相较に運用コストを大幅に削減しつつ、強いタスクパフォーマンスを維持していることを示す。\n\nこの結果の意義は、オンライン・進度誘導のルーティング戦略が、品質を犠牲にせずコスト節約を実現し得ることを実証した点にある。抽象には具体的な数値指標が開示されないため、本論文は単一データセット上の絶対的向上ではなく、ベースライン相対の全体としての質とコストの权衡を強調する。この多タスク・コスト効率中心の評価は、方法の普適性を検証したいという著者の意図を反映している。\n\n## 今後の展望\n\nこのオンライン進度誘導のルーティングは、マルチエージェントLLMワークフローの低成本展開へ実用的な道筋を提供する。エージェントシステムが実應用で普及する中、運用コストと時間予算は往々にして展開の瓶颈となる。精緻なタスク進度の知覚と動的ルーティングにより、品質を大きく損なわずにオーバーヘッドを大幅に圧縮できる。\n\nオープンソースコミュニティには、ルーティングを静态的判断から状態進化駆動のオンラインオーケストレーションへ昇格させる迁移可能なフレーム設計范式を提供する。産業展開では、質とコストを両立させる本手法が、実场景でのより複雑で長程な多ステップタスクの展開を助ける。今後の研究では、粗粒度のワークフロー状態と細粒度のサブタスク信号の区別が、さらなる精度の高い進度推測の方向を示し、適應型メタゲート機構が候補LLMプール拡大に伴うより柔軟な経路選択へと向かう。