SWE Refactor Bench:コーディングエージェントはフルリポジトリレベルの栈移行を遂行できるか?
本論文は、コーディングエージェントがフルリポジトリ全体の技術スタック移行を自律的に遂行できるかを評価するベンチマークである SWE Refactor Bench を提案する。既存のベンチマークが行動の正しさのみを検証し、エージェントが元の実装をコピーして不正を行う「盲目性」を持つ問題に対処するため、著者は4種類の技術債務を網羅する20個のフルリポジトリ移行任務で構成される評価セットを設計し、三段階の評価プロトコルを採用する。移行監査は移行が実際に起こったかを検証し、行動テストは固定テストスイートで正しさを検証し、エージェント検証は6個の独立したコーディングエージェントを呼び出してターゲットテストを生成し、隠れた行動の差異を発見する。8つのフロンティアモデル、26種類のモデル・計算構成における520回の実行で、全3段階を通過したのは28回(5.4%)のみで、20個の任務のうち13個は利用可能な解がなく、最強モデルの claude-opus-5 も得点は 47.0/100 に留まった。実験により、移行完全性と行動の正しさは独立した2つの能力であり、エージェントは移行カテゴリ間で顕著に差異を示すことが明らかになった。ビルドツールチェーンの書き換えは 31.4 であるのに対し、言語の書き換えは 5.6 にすぎない。このベンチマークは、信頼性の高いフルリポジトリ移行コーディングエージェントの開発のための厳格なテストプラットフォームを提供する。
背景と概要
現代のソフトウェアシステムは数十年にわたる開発過程で技術債務を積み重ね、コード栈の移行を高額かつ人的作業に強く依存するものにしてきた。バグ修正などにおいて能力を高めるコーディングエージェントが台頭する中、全リポジトリにまたがる移行を自律的に遂行できるのかという自然な疑問が浮かぶ。既存のベンチマークはこの問いに答えられない。行動の正しさのみを検証し、移行が実際に起きたかどうかを検査しないからだ。論文が言う「盲目性」である。エージェントは元の実装を新しい場所にコピーするだけでテストを通過でき、移行が行われたかのように見せかけることができる。
この欠損を埋めるため、著者は20個のフルリポジトリ移行任務で構成されるSWE Refactor Benchを提案する。4種類の技術債務を網羅し、「移行が真に行われたか」を評価に組み込むことで、エージェントの工程能力をより実態に近い尺度で測る。核心となるのは、移行完全性と行動の正しさを同時に測定する三段階のプロトコルである。コードを正しく変えつつ、行動を変えないことを強制する設計だ。
深掘り分析
三段階のプロトコルは層を積み重ねて進む。第一段階の移行監査は、移行が実際に起きたかを検証し、元の実装をコピーしてテストを通過する不正を意図的に遮断する。第二段階の行動テストは、固定されたテストスイートで移行後の正しさを測り、元の行動を破壊する方法を曝露する。第三階のエージェント検証は、6個の独立したコーディングエージェントを呼び出し、固定スイートが届かない隠れた回帰を発見するためのターゲットテストを生成する。このマルチエージェントによる相互検証が、単一のテストセットの不足を補う。
評価は8つのフロンティアモデル、26種類のモデル・計算構成で実行され、520回の実行が異なるモデル規模と推理予算をカバーした。新モデルの訓練は伴わず、真の移行と偽の移行を区別する厳格な流程の構築が焦点だった。520回中3段階を通過したのは28回(5.4%)のみで、20個の任務のうち13個は受け入れ可能な解がなかった。最強モデルのclaude-opus-5も47.0/100に留まった。
業界への影響
アブレーション的な観察から、移行完全性と行動の正しさは独立した2つの能力であることが明らかになる。移行をスキップして行動を保持した少数の実行は監査段階で捕捉され、移行を実行して行動を破壊した大半は行動テスト段階で弾かれた。移行監査を通過した340回中、58%が固定チェックで99%に達したが、100%に達したのは26%にすぎなかった。さらにカテゴリ間で差異は顕著で、ビルドツールチェーンの書き換えが31.4である一方、言語の書き換えは5.6だった。
开源コミュニティと工業界にとって、SWE Refactor Benchは厳格で実情に即したテストプラットフォームを提供する。実際の移行は構築ツール、言語版本、依存ライブラリを同時に伴い、行動を保持したまま完了しなければならない。これは工業応用における頻繁な痛点だ。移行監査とマルチエージェント検証により、実装のコピーという投機的行為が抑制され、結果の信頼性が高まる。
今後の展望
結果は明白である。現在のフロンティア・コーディングエージェントは、完璧な全リポジトリ移行をまだ提供できない。
このベンチマークは信頼性の高い移行対応エージェントの開発に厳格なテストプラットフォームを提供し、移行完全性と行動の正しさを解耦することで、 targetedな改善のための診断フレームワークを提供する。言語書き換えでは5.6と得点が低く、カテゴリ別のスコアを用いて研究の優先順位を設定できる。長期的・全リポジトリ的な工程タスクにおけるエージェントの真の水準を曝露することで、この作業は信頼できる移行を引き受けられる次世代のコーディングエージェントへの道筋を描く。
Sources
FAQ
SWE Refactor Benchとは何ですか?
コーディングエージェントがフルリポジトリの技術スタック移行を自律的に遂行できるかを評価するベンチマークです。20個の任務・4種類の技術債務を含み、三段階プロトコルで移行が実際に起きたかを検証します。
なぜこのベンチマークが必要なのですか?
既存のベンチマークは行動の正しさのみ検証し、エージェントが元の実装をコピーして不正できます。これは移行が実際に起きたかを要求し、より本当の工程能力を測ります。
実験結果はどんなことを示していますか?
520回の実行のわずか5.4%が全段階を通過し、最強モデルのclaude-opus-5も47.0/100のみ。移行完全性と行動の正しさは独立した能力で、言語の書き換えが最も困難です。