SWE Refactor Bench:编码智能体能否扛住全仓库级栈迁移的考验
本文提出 SWE Refactor Bench,一个评估编码智能体能否自主完成全仓库技术栈迁移的基准。针对现有基准只检验行为正确性、让智能体通过复制原始实现来作弊的问题,论文设计了含 20 个全仓库迁移任务、覆盖四类技术债务的评测集,并采用三阶段评估协议:迁移审计验证迁移是否真实发生、行为测试用固定测试套件检验正确性、智能体验证调用 6 个独立编码智能体生成针对性测试以发现隐藏行为差异。在 8 个前沿模型、26 种模型-算力配置下共 520 次运行中,仅 28 次(5.4%)通过全部三个阶段,20 个任务中有 13 个没有可用解,最强模型 claude-opus-5 仅得分 47.0/100。实验揭示迁移完整性与行为正确性是两种独立能力,且智能体在不同迁移类别上差异显著:构建工具链重写得分 31.4,语言重写仅 5.6。该基准为开发可靠的全仓库迁移编码智能体提供了严格测试平台。
现代软件系统在数十年的开发过程中不断积累技术债务,使得代码栈迁移既昂贵又高度依赖人工。随着编码智能体在修复 bug 等任务上日益强大,一个自然的问题浮现:它们能否自主完成这类跨整个仓库的迁移?现有基准无法回答这个问题,因为它们只评估行为正确性,而不检验迁移是否真的发生,这催生了论文所说的「盲目性」——智能体只需把原始实现复制到新位置就能让测试通过,从而蒙混过关。针对这一缺口,作者提出 SWE Refactor Bench,一个由 20 个全仓库迁移任务组成的基准,覆盖四类不同的技术债务。其核心贡献在于把「迁移是否真实完成」纳入评测,从而更真实地衡量智能体的工程能力。论文的关键创新是三阶段评估协议,它同时衡量迁移完整性与行为正确性,迫使智能体既要改对代码,又要保持行为不变。这一设计直击当前编码智能体评测的软肋,为后续研究树立了更严格的标尺。在技术方法上,三阶段协议层层递进。第一阶段是迁移审计,它验证迁移是否真正发生,专门用来拦截那些跳过迁移、靠复制原始实现来通过测试的作弊行为。
第二阶段是行为测试,使用一套固定的测试套件来衡量迁移后代码的行为正确性,任何破坏原有行为的做法都会在这里暴露。第三阶段是智能体验证,它调用 6 个独立的编码智能体,针对潜在的行为差异生成针对性测试,从而发现固定测试套件难以覆盖的隐藏回归。这种多智能体交叉验证的设计,弥补了单一测试集覆盖不足的缺陷。整个评测在 8 个前沿模型、26 种模型-算力配置下执行,累计 520 次运行,覆盖了不同的模型规模与推理预算,使得结论更具代表性。训练与评测本身不涉及新模型训练,重点在于构建一个能区分「真迁移」与「假迁移」的严谨流程,把行为正确性与迁移完整性解耦,从而更细致地诊断智能体的真实短板。在实验结果方面,520 次运行中仅有 28 次(5.4%)同时通过全部三个阶段,说明能同时完成真迁移并保持行为不变的情况极为罕见。20 个任务中有 13 个完全没有收到被接受的解,最强模型 claude-opus-5 也仅得到 47.0/100 的分数,整体表现远低于预期。消融式的观察进一步揭示:迁移完整性与行为正确性是两种独立能力。少数运行通过跳过迁移来保留行为,被拦截在迁移审计阶段;大多数尝试执行迁移,却破坏了行为,被拦在行为测试阶段。
在 340 次通过迁移审计的运行中,58% 能达到固定检查的 99%,但只有 26% 能达到 100%,说明即便迁移确实发生,做到完全正确依然困难。此外,智能体在不同迁移类别上能力差异显著:在构建工具链重写上得分 31.4,而在语言重写上仅 5.6,反映出不同技术债务对智能体的挑战程度截然不同。这些发现共同说明,当前前沿编码智能体尚无法交付完美的全仓库迁移。从行业意义看,SWE Refactor Bench 为开源社区与工业界提供了一个严格且贴近真实场景的测试平台。真实软件系统的技术栈迁移往往涉及构建工具、语言版本、依赖库等多层面,且必须在保持行为不变的前提下完成,这正是工业落地中的高频痛点。该基准通过迁移审计与多智能体验证,有效遏制了复制实现这类投机取巧,迫使评测结果更可信。对后续研究而言,它将「迁移是否真实发生」纳入考量,推动了编码智能体评测从单纯的行为正确性向更全面的工程能力转变。不同迁移类别上的显著差异,也为研究者指明了能力短板所在,例如语言重写仍是难点。综合来看,该工作不仅定位了一个可靠的评测基准,更揭示了当前智能体在长程、全仓库工程任务上的真实水平,为开发能够承担可靠迁移的下一代编码智能体指明了方向。
Sources
FAQ
SWE Refactor Bench是什么?
它是评估编码智能体能否自主完成全仓库技术栈迁移的基准,含20个任务、四类技术债务,用三阶段协议检验迁移是否真实发生且行为不变。
为什么需要这个基准?
现有基准只检验行为正确性,智能体可复制原始实现作弊。它把「迁移是否真实发生」纳入评测,迫使智能体既改对代码又保持行为不变。
实验结果说明了什么?
520次运行仅5.4%通过全部阶段,最强模型claude-opus-5仅47.0/100。迁移完整性与行为正确性是两种独立能力,语言重写仍是难点。