TRACE-Router:打破智能体AI路由瓶颈,实现任务级自适应优化

针对现有LLM路由机制难以适应智能体长周期工作流的痛点,研究提出TRACE-Router框架。该框架将路由决策单元从单次调用升级至任务级监督单元,利用上下文博弈论进行初始分配,并在执行期间锁定模型,仅依据最终结果更新策略。实验显示,TRACE-Router在tau2-Bench准确率提升7-8分,在Terminal-Bench准确率提升7.1分且延迟降低36%,在WebArena和SWE-bench等基准测试中均实现帕累托改进,为智能体AI的高效路由提供了新范式。

随着大语言模型在企业AI应用中的广泛部署,如何根据成本与质量的权衡选择最合适的模型已成为关键部署特征。然而,现有的路由机制主要存在一个根本性缺陷:它们通常针对每一次独立的LLM调用做出路由决策,而忽视了智能体应用程序本质上是长周期的工作流。在智能体场景中,最终的质量仅由延迟的任务级结果决定,而非中间每一步的独立输出。这种监督单元的不匹配导致基于单次调用的路由器无法正确地将最终反馈归因于具体的路由决策,从而难以优化整体工作流性能。

为了解决这一核心问题,本文提出了TRACE-Router,这是一个任务级的路由框架,旨在将路由决策与监督单元严格对齐。该框架的核心贡献在于它不再追求单次调用的局部最优,而是通过任务级别的反馈来学习全局最优的路由策略,从而在复杂的多步骤智能体任务中实现更高效的资源分配和质量控制。在技术方法层面,TRACE-Router采用了一种创新的上下文博弈论(contextual bandit)机制来处理任务准入阶段的路由选择。当一个新的任务进入系统时,框架会根据任务的上下文特征,利用上下文博弈论模型一次性决定将其分配给哪个后端模型。

一旦分配完成,该任务后续所有的LLM调用都被"锁定"到选定的后端,直到任务结束。这种"准入即锁定"的策略避免了在任务执行过程中频繁切换模型带来的额外延迟和状态不一致问题。更重要的是,策略更新机制完全依赖于任务的终端奖励(terminal reward)。这意味着框架能够利用延迟的任务反馈,直接学习哪些模型在特定类型的工作流中表现更好,而无需显式地估计任务的复杂度。

通过联合优化准确率与延迟,TRACE-Router能够动态适应不断变化的工作负载,自动发现不同模型在不同任务类型上的优势区间,从而实现路由策略的自适应演进。为了验证TRACE-Router的有效性,研究团队在三个主流的智能体基准测试上进行了广泛的实验评估。实验结果显示,TRACE-Router在所有测试场景中均能持续改善准确率与延迟之间的权衡关系,并达到了非支配的帕累托前沿点,这意味着它在同等延迟下提供了更高的准确率,或在同等准确率下显著降低了延迟。具体而言,在tau2-Bench基准上,TRACE-Router的准确率比延迟匹配的单个模型插值方法高出7到8个百分点,显示出其在复杂推理任务中的强大能力。

而在Terminal-Bench基准上,其表现更为突出,相比最强的单一模型基线,准确率提升了7.1分,同时延迟降低了36%。这些关键指标不仅证明了框架在提升任务完成质量方面的显著效果,也展示了其在降低计算成本和响应时间方面的巨大潜力。消融实验进一步揭示了延迟反馈机制对于避免显式任务复杂度估计的重要性,证实了直接利用终端奖励进行策略更新的优越性。TRACE-Router的提出对开源社区和工业落地具有深远的意义。对于工业界而言,它提供了一种无需重新训练基础模型即可优化现有LLM部署效率的新范式,特别是在智能体应用日益普及的背景下,能够显著降低企业运行复杂AI工作流的成本。对于开源社区,该框架为后续研究提供了新的思路,即从单次调用优化转向任务级全局优化,鼓励研究者探索更多基于长周期反馈的路由算法。此外,TRACE-Router避免了对任务复杂度的显式估计,简化了系统设计的复杂性,使其更容易集成到现有的AI基础设施中。随着智能体技术在客服、代码生成、数据分析等领域的深入应用,这种能够自适应调整模型选择并优化整体工作流性能的路由机制,将成为构建高效、可靠且经济的大规模AI系统的关键组件,推动AI应用从"可用"向"高效可用"迈进。

Sources