潘多拉路由器:用最优搜索理论破解AI模型路由的成本困局
本文研究如何把查询高效路由到最合适的AI专家模型。异构AI系统由多个模型、架构、推理框架或推理时设置组成,把查询分给最擅长且成本最低的处理者,可同时提升质量与效率。路由的关键在于估计每个专家的预期回报,但估值本身有成本:廉价估计器快却噪声大,准确估计器昂贵。作者将这一权衡形式化为经典的最优搜索问题潘多拉盒子问题。在高斯信号模型下,所得策略具有闭合形式的信息价值表达式,可判断是否为每个专家与输入付出成本精修估值。集中式策略称为潘多拉路由器,去中心化扩展为潘多拉投标者。三类域实验表明,潘多拉路由器在路由质量上匹配穷举估值,却更频繁地少用昂贵估计器。
这篇论文聚焦异构AI系统中一个普遍却棘手的问题:当系统里同时存在多个模型、多种架构、不同的推理框架以及可变的推理时设置时,如何把每个查询精准地分派给最擅长回答且成本最低的那个处理者。作者指出,这类系统本可通过合理路由同时提升质量与效率,而路由的前提是估计每个专家对特定查询的预期回报。问题在于,估值这件事本身是有代价的。便宜的估计器比如基于嵌入的预测器运行很快,但输出噪声大、准确度低;准确的估计器比如能访问检索结果或部分推理链的微调模型,虽然可靠,却需要付出高昂的计算或时间成本。正是这种廉价但嘈杂与昂贵但精确之间的张力,构成了本文要解决的核心矛盾。作者的主要贡献是把这个现实权衡形式化为经典的潘多拉盒子问题,即带成本检查的最优搜索问题,并由此推导出一套可计算、可策略化的路由框架,为理解路由中的估值投入提供了统一视角。在技术方法上,作者在高斯信号模型下展开分析,这一假设让问题具备可解性。在此框架下,所得策略拥有闭合形式的信息价值表达式,信息价值衡量的是为了降低不确定性而获取额外信息所能带来的期望收益。这一表达式决定了对于每个专家和每个具体输入,是否值得付出成本去 refining 估值,从而把直觉性的取舍转化为了可量化的决策规则。作者把这一集中式策略命名为潘多拉路由器,它由一个中心控制器统一调度,依据信息价值决定何时调用廉价估计器、何时切换到昂贵估计器。进一步地,作者把框架扩展到去中心化场景,提出潘多拉投标者。在这一设定中,专家不再被中心统一指派,而是自主决定是否投资自我评估,并据此判断是否接受一个报价来认领查询。这种机制让专家能够像市场中的独立参与者那样,权衡自我评估的成本与认领收益,从而刻画了竞争环境下的策略性行为。在实验设置与关键结果方面,作者在三个不同域上进行了验证。第一个是标准的多LLM基准,用于评估在多个大语言模型之间路由的能力;第二个是检索增强的专家系统,考察能访问外部检索结果的昂贵估计器的作用;第三个是带有可变推理时推理的大模型,评估在不同推理预算之间路由的效果。实验结果显示,潘多拉路由器在路由质量上能够匹配穷举估值的水平,也就是同时评估所有专家所得到的最优路由,但它却更频繁地少用昂贵估计器,从而显著节省了估值成本。消融与对比发现揭示了信息价值推理的双重作用:在去中心化设定中,当竞争的估计较为准确时,信息价值推理能够提升分配效率;然而当竞争估计充满噪声时,它反而可能提高采取策略的专家自身的效用,代价是损害其他参与者的利益。这一发现提醒读者,估值精度直接影响机制设计的最终效果。从行业意义与潜在影响来看,这项工作为开源社区与工业落地都提供了可借鉴的框架。在工业侧,异构模型路由已成为真实部署中的常见形态,如何在保证质量的同时控制推理成本,是规模化服务的关键挑战,本文提供的闭合形式解与清晰的价值判断规则,为工程实现提供了可落地的理论依据。在开源社区,这一框架鼓励研究者把估值成本纳入路由设计的考量,而非仅仅追求路由准确率。对后续研究而言,潘多拉盒子视角把路由与最优搜索、信息价值理论连接起来,打开了将经济学的策略分析引入多模型系统的可能。去中心化的潘多拉投标者尤其值得关注,它为理解竞争环境下专家的策略性行为提供了新工具,也为未来设计更贴近真实市场的路由机制指明了方向。