基於錯誤定位的測試時擴展:TTEL演算法提升推理效率

本文提出一種名為測試時擴展透過錯誤定位(TTEL)的新型推理演算法,旨在解決大型語言模型在複雜推理任務中計算資源浪費的問題。傳統測試時縮放方法如獨立採樣和順序多輪細化缺乏詞元級別的信用分配,導致大量有效的推理字首被丟棄。TTEL利用固定或環境回饋進行詞元級別的錯誤定位,透過對比知情回饋下的條件機率與空上下文基線,精準隔離錯誤發生步驟,並截斷軌跡以分支生成新路徑,從而最大化重複使用有效字首。在LiveCodeBench、AIME-2025和HMMT-2025等基準上的廣泛評估表明,TTEL在產生記號成本與通過率之間建立了嚴格優勢的帕累托前沿。例如在Qwen3-8B模型上,TTEL在產生約一半記號的情況下,達到了71.0%的pass@64準確率,顯著優於獨立採樣及其他基準方法。

在大语言模型处理复杂推理和编程任务时,测试时计算扩展已成为提升性能的重要手段,但现有的主流方法存在明显的效率瓶颈。传统的测试时缩放策略,如独立采样和顺序多轮细化,往往缺乏词元级别的信用分配机制。这意味着模型在生成过程中无法准确判断哪些步骤是正确的,哪些是错误的,导致大量已经生成的有效推理前缀在后续步骤出错时被全盘丢弃,造成了巨大的计算资源浪费。针对这一核心痛点,本研究提出了测试时扩展通过错误定位(TTEL)算法。

TTEL的核心贡献在于引入了一种基于反馈的推理路径优化机制,它不再盲目地从头生成或简单重试,而是通过精细的错误定位,确保每一次计算投入都能最大限度地保留有效信息,从而在提升模型表现的同时显著降低计算开销。这一方法为理解如何更高效地利用推理时的计算资源提供了新的视角,特别是在资源受限的场景下具有重要的应用价值。从技术实现的角度来看,TTEL算法巧妙地结合了环境反馈与概率对比分析。该算法利用固定规则或环境提供的反馈信号,对生成过程中的每一个词元进行误差定位。

具体而言,TTEL通过比较在知情反馈条件下的条件概率与空上下文基线下的概率,精准地识别出导致推理偏差的具体步骤。一旦定位到错误发生的位置,算法便会截断当前的生成轨迹,并以此为起点分支出新的生成路径。这种机制确保了模型能够最大化地复用之前生成的有效前缀,避免了重复计算和无效探索。与传统的独立采样不同,TTEL不是简单地增加采样次数,而是通过智能的路径修剪和重组,实现了计算资源的最优配置。

这种基于词元级别的细粒度控制,使得模型能够在保持推理连贯性的同时,灵活应对复杂的逻辑链条,从而在本质上提升了推理过程的效率和准确性。为了验证TTEL的有效性,研究团队在多个权威的推理基准上进行了广泛的实验评估,包括代码生成的LiveCodeBench以及数学推理的AIME-2025和HMMT-2025。实验结果清晰地展示了TTEL在帕累托前沿上的严格主导地位,即在相同的生成令牌成本下,TTEL获得了更高的通过率,或者在相同的通过率下,TTEL消耗了更少的计算资源。以Qwen3-8B模型在LiveCodeBench上的表现为例,TTEL在pass@64指标上达到了71.0%的高准确率,而生成的令牌数量仅为360.4k,相比之下,独立采样方法虽然达到了类似的准确率,但生成了735.0k个令牌,计算成本几乎翻倍。

此外,在AIME-2025和HMMT-2025等数学基准上,TTEL在Qwen3-8B和Qwen3-4B-Thinking-2507等不同规模的模型上均稳定地优于其他测试时基线方法。消融实验进一步证实了错误定位机制对于提升整体性能的关键作用,证明了通过精准截断和分支来复用有效前缀是提升推理效率的核心所在。TTEL算法的提出对开源社区和工业落地具有深远的意义。首先,它为大语言模型在复杂推理任务中的高效部署提供了一条切实可行的路径,特别是在计算资源有限或延迟敏感的应用场景中,TTEL能够显著降低推理成本,提升用户体验。其次,TTEL所提出的错误定位和路径分支机制,为后续研究提供了新的思路,激发了更多关于如何优化测试时计算资源的探索。对于工业界而言,这种能够显著提升推理效率的技术,有助于降低大规模模型服务的运营成本,使得更强大的推理能力能够以更低的门槛服务于更广泛的用户。此外,TTEL的通用性使其能够适配多种不同的基础模型,如Qwen系列,这进一步增强了其在实际应用场景中的灵活性和适应性。总体而言,TTEL不仅是一项技术创新,更是推动大语言模型向更高效、更智能方向发展的关键一步,其影响将深远地波及到自然语言处理、代码生成和数学推理等多个领域。

Sources