YOPO:凍結語言模型單次前向傳播實現推理與拒答
本文提出YOPO框架,解決凍結語言模型在推理任務中證據利用不足及無法檢測信息缺失導致胡言亂語的問題。研究整合了條件引導探針與零樣本充分性方向兩個研究線,通過訓練小型網絡重構引導前的殘差流,使模型在單次前向傳播中同時完成回答、引導和拒答。實驗顯示,在Qwen2.5骨幹網絡上,YOPO將三分類準確率從0.375提升至0.798,且在所有規模上超越雙次前向參考基準。該工作貢獻了首個答案或拒答基準,證明了拒答能力不應被訓練進模型,而是通過架構設計實現,為工業落地提供了高效且可靠的推理方案。
当前冻结语言模型在处理推理任务时面临两个相互耦合的核心弱点:一方面,模型未能充分利用其自身残差流中已经编码的证据信息,导致推理准确率受限;另一方面,模型缺乏对输入信息充分性的检测能力,当信息不足时往往会产生幻觉或胡言乱语。针对这些问题,本文提出YOPO(You Only Pass Once)框架,旨在通过单次前向传播同时实现回答、引导和拒答功能。核心贡献在于整合了条件引导探针和零样本充分性方向两条研究线,前者在中间层写入残差流以恢复推理精度,后者读取残差流以判断信息是否充分。然而,直接部署这两个机制会导致干扰,引导写入会改变方向读取的状态,造成跨域迁移性能下降。YOPO通过训练一个小型网络重构引导前的残差流,解决了这一干扰问题,使得模型能够在不增加推理成本的情况下,同时具备高精度的推理能力和可靠的拒答机制,显著提升了冻结模型在复杂推理任务中的实用性和可靠性。 YOPO的技术方法核心在于解决引导写入与方向读取之间的状态干扰问题。具体而言,研究团队保持充分性方向固定,训练一个小型网络,以均方误差为损失函数,利用(引导后,干净)残差流对来重构引导前的残差流。这一过程不需要任何充分性标签,仅依赖残差流本身的配对数据。重构后的残差流被用于读取充分性方向,从而确保拒答判断基于未受引导干扰的原始状态。整个系统部署在冻结的Qwen2.5骨干网络(1.5B/3B/7B)上,通过单次前向传播完成所有操作。这种设计避免了传统双次前向传播带来的推理成本翻倍问题,同时通过重构网络有效隔离了引导机制对拒答判断的负面影响。技术实现上,YOPO利用了残差流的线性可分性,通过简单的重构任务实现了复杂的状态解耦,体现了对语言模型内部表示结构的深入理解和巧妙利用,为冻结模型的功能增强提供了新的技术路径。 实验在多个数据集和基准上进行了全面评估,关键结果表明YOPO显著优于冻结基线和双次前向参考基准。在alphaNLI数据集上,1.5B模型的三分类准确率从0.375提升至0.798,实现了翻倍以上的提升。在1.5B、3B和7B规模上,YOPO的准确率分别为0.798、0.830和0.893,均高于双次前向参考基准的0.753、0.790和0.863。此外,在十个骨干网络、六个模型家族上的实验验证了方法的泛化能力。消融实验揭示了容量转移前沿,量化了拒答能力不应被训练进模型的原则。研究团队还进行了源端审计,发现alphaNLI构建中存在表面伪影泄漏问题,因此架构声明基于原生标签复制(SQuAD2、RepLiQA、MuSiQue)进行锚定。在标准四域套件上,YOPO的网关在所有域内数据集上表现最佳,且无标签方向是唯一能在域迁移中保持性能的网关家族,证明了方法的鲁棒性和跨域适用性。 YOPO对开源社区和工业落地具有深远意义。首先,它提供了一种高效的方法,使冻结语言模型能够在不增加推理成本的情况下,同时具备高精度推理和可靠拒答能力,这对于资源受限的部署场景尤为重要。其次,YOPO贡献了首个答案或拒答基准,填补了该领域的空白,为后续研究提供了标准化的评估工具。第三,研究证明了拒答能力不应被训练进模型,而是通过架构设计实现,这一原则为模型设计和训练策略提供了新的指导。对于工业落地,YOPO的单次前向传播特性使其适合实时应用,如客服机器人、智能助手等,能够显著降低延迟和成本。对于后续研究,YOPO的残差流重构方法和容量转移前沿分析为理解语言模型内部表示和功能解耦提供了新的视角,可能启发更多基于冻结模型的功能增强研究,推动自然语言处理领域向更高效、更可靠的方向发展。