MaLoRA與MaRA:基於選擇性狀態空間自適應的LLM推理增強方法
針對低秩自適應(LoRA)等靜態適配方法無法捕捉輸入動態狀態的問題,本文提出了一種引入選擇性狀態空間遞歸的新型適配器家族。核心包括MaLoRA,透過Mamba機制使適配器縮放因子成為隨Token動態變化的函數,並保留跨Token的遞歸狀態;以及MaRA,在上下文層面追蹤跨片段狀態並檢索與查詢最相關的片段以輔助生成。在Qwen-2.5-7B、Llama-3.1-8B和Gemma-2-9B三個凍結骨幹網路上,該方法在MuSiQue和2WikiMultihopQA兩個推理基準上全面超越LoRA基線。平均F1分數提升6.8(相對增長10.5%),在最難樣本上提升高達9.3(相對增長18.2%)。此外,Token級別的增益在RULER QA-2長文本壓力下依然有效,證明了其在複雜推理任務中的魯棒性與泛化能力。
大型语言模型在复杂推理任务中往往面临状态保持与动态适应的挑战。传统的低秩自适应(LoRA)技术虽然高效,但其本质是一种静态的、对所有输入应用相同更新的学习机制。这种机制仅能提供任务级别的适配,却无法显式地表示Token级别或实例级别的动态状态变化,导致模型在处理需要长程依赖或上下文感知的推理任务时表现受限。本文旨在解决这一核心痛点,提出了一种基于选择性状态空间递归的新型适配器家族。该研究的核心贡献在于打破了传统适配器无状态或仅依赖局部上下文的局限,通过引入Mamba架构的选择性状态空间机制,实现了从Token到上下文两个互补粒度的动态适配。
这不仅让模型能够根据输入内容动态调整参数行为,还使其具备了记忆和检索关键历史信息的能力,从而显著提升了复杂逻辑推理的准确性。这种从静态适配到动态状态感知的范式转变,为提升冻结预训练模型的推理能力提供了新的技术路径。在技术实现层面,本文详细阐述了两种互补的适配器设计。首先是MaLoRA(Mamba-modulated low-rank adaptation),它在Token级别引入了动态适应性。与先前工作中无状态的调制器不同,MaLoRA将适配器的缩放因子构建为一个依赖于输入的动态函数,并利用Mamba的递归状态机制,使该函数能够跨Token保留历史信息。
这意味着模型在处理序列时,能够根据前序Token的状态动态调整当前Token的参数更新幅度,从而更精细地捕捉序列内部的依赖关系。其次是MaRA(Mamba Retrieval Adapter),它在上下文级别发挥作用。MaRA通过追踪跨片段的隐藏状态,能够有效地识别并选择与当前查询最相关的文本片段。在生成答案之前,模型会利用这种检索机制聚焦于关键信息,从而减少噪声干扰。这两种方法均建立在冻结的骨干网络之上,通过插入轻量级的状态空间模块,既保持了计算效率,又赋予了模型更强的动态推理能力。
这种分层的设计使得模型能够在微观的Token交互和宏观的上下文检索之间取得平衡。为了验证所提方法的有效性,研究者在三个主流的大型语言模型骨干网络上进行了广泛实验,包括Qwen-2.5-7B、Llama-3.1-8B和Gemma-2-9B。实验选取了MuSiQue和2WikiMultihopQA两个极具挑战性的多跳推理基准测试。结果显示,该适配器家族在3x2的实验网格中,所有组合均优于传统的LoRA基线。具体而言,平均F1分数提升了6.8,相对增长达到10.5%。
特别是在最难处理的样本子集中,F1分数提升高达9.3,相对增长为18.2%,这表明该方法在处理高难度推理任务时具有显著优势。此外,消融实验进一步证实了Token级别增益的鲁棒性,即使在RULER QA-2这种对长度压力敏感的测试中,MaLoRA带来的性能提升依然得以保持。这些结果不仅证明了选择性状态空间机制在提升推理精度上的有效性,也展示了其在不同模型架构和不同难度分布下的泛化能力。这项研究对开源社区和工业落地具有深远的意义。首先,它证明了在不重新训练庞大骨干网络的前提下,通过引入轻量级的状态空间适配器,可以显著提升模型的复杂推理能力,这为资源受限场景下的模型优化提供了可行方案。其次,MaLoRA和MaRA的设计思路为后续研究如何在Transformer架构中有效集成状态空间模型(SSM)提供了宝贵经验,特别是在处理长文本和动态依赖方面。对于工业界而言,这种能够动态适应输入并检索关键信息的机制,有望被应用于更复杂的问答系统、代码生成和逻辑推理应用中,提升AI系统的可靠性和准确性。最后,该工作推动了从静态参数适配向动态状态感知的技术演进,可能激发更多关于如何结合SSM的高效性与LLM的语义理解能力的后续研究,为下一代高效推理模型的设计奠定理论基础。