低顯存長上下文微調:結合層級全局注意力的顯存優化方案
本文針對長序列訓練中高密集注意力導致的顯存瓶頸,提出了一種結合層級全局注意力(HGA)、分段反向傳播及分層KV緩存的高效微調方法。該方法僅對當前活動分段進行反向傳播,將歷史KV緩存卸載至RAM或NVMe,並利用HGA為每個查詢塊加載受限的精確歷史token。在Qwen3-8B模型及PG19數據集上的實驗顯示,該方法在16GB顯存顯卡上成功支援16,384序列長度訓練,峰值顯存僅15.28GB,遠超傳統密集訓練的2,048 token限制。在2K共享訓練長度下,HGA微調模型在密集注意力讀取下的困惑度(2.7405 nat)與密集訓練(2.7383 nat)相當,且訓練吞吐量略高。評估階段,同一適配器可處理高達131,072 tokens,顯存隨駐留塊摘要溫和增長,實際限制由RAM和NVMe容量決定。