低顯存長上下文微調:層級全局注意力與分段反向傳播的實踐
針對長序列微調中密集注意力機制導致的顯存瓶頸,本文提出結合層級全局注意力(HGA)、分段反向傳播及分層KV儲存的高效微調方案。該方法僅保留當前活躍段的微分狀態,將歷史KV快取卸載至RAM或NVMe,顯著降低顯存峰值。在Qwen3-8B模型與PG19數據集上的實驗顯示,該方法在16GB顯存下支援16,384序列長度訓練,且推論時可處理131,072 tokens。在2K長度下,HGA訓練配適器與密集訓練配適器在密集注意力讀出下表現相當(2.7405 vs 2.7383 nat),且HGA訓練速度略快。隨著上下文增長,HGA因保持歷史注意力集恆定,吞吐量優勢預計將進一步擴大,為低資源下的長文本模型優化提供了新途徑。