前沿語言模型複製困境:為何二維位置編碼能突破一維局限

儘管當前大型語言模型在複雜推理任務上表現卓越,但本文揭示了一個反直覺現象:即使是前沿模型,也難以準確複製輸入字串中位於上下文視窗內的文字。研究指出,這一失敗源於Transformer架構中一維位置編碼的歸納偏置,其傾向於通過匹配局部上下文捷徑來近似複製,而非精確定位輸入位置。為此,作者提出2D-RoPE方法,將文本重構為二維網格,為每個詞元分配行ID和列ID,使複製任務轉化為固定列偏移的檢索,從而大幅降低學習難度。在合成實驗中,採用2D-RoPE的淺層Transformer在遠超訓練長度的輸入下實現了完美複製,顯著優於標準位置編碼。此外,在DCLM數據集上規模達1.4B參數的預訓練進一步驗證了該方法的泛化優勢。結果表明,二維視角的文本表示能有效提升語言模型的複製能力,為位置編碼設計提供了新方向。

Sources