Pivot-SD:只監督「關鍵承諾」,遮罩擴散語言模型的高效自蒸餾後訓練
遮罩擴散語言模型(dLM)以並行去噪取代逐詞生成,但後訓練面臨一個特殊的信用分配難題:去噪過程中少數幾次「承諾」會大幅降低其餘遮罩位置的不確定性,並決定整段回答的走向。現有方法多在最終文本或整個去噪步驟上打分,沒有利用這一訊號。Pivot-SD 用資訊增益挑出這些高影響力的「樞紐」詞元:成功軌跡的樞紐用交叉熵強化,失敗軌跡的樞紐用定向 unlikelihood 壓低,其餘部分不動。僅用 200 道題、每題 4 次取樣,LLaDA-8B-Instruct 在數學與程式碼基準上超過了全序列 SFT 與預算匹配的擴散 RL 基線。
遮罩擴散語言模型(masked diffusion language model,簡稱 dLM)近兩年成為自迴歸大模型之外最受關注的路線。它不再一個詞接一個詞地寫,而是從一整段被遮罩占滿的序列出發,每一輪並行預測多個位置,再把其中一部分「承諾」為確定的詞元,剩下的位置繼續去噪。LLaDA 是這條路線上最有代表性的開源模型之一。並行生成帶來了吞吐與雙向上下文的潛力,也讓它在複雜推理上顯得有希望。但是,怎樣對這類模型做後訓練,業界還沒有成熟答案。arXiv 2610.03665 的 Pivot-SD 針對的正是這個缺口。 【問題:擴散解碼裡的信用分配】 論文的出發點是一個觀察:在去噪過程中,少數幾次承諾會讓其餘遮罩位置的不確定性大幅下降,並塑造回應的大部分內容。舉例來說,數學題裡模型先確定了一個關鍵中間量,或者程式碼題裡先確定了函式的整體結構,之後的大量位置幾乎只是順著這些決定把細節填滿。這些高影響力的承諾,論文稱為「樞紐」(pivot)。而現有的後訓練配方基本沒有利用這一點:監督微調通常在最終文本的每個詞元上平均用力,強化學習類方法則把獎勵分配給整個去噪步驟,甚至整條軌跡。兩種做法都無法回答一個更細的問題:到底是哪幾個詞元的決定,導致了這次回答的成敗?
這就是擴散模型裡的信用分配難題。自迴歸模型的信用沿時間軸鋪開,每一步的責任大致均勻。擴散模型的承諾順序不固定,一次承諾會改變後續所有位置的條件分佈,因此責任高度集中。用全序列損失去訓練,等於把大量梯度花在那些本來就已經確定、對結果影響很小的詞元上,同時稀釋了真正關鍵的訊號。 【方法:用資訊增益選出樞紐,再區別對待】 Pivot-SD 是一個離線的自蒸餾框架,核心有三步。第一步,讓模型對每道題做若干次取樣,論文使用每題四次,並用答案對錯把軌跡標記為成功或失敗。第二步,對軌跡裡每一次承諾計算資訊增益:衡量這次承諾之後,剩餘遮罩位置的不確定性降低了多少。直觀地說,若承諾前模型對剩餘位置的預測分佈很分散,承諾後變得集中,這個詞元的資訊增益就大,它就是樞紐。具體的數學形式以論文為準,常見的寫法是用剩餘遮罩位置預測分佈的熵之差來度量。第三步,只在樞紐上訓練:成功軌跡的樞紐用交叉熵損失強化,失敗軌跡的樞紐用定向的 unlikelihood 損失壓低,軌跡的其餘部分不參與訓練。
這裡有兩個設計值得注意。其一,失敗軌跡並沒有被整體丟棄或整體懲罰。一條錯誤的解答裡,絕大多數詞元其實是正確的、與錯誤無關的。把它們一併壓低,會引入雜訊並損傷已有能力。只懲罰樞紐,意味著只對「導致錯誤的那一兩次承諾」追責。其二,這是自蒸餾:訓練資料來自模型自己的取樣,不需要更強的教師模型,也不需要人工標註的推理過程,只需要一個能判斷答案對錯的驗證器,這在數學和程式碼任務裡很容易取得。 【實驗結果與成本】 按摘要的說法,Pivot-SD 只用 200 道題、每題四次取樣,就讓 LLaDA-8B-Instruct 在數學與程式碼基準上超過了全序列 SFT,也超過了預算匹配的擴散 RL 基線。需要說明的是,摘要沒有給出具體分數和基準名稱,漲幅的大小需要讀者查閱論文的表格,本文不對數字做推測。但結論的方向很清楚:在同等取樣與訓練預算下,把監督集中在少數關鍵位置,比把監督鋪滿全序列更划算。
成本方面有幾點可以推斷。訓練資料規模極小,意味著取樣與驗證的開銷很低;離線方式不需要像線上 RL 那樣在訓練迴圈裡反覆生成,因而工程上更簡單、更穩定。另一方面,資訊增益需要在去噪軌跡上額外評估模型的預測分佈,這是一筆額外的前向計算,實際負擔取決於實作方式,團隊應在自己的流水線裡測量。 【對開發者與企業的意義】 對想要給開源 dLM 做領域適配的團隊,這篇論文給出一條低門檻的路徑:準備幾百道帶自動判分的題目,取樣、判分、挑出樞紐、做輕量微調。它特別適合數學、程式碼、結構化推理這類答案可以自動驗證的場景。對研究者而言,「按承諾的影響力來分配監督」這一思路還可能延伸到別的方向,例如更好的解碼排程、對承諾順序的學習,或者把樞紐作為可解釋性工具,觀察模型在哪些位置真正做出了決定。
【局限與未來】 首先,證據範圍有限:摘要裡的評測以 LLaDA-8B-Instruct 為主,是否適用於其他擴散模型、更大參數量,或沒有自動判分器的開放式寫作任務,還不清楚。其次,樞紐的定義依賴資訊增益這一度量,度量本身對不同解碼策略、遮罩比例是否穩健,需要更多消融。第三,失敗軌跡上的 unlikelihood 若力度過大,可能讓模型變得過度保守,這類副作用需要持續監控。最後,這是一篇剛發佈的預印本(v1),尚未經過同行評議,也缺少獨立複現。 總的來說,Pivot-SD 的價值在於把擴散解碼的一個結構性事實變成了可操作的訓練訊號。如果後續複現能夠確認它的收益,它會成為 dLM 後訓練工具箱裡一個成本低、思路清晰的元件。