Runden im Präkonditionierer-Raum: Neuentwurf der 4-Bit-Quantisierung des AdamW-Zustands

Published · AI Daily — AI-assisted deep research, methodology & disclosure

Ein neues Paper fasst die 4-Bit-Quantisierung des AdamW-Zustands als Problem des Rundungsraums auf. ZIP-SR und ZE-EDEN verkleinern die Verlustlücke zu 32-Bit-AdamW um bis zu 70 %, von 130M bis 2,7B Parametern.

AdamW ist der Standardoptimierer im Training großer Modelle, und seine Kosten werden leicht unterschätzt. Neben Gewichten und Gradienten trägt jeder Parameter zwei weitere Zustände, ein erstes und ein zweites Moment. In 32 Bit gespeichert, belegen diese Zustände etwa so viel residenten Speicher wie die Gewichte, oft mehr. Sie auf 4 Bit zu komprimieren, ist einer der direktesten Wege, den Trainingsspeicher zu senken. TorchAO liefert bereits ein 4-Bit-AdamW, doch zu 32-Bit-AdamW bleibt eine messbare Lücke im Validierungsverlust. Das Paper von Hanyang Li und vier Koautoren, am 8. Oktober 2026 auf arXiv cs.LG erschienen, stellt weder Codebuchform noch Blockgröße ein. Es stellt eine grundlegendere Frage: In welchem Koordinatenraum soll ein Quantisierer wählen, wenn er sich zwischen zwei benachbarten Rekonstruktionsstufen entscheidet?

Die Autoren nennen diesen Raum den Rundungsraum. Er ist wichtig, weil der Quantisierungsfehler nicht an Ort und Stelle bleibt. Er pflanzt sich durch die Momentenrekursionen fort und stört jedes spätere adaptive Update. Beim ersten Moment hängt das Update ungefähr linear vom Zustand ab, und Runden im Zustandsraum ist kaum ein Problem. Das zweite Moment ist anders. Adam teilt durch die Quadratwurzel des zweiten Moments, und dieser Kehrwert ist der Präkonditionierer. Das Paper analysiert die an null angrenzende Quantisierungszelle und zeigt, dass ein kleiner mittlerer Fehler im Zustand keinen kleinen mittleren Fehler im Präkonditionierer des nächsten Schritts garantiert. Ein Zustand, der leicht von null abweicht, läuft durch eine steile Kehrwertfunktion, und der Fehler wird auf der Präkonditionierer-Seite vergrößert. Eine eindimensionale quadratische Konstruktion zeigt zudem, dass Runden im Zustandsraum und Runden im Präkonditionierer-Raum qualitativ verschiedene Optimierungsdynamiken erzeugen, nicht bloß andere Zahlen.

Aus diesen Beobachtungen folgt die erste Methode, ZIP-SR, das nullenthaltende stochastische Runden im Präkonditionierer-Raum. Sie behält null im Codebuch des zweiten Moments und berechnet die Wahrscheinlichkeiten des stochastischen Rundens im Präkonditionierer-Raum statt im Zustandsraum. Stochastisches Runden ist im Erwartungswert unverzerrt und macht aus einem deterministischen, systematischen Fehler Rauschen mit Mittelwert null. Die richtige Wahl des Raums legt diese Unverzerrtheit auf die Größe, die die Schrittweite tatsächlich bestimmt. Die zweite Methode, ZE-EDEN, geht einen komplementären Weg. Ihr Codebuch für das zweite Moment schließt null aus, die quantisierten Werte haben also eine positive Untergrenze, und der Kehrwert divergiert nahe null nicht. Diese Untergrenze verzerrt selbst den Präkonditionierer, daher skaliert die Methode jeden quantisierten Block des zweiten Moments mit einer Kalibrierung nach EDEN-Art neu, um die Verzerrung auszugleichen. Beide Konfigurationen nutzen 4-Bit-NormalFloat (NF4) für das erste Moment und wenden in den letzten 10 % des Trainings gezieltes stochastisches Runden auf das erste Moment des LM-Heads an.

Die Experimente umfassen Vortraining im GPT- und Llama-Stil mit Größen von 130M bis 2,7B Parametern. Bei jeder ausgewerteten Größe verkleinern beide Methoden die mittlere Lücke im Validierungsverlust zwischen TorchAOs 4-Bit-AdamW und 32-Bit-AdamW, und die größte berichtete Verringerung erreicht 70 %. Beim überwachten Feintuning aller Parameter erzielen beide Rezepte einen niedrigeren Validierungsverlust als TorchAO und bleiben bei Folgeaufgaben nahe an 32-Bit-AdamW. Die Konsistenz zählt mehr als ein einzelner großer Erfolg. Ein Gewinn, der bei jeder Größe auftritt, deutet auf einen wirksamen Mechanismus hin und nicht auf Glück in einem Lauf.

Unsere Einschätzung: Der Hauptbeitrag ist eine Neuordnung des Entwurfsraums. Frühere Arbeiten konzentrierten sich auf das Codebuch und die Blockzuschnitte. Dieses Paper fügt eine dritte Achse hinzu, den Koordinatenraum, in dem gerundet wird. Diese Sicht lässt sich gut auf andere Optimierer übertragen, die ihren gespeicherten Zustand nichtlinear abbilden. Zurückhaltung bleibt angebracht. Die Zusammenfassung nennt weder eingesparten Speicher noch Durchsatz, das größte Modell hat 2,7B Parameter, und ob die Gewinne bei größerem Maßstab und längerem Training halten, muss eine unabhängige Replikation klären. Für ein Team mit knappem Trainingsspeicher ist der vernünftige Schritt, ZIP-SR und ZE-EDEN als Kandidaten für einen kleinen Test gegen TorchAO im eigenen Maßstab zu behandeln und nicht als direkten Ersatz für ein Produktionsrezept.

Sources

FAQ

Was unterscheidet ZIP-SR von ZE-EDEN?

ZIP-SR behält null im Codebuch des zweiten Moments und berechnet die Wahrscheinlichkeiten des stochastischen Rundens im Präkonditionierer-Raum. ZE-EDEN nutzt ein Codebuch ohne null und skaliert jeden quantisierten Block neu, um die Verzerrung durch die positive Untergrenze auszugleichen. Beide speichern das erste Moment in NF4.

Warum ist der Rundungsraum beim zweiten Moment wichtiger?

Adams Update skaliert mit dem Kehrwert der Wurzel des zweiten Moments. Nahe null ist dieser Kehrwert sehr steil, sodass ein kleiner Zustandsfehler zu einem großen Präkonditionierer-Fehler wird. Die lokale Analyse des Papers zeigt, dass ein kleiner mittlerer Zustandsfehler dies nicht verhindert.

Sind die Ergebnisse produktionsreif?

Noch nicht. Die Zusammenfassung berichtet bis zu 70 % weniger Verlustlücke von 130M bis 2,7B Parametern und besseren Feintuning-Verlust als TorchAO. Zahlen zu Speicher und Durchsatz und größere Maßstäbe fehlen. Testen Sie zuerst im eigenen Maßstab gegen TorchAO.