Disaggregated Quantization: LLM-Inferenz phasenweise optimiert
Getrennte Spezialisierung für Prefill und Decode verbessert Genauigkeit und beschleunigt Prompt-Verarbeitung ohne Mehrkosten
Mit KI erstellt◆ Fakten auf einen Blick
- Disaggregated Quantization spezialisiert Rechenformate, Gewichte und Speicherplatz für die Prefill- und Decode-Phase von LLMs.
- Auf Qwen 3 und Gemma 3 verbessert das Entfernen der Aktivierungsquantisierung speziell im Decode die Genauigkeit bei decode-lastigen Aufgaben, ohne die Inferenzkosten zu erhöhen.
- Das Training separater compute-native Prefill-Gewichte beschleunigt die Prompt-Verarbeitung im Vergleich zu Weight-only-Inferenz und erreicht oder übertrifft deren Genauigkeit bei 2-3-Bit-Decode auf sowohl decode- als auch prefill-lastigen Aufgaben.
- Mit veröffentlichten Qwen3.8-27B GGUF-Decodern verbessert das Training eines NVFP4-Prefillers die 1-Bit-Genauigkeit um 32,5 Punkte auf MMLU-Pro und 35,3 Punkte auf MMMU-Pro, ohne den Decode-Checkpoint zu ändern.
- Offloaded Disaggregated Prefill (ODP) streamt Gewichte von SSD und amortisiert das Laden über die Prompt-Länge; auf dem 27B-Modell liefert ODP einen 1,78x Time-to-First-Token Speedup gegenüber der Weight-only-Baseline bei 8K Prompt-Länge in llama.cpp.
- Die Genauigkeit unter disaggregated Serving in vLLM wurde evaluiert, und Shared-Weight-Format-Disaggregation wurde durch Post-Training-Quantisierung auf Modellen bis zu 2,8T Parametern validiert.
Phasen-spezifische Quantisierung für Prefill und Decode
Forschende haben mit Disaggregated Quantization (DQ) eine Methode vorgestellt, die die beiden Phasen der Inferenz großer Sprachmodelle getrennt behandelt. Anders als bisherige Quantisierungsverfahren, die Prefill und Decode einheitlich quantisieren, spezialisiert DQ die Phasen getrennt. Die Forscher begründen dies mit den unterschiedlichen Anforderungen: Prefill verarbeitet die gesamte Eingabeaufforderung in einem parallelen Durchgang und ist rechenintensiv, weshalb niedrige Rechengenauigkeit die Prompt-Verarbeitung beschleunigt. Decode erzeugt dagegen Token für Token und ist speicherbandbreitenintensiv, weil bei jedem Schritt das gesamte Modell und der wachsende KV-Cache aus dem Speicher gelesen werden; hier sind kompakte Gewichte entscheidend, um den Speicherverkehr zu reduzieren. DQ passt daher Rechenformate, Gewichte und Speicherplatz jeweils an die Phase an.
Konkret wird die Aktivierungsquantisierung im Decode entfernt. Das verbessert nach Angaben der Forscher die Genauigkeit bei decode-lastigen Aufgaben auf Qwen 3 und Gemma 3, ohne die Inferenzkosten zu erhöhen. Der Grund: Aktivierungsquantisierung führt zu Quantisierungsfehlern in kritischen Aktivierungen, die während der autoregressiven Decodierung akkumulieren und die Ausgabequalität verschlechtern können. Da der Decode ohnehin durch die Speicherbandbreite limitiert ist und die Aktivierungsquantisierung dort keinen Geschwindigkeitsvorteil bringt, kann sie ohne Leistungseinbußen weggelassen werden – die Genauigkeit steigt, während die Kosten gleich bleiben.
Zusätzlich werden separate compute-native Prefill-Gewichte trainiert. Diese beschleunigen die Prompt-Verarbeitung gegenüber reiner Weight-only-Inferenz und erreichen oder übertreffen bei 2–3-Bit-Decode die Genauigkeit der Weight-only-Methode – sowohl bei decode- als auch bei prefill-lastigen Aufgaben. Der Mechanismus: Die Gewichte werden speziell für die rechenintensive Prefill-Phase optimiert, sodass sie die dort auftretenden Berechnungsmuster besser abbilden und Quantisierungsfehler in dieser Phase minimieren. Dadurch wird die Genauigkeit des Gesamtsystems erhöht, ohne den bereits optimierten Decode-Checkpoint zu verändern.
Konkrete Ergebnisse: 1,78x Speedup und Genauigkeitsgewinne
Die Forscher berichten konkrete Ergebnisse auf Qwen 3 und Gemma 3. Das Entfernen der Aktivierungsquantisierung im Decode verbessert die Genauigkeit bei decode-lastigen Aufgaben, weil die oben beschriebenen Quantisierungsfehler in den Aktivierungen vermieden werden. Mit veröffentlichten Qwen3.8-27B GGUF-Decodern verbessert das Training eines NVFP4-Prefillers die 1-Bit-Genauigkeit um 32,5 Punkte auf MMLU-Pro und um 35,3 Punkte auf MMMU-Pro, ohne den Decode-Checkpoint zu ändern. Dieser große Genauigkeitssprung entsteht, weil der separate Prefill-Checkpoint seine Gewichte gezielt an die Anforderungen der Prefill-Phase anpasst: Die Gewichte werden so trainiert, dass sie die niedrige 1-Bit-Quantisierung im Prefill besser kompensieren, was die Fehleranfälligkeit drastisch reduziert. Der bereits veröffentlichte Decoder bleibt unverändert, nur ein zusätzlicher, spezialisierter Prefill-Checkpoint wird ergänzt.
Um diesen zusätzlichen Checkpoint auf einem einzelnen Gerät unterzubringen, streamt Offloaded Disaggregated Prefill (ODP) die Gewichte von einer SSD und amortisiert das Laden über die Prompt-Länge. Auf demselben 27B-Modell liefert ODP einen 1,78-fachen Speedup der Time-to-First-Token gegenüber der Weight-only-Baseline bei einer Prompt-Länge von 8K Token in llama.cpp. Der Speedup resultiert aus der Verteilung der Ladezeit: Statt alle Prefill-Gewichte vor Beginn der Verarbeitung vollständig von der SSD zu laden, werden sie während der Prompt-Verarbeitung nach und nach gestreamt. Dadurch überlappt die I/O-Latenz der SSD mit der parallelen Berechnung des Prefills, die initiale Wartezeit sinkt, und das erste Token wird deutlich schneller erzeugt. Darüber hinaus wurde die Genauigkeit unter disaggregated Serving in vLLM evaluiert und die Shared-Weight-Format-Disaggregation durch Post-Training-Quantisierung auf Modellen bis zu 2,8 Billionen Parametern validiert, was die Skalierbarkeit des Ansatzes belegt.



