Softmax Reparameterization: Verfahren für Output-Head-Quantisierung beschrieben
Post-Training-Methode wählt funktional äquivalenten Ausgabekopf vor der Quantisierung, um Inferenzkosten bei kleinen Sprachmodellen mit großen Vokabularen zu senken.
Mit KI erstellt◆ Fakten auf einen Blick
- Große Vokabulare machen Ausgabeköpfe zu einem erheblichen Inferenzkostenfaktor in kleinen Sprachmodellen.
- Softmax Reparameterization ist ein Post-Training-Verfahren, das vor der Quantisierung einen funktional äquivalenten Ausgabekopf auswählt.
- Das Verfahren subtrahiert ein skalares Vielfaches des Vokabular-Zeilenmittelwerts von jeder Ausgabezeile und wählt den Koeffizienten per Validierungs-KL getrennt für RTN, aktivierungsgewichteten MSE und full-Hessian GPTQ.
- Die eindimensionale Suche umfasst den ursprünglichen Kopf und feste Mittelwertzentrierung, erhält die Full-Precision-Softmax-Verteilung und lässt den trainierten Decoder unverändert; eine Rang-1-Korrektur behandelt nichtlineare Logit-Pfade wie Soft-Capping.
- Über sieben Köpfe konzentrieren sich W4-Gewinne dort, wo die Basis-Quantisierung Vorhersagen stark verzerrt: Bei Phi-4-mini fällt AW-MSE KL von 0,936 auf 0,256.
- Die Gewinne überstehen stärkere GPTQ-Kalibrierung und bleiben komplementär zu exakter Per-Channel-Skalierung und affiner Quantisierung.
Neues Verfahren für Output-Head-Quantisierung auf Hugging Face gesichtet
Ein auf Hugging Face gesichtetes Abstract beschreibt die Methode Softmax Reparameterization. Es handelt sich um ein Post-Training-Verfahren, das vor der Quantisierung einen funktional äquivalenten Ausgabekopf auswählt, um die Inferenzkosten bei kleinen Sprachmodellen mit großen Vokabularen zu senken. Große Vokabulare machen Ausgabeköpfe zu einem erheblichen Inferenzkostenfaktor, weil der Ausgabekopf für jedes Token im Vokabular einen Logit-Wert berechnen muss. Jeder Logit erfordert eine Multiplikation des verborgenen Zustands mit einer Zeile der Ausgabematrix; bei großen Vokabularen summiert sich dieser Aufwand erheblich und erhöht Rechenzeit sowie Speicherzugriffe. Das Verfahren wählt einen funktional äquivalenten Ausgabekopf, der sich besser für die nachfolgende Quantisierung eignet, ohne das Modell neu zu trainieren. Die Autoren beschreiben, dass die Wahl eines funktional äquivalenten Ausgabekopfs die Inferenzkosten senken kann, ohne die Modellarchitektur oder die trainierten Gewichte des Decoders zu verändern. Das Verfahren zielt darauf ab, die Inferenzkosten zu senken, indem es einen Ausgabekopf wählt, der für die Quantisierung optimiert ist.
Technische Umsetzung und erste Ergebnisse der Methode
Technisch subtrahiert das Verfahren ein skalares Vielfaches des Vokabular-Zeilenmittelwerts von jeder Ausgabezeile. Der Koeffizient wird per Validierungs-KL getrennt für RTN, aktivierungsgewichteten MSE und full-Hessian GPTQ gewählt. Die eindimensionale Suche umfasst den ursprünglichen Kopf und feste Mittelwertzentrierung, erhält die Full-Precision-Softmax-Verteilung und lässt den trainierten Decoder unverändert. Eine Rang-1-Korrektur behandelt nichtlineare Logit-Pfade wie Soft-Capping, um die funktionale Äquivalenz des Ausgabekopfs zu erhalten. Über sieben Köpfe konzentrieren sich die W4-Gewinne dort, wo die Basis-Quantisierung Vorhersagen stark verzerrt: Bei Phi-4-mini fällt AW-MSE KL von 0,936 auf 0,256. Die Autoren berichten, dass die Gewinne stärkere GPTQ-Kalibrierung überstehen und komplementär zu exakter Per-Channel-Skalierung und affiner Quantisierung bleiben. Über vier Köpfe und drei W4-Quantisierer übertragen sich eingefrorene, auf WikiText gewählte Koeffizienten auf C4 und OpenWebMath; sie übertreffen Mittelwertzentrierung in allen 18 Vergleichen, in denen der eingefrorene Koeffizient von 1 abweicht, und gleichen sie in den übrigen sechs. Die Autoren berichten, dass sich bei W2, als Kompressions-Stresstest genutzt, die Vorteile über nahezu die gesamte Modell-Quantisierer-Matrix verbreitern. Eine Matched-Residual-Analyse zeigt, dass verbesserte Genauigkeit mit größerem Logit-Rekonstruktionsfehler einhergehen kann.



