Rufus-Air: Offenes Post-Training-Rezept für GLM-4.5-Air-Base veröffentlicht
Acht Stufen von SFT bis RLHF dokumentiert – mit Fokus auf Reproduzierbarkeit und Verbesserung gegenüber dem offiziellen Release
Mit KI erstelltInhalt
◆ Fakten auf einen Blick
- Rufus-Air ist ein offenes und reproduzierbares Post-Training-Rezept auf Basis von GLM-4.5-Air-Base (106B-A12B).
- Das Rezept besteht aus einer seriellen Pipeline von acht Stufen: SFT, Reasoning RL, Coding RL, Instruction-Following RL, General Agent, Coding Agent, Search Agent und RLHF.
- Das Rezept dokumentiert Daten, Reward-Design, Infrastruktur, Stufen-Reihenfolge und stufenweise Ergebnisse, die zur Reproduktion benötigt werden.
- Die Stufen schreiten von grundlegenden zu fortgeschrittenen Fähigkeiten und von harten, verifizierbaren Rewards zu weicheren, judge-basierten Signalen fort.
- Das Training nutzt Open-Source-Komponenten und öffentliche Daten, größtenteils unverändert, ohne neue menschliche Annotationen oder einen internen Distillations-Lehrer.
- Zentrale Erkenntnisse des Rezepts: Vielfältiges, hochwertiges SFT schafft eine starke Fähigkeitsbasis; Schwierigkeits-Filter halten RL-Prompts im produktiven Lernbereich; Reward-Zuverlässigkeit liefert ein praktisches Prinzip für die Stufen-Reihenfolge; Infrastruktur- und Engineering-Entscheidungen sind Teil des Rezepts.
Rufus-Air: Offenes Post-Training-Rezept für GLM-4.5-Air-Base veröffentlicht
Rufus-Air ist ein offenes und reproduzierbares Post-Training-Rezept auf Basis von GLM-4.5-Air-Base (106B-A12B). Im Mittelpunkt steht nicht das fertige Modell, sondern der Trainingsprozess selbst: Die Autoren dokumentieren Daten, Reward-Design, Infrastruktur, die Reihenfolge der Stufen sowie stufenweise Ergebnisse, die für eine Reproduktion erforderlich sind. Dieser Fokus ist entscheidend, weil erst die vollständige Dokumentation des Ablaufs es anderen ermöglicht, die Entscheidungen nachzuvollziehen, das Rezept zu reproduzieren und für eigene Zwecke anzupassen – ein reines Modell-Release würde nur das Ergebnis liefern, nicht aber das Wissen, wie man dorthin gelangt. Laut dem veröffentlichten Rezept verbessert sich Rufus-Air gegenüber dem offiziellen GLM-4.5-Air-Post-Training-Release und ist konkurrenzfähig mit ähnlich großen offenen Modellen.
Acht Stufen von SFT bis RLHF mit dokumentierten Ergebnissen
Das Rezept besteht aus einer seriellen Pipeline von acht Stufen: SFT, Reasoning RL, Coding RL, Instruction-Following RL, General Agent, Coding Agent, Search Agent und RLHF. Die Stufen schreiten von grundlegenden zu fortgeschrittenen Fähigkeiten fort und wechseln von harten, verifizierbaren Rewards zu weicheren, judge-basierten Signalen. Diese Reihenfolge ist bewusst gewählt: Grundlegende Fähigkeiten wie Instruktionsbefolgung und logisches Denken müssen zuerst stabilisiert werden, bevor komplexe Agenten- und Suchaufgaben angegangen werden können. Ebenso liefern harte, verifizierbare Rewards in frühen Stufen ein zuverlässiges Lernsignal, während weichere, judge-basierte Bewertungen erst dann sinnvoll sind, wenn das Modell bereits eine solide Basis besitzt und subjektivere Qualitätsurteile verarbeiten kann – dies spiegelt das Prinzip der Reward-Zuverlässigkeit wider, das als praktische Richtschnur für die Stufen-Reihenfolge dient. Das Training nutzt Open-Source-Komponenten und öffentliche Daten, größtenteils unverändert, ohne neue menschliche Annotationen oder einen internen Distillations-Lehrer. Als zentrale Erkenntnisse nennt das Rezept: Vielfältiges, hochwertiges SFT schafft eine starke Fähigkeitsbasis; Schwierigkeits-Filter halten RL-Prompts im produktiven Lernbereich; Reward-Zuverlässigkeit liefert ein praktisches Prinzip für die Stufen-Reihenfolge; Infrastruktur- und Engineering-Entscheidungen sind Teil des Rezepts, nicht nur Implementierungsdetails.
Basis: GLM-4.5-Air mit 106B Parametern unter MIT-Lizenz
Das zugrunde liegende Modell GLM-4.5-Air hat 106 Milliarden Gesamtparameter und 12 Milliarden aktive Parameter. Es ist ein hybrides Reasoning-Modell mit Denk- und Nicht-Denk-Modus. GLM-4.5-Air ist unter der MIT-Lizenz veröffentlicht und darf kommerziell genutzt werden. In einer umfassenden Evaluation über 12 industrieübliche Benchmarks erreicht das Modell einen Score von 59,8.



