GAGAR: Qualitätsbasierte Kreditumverteilung für RL-Code-Agenten
Ein neues Framework verbessert das Reinforcement Learning für Code-Agenten, indem es die Belohnungsverteilung innerhalb von GRPO qualitätsbasiert umverteilt.
Mit KI erstelltInhalt
◆ Fakten auf einen Blick
- GAGAR ist ein Framework für qualitätsbewusste Kreditumverteilung im Reinforcement Learning für Code-Agenten.
- GAGAR baut auf dynamischem Sampling auf, das Gruppen mit sowohl bestandenen als auch nicht bestandenen Trajektorien behält.
- Ein SFT-trainierter agentischer Grader inspiziert gemeinsam alle Trajektorien einer Gruppe und ordnet die testbestandenen Kandidaten.
- Basierend auf dem Ranking werden niedriger eingestufte Trajektorien abgewertet und die Vorteile aller testbestandenen Trajektorien proportional neu skaliert, um die ursprüngliche Summe wiederherzustellen.
- GAGAR wurde mit Pre-RL-SFT-Checkpoints von MiMo-V2.6-Flash (310B Parameter) und MiMo-V2.6-Pro (1,02T Parameter) evaluiert.
- Kontrollierte reine Code-Flash-Experimente zeigen verbesserte Code-Agenten-Leistung und reduzierte Trajektorien (Abstract abgeschnitten).
GAGAR: Qualitätsbasierte Kreditumverteilung für RL-Code-Agenten
Reinforcement Learning für Code-Agenten setzt häufig auf ausführbare Tests, die binäre Belohnungen liefern. Group Relative Policy Optimization (GRPO) weist dabei allen testbestandenen Trajektorien innerhalb einer Gruppe identische Vorteile zu – unabhängig davon, ob eine Implementierung sauber und zielgerichtet ist oder unnötige Änderungen enthält. Das neue Framework GAGAR (in einer Quelle auch als „Gagar“ bezeichnet) soll dieses Defizit beheben: Es verteilt den Lernkredit innerhalb von GRPO qualitätsbasiert um. Statt gleicher Vorteile für alle bestandenen Lösungen bewertet ein trainierter Grader die Qualität der Implementierungen und verschiebt den Kredit zu den saubereren, zielgerichteten Varianten. GAGAR ist damit ein Framework für qualitätsbewusste Kreditumverteilung im Reinforcement Learning für Code-Agenten. Es baut auf dynamischem Sampling auf, das Gruppen mit sowohl bestandenen als auch nicht bestandenen Trajektorien beibehält, um einen Lernsignal-Unterschied zwischen guten und schlechten Lösungen zu erzeugen.
So funktioniert GAGAR: Dynamisches Sampling und agentischer Grader
Der Mechanismus von GAGAR läuft in mehreren Schritten ab. Zunächst sorgt dynamisches Sampling dafür, dass Rollout-Gruppen sowohl bestandene als auch nicht bestandene Trajektorien enthalten. Anschließend werden alle Trajektorien einer Gruppe in einem gemeinsamen Arbeitsbereich platziert. Ein mit Supervised Fine-Tuning (SFT) trainierter agentischer Grader inspiziert die Trajektorien gemeinsam und ordnet die testbestandenen Kandidaten nach Qualität. Basierend auf diesem Ranking werden niedriger eingestufte Trajektorien abgewertet. Um die ursprüngliche Summe der Vorteile zu erhalten, werden die Vorteile aller testbestandenen Trajektorien proportional neu skaliert. Diese summen-erhaltende Umverteilung behält die relativen Gewichte bei, die durch die qualitätsbasierte Abwertung entstanden sind, verschiebt aber den Lernkredit hin zu höherwertigen Implementierungen. Dadurch erhält die Policy ein Signal, das saubere, zielgerichtete Änderungen gegenüber solchen mit unnötigen oder nicht zum Auftrag gehörenden Modifikationen bevorzugt.
Erste Evaluierung mit MiMo-Modellen zeigt verbesserte Leistung
Die Autoren evaluieren GAGAR nach eigenen Angaben im industriellen Maßstab. Als Ausgangspunkt dienen Pre-RL-SFT-Checkpoints der Modelle MiMo-V2.6-Flash (310 Milliarden Parameter) und MiMo-V2.6-Pro (1,02 Billionen Parameter). In kontrollierten Experimenten, die ausschließlich Code-Aufgaben umfassten, zeigte das Flash-Modell eine verbesserte Leistung als Code-Agent sowie eine reduzierte Anzahl von Trajektorien. Die verfügbare Quelle – der Abstract des Papers – enthält jedoch keine quantitativen Ergebnisse, Messmethoden oder eine detaillierte Analyse dieser Verbesserungen. Der Text endet an dieser Stelle abgeschnitten, sodass konkrete Zahlen, Benchmarks oder Effektgrößen nicht vorliegen. Die Aussage stützt sich allein auf die qualitative Beschreibung im Abstract; eine unabhängige Überprüfung der Leistungssteigerung ist auf dieser Basis nicht möglich.



