Neues Post-Training kombiniert Präferenz- und Rubrik-Belohnungen für Text-zu-Bild-Modelle
Forscher schlagen eine einfache Kompositionsstrategie vor, um heterogene Belohnungssignale auszubalancieren und die Modellqualität zu verbessern.
Mit KI erstellt◆ Fakten auf einen Blick
- Das Paper beschreibt ein Post-Training-Verfahren für Text-zu-Bild-Modelle, das eine Präferenz-Belohnung (trainiert auf großen menschlichen Präferenzdaten mit Bradley-Terry-Objektiv) und rubrikbasierte Belohnungen (explizite Bewertung von Prompt-Treue und anderen Eigenschaften, Schutz vor Reward Hacking) kombiniert.
- Eine naive gewichtete Mittelung der heterogenen Belohnungssignale führt zu suboptimalem Optimierungsverhalten; die Autoren schlagen eine einfache Kompositionsstrategie vor, die Präferenzoptimierung und Rubrik-Erfüllung besser ausbalanciert.
- Im Arena-Text-zu-Bild-Leaderboard erreicht das RL-trainierte Flux2dev eine Elo-Bewertung 69 Punkte über dem Basismodell.
- Das post-trainierte Ideogram-4 übertrifft jedes Open-Source-Modell im Arena-Leaderboard und erreicht einen Elo von 1223,5.
- Die State-of-the-Art-Behauptung basiert auf dem Arena-Leaderboard-Snapshot vom 4. September 2026.
Neues Post-Training kombiniert Präferenz- und Rubrik-Belohnungen
Ein neues Post-Training-Verfahren für Text-zu-Bild-Modelle kombiniert zwei komplementäre Belohnungssignale. Die Präferenz-Belohnung wird auf großen menschlichen Präferenzdaten mit einem Bradley-Terry-Objektiv trainiert und erfasst laut den Autoren ästhetische und wahrnehmungsbezogene Urteile. Rubrikbasierte Belohnungen bewerten explizit Prompt-Treue und weitere gewünschte Eigenschaften und bieten zugleich Schutz vor Reward Hacking, also der Ausnutzung von Belohnungsfunktionen durch das Modell. Hintergrund ist, dass kein einzelnes Belohnungssignal das gesamte Spektrum menschlicher Präferenzen abdeckt.
Eine zentrale Herausforderung besteht darin, diese heterogenen Signale zu kombinieren. Die Autoren zeigen, dass eine naive gewichtete Mittelung zu suboptimalem Optimierungsverhalten führt. Eine naive gewichtete Mittelung kann suboptimal sein, weil die Belohnungen unterschiedliche Skalen und Verteilungen aufweisen; eine feste Gewichtung kann dazu führen, dass das Modell eine Komponente überoptimiert und die andere vernachlässigt oder die Belohnungsfunktion ausnutzt. Stattdessen schlagen sie eine einfache Kompositionsstrategie vor, die Präferenzoptimierung und Rubrik-Erfüllung besser ausbalanciert. Konkret bedeutet das: Die Strategie gewichtet die beiden Belohnungsarten nicht starr, sondern so, dass weder die ästhetische Präferenz noch die explizite Prompt-Treue einseitig dominiert. Dadurch soll das Modell sowohl menschlich ansprechende Bilder erzeugen als auch die Vorgaben des Prompts zuverlässig erfüllen, ohne die Belohnungsfunktion auszunutzen. Details zur genauen mathematischen Umsetzung nennt der Abstract nicht; die Autoren beschreiben das Verfahren lediglich als „einfaches und effektives Post-Training-Rezept“.
Elo-Sprung: Flux2dev und Ideogram-4 übertreffen Open-Source-Konkurrenz
Laut dem Abstract erreicht das RL-trainierte Flux2dev im Arena-Text-zu-Bild-Leaderboard eine Elo-Bewertung, die 69 Punkte über dem Basismodell liegt. Das Basismodell ist hier die nicht RL-trainierte Ausgangsversion von Flux2dev; die Differenz von 69 Elo-Punkten quantifiziert also den Leistungszuwachs durch das beschriebene Post-Training. Im Elo-System, das relative Spielstärken abbildet, ist ein solcher Abstand ein deutlicher Sprung: Er bedeutet, dass das trainierte Modell in direkten Vergleichen konsistent besser abschneidet als seine Basisversion.
Das post-trainierte Ideogram-4 erreicht einen Elo von 1223,5 und übertrifft damit nach dem Snapshot vom 4. September 2026 jedes Open-Source-Modell im Arena-Leaderboard. Der Wert von 1223,5 ist als Spitzenwert im Open-Source-Bereich zu lesen: Kein anderes öffentlich zugängliches Modell erreicht in diesem Snapshot eine höhere Punktzahl. Die Autoren betonen, dass sich die Angabe zum Stand der Technik auf diesen Leaderboard-Snapshot bezieht. Die Zahlen sind dem Abstract entnommen und nicht unabhängig verifiziert.


