UniEvo-VL: Selbstlernendes Framework für multimodale Modelle ohne externen Lehrer
Autoren beschreiben On-policy-Self-Distillation und berichten Ergebnisse für Qwen-image-2512
Mit KI erstelltInhalt
◆ Fakten auf einen Blick
- UniEvo-VL ist ein Self-Evolving-Framework für multimodale Modelle, das aus konstruktivem Selbstkorrektur-Feedback während des Test-Computes lernt.
- UniEvo-VL nutzt keinen separaten, oft größeren Lehrer, sondern Selbstkritiken als privilegierte Information; ein einzelnes multimodales Modell agiert als Lehrer und Schüler mit unterschiedlichen Kontexten.
- Der Schüler sieht nur die ursprüngliche Frage, der Lehrer konditioniert auf die privilegierte Kritik.
- Das Training minimiert die Divergenz zwischen den Denoising-Diffusionsverteilungen pro Zustand über die eigenen Sampling-Trajektorien des Schülers.
- UniEvo-VL baut auf dem Open-Source-Modell Qwen-image-2512 auf und erzielt einen Anstieg von 0,747 auf 0,808 bei GenEval sowie von 32,97 auf 35,53 bei GenEval2 Soft-TIFA.
- Versuche mit leistungsfähigeren externen Kritikern (z. B. GPT5.6-Luna) deuten darauf hin, dass multimodale Modelle mit starken Judge-Fähigkeiten eine höhere Self-Evolving-Obergrenze erwarten lassen.
UniEvo-VL: Selbstlernendes Framework ohne externen Lehrer
UniEvo-VL ist ein von den Autoren vorgestelltes Self-Evolving-Framework für multimodale Modelle. Es soll aus konstruktivem Selbstkorrektur-Feedback während des Test-Computes lernen. Die Autoren beschreiben es als On-policy-Self-Distillation-Trainingsrezept, das ohne einen separaten, oft größeren Lehrer auskommt. Stattdessen nutzt das Verfahren Selbstkritiken als privilegierte Information: Ein einzelnes multimodales Modell agiert zugleich als Lehrer und Schüler, jedoch mit unterschiedlichen Kontexten. Hintergrund ist die vereinheitlichte Architektur moderner multimodaler Modelle, die Generierung und Verständnis in einem System bündeln und dadurch eigenes Feedback erzeugen und daraus lernen können. Selbstkritiken gelten als privilegiert, weil sie fehlerkorrigierende Signale enthalten, die dem Modell während der normalen Generierung nicht zugänglich sind – sie entstehen erst durch die Reflexion über die eigene Ausgabe. Dadurch kann das Modell ohne externen Lehrer lernen: Es erzeugt seine eigenen Korrekturen und nutzt diese als Trainingssignal, um künftige Fehler zu vermeiden. [Herstellerangabe]
So funktioniert die Self-Distillation
Im Kern des Trainings steht eine asymmetrische Rollenverteilung: Der Schüler sieht ausschließlich die ursprüngliche Frage, während der Lehrer auf die privilegierte Kritik konditioniert wird. Diese Kritik stammt aus der Selbstkorrektur des Modells und enthält Informationen, die dem Schüler während der Generierung nicht zur Verfügung stehen. Das Training minimiert dann die Divergenz zwischen den Denoising-Diffusionsverteilungen pro Zustand – und zwar über die eigenen Sampling-Trajektorien des Schülers. Anders als bei klassischer Knowledge Distillation, bei der ein stationärer Lehrer statische Ziele vorgibt, folgt UniEvo-VL damit einem On-policy-Ansatz: Der Schüler generiert selbst Trajektorien, und der Lehrer liefert entlang genau dieser Pfade Korrektursignale. Die Minimierung der per-Zustands-Divergenz zwischen Lehrer- und Schüler-Diffusionsverteilungen soll das Modell verbessern, weil sie die Wahrscheinlichkeitsverteilungen angleicht und so Sampling-Fehler reduziert. Dadurch soll das Modell lernen, seine eigenen Fehler während des Generierungsprozesses zu erkennen und zu korrigieren, ohne auf einen externen, oft größeren Lehrer angewiesen zu sein. [Herstellerangabe]
Ergebnisse bei Qwen-image-2512
Die Autoren haben UniEvo-VL auf dem Open-Source-Modell Qwen-image-2512 aufgebaut und berichten von Zuwächsen bei der Bildgenerierung. Auf dem GenEval-Benchmark steigt der Wert von 0,747 auf 0,808. Bei GenEval2 Soft-TIFA steigt der Wert von 32,97 auf 35,53. Zusätzliche Versuche mit leistungsfähigeren externen Kritikern wie GPT5.6-Luna deuten laut Abstract darauf hin, dass multimodale Modelle mit starken Judge-Fähigkeiten eine höhere Obergrenze für das Self-Evolving erwarten lassen. [Herstellerangabe]



