Mask Forcing: Neue Methode gegen Mode Collapse bei Video-Diffusionsmodellen
Dual-Noise Masking Rollout stört den Selbst-Rollout des AR-Schülers, um die Modenvielfalt zu erhöhen
Mit KI erstellt◆ Fakten auf einen Blick
- Mask Forcing ist eine Strategie zur Verbesserung der Destillation autoregressiver Video-Diffusionsmodelle.
- Es verwendet eine Dual-Noise Masking Rollout-Strategie, die den Selbst-Rollout des AR-Schülers stört, um Mode Collapse zu mildern.
- Die Kernidee ist, sauberere Signale über zufällige Masken entlang räumlicher und zeitlicher Achsen in verrauschte Rollout-Eingaben zu injizieren.
- Bestehende Methoden destillieren vortrainierte bidirektionale Video-Diffusionsmodelle in kausale AR-Schüler mittels Distribution Matching Distillation (DMD), aber die generierten Videos leiden oft unter Über-Sättigung und Über-Glättung.
- Der Hauptfaktor ist das mode-seeking Verhalten des reverse KL Ziels in DMD, das die Schülerverteilung auf wenige Moden der Lehrerverteilung kollabieren lässt.
- Mask Forcing verbessert die visuelle Qualität ohne zusätzliche Trainingsdaten.
Dual-Noise Masking Rollout injiziert saubere Signale in verrauschte Rollout-Eingaben
Mask Forcing setzt auf eine Dual-Noise Masking Rollout-Strategie, die den Selbst-Rollout des autoregressiven Schülers gezielt stört. Bei der Destillation autoregressiver Video-Diffusionsmodelle neigt der Schüler dazu, nur bereits gelernte Moden der Lehrerverteilung zu reproduzieren, was die Vielfalt der generierten Videos einschränkt. Während der Destillation werden daher zufällige Masken entlang räumlicher und zeitlicher Achsen angewendet, um sauberere Signale in die verrauschten Rollout-Eingaben zu injizieren. Konkret werden dabei einige der verrauschten Tokens durch weniger verrauschte oder sauberere Versionen ersetzt. Dadurch verändert sich die Eingabeverteilung des Schülers: Er sieht nicht mehr nur seine eigenen typischen, stark verrauschten Ausgaben, sondern auch Referenztokens mit geringerem Rauschanteil. Diese veränderten Eingaben zwingen den Schüler, von seinen gewohnten Denoising-Pfaden abzuweichen, da die sauberen Tokens als Denoising-Leitfaden für die übrigen verrauschten Tokens wirken. Sie geben vor, in welche Richtung die verrauschten Tokens entrauscht werden sollten, und erweitern so die bedingte Verteilung des Schülers. Der Schüler muss lernen, auch auf Eingaben zu reagieren, die außerhalb seiner bisherigen Selbst-Rollout-Trajektorien liegen. Dies führt zu einer breiteren Exploration der Lehrerverteilung und reduziert die Konzentration auf wenige Moden. Dadurch kann die Distribution Matching Distillation (DMD) Lernsignale liefern, die über die vom Schüler bereits abgedeckten Moden hinausgehen. Der Ansatz verbessert die Qualität der generierten Videos, ohne dass zusätzliche Trainingsdaten benötigt werden.
Mode Collapse durch reverse KL in DMD wird ausgeglichen
Bestehende Verfahren destillieren vortrainierte bidirektionale Video-Diffusionsmodelle mithilfe von Distribution Matching Distillation (DMD) in kausale autoregressive Schüler. Diese Destillation ist ein vielversprechender Ansatz für Echtzeit-Videogenerierung, leidet jedoch unter Qualitätsproblemen. Die so erzeugten Videos leiden häufig unter Über-Sättigung und Über-Glättung, was die visuelle Qualität und den Realismus einschränkt. Als Hauptursache identifizieren die Autoren das mode-seeking Verhalten des reverse KL Ziels in DMD. Dieses Ziel führt dazu, dass die Schülerverteilung auf nur wenige Moden der Lehrerverteilung kollabiert. Das bedeutet, dass der Schüler nur einen kleinen Teil der möglichen Ausgaben des Lehrers abdeckt. Mask Forcing soll diesen Mode Collapse ausgleichen, indem es die durch das reverse KL induzierte Modensuche abmildert. Die Dual-Noise Masking Rollout-Strategie stört den Selbst-Rollout so, dass der Schüler mehr Regionen der Lehrerverteilung erkundet. Durch die injizierten sauberen Signale wird der Schüler aus seiner Komfortzone gelockt und gezwungen, vielfältigere Ausgaben zu erzeugen. Dadurch kann DMD Lernsignale liefern, die über die bereits abgedeckten Moden hinausgehen. Nach Angaben der Autoren verbessert Mask Forcing die visuelle Qualität, ohne dass zusätzliche Trainingsdaten erforderlich sind. Damit adressiert die Methode die bekannten Qualitätsprobleme der DMD-Destillation.



