WanPE: 397-Milliarden-Parameter-Modell für filmische Prompt-Planung
Neues Prompt-Enhancement-Modell trainiert auf 1,05 Millionen realen Videos für Regisseur-Level-Planung in der Text-zu-Video-Generierung.
Mit KI erstellt◆ Fakten auf einen Blick
- WanPE ist ein Prompt-Enhancement-Modell mit 397 Milliarden Parametern.
- WanPE wurde auf 1,05 Millionen realen Videos trainiert.
- WanPE zielt auf filmische Planung auf Regisseurebene (director-level cinematic planning) ab.
- WanPE formuliert Shot-Level-Filmpläne mittels video-grounded reverse construction.
- WanPE verwendet Semantic-Consistency GRPO (SC-GRPO), um Nutzeranforderungen über Shots und Zeit hinweg zu bewahren.
- Für die Bewertung wurde WanPEval erstellt, ein menschlich annotiertes Testbed für Dauern von 5 bis 30 Sekunden mit etwa 11.000 blinden paarweisen Bewertungen.
WanPE: 397-Milliarden-Parameter-Modell für filmische Prompt-Planung
Ein Forschungsteam hat mit WanPE ein Prompt-Enhancement-Modell vorgestellt, das nach eigenen Angaben 397 Milliarden Parameter umfasst. Trainiert wurde es auf 1,05 Millionen realen Videos. Das Ziel: eine filmische Planung auf Regisseurebene für die Text-zu-Video-Generierung. Statt lediglich einzelne Szenen zu beschreiben, soll WanPE detaillierte Shot-Level-Filmpläne formulieren – also festlegen, wie Handlungen, Kamerafahrten, Licht und Ton über mehrere Einstellungen hinweg ablaufen.
Damit adressiert das Modell eine zentrale Schwäche vieler aktueller Systeme: Rohe Nutzer-Prompts liefern oft nur grobe Vorgaben, während die eigentliche filmische Struktur dem Generator überlassen bleibt. Die Folge sind inkonsistente oder dramaturgisch schwache Videos, weil der Generator ohne Regieanweisungen keine kohärente visuelle Erzählung aufbauen kann. WanPE schließt diese Lücke, indem es aus kurzen Eingaben ausgearbeitete, konsistente Drehbücher erzeugt. Der Mechanismus dahinter ist eine video-grounded reverse construction: Das Modell leitet aus realen Videodaten rückwärts filmische Pläne ab und lernt so, wie cinematische Konventionen in der Praxis aussehen. Dieses Wissen überträgt es anschließend auf neue Prompts, um daraus vollständige Shot-Level-Drehbücher zu generieren. Ergänzend sorgt Semantic-Consistency GRPO (SC-GRPO) dafür, dass die ursprünglichen Nutzeranforderungen über alle Shots und die gesamte Zeitachse hinweg erhalten bleiben. Die Entwickler betonen, dass das Training auf realen Videodaten ein tiefes Verständnis für cinematische Konventionen ermöglicht. Konkrete Angaben zur Architektur oder zum Trainingsverfahren über die genannten Eckdaten hinaus macht das Team in der Ankündigung nicht.
Methodik und Benchmark-Ergebnisse: Deutliche Präferenzgewinne mit Wan3.0
Die Kernmethodik von WanPE besteht aus zwei Komponenten: einer video-grounded reverse construction und Semantic-Consistency GRPO (SC-GRPO). Bei der reverse construction wird das Modell nicht vorwärts von einem Prompt zu einem Drehbuch trainiert, sondern rückwärts: Aus realen Videos werden die zugrunde liegenden filmischen Pläne rekonstruiert. Dadurch lernt das Modell, welche Kameraführung, Beleuchtung und Schnittfolge in tatsächlichen Produktionen verwendet werden, und kann dieses Wissen auf neue, kurze Nutzereingaben übertragen. SC-GRPO ergänzt diesen Ansatz, indem es während des Trainings die semantische Konsistenz über Shots und Zeit hinweg sicherstellt: Die Nutzeranforderungen dienen als Referenz, und Abweichungen werden bestraft, sodass das Modell lernt, die ursprüngliche Intention auch in langen, mehrschüssigen Sequenzen nicht zu verlieren.
Für die Bewertung wurde ein eigenes Testbed namens WanPEval erstellt, das Dauern von 5 bis 30 Sekunden abdeckt und auf blinden paarweisen Bewertungen basiert. In Ablationsstudien verglichen die Entwickler die reverse construction mit dem üblichen forward rewriting und maßen die menschliche Präferenz als zentrale Metrik. Das Ergebnis: Reverse construction zeigt eine klare Überlegenheit, weil sie aus realen Videodaten lernt und dadurch realistischere, besser umsetzbare Filmpläne erzeugt als ein reines Vorwärts-Umschreiben von Prompts. SC-GRPO erhält die semantische Treue über verschiedene Modellskalen robust. In Kombination mit dem Video-Generator Wan3.0 verbessert WanPE-397B die menschliche Präferenz gegenüber rohen Nutzer-Prompts um 10,66 bis 18,84 Punkte bei 5 bis 15 Sekunden und um 50,86 Punkte bei 30 Sekunden. Bei 5 bis 15 Sekunden führt das Modell nach Angaben des Teams alle evaluierten kommerziellen Angebote an; bei 30 Sekunden bleibt es konkurrenzfähig mit Seedance 2.5. Wan3.0 dient dabei als Basis-Videogenerator, dessen Ausgabe durch die verbesserten Prompts deutlich aufgewertet wird.



