OmniVBench: Neuer Benchmark für Omni-Reference-to-Video-Generierung
Ein neues Benchmark-Dataset namens OmniVBench für omni Reference-to-Video Generation wurde veröffentlicht. Es umfasst 7 Task-Familien, 18 feingranulare Tasks und 12.172 Checklisten-Items sowie ein zugehöriges Trainingsdataset (Omni-R2V Dataset).
Mit KI erstellt◆ Fakten auf einen Blick
- OmniVBench umfasst 7 Task-Familien und 18 feingranulare Tasks.
- OmniVBench enthält 12.172 fallspezifische Checklisten-Items für die Evaluation.
- OmniVBench deckt die Bereiche content, motion, style, structure, narrative und multi-reference settings ab.
- Zusätzlich wird ein Omni-R2V Dataset für Trainingszwecke bereitgestellt.
OmniVBench: 7 Task-Familien, 18 Tasks, 12.172 Checklisten-Items
Ein neues Benchmark-Dataset für die sogenannte Omni-Reference-to-Video-Generierung (R2V) ist veröffentlicht worden. OmniVBench umfasst sieben Task-Familien und 18 feingranulare Tasks. Für die Evaluation stehen 12.172 fallspezifische Checklisten-Items bereit. Diese Items ermöglichen eine feinkörnige, faktorbasierte Bewertung: Statt nur die ganzheitliche Referenzkonsistenz zu messen, prüfen sie gezielt, ob intendierte Referenzfaktoren korrekt erhalten, entflochten und an ihre Ziele gebunden sowie gemäß der Instruktion umgesetzt werden. Dadurch wird sichtbar, welche spezifischen Aspekte eines Modells versagen – etwa ob eine Stilvorgabe korrekt auf ein Objekt übertragen wird oder ob eine Bewegungsanweisung sauber von anderen Faktoren getrennt bleibt. Der Benchmark deckt die Bereiche Content, Motion, Style, Structure, Narrative und Multi-Reference-Settings ab. Diese sechs Bereiche sind zentral, weil sie unterschiedliche Dimensionen der Referenzkontrolle abbilden: von visuellen Inhalten über Bewegungsabläufe und Stilvorgaben bis hin zu strukturellen, narrativen und kombinierten Mehrfachreferenzen. Nur so lässt sich die zunehmend allgemeine und vielseitige Referenzsteuerung moderner R2V-Modelle umfassend bewerten.
Autoren: OmniVBench erweitert R2V-Evaluation und liefert Trainingsdaten
Nach Angaben der Autoren erweitert OmniVBench die R2V-Evaluation im Vergleich zu bestehenden Benchmarks auf breitere Referenztypen, feingranularere Kontrollaufgaben und reichere Referenzkompositionen. Konkret umfassen die breiteren Referenztypen die sechs Bereiche Content, Motion, Style, Structure, Narrative und Multi-Reference-Settings, die über die begrenzten Typen bestehender Benchmarks hinausgehen. Die feingranulareren Kontrollaufgaben werden durch die 18 feingranularen Tasks ermöglicht, die eine detailliertere Steuerung erlauben als grobe Aufgaben in bisherigen Benchmarks. Die reicheren Referenzkompositionen beziehen sich auf Multi-Reference-Settings, bei denen mehrere Referenzen gleichzeitig kontrolliert werden müssen. Diese Erweiterungen sind relevant, weil bestehende Benchmarks laut den Autoren nur begrenzte Referenztypen und -kompositionen abdecken und vor allem die ganzheitliche Referenzkonsistenz bewerten, ohne zu prüfen, ob einzelne Referenzfaktoren korrekt erhalten, entflochten und geroutet werden. OmniVBench schließt diese Lücke durch die faktorbasierte Evaluation mit Checklisten-Items. Zusätzlich stellen die Autoren ein Omni-R2V Dataset für Trainingszwecke bereit, das nach Autorenangabe industrietaugliche Trainingsressourcen für diverse R2V-Aufgaben bietet. Diese Aussagen zur Erweiterung und zur industriellen Tauglichkeit sind als Autorenangaben zu werten und nicht unabhängig verifiziert.



