World Embedding Benchmark prüft physikalische Genauigkeit von Video-Embeddings
Das World Embedding Benchmark ist ein neues Benchmark zur Bewertung, wie Video-Repräsentationen physikalische Informationen kodieren. Es umfasst 8.000 kontrollierte Simulationsfälle aus 80 Familien und definiert drei Aufgaben: Text-Video-Retrieval, Regression physikalischer Eigenschaften und Multipl
Mit KI erstellt◆ Fakten auf einen Blick
- Das World Embedding Benchmark umfasst 8.000 kontrollierte Simulationsfälle aus 80 Familien.
- Die Familien decken die Bereiche Fluidmechanik, Festkörpermechanik, Dynamik sowie Optik & Elektromagnetismus ab.
- Jeder Fall kombiniert ein gerendertes Video mit simulationsabgeleiteten physikalischen Annotationen.
- Das Benchmark unterstützt drei Aufgaben: Text-Video-Retrieval, Regression physikalischer Eigenschaften und Multiple-Choice-Klassifikation von Video-Beschreibungs-Paaren.
- Vortrainierte omnimodale Embedding-Modelle zeigen schwaches Retrieval und nahezu zufällige Klassifikation innerhalb der Familie.
- Leichtgewichtige Probes können nützliche physikalische Informationen aus eingefrorenen Video-Embeddings wiederherstellen.
Neues Benchmark mit 8.000 Simulationsfällen und drei Aufgaben
Ein neu vorgestelltes Benchmark namens World Embedding Benchmark soll messen, wie gut Video-Repräsentationen physikalische Informationen kodieren. Physikalische Genauigkeit gewinnt in Weltmodellen und Videogenerierung zunehmend an Bedeutung, doch wie Video-Embeddings solche Informationen abbilden, ist bislang wenig verstanden. Das Benchmark umfasst 8.000 kontrollierte Simulationsfälle aus 80 Familien, die Fluidmechanik, Festkörpermechanik, Dynamik sowie Optik und Elektromagnetismus abdecken. Jeder Fall kombiniert ein gerendertes Video mit physikalischen Annotationen, die direkt aus der Simulation abgeleitet sind. Definierte Aufgaben sind Text-Video-Retrieval, die Regression physikalischer Eigenschaften und eine Multiple-Choice-Klassifikation von Video-Beschreibungs-Paaren. Diese drei Aufgaben sollen zwischen cross-modaler physikalischer Ausrichtung und der Wiederherstellbarkeit quantitativer physikalischer Informationen unterscheiden. Die kontrollierten Fälle erlauben eine präzise Bewertung, weil die zugrunde liegenden physikalischen Größen bekannt sind.
Erste Ergebnisse zeigen Schwächen omnimodaler Modelle und einen Trade-off
Erste Auswertungen zeigen deutliche Schwächen vortrainierter omnimodaler Embedding-Modelle: Beim Text-Video-Retrieval schneiden sie schwach ab, und bei der Klassifikation innerhalb einer Familie liegen sie nahezu auf Zufallsniveau. Die schwache Retrieval-Leistung und die fast zufällige Klassifikation deuten darauf hin, dass die Embeddings zwar physikalische Informationen enthalten, diese aber nicht in einer für Textabfragen oder Paarvergleiche direkt nutzbaren Form repräsentiert sind – vermutlich, weil das Vortraining nicht auf physikalische Semantik oder quantitative Größen fokussiert war. Leichtgewichtige Probes, die auf eingefrorenen Video-Embeddings aufsetzen, können dagegen nützliche physikalische Informationen wiederherstellen – ein Hinweis darauf, dass die Informationen latent vorhanden, aber nicht direkt abrufbar sind. Kontinuierliches kontrastives Training mit physikspezifischen Video-Text-Paaren verbessert Retrieval und Paarklassifikation, verschlechtert jedoch die Regression physikalischer Eigenschaften. Das kontrastive Training priorisiert die relative Ähnlichkeit zwischen Video und Text, wodurch die Embeddings stärker auf diskrete Paarzuordnungen ausgerichtet werden und absolute, kontinuierliche Größen wie physikalische Eigenschaften in den Hintergrund treten. Dieser bislang nicht dokumentierte Trade-off zeigt, dass eine bessere cross-modale Ausrichtung nicht automatisch zu einer besseren quantitativen Wiederherstellbarkeit führt. Zusätzlich wurden die Embeddings genutzt, um Referenzvideos für Retrieval-Augmented Generation mit MiniMax-H3 abzurufen. Die abgerufenen Referenzen verbessern die physikalische Genauigkeit generierter Videos, wobei stärkere Retrieval-Modelle größere Verbesserungen erzielen. Die Ergebnisse unterstreichen die Notwendigkeit, physikalische Fidelity in Video-Embeddings gezielt zu evaluieren.



