Live Copilot Cowork: Microsofts Agent wird weltweit verfügbar – und ab Juli kostenpflichtig

WorldCrafter: Kameraabfragbarer 3D-Speicher für Video-Weltmodelle gesichtet

Posenbedingte Kompression und regularisierte Selbstverbesserung im Kontext rekursiver Meta-Intelligenz

· Veröffentlicht: 22.09.2026 ·5 Min Lesezeit
WorldCrafter: Kameraabfragbarer 3D-Speicher für Video-Weltmodelle gesichtetMit KI erstellt
Inhalt
◆ Fakten auf einen Blick
  • WorldCrafter ist ein Video-Weltmodell, das eine kameraabfragbare implizite 3D-bewusste Speicherfunktion lernt.
  • Die angeforderte Kamerapose bestimmt, wie Multi-View-Evidenz in das begrenzte Token-Budget des Video-Generators komprimiert wird.
  • Ein Speicher-Encoder und ein posenbedingtes Auslesemodul integrieren historische Beobachtungen in eine feste Menge zielansichtsspezifischer Tokens vor dem Denoising, ohne explizite tiefenbasierte Korrespondenzen.
  • WorldCrafter ermöglicht streamingfähige Szenenexploration aus einem einzelnen Eingabebild oder Text-Prompt.
  • Die Autoren berichten von substantiellen Verbesserungen bei Langzeit-Konsistenz und Kamera-Steuerungsgenauigkeit, während die visuelle Qualität bei minutenlanger Exploration erhalten bleibt.
  • RRSI integriert Regularisierungsprinzipien in die Selbstverbesserung von Agenten-Harnessen, indem es die Kandidatenvorschläge und -auswahl bei der Evolution einschränkt.

WorldCrafter: Kameraabfragbarer 3D-Speicher für Video-Weltmodelle

Video-Weltmodelle sollen interaktive Erkundungen dynamischer Umgebungen ermöglichen, scheitern jedoch häufig daran, frühere Beobachtungen über lange Zeithorizonte und wechselnde Blickwinkel hinweg zu berücksichtigen. Genau hier setzt WorldCrafter an: Das neu gesichtete Video-Weltmodell lernt eine kameraabfragbare implizite 3D-bewusste Speicherfunktion. Anders als bei bisherigen Ansätzen wird die angeforderte Kamerapose zum steuernden Element: Sie bestimmt, wie Multi-View-Evidenz in das begrenzte Token-Budget des Video-Generators komprimiert wird. Die Sichtung erfolgt im Umfeld eines Papiers zu RRSI, betrifft jedoch ein separates Modell. Die Autoren beschreiben WorldCrafter als Video-Weltmodell, das gemeinsam mit dem Video-Generator trainiert wird; ein Speicher-Encoder und ein posenbedingtes Auslesemodul integrieren historische Beobachtungen in eine feste Menge zielansichtsspezifischer Tokens. Damit soll das Modell auch bei minutenlanger Exploration konsistent bleiben. Der kameraabfragbare Speicher erlaubt es, bei jeder neuen Ansicht nur die für die angeforderte Perspektive relevanten historischen Beobachtungen zu aktivieren, statt den gesamten Szenenverlauf erneut verarbeiten zu müssen. Dies ist der zentrale Unterschied zu früheren Weltmodellen, die entweder nur einen kurzen zeitlichen Kontext nutzen oder explizite 3D-Rekonstruktionen benötigen.

Posenbedingte Kompression: Wie die Kamerapose das Token-Budget steuert

Der zentrale Mechanismus ist die posenbedingte Kompression. Die angeforderte Kamerapose legt fest, welche Ausschnitte der gesammelten Multi-View-Evidenz in das Token-Budget des Video-Generators übernommen werden. Ein Speicher-Encoder verarbeitet die historischen Beobachtungen und überführt sie in eine latente Repräsentation, die alle bisherigen Ansichten verdichtet. Das posenbedingte Auslesemodul fragt diese Repräsentation anschließend ab – konditioniert auf die aktuelle Kamerapose – und wählt daraus eine feste Menge zielansichtsspezifischer Tokens aus. Diese Tokens werden vor dem Denoising in den Generierungsprozess eingespeist. Entscheidend ist, dass keine expliziten tiefenbasierten Korrespondenzen zwischen Ansichten hergestellt werden. Stattdessen lernt das Modell die Zuordnung implizit über die Kamerapose: Die Pose wirkt wie ein Schlüssel, der bestimmt, welche Teile des Speichers für die angefragte Perspektive relevant sind. Dadurch wird die begrenzte Token-Kapazität nicht mit irrelevanten Ansichten belastet, sondern gezielt auf die angefragte Perspektive ausgerichtet. Die Autoren trainieren Speicher-Encoder und Auslesemodul gemeinsam mit dem Video-Generator, sodass die Kompression auf die nachgelagerte Videogenerierung abgestimmt ist und die ausgewählten Tokens optimal zur Rekonstruktion der Zielansicht beitragen. Diese gemeinsame Optimierung stellt sicher, dass die Kompression nicht als verlustbehafteter Zwischenschritt, sondern als integraler Bestandteil des Generierungsprozesses wirkt.

Streaming-Exploration und berichtete Verbesserungen

WorldCrafter ermöglicht nach Angaben der Autoren eine streamingfähige Szenenexploration aus einem einzelnen Eingabebild oder einem Text-Prompt. Die Kombination aus dem 3D-bewussten Speicher, jüngerem zeitlichem Kontext und Few-Step-Destillation erlaubt es, Szenen schrittweise zu erkunden: Der Speicher liefert langfristige Konsistenz über viele Zeitschritte, der jüngere zeitliche Kontext erfasst kurzfristige Dynamiken, und die Few-Step-Destillation reduziert die Anzahl der Denoising-Schritte pro Generierung, sodass neue Ansichten in Echtzeit oder nahezu in Echtzeit erzeugt werden können. Die Architektur erklärt die berichteten Verbesserungen unmittelbar: Da die posenbedingte Kompression bei jeder neuen Ansicht nur die relevanten historischen Beobachtungen in das Token-Budget lädt, bleibt die Langzeit-Konsistenz über hunderte von Zeitschritten erhalten, ohne dass der Generator mit irrelevanten Informationen überladen wird. Gleichzeitig sorgt die explizite Konditionierung auf die Kamerapose dafür, dass die Kamera-Steuerung präzise auf die angeforderte Pose abgestimmt ist – Abweichungen zwischen gewünschter und generierter Ansicht werden minimiert. Die Few-Step-Destillation wiederum reduziert die Latenz, sodass die Exploration streamingfähig wird, ohne die visuelle Qualität zu beeinträchtigen, da der Speicher die notwendige Information liefert, die bei weniger Denoising-Schritten sonst verloren ginge. In Experimenten mit statischen und dynamischen Szenen berichten die Autoren von substantiellen Verbesserungen bei der Langzeit-Konsistenz und der Genauigkeit der Kamera-Steuerung. Die visuelle Qualität bleibt dabei nach ihren Angaben auch bei minutenlanger Exploration erhalten. Konkrete Messwerte werden in der gesichteten Quelle nicht ausgewiesen; die Ergebnisse sind Herstellerangaben und noch nicht unabhängig verifiziert.

RRSI: Der regularisierte Rahmen für Selbstverbesserung

Parallel zur WorldCrafter-Sichtung wird mit RRSI ein Rahmen für die regularisierte rekursive Selbstverbesserung von Agenten-Harnessen beschrieben. Der Ansatz überträgt Regularisierungsprinzipien auf die Selbstverbesserung: Kandidatenvorschläge und -auswahl werden bei der Evolution eingeschränkt, um Überanpassung an Trainingsaufgaben zu verhindern. Der Proposer arbeitet mit einem zeitlich geglühten Budget, das die Anzahl der in einem Kandidaten gebündelten Änderungen begrenzt; zugleich fördert er unerforschte Trajektorien auf Basis der Evolutionshistorie. Das bedeutet: In frühen Evolutionsrunden darf der Proposer umfangreichere Änderungspakete vorschlagen, mit fortschreitender Zeit wird das Budget enger, sodass nur noch fokussierte, gezielte Anpassungen möglich sind. Der Selektor ist mit einem Kritiker und einem Pruner ausgestattet: Der Kritiker filtert benchmarkspezifische Vorschläge heraus, die nur auf den Trainingsaufgaben gut abschneiden, aber nicht generalisieren. Der Pruner entfernt Änderungen, die zu klein, zu teuer oder nicht mehr nützlich sind. Gemeinsam begünstigen diese Einschränkungen wiederverwendbare Agentenmechanismen gegenüber benchmarkspezifischen Anpassungen oder gar Rauschen. Über acht Benchmarks aus Coding, agentischen Arbeitsbereichen und Engineering-Design-Aufgaben erzielt RRSI nach Angaben der Autoren bis zu 14,1 Punkte auf dem Split, gegen den es evolviert. Auf fünf Out-of-Distribution-Benchmarks werden bis zu 4,7 Punkte erreicht, bei 30 Prozent weniger Policy-Tokens als die unregularisierte Evolution.

Von rekursiver Meta-Intelligenz zur regularisierten Evolution

Die Sichtung von WorldCrafter fällt in eine Forschungslinie, die unter dem Begriff Recursive Meta-Intelligence diskutiert wird. Der frühere Artikel „KI baut sich ihre eigene Simulations-Toolbox: Buehler demonstriert Recursive Meta-Intelligence“ beschreibt, wie ein System seine eigenen Werkzeuge und Simulationsumgebungen konstruiert, um sich selbst zu verbessern – ein Beispiel für rekursive Meta-Intelligenz, bei der die Verbesserungsmaschinerie selbst Gegenstand der Verbesserung wird. RRSI übernimmt dieses Konzept der rekursiven Selbstverbesserung und erweitert es um Regularisierung: Wo die ursprüngliche rekursive Meta-Intelligenz vor allem die Fähigkeit betont, eigene Werkzeuge zu bauen, adressiert RRSI das Problem der Überanpassung, indem es die Evolutionskandidaten und deren Auswahl einschränkt. Die Ergebnisse von RRSI – bis zu 14,1 Punkte auf Evolutions-Benchmarks und 4,7 Punkte auf Out-of-Distribution-Benchmarks – zeigen, dass regularisierte Selbstverbesserung nicht nur in-distribution, sondern auch auf ungesehenen Aufgaben generalisiert. WorldCrafter wiederum liefert einen komplementären Baustein: Ein Video-Weltmodell mit kameraabfragbarem 3D-Speicher stellt die konsistente Umgebungsrepräsentation bereit, die selbstverbessernde Agenten benötigen, um langfristige Interaktionen zu planen und zu verifizieren. Die konzeptionelle Überschneidung liegt in der strukturierten Nutzung vergangener Informationen: WorldCrafter komprimiert historische Beobachtungen posenbedingt, um nur relevante Evidenz in das begrenzte Token-Budget zu übernehmen; RRSI regularisiert die Evolution von Agenten-Harnessen, um nur wiederverwendbare Mechanismen zu behalten. Beide Ansätze zielen darauf ab, Überanpassung bzw. Inkonsistenz zu vermeiden und die Generalisierung über Zeit und Kontext hinweg zu verbessern. Eine direkte technische Integration beider Ansätze ist in den gesichteten Quellen nicht beschrieben, doch liefert WorldCrafter einen Baustein für konsistente Umgebungsmodelle, die selbstverbessernde Agenten künftig nutzen könnten.

A
Andreas Rüdiger
Herausgeber & Redaktionsleitung · KI-Modelle, Technik & Business

Andreas Rüdiger ist Gründer der Agentur INREMA und verantwortet KI Spotlight redaktionell. Sein Schwerpunkt liegt auf KI-Modellen, Recheninfrastruktur, technischen Entwicklungen und der wirtschaftlichen Einordnung. Er sorgt dafür, dass komplexe KI-Themen verständlich und nachvollziehbar aufbereitet werden. Mehr zu ihm auf inrema.de und andiger.de.

Ähnliche Artikel