Live TokenRouter: Neues Serving-System für Token-Level-Routing über mehrere LLMs
↘

DreamTrue senkt Interaktionsdefektrate auf AgiBot von 48 auf 6 Prozent

Ein multi-view Robot World Model erreicht nach Angaben der Entwickler eine deutliche Reduktion der Interaktionsdefektrate auf dem AgiBot-Benchmark.

· Veröffentlicht: 11.10.2026 ·2 Min Lesezeit
DreamTrue senkt Interaktionsdefektrate auf AgiBot von 48 auf 6 ProzentMit KI erstellt
Inhalt
◆ Fakten auf einen Blick
  • DreamTrue ist ein multi-view, cross-embodiment robot world model für action-faithful und physikalisch plausible Videovorhersage.
  • Das Training auf bestehenden Roboterdatensätzen stößt auf zwei Hindernisse: ungenaue Kalibrierung beeinträchtigt das Action Following, und die begrenzte Abdeckung erfolgloser Interaktionen verzerrt Vorhersagen in Richtung erfolgreicher Ergebnisse.
  • Zur Verbesserung des Action Following werden Aktions-Trajektorien in Image-Space-Conditions gerendert und eine offline geometrische Kalibrierung eingeführt, um diese Conditions mit den Zielvideos auszurichten.
  • Zur Erweiterung der Interaktionsabdeckung wird Counterfactual Post-Training eingesetzt, das aufgezeichnete Aktions-Trajektorien modifiziert und Zukunftsvideos unter einer breiteren Palette von Aktionen und Kontaktkonfigurationen generiert.
  • Es wird ein menschlich annotierter Videodatensatz mit Robot-, Objekt- und Interaktionsdefekten erstellt und ein embodied video reward model trainiert; dessen Scores steuern das Reinforcement-Learning-Post-Training in Richtung physikalisch plausiblerer Interaktionsergebnisse.
  • Auf AgiBot reduziert DreamTrue die menschlich bewertete Interaktionsdefektrate von 48,12 % auf 6,25 %.

DreamTrue senkt Interaktionsdefektrate auf AgiBot von 48 auf 6 Prozent

DreamTrue ist laut den Autoren ein multi-view, cross-embodiment Robot World Model für action-faithful und physikalisch plausible Videovorhersage. Auf dem AgiBot-Benchmark senkt das Modell nach Herstellerangaben die menschlich bewertete Interaktionsdefektrate von 48,12 Prozent auf 6,25 Prozent. Damit belegt DreamTrue nach Angaben der Entwickler den ersten Platz im World-Model-Track der AgiBot World Challenge 2026. Die Autoren geben an, dass das Modell state-of-the-art Action Following erreicht. Sie identifizieren zwei Hindernisse beim Training auf bestehenden Roboterdatensätzen: ungenaue Kalibrierung beeinträchtigt das Action Following, und die begrenzte Abdeckung erfolgloser Interaktionen verzerrt Vorhersagen in Richtung erfolgreicher Ergebnisse. DreamTrue adressiert beide Probleme nach Darstellung der Autoren durch eine Kombination aus offline geometrischer Kalibrierung, Counterfactual Post-Training und einem menschlich annotierten embodied video reward model.

Drei Bausteine: Kalibrierung, Counterfactual Post-Training und Reward Model

Für die Verbesserung des Action Following rendert DreamTrue laut den Autoren Aktions-Trajektorien in Image-Space-Conditions und führt eine offline geometrische Kalibrierung ein, um diese Conditions mit den Zielvideos auszurichten. Das Counterfactual Post-Training modifiziert nach Angaben der Entwickler aufgezeichnete Aktions-Trajektorien und generiert Zukunftsvideos unter einer breiteren Palette von Aktionen und Kontaktkonfigurationen. Da für Vorhersagen keine gepaarten Ground-Truth-Zukünfte vorliegen, wird laut den Autoren ein menschlich annotierter Videodatensatz mit Robot-, Objekt- und Interaktionsdefekten erstellt und ein embodied video reward model trainiert; dessen Scores steuern das Reinforcement-Learning-Post-Training in Richtung physikalisch plausiblerer Interaktionsergebnisse. Diese drei Bausteine adressieren nach Darstellung der Autoren gezielt die beiden identifizierten Hindernisse.

Weitere Kennzahlen und veröffentlichte Daten

Ein Bericht von aiweekly nennt weitere Kennzahlen: Die Objektdefektrate sinkt von 31,88 Prozent auf 3,12 Prozent. Der nDTW liegt bei 0,8772, unter counterfactual actions bei 0,8831. Die Bewertung erfolgte durch drei unabhängige Annotatoren auf 960 Videos mit einem Fleiss' κ von 0,7817. Die Autoren veröffentlichen laut dem Bericht Kalibrierungsdaten für 153.666 Episoden (1.660 Stunden) und einen Reward-Model-Korpus von 44,9K annotierten Videos mit 30,4K Defektlabels. Als Entwickler werden das Institute of Automation der Chinese Academy of Sciences (CASIA) und Amap, Alibaba Group genannt.

A
Andreas Rüdiger
Herausgeber & Redaktionsleitung · KI-Modelle, Technik & Business

Andreas Rüdiger ist Gründer der Agentur INREMA und verantwortet KI Spotlight redaktionell. Sein Schwerpunkt liegt auf KI-Modellen, Recheninfrastruktur, technischen Entwicklungen und der wirtschaftlichen Einordnung. Er sorgt dafür, dass komplexe KI-Themen verständlich und nachvollziehbar aufbereitet werden. Mehr zu ihm auf inrema.de und andiger.de.

Ähnliche Artikel