Live Encoder-freie MLLMs holen bei 10^22 FLOPs auf
↘

REALM: Neues Framework für reaktionsfähiges Zuhören in verkörperter KI

Ein grob-zu-fein-Ansatz kombiniert Sprecher-Audio mit der Bewegungshistorie des Zuhörers und erzeugt reaktive Gesichtsmotion.

· Veröffentlicht: 29.09.2026 ·1 Min Lesezeit
REALM: Neues Framework für reaktionsfähiges Zuhören in verkörperter KIMit KI erstellt
Inhalt
◆ Fakten auf einen Blick
  • REALM ist ein Framework für audio-getriebenes reaktives Zuhören (embodied reactive listening).
  • Ein Reactive Gated Speaker-Listener Fusion Modul kombiniert Listener-Bewegungshistorie mit Sprecher-Audio durch einen delay-centered attention prior und adaptives Gating.
  • Ein grober Decoder sagt eine Basisbewegungstrajektorie voraus.
  • Die Basisbewegung wird durch audio-konditionierte stochastische Residuen im Expressions-Unterraum ergänzt, während die groben Pose-Parameter beibehalten werden.
  • Evaluationen auf den Datensätzen ViCo und L2L zeigen Verbesserungen gegenüber den evaluierten Baselines über mehrere Bewegungsqualitätsmetriken.
  • Zusätzliche Analysen untersuchen Delay-Sensitivität, Gate-Verhalten und Blinzel-Dynamik.

REALM erzeugt reaktive Gesichtsmotion aus Sprecher-Audio und Zuhörer-Historie

Mit REALM (Reactive Embodied Audio-driven Listening Model) stellen Forschende ein generatives Framework für audio-getriebenes reaktives Zuhören in verkörperter Konversations-KI vor. Es adressiert zwei zentrale Herausforderungen: die zeitliche Abstimmung auf Sprecher-Signale bei gleichzeitiger Kontinuität zur laufenden Bewegung des Zuhörers sowie die Erfassung lokal variabler Gesichtsereignisse neben der Gesamttrajektorie. Dazu kombiniert REALM die Bewegungshistorie des Zuhörers mit dem Sprecher-Audio. Reaktionen können zeitlich verzögert auf vorausgehende Hinweisreize folgen, während kurze Ausdrücke und Blinzeln schwer deterministisch vorhersagbar sind. Das Framework zielt darauf ab, diese Dynamik durch eine Kombination aus historienbewusster zeitlicher Ausrichtung und stochastischer Expressionsverfeinerung abzubilden.

Grob-zu-fein: Basisbewegung plus stochastische Residuen im Expressions-Unterraum

REALM verfolgt einen grob-zu-fein-Ansatz. Ein Reactive Gated Speaker-Listener Fusion Modul kombiniert die Bewegungshistorie des Zuhörers mit dem Sprecher-Audio über einen delay-centered attention prior und adaptives Gating. Ein grober Decoder sagt daraufhin eine Basisbewegungstrajektorie voraus. Diese wird durch audio-konditionierte stochastische Residuen im Expressions-Unterraum ergänzt, während die groben Pose-Parameter beibehalten werden. Dadurch lassen sich lokal variable Gesichtsereignisse wie kurze Expressionen oder Blinzeln erzeugen, die deterministisch schwer vorhersagbar sind, ohne die übergeordnete Bewegung zu destabilisieren.

Evaluation auf ViCo und L2L sowie Einsatz auf Ameca-Roboter

In Evaluationen auf den Datensätzen ViCo und L2L zeigt REALM Verbesserungen gegenüber den evaluierten Baselines über mehrere Bewegungsqualitätsmetriken. Zusätzliche Analysen untersuchen die Delay-Sensitivität, das Gate-Verhalten und die Blinzel-Dynamik. Das Framework wurde außerdem auf einem humanoiden Roboter vom Typ Ameca eingesetzt; eine perzeptuelle Nutzerstudie demonstriert die Anwendbarkeit des generativen Ansatzes für verkörperte Konversations-KI.

A
Andreas Rüdiger
Herausgeber & Redaktionsleitung · KI-Modelle, Technik & Business

Andreas Rüdiger ist Gründer der Agentur INREMA und verantwortet KI Spotlight redaktionell. Sein Schwerpunkt liegt auf KI-Modellen, Recheninfrastruktur, technischen Entwicklungen und der wirtschaftlichen Einordnung. Er sorgt dafür, dass komplexe KI-Themen verständlich und nachvollziehbar aufbereitet werden. Mehr zu ihm auf inrema.de und andiger.de.

Ähnliche Artikel