Live APort Vault: 4.371 Angriffe gegen simulierte Zahlungsagenten – 0 nicht erlaubte Transfers mit OAP

GAVEL: Graph-Weltmodell prüft LLM-Roboterpläne vor der Ausführung

Auf BEHAVIOR-1K steigen die Erfolgsraten mit Qwen3-8B von 41,2 auf 91,8 Prozent (Single-Task) und von 19,9 auf 92,6 Prozent (Multi-Task).

· Veröffentlicht: 21.09.2026 ·1 Min Lesezeit
GAVEL: Graph-Weltmodell prüft LLM-Roboterpläne vor der AusführungMit KI erstellt
◆ Fakten auf einen Blick
  • GAVEL ist ein Framework zur Verifikation und Reparatur von LLM-Langzeitplanung, aufgebaut um ein explizites Graph-Weltmodell.
  • Das Graph-Weltmodell repräsentiert relevante Objektrelationen, Aktionsvoraussetzungen und -effekte sowie probabilistische Überzeugungen über unbeobachtete Objektpositionen.
  • GAVEL kann die Konsequenzen LLM-generierter Aktionen vor der Ausführung vorhersagen, Verstöße erkennen und solche Fehler reparieren, deren Korrekturen direkt aus dem Weltmodell folgen.
  • LLM-Replanung wird ausschließlich für Fehler reserviert, die semantisches Denken erfordern.
  • Bei Multi-Task-Anweisungen nutzt GAVEL Verteilungen möglicher Objektpositionen, um verbleibende Teilaufgaben umzuordnen und die erwarteten Suchkosten zu minimieren.
  • GAVEL wurde auf BEHAVIOR-1K mit 100 einzelnen Langzeitaufgaben und 500 Multi-Task-Anweisungen evaluiert.

GAVEL: Graph-Weltmodell als Prüfinstanz für LLM-Roboterpläne

GAVEL ist ein neues Framework zur Verifikation und Reparatur von Langzeitplänen, die große Sprachmodelle (LLMs) für Roboteraufgaben erzeugen. LLMs bieten eine flexible Schnittstelle für solche Planungen, doch generierte Pläne verletzen oft Embodiment-Beschränkungen, erholen sich schlecht von Planungsfehlern oder berücksichtigen Teilbeobachtbarkeit unzureichend. GAVEL setzt dagegen ein explizites Graph-Weltmodell als Prüfinstanz ein. Dieses Modell repräsentiert relevante Objektrelationen, Aktionsvoraussetzungen und -effekte sowie probabilistische Überzeugungen über unbeobachtete Objektpositionen. Vor der Ausführung sagt es die Konsequenzen LLM-generierter Aktionen vorher, erkennt Verstöße und repariert Fehler, deren Korrekturen direkt aus dem Weltmodell folgen. Eine erneute LLM-Planung wird ausschließlich für Fehler reserviert, die semantisches Denken erfordern. Dadurch werden einfache Korrekturen deterministisch aus dem Weltmodell abgeleitet, statt jedes Mal das LLM erneut aufzurufen. Bei Multi-Task-Anweisungen nutzt GAVEL Verteilungen möglicher Objektpositionen, um verbleibende Teilaufgaben umzuordnen und die erwarteten Suchkosten zu minimieren. Das Graph-Weltmodell dient so als Harness, das die LLM-Planung umgibt und absichert. Der Name GAVEL wird auch für andere Systeme verwendet; hier ist das Framework für Roboterplanung gemeint.

BEHAVIOR-1K: Erfolgsraten steigen auf über 90 Prozent

Die Evaluation erfolgte auf BEHAVIOR-1K mit 100 einzelnen Langzeitaufgaben und 500 Multi-Task-Anweisungen. Mit dem Sprachmodell Qwen3-8B verbessert GAVEL die Single-Task-Erfolgsrate von 41,2 Prozent auf 91,8 Prozent und die Multi-Task-Erfolgsrate von 19,9 Prozent auf 92,6 Prozent. Das verteilungsbasierte Belief-Reasoning reduziert die Reisedistanz um etwa 5,4 Prozent im Vergleich zu einer statischen Variante. Nach Angaben der Entwickler zeigt dies, dass ein explizites Graph-Weltmodell-Harness die Zuverlässigkeit und Effizienz von Langzeit-Embodied-Planung erheblich verbessern kann. Die Steigerungen betreffen sowohl einzelne Langzeitaufgaben als auch komplexe Multi-Task-Anweisungen und deuten auf eine deutlich robustere Planung hin.

A
Andreas Rüdiger
Herausgeber & Redaktionsleitung · KI-Modelle, Technik & Business

Andreas Rüdiger ist Gründer der Agentur INREMA und verantwortet KI Spotlight redaktionell. Sein Schwerpunkt liegt auf KI-Modellen, Recheninfrastruktur, technischen Entwicklungen und der wirtschaftlichen Einordnung. Er sorgt dafür, dass komplexe KI-Themen verständlich und nachvollziehbar aufbereitet werden. Mehr zu ihm auf inrema.de und andiger.de.

Ähnliche Artikel