Live WideSWE: Coding-Agenten scheitern an repository-übergreifenden Aufgaben
↘

Recursive Harness Distillation: Starke Agenten erstellen wiederverwendbare Playbooks für Robotermanipulation

RHD destilliert Interventionserfahrung in ein Playbook und steigert Erfolgsraten real und in SimplerEnv deutlich.

· Veröffentlicht: 29.09.2026 ·2 Min Lesezeit
Recursive Harness Distillation: Starke Agenten erstellen wiederverwendbare Playbooks für RobotermanipulationMit KI erstellt
◆ Fakten auf einen Blick
  • Das Verfahren heißt Recursive Harness Distillation (RHD).
  • Ein starker Agent destilliert seine Erfahrung in ein Playbook für einen leichten Agenten und verfeinert das Playbook dann rekursiv anhand des Ausführungsfeedbacks des leichten Agenten.
  • Das resultierende Playbook ermöglicht es Agenten, gesammeltes Interventionswissen in neuen Aufgabeninstanzen wiederzuverwenden, ohne Modellparameter zu aktualisieren.
  • In realer Robotermanipulation verbessert das Harness die Erfolgsrate von 37,3 % auf 64,0 %.
  • Auf SimplerEnv Bridge erreicht der leichte Agent mit Playbook 66,7 % Erfolg, verglichen mit 41,7 % für die GR00T-only-Baseline.
  • Der leichte Agent mit Playbook übertrifft den starken Agenten ohne Playbook.

Starker Agent destilliert Playbook für leichten Agenten

Ein zentrales Ziel in der Robotik ist die Manipulation über wechselnde Aufgaben und Umgebungen hinweg. Recursive Harness Distillation (RHD) akkumuliert Interventionserfahrung als wiederverwendbare Anleitung über Agenten hinweg. Konkret destilliert ein starker Agent seine Interventionserfahrung in ein Playbook für einen leichten Agenten. Dieses Playbook wird anschließend rekursiv verfeinert, indem das Ausführungsfeedback des leichten Agenten einfließt. Das resultierende Playbook ermöglicht es Agenten, gesammeltes Interventionswissen in neuen Aufgabeninstanzen wiederzuverwenden, ohne Modellparameter zu aktualisieren.

Das Playbook fungiert dabei als expliziter Erfahrungsspeicher: Es ist eine strukturierte Sammlung von Interventionsstrategien, die der starke Agent aus seinen Interaktionen extrahiert und die unabhängig von den Modellgewichten gespeichert wird. Dadurch bleibt das Wissen über einzelne Ausführungen hinweg erhalten – es wird nicht in den Parametern des leichten Agenten verankert, sondern als separates, abrufbares Artefakt geführt. Bei jeder neuen Aufgabeninstanz kann der leichte Agent auf dieses Playbook zugreifen und die darin enthaltenen Regeln anwenden, ohne dass ein erneutes Training oder eine Parameteranpassung nötig ist. Die rekursive Verfeinerung sorgt dafür, dass der Erfahrungsspeicher mit jeder Ausführung präziser wird: Das Feedback des leichten Agenten – etwa Fehlschläge, ineffiziente Schritte oder unerwartete Situationen – fließt zurück und aktualisiert die gespeicherten Interventionsmuster. So entsteht ein sich selbst verbessernder Wissenspool, der die diagnostische Tiefe des starken Agenten mit der praktischen Ausführungserfahrung des leichten Agenten kombiniert. Der leichte Agent profitiert damit von der Problemlösungskompetenz des starken Agenten, ohne dessen Rechenaufwand zu tragen, und kann in neuen Situationen auf bewährte Handlungsstrategien zurückgreifen.

Erfolgsraten steigen real und in SimplerEnv deutlich

Die quantitativen Ergebnisse des Papers (ID 2609.33378) zeigen deutliche Verbesserungen. In realer Robotermanipulation steigt die Erfolgsrate durch das Harness von 37,3 % auf 64,0 %. Auf dem SimplerEnv-Bridge-Benchmark erreicht der leichte Agent mit Playbook 66,7 % Erfolg, verglichen mit 41,7 % für die GR00T-only-Baseline. Damit übertrifft der leichte Agent mit Playbook sogar den starken Agenten ohne Playbook. Dasselbe Playbook nützt auch dem starken Agenten: Mit ihm erreicht dieser 79,2 % Erfolg.

Der Grund für diese Steigerungen liegt in der rekursiven Verfeinerung des Playbooks: Durch das Ausführungsfeedback des leichten Agenten wird das Playbook kontinuierlich an die tatsächlichen Schwierigkeiten angepasst, sodass es gezielt die Interventionsstrategien enthält, die in der Praxis am wirksamsten sind. Zudem stellt das Playbook explizites Interventionswissen bereit, das der Agent bei der Ausführung abrufen kann, um Fehler zu erkennen und sein Verhalten anzupassen. Dadurch wird die Erfolgswahrscheinlichkeit erhöht, ohne dass Modellparameter verändert werden müssen.

Die Ergebnisse belegen laut dem Paper die Machbarkeit der Harness-Destillation für die Robotik: Interventionserfahrung lässt sich akkumulieren, durch Ausführung verfeinern und über Agenten hinweg wiederverwenden, um die Manipulation zu verbessern. Diese Steigerungen unterstreichen, dass das Playbook als wiederverwendbare Wissensquelle sowohl leichten als auch starken Agenten zugutekommt und die Anpassungsfähigkeit an wechselnde Aufgaben erhöht.

A
Andreas Rüdiger
Herausgeber & Redaktionsleitung · KI-Modelle, Technik & Business

Andreas Rüdiger ist Gründer der Agentur INREMA und verantwortet KI Spotlight redaktionell. Sein Schwerpunkt liegt auf KI-Modellen, Recheninfrastruktur, technischen Entwicklungen und der wirtschaftlichen Einordnung. Er sorgt dafür, dass komplexe KI-Themen verständlich und nachvollziehbar aufbereitet werden. Mehr zu ihm auf inrema.de und andiger.de.

Ähnliche Artikel