PlannerForge vereint alle Teststufen und erweitert sie um Enhancement und Benchmarking
Open-Source-20–35B-Modelle erreichen bei den meisten Aufgaben API-Niveau; Paper bei EMNLP 2026 angenommen.
Mit KI erstelltInhalt
◆ Fakten auf einen Blick
- PlannerForge ist ein LLM-Agenten-Framework, das alle Stufen des scenario-basierten Testens für autonomes Fahren vereint.
- PlannerForge erweitert die bestehenden Stufen von Scenario Generation bis ADS Assessment und fügt ADS Enhancement und ADS Benchmarking hinzu.
- PlannerForge wurde mit 10 handelsüblichen LLMs über alle Aufgaben (Generation, Selection, Modification, Module Routing, Planner Testing, Enhancement) unter 5 Prompt-Bedingungen evaluiert.
- Die besten Werte pro Aufgabe liegen zwischen 0.88 und 1.00.
- Open-Source-20–35B-Backends erreichen bei den meisten Aufgaben vergleichbare Leistungen wie kommerzielle APIs; Qwen3.6:35B erreicht bei drei von fünf Aufgaben kommerzielles API-Niveau.
- Die End-to-End-Verkettung der Module behält 83 % (kommerziell) bzw. 78 % (Open Source) der Seed-Queries.
PlannerForge vereint alle Teststufen und erweitert sie um Enhancement und Benchmarking
PlannerForge ist ein LLM-Agenten-Framework, das alle Stufen des scenario-basierten Testens von Bewegungsplanern im autonomen Fahren vereint. Bisher war diese Testpipeline fragmentiert: Szenariogenerierung, -abruf, -modifikation, Ausführung autonomer Fahrsysteme (ADS) und Ergebnisanalyse liefen in getrennten Werkzeugen mit wenig Interaktion. Zuvor deckte keine Arbeit die gesamte scenario-basierte Testpipeline mit einem einheitlichen LLM-Agenten-Framework ab; LLM-Agenten wurden bislang nur für Teilbereiche wie Wahrnehmung, Planung und Steuerung eingesetzt. PlannerForge erweitert die bestehenden Stufen von der Szenariogenerierung bis zur ADS-Bewertung und ergänzt zwei LLM-gestützte Stufen: ADS Enhancement und ADS Benchmarking. Damit schließt das Framework die Lücke zwischen isolierten Werkzeugen und verbessert die Interaktion zwischen den Teststufen.
Open-Source-20–35B-Modelle erreichen bei den meisten Aufgaben API-Niveau
Die Autoren evaluierten PlannerForge mit zehn handelsüblichen LLMs über alle Aufgaben – Generierung, Auswahl, Modifikation, Modul-Routing, Planer-Test und Enhancement – unter fünf Prompt-Bedingungen. Die besten Werte pro Aufgabe liegen zwischen 0,88 und 1,00, was auf eine hohe Aufgabenerfüllung hindeutet. Open-Source-Backends mit 20 bis 35 Milliarden Parametern erreichen bei den meisten Aufgaben vergleichbare Leistungen wie kommerzielle APIs. Das Modell Qwen3.6:35B erreicht bei drei von fünf Aufgaben kommerzielles API-Niveau. Werden die Module Ende-zu-Ende verkettet, bleiben 83 Prozent der Seed-Queries bei kommerziellen Modellen und 78 Prozent bei Open-Source-Modellen erhalten. Die Beibehaltung dieser Anteile zeigt, dass die Pipeline auch im Verbund stabil arbeitet. PlannerForge übertrifft damit Scenario Factory 2.0. Für Anwender bedeutet das, dass sich viele Testschritte ohne proprietäre API-Zugänge umsetzen lassen. Die Ergebnisse legen nahe, dass offene Modelle mit 20 bis 35 Milliarden Parametern eine kostengünstige Alternative zu kommerziellen Diensten sein können. Die Evaluation deckt damit sowohl Einzelaufgaben als auch die Gesamtpipeline ab.
EMNLP-Annahme und Open-Source-Veröffentlichung
Das Paper zu PlannerForge wurde bei der EMNLP 2026 (Main Conference) angenommen. Die Annahme als Main-Conference-Paper unterstreicht die Relevanz des einheitlichen Frameworks. Der Erstautor ist Research Associate und Ph.D.-Kandidat an der Professorship of Autonomous Vehicle Systems der TU München unter Professor Johannes Betz. Die Professur gehört zur School of Engineering and Design der TU München. Code und Daten sind unter https://github.com/TUM-AVS/PlannerForge verfügbar. Damit können andere Forschungsgruppen die Pipeline nachbauen, eigene Szenarien einspeisen und die Leistung ihrer Modelle mit den berichteten Werten vergleichen. Die Ergebnisse sind damit reproduzierbar.



