Live SageMaker AI führt Multi-Turn Reinforcement Learning für agentische Modellanpassung ein
↘

DMM: Dezentrales Multi-Agenten-Pfadfinding mit iterativer Intent-Verfeinerung

Ein neues System ersetzt einmaliges Action-Sampling durch diskrete, iterative Verfeinerung von Aktionsabsichten über Kommunikationsrunden – inspiriert von Denoising in Diffusionsmodellen.

· Veröffentlicht: 02.10.2026 ·2 Min Lesezeit
DMM: Dezentrales Multi-Agenten-Pfadfinding mit iterativer Intent-VerfeinerungMit KI erstellt
Inhalt
◆ Fakten auf einen Blick
  • Der Titel des Papers lautet 'Decentralized Master-Mind: Joint Action Refinement through Iterative Intent Denoising in Multi-Agent Pathfinding'.
  • Das System wird als DMM (Decentralized Master-Mind) bezeichnet.
  • DMM adressiert dezentrales Multi-Agent Path Finding (MAPF) mit Kommunikation unter partieller Beobachtbarkeit.
  • DMM ersetzt einmaliges Action-Sampling durch diskrete, iterative Verfeinerung von Action-Intents über Kommunikationsrunden, inspiriert von Denoising in Diffusionsmodellen.
  • Agenten initialisieren zufällige Action-Intents und verfeinern sie durch lokale Kommunikation, bevor sie sich auf Aktionen festlegen.
  • DMM wird mit Imitation Learning auf Experten-MAPF-Lösungen vortrainiert und anschließend mit MICPO weiter optimiert, einer critic-freien group-relative Reinforcement-Learning-Methode für Multi-Agenten, Multi-Runden Action-Refinement.

Neues System DMM verfeinert Aktionsabsichten iterativ statt einmalig zu sampeln

Das System DMM (Decentralized Master-Mind) adressiert dezentrales Multi-Agent Path Finding (MAPF) mit Kommunikation unter partieller Beobachtbarkeit. Bisherige lernbasierte Ansätze sampeln einmalig Aktionen aus per-Agent-Verteilungen. Das kann scheitern, wenn mehrere koordinierte gemeinsame Aktionen im selben Kontext gültig sind: Unabhängiges Sampling rekombiniert lokal gültige Entscheidungen zu inkompatiblen gemeinsamen Aktionen. DMM ersetzt dieses einmalige Action-Sampling durch eine diskrete, iterative Verfeinerung von Action-Intents über mehrere Kommunikationsrunden. Der Ansatz ist inspiriert vom Denoising in Diffusionsmodellen. Die Agenten initialisieren zufällige Action-Intents und verfeinern sie durch lokale Kommunikation, bevor sie sich auf konkrete Aktionen festlegen. Dadurch werden ihre Entscheidungen gekoppelt, noch bevor eine Festlegung erfolgt – Kollisionen sollen so vermieden werden.

Vortraining mit Imitation Learning und Feinabstimmung mit critic-freiem MICPO

Für das Training kombiniert DMM zwei Phasen. Zunächst wird das System mit Imitation Learning auf Experten-MAPF-Lösungen vortrainiert. Anschließend erfolgt eine weitere Optimierung mit MICPO, einer critic-freien group-relative Reinforcement-Learning-Methode. MICPO ist speziell für Multi-Agenten-Szenarien mit mehreren Runden der Aktionsverfeinerung konzipiert. Der Verzicht auf einen Critic unterscheidet den Ansatz von vielen akteur-kritischen RL-Verfahren und soll die Optimierung der gemeinsamen Intent-Verfeinerung vereinfachen. Durch die Kombination aus überwachtem Vortraining und nachgelagerter RL-Feinabstimmung lernt DMM, die iterativen Kommunikationsrunden so zu nutzen, dass die Agenten ihre zufällig initialisierten Intents zu kollisionsfreien, koordinierten Aktionen verfeinern.

Hohe Erfolgsraten und niedrige Lösungskosten auf MovingAI-Benchmark

In den berichteten Experimenten erreicht DMM im Allgemeinen höhere Erfolgsraten und niedrigere Lösungskosten als die evaluierten lernbaren Baselines. Auf 1.600 Aufgaben des MovingAI-Benchmarks löst DMM nach Feinabstimmung mit MICPO 1.598 Aufgaben – die höchste Abdeckung unter allen evaluierten Methoden. Die Lösungskosten bleiben dabei nach Angaben der Autoren wettbewerbsfähig. Die Ergebnisse deuten darauf hin, dass die iterative Intent-Verfeinerung gegenüber einmaligem Sampling einen systematischen Vorteil bei der Vermeidung inkompatibler gemeinsamer Aktionen bietet.

A
Andreas Rüdiger
Herausgeber & Redaktionsleitung · KI-Modelle, Technik & Business

Andreas Rüdiger ist Gründer der Agentur INREMA und verantwortet KI Spotlight redaktionell. Sein Schwerpunkt liegt auf KI-Modellen, Recheninfrastruktur, technischen Entwicklungen und der wirtschaftlichen Einordnung. Er sorgt dafür, dass komplexe KI-Themen verständlich und nachvollziehbar aufbereitet werden. Mehr zu ihm auf inrema.de und andiger.de.

Ähnliche Artikel