DMM: Dezentrales Multi-Agenten-Pfadfinding mit iterativer Intent-Verfeinerung
Ein neues System ersetzt einmaliges Action-Sampling durch diskrete, iterative Verfeinerung von Aktionsabsichten über Kommunikationsrunden – inspiriert von Denoising in Diffusionsmodellen.
Mit KI erstelltInhalt
◆ Fakten auf einen Blick
- Der Titel des Papers lautet 'Decentralized Master-Mind: Joint Action Refinement through Iterative Intent Denoising in Multi-Agent Pathfinding'.
- Das System wird als DMM (Decentralized Master-Mind) bezeichnet.
- DMM adressiert dezentrales Multi-Agent Path Finding (MAPF) mit Kommunikation unter partieller Beobachtbarkeit.
- DMM ersetzt einmaliges Action-Sampling durch diskrete, iterative Verfeinerung von Action-Intents über Kommunikationsrunden, inspiriert von Denoising in Diffusionsmodellen.
- Agenten initialisieren zufällige Action-Intents und verfeinern sie durch lokale Kommunikation, bevor sie sich auf Aktionen festlegen.
- DMM wird mit Imitation Learning auf Experten-MAPF-Lösungen vortrainiert und anschließend mit MICPO weiter optimiert, einer critic-freien group-relative Reinforcement-Learning-Methode für Multi-Agenten, Multi-Runden Action-Refinement.
Neues System DMM verfeinert Aktionsabsichten iterativ statt einmalig zu sampeln
Das System DMM (Decentralized Master-Mind) adressiert dezentrales Multi-Agent Path Finding (MAPF) mit Kommunikation unter partieller Beobachtbarkeit. Bisherige lernbasierte Ansätze sampeln einmalig Aktionen aus per-Agent-Verteilungen. Das kann scheitern, wenn mehrere koordinierte gemeinsame Aktionen im selben Kontext gültig sind: Unabhängiges Sampling rekombiniert lokal gültige Entscheidungen zu inkompatiblen gemeinsamen Aktionen. DMM ersetzt dieses einmalige Action-Sampling durch eine diskrete, iterative Verfeinerung von Action-Intents über mehrere Kommunikationsrunden. Der Ansatz ist inspiriert vom Denoising in Diffusionsmodellen. Die Agenten initialisieren zufällige Action-Intents und verfeinern sie durch lokale Kommunikation, bevor sie sich auf konkrete Aktionen festlegen. Dadurch werden ihre Entscheidungen gekoppelt, noch bevor eine Festlegung erfolgt – Kollisionen sollen so vermieden werden.
Vortraining mit Imitation Learning und Feinabstimmung mit critic-freiem MICPO
Für das Training kombiniert DMM zwei Phasen. Zunächst wird das System mit Imitation Learning auf Experten-MAPF-Lösungen vortrainiert. Anschließend erfolgt eine weitere Optimierung mit MICPO, einer critic-freien group-relative Reinforcement-Learning-Methode. MICPO ist speziell für Multi-Agenten-Szenarien mit mehreren Runden der Aktionsverfeinerung konzipiert. Der Verzicht auf einen Critic unterscheidet den Ansatz von vielen akteur-kritischen RL-Verfahren und soll die Optimierung der gemeinsamen Intent-Verfeinerung vereinfachen. Durch die Kombination aus überwachtem Vortraining und nachgelagerter RL-Feinabstimmung lernt DMM, die iterativen Kommunikationsrunden so zu nutzen, dass die Agenten ihre zufällig initialisierten Intents zu kollisionsfreien, koordinierten Aktionen verfeinern.
Hohe Erfolgsraten und niedrige Lösungskosten auf MovingAI-Benchmark
In den berichteten Experimenten erreicht DMM im Allgemeinen höhere Erfolgsraten und niedrigere Lösungskosten als die evaluierten lernbaren Baselines. Auf 1.600 Aufgaben des MovingAI-Benchmarks löst DMM nach Feinabstimmung mit MICPO 1.598 Aufgaben – die höchste Abdeckung unter allen evaluierten Methoden. Die Lösungskosten bleiben dabei nach Angaben der Autoren wettbewerbsfähig. Die Ergebnisse deuten darauf hin, dass die iterative Intent-Verfeinerung gegenüber einmaligem Sampling einen systematischen Vorteil bei der Vermeidung inkompatibler gemeinsamer Aktionen bietet.



