Movement Trend Guidance: Latente Zukunfts-Konditionierung für 3D-Diffusions-Policies
Wie latente Voraussicht ohne explizite Trajektorien die Leistung von 3D-Diffusions-Policies steigert.
Mit KI erstellt◆ Fakten auf einen Blick
- Movement Trend Guidance lernt aus einer kurzen Beobachtungshistorie eine kompakte latente Repräsentation der Interaktionsentwicklung.
- Während des Trainings überwachen spärliche zukünftige Greiferzustände diese Repräsentation; bei Inferenz wird nur das Latente als zukunftsorientierte Konditionierung neben der aktuellen Beobachtung behalten.
- Das Latente bietet globale Konditionierung für die Aktionsgenerierung, während ein zusätzlicher gated FiLM-Zweig nur am UNet-Bottleneck verwendet wird.
- Das Verfahren fügt nur 3,52% mehr Parameter im Vergleich zu DP3 hinzu.
- Movement Trend Guidance verbessert DP3 konsistent auf RoboTwin2.0, LIBERO-40 und DexArt.
- Auf 50-Task RoboTwin2.0 mixed training erreicht das Verfahren 62,8% gegenüber 56,1% von DP3.
Movement Trend Guidance: Latente Zukunfts-Konditionierung für 3D-Diffusions-Policies
Das neue Verfahren Movement Trend Guidance verleiht 3D-Diffusions-Policies eine Form von Voraussicht, ohne explizite Trajektorien zu verwenden. Aus einer kurzen Beobachtungshistorie lernt die Policy eine kompakte latente Repräsentation der Interaktionsentwicklung. Während des Trainings wird diese Repräsentation durch spärliche zukünftige Greiferzustände überwacht; bei der Inferenz bleibt nur das Latente als zukunftsorientierte Konditionierung neben der aktuellen Beobachtung erhalten. Das Latente liefert eine globale Konditionierung für die Aktionsgenerierung: Es moduliert die Feature-Maps des Diffusions-UNet über alle Skalen hinweg, sodass die erzeugten Aktionssequenzen nicht nur die momentane Szene widerspiegeln, sondern auch die erwartete Richtung der Interaktion berücksichtigen. Dadurch wird die Aktionsgenerierung von einer rein reaktiven zu einer vorausschauenden Planung verschoben, ohne dass eine explizite Trajektorie vorgegeben werden muss. Zusätzlich kommt ein gated FiLM-Zweig ausschließlich am UNet-Bottleneck zum Einsatz. Diese Platzierung ist sinnvoll, weil der Bottleneck die kompakteste und semantisch reichste Repräsentation des Netzwerks enthält; eine Modulation genau dort beeinflusst alle nachfolgenden Upsampling-Stufen effizient, während die frühen Verarbeitungsschichten unverändert bleiben. Der Gating-Mechanismus erlaubt zudem, den Einfluss der Voraussicht adaptiv zu steuern, sodass das Netzwerk selbst entscheiden kann, wie stark es der latenten Zukunfts-Konditionierung vertraut. Gegenüber DP3 fügt das Verfahren lediglich 3,52 Prozent mehr Parameter hinzu und behält die ursprüngliche Formulierung mit dichten Aktionen und zurückweichendem Horizont bei. Die Motivation: Erfolgreiche Manipulation erfordert nicht nur zu wissen, welche Bewegung aktuell machbar ist, sondern auch zu antizipieren, wohin die Interaktion führt. Bisher blieb solche Voraussicht implizit dem Aktionslernen überlassen. Movement Trend Guidance macht sie über eine latente Repräsentation explizit, die aus wenigen vergangenen Beobachtungen gewonnen wird.
Konsistente Verbesserungen auf RoboTwin2.0, LIBERO-40 und DexArt
Die gemessenen Leistungssteigerungen fallen konsistent über mehrere Benchmarks aus. Auf dem 50 Aufgaben umfassenden RoboTwin2.0-Benchmark im gemischten Training erreicht Movement Trend Guidance 62,8 Prozent, DP3 kommt auf 56,1 Prozent. Auf LIBERO-40 liegt das Verfahren bei 71,93 Prozent gegenüber 37,08 Prozent für DP3. Bei fünf realen Roboteraufgaben erreicht es 72,0 Prozent, DP3 49,0 Prozent. Die Verbesserungen treten damit nicht nur in Simulationen, sondern auch auf physischen Robotern auf. Diese Konsistenz über so unterschiedliche Benchmarks hinweg deutet darauf hin, dass die latente Zukunfts-Konditionierung eine grundlegende Fähigkeit adressiert: das Antizipieren des Interaktionsverlaufs, das in nahezu allen Manipulationsaufgaben benötigt wird. Da das Verfahren die ursprüngliche dichte Aktionsgenerierung beibehält und nur einen kleinen, gated FiLM-Zweig am Bottleneck ergänzt, profitiert es von der Skalierbarkeit und Robustheit des DP3-Basismodells, während es gleichzeitig die fehlende Voraussicht gezielt nachrüstet. Auf echten Robotern funktioniert die Methode, weil sie keine expliziten Trajektorien oder präzisen Zukunftspläne benötigt, die in der realen Welt oft schwer zu schätzen sind. Stattdessen lernt sie aus kurzen Beobachtungshistorien eine kompakte latente Repräsentation, die auch unter realen Sensorrauschen und Aktionsunsicherheiten robust bleibt. Die spärliche Überwachung durch zukünftige Greiferzustände während des Trainings stellt sicher, dass die latente Repräsentation tatsächlich die Interaktionsentwicklung erfasst, ohne dass bei der Inferenz aufwendige Planungsschritte nötig wären. Die Autoren sehen darin einen Beleg, dass eine Diffusions-Policy erheblich davon profitieren kann, wenn sie weiß, wohin eine Interaktion tendiert – ohne dass ihr exakt vorgegeben wird, wohin sie sich bewegen soll.



