LightNav-0: Generalistisches Navigationsmodell aus vortrainiertem VLM
Ein einziges Modell für Instruction Following, Open-Vocabulary Object Navigation und Visual Tracking – ohne task-spezifische Heads.
Mit KI erstelltInhalt
◆ Fakten auf einen Blick
- LightNav-0 ist ein kompaktes, generalistisches Modell für embodied navigation, das die räumliche Intelligenz eines vortrainierten VLM (Qwen3-VL) nutzt und ohne task-spezifische Prediction Heads auskommt.
- LightNav-0 verwendet eine einheitliche Token-Schnittstelle: Dual-Channel Pointing (Affordance-Punkt und Objekt-Punkt) und einen residualen vektorquantisierten (RVQ) Action-Tokenizer, der räumliche Absicht in präzise, embodiment-spezifische Trajektorien umsetzt.
- Das Modell unterstützt Instruction Following, Open-Vocabulary Object Navigation und Visual Tracking in einem einzigen Modell.
- Das Training umfasst über 2.000 Szenen und über 4.000 Stunden embodied navigation data.
- LightNav-0 wird aus Qwen3-VL-4B-Instruct instanziiert und fügt keine navigationsspezifischen Module hinzu; lediglich das Vokabular wird um indexierte Pointing-Tokens und RVQ-Action-Tokens erweitert.
- Das Modell überträgt zero-shot über verschiedene Roboter-Embodiments (humanoide, vierbeinige, radgetriebene und fliegende Roboter) und Szenen.
LightNav-0: Ein generalistisches Navigationsmodell aus vortrainiertem VLM
LightNav-0 ist ein kompaktes, generalistisches Modell für embodied navigation, das die räumliche Intelligenz des vortrainierten Vision-Language-Modells Qwen3-VL nutzt und ohne task-spezifische Prediction Heads auskommt. Statt separater Ausgabeköpfe für jede Aufgabe verwendet das Modell den ursprünglichen autoregressiven LM-Kopf des VLM; lediglich das Vokabular wird um indexierte Pointing-Tokens und RVQ-Action-Tokens erweitert. Dadurch entfällt die Fragmentierung in per-Embodiment-Experten oder Wegpunkt-Prädiktoren, und die räumlichen Priors des VLM werden direkt für die Navigation genutzt. Die einheitliche Token-Schnittstelle besteht aus zwei Komponenten: Dual-Channel Pointing drückt die räumliche Absicht aus – ein Affordance-Punkt für eine gangbare Richtung und ein Objekt-Punkt für das Ziel –, während ein residualer vektorquantisierter Action-Tokenizer diese Absicht in präzise, roboterspezifische Trajektorien übersetzt. Da alle Aufgaben über dieselben Token-Typen repräsentiert werden, kann ein einziges Modell mehrere Navigationsaufgaben bewältigen, ohne dass zusätzliche Module nötig sind.
Unterstützte Aufgaben, Training und Zero-Shot-Transfer
Das Modell unterstützt Instruction Following, Open-Vocabulary Object Navigation und Visual Tracking in einem einzigen Modell. Die einheitliche Token-Schnittstelle ermöglicht dies, weil alle drei Aufgaben auf dieselbe räumliche Absicht (Dual-Channel Pointing) und dieselbe Aktionsrepräsentation (RVQ-Action-Tokenizer) abgebildet werden: Bei Instruction Following dient die Sprachinstruktion als Ziel, der Objekt-Punkt zeigt auf das referenzierte Objekt oder den Zielort; bei Open-Vocabulary Object Navigation wird das Zielobjekt als Text genannt und der Objekt-Punkt lokalisiert es im Bild; beim Visual Tracking markiert der Objekt-Punkt die Position des zu verfolgenden Ziels über die Zeit. In allen Fällen übersetzt der RVQ-Action-Tokenizer die Pointing-Intention in konkrete Bewegungsbefehle für den jeweiligen Roboter. Da die räumliche Absicht verkörperungsagnostisch ist, reicht ein einziges Modell für humanoide, vierbeinige, radgetriebene und fliegende Roboter. Das Training kombiniert überwachtes Feintuning und Reinforcement Learning auf einem Korpus aus 2K+ Szenen und 4K+ Stunden embodied navigation data. Inference-, Serving- und Evaluationscode sowie Modellgewichte sind öffentlich über ein GitHub-Repository und HuggingFace verfügbar.
Leistungsversprechen der Autoren
Nach Angaben der Autoren erreicht LightNav-0 state-of-the-art monokulare Erfolgsraten über alle 10 öffentlichen Navigations-Simulationssettings. Monokular bedeutet, dass nur eine einzelne RGB-Kamera als visuelle Eingabe dient. Übliche Metriken sind Success Rate (SR) – der Anteil der Episoden, in denen der Agent das Ziel innerhalb eines Schwellwerts erreicht – und Success weighted by Path Length (SPL), das SR mit dem Verhältnis aus optimaler Pfadlänge zur tatsächlichen Pfadlänge gewichtet und so ineffiziente Wege bestraft. Die Autoren berichten, dass LightNav-0 in allen 10 Settings die besten Werte dieser Metriken erreicht. Der zur Initialisierung verwendete Checkpoint LightNav-ER erzielt demnach den höchsten complete-set average über 8 embodied-reasoning Benchmarks, also den Durchschnitt der Erfolgsraten über alle Benchmarks. Diese Leistungsversprechen sind bislang nicht unabhängig verifiziert und beruhen auf der Selbstauskunft des Forschungsteams.



