Imagine3D-LLM: Multimodales LLM rekonstruiert 3D-Szene vor der Antwort
Neues multimodales Large Language Model baut aus mehreren Ansichten eine kompakte 3D-Repräsentation auf und stützt seine Antworten darauf.
Mit KI erstellt◆ Fakten auf einen Blick
- Imagine3D-LLM ist ein MLLM, das lernt, eine kompakte 3D-Repräsentation der Szene zu erstellen und seine Antwort auf diese Repräsentation zu konditionieren.
- Technisch werden eine kleine Menge lernbarer Summary Tokens an die Bild-Tokens angehängt, in eine kompakte 3D Gaussian Splatting Repräsentation dekodiert, mit einem photometrischen Rekonstruktionsverlust überwacht und gemeinsam mit dem Standard Next-Token-Prediction-Ziel trainiert.
- Nur die Summary Tokens erhalten direkte Rekonstruktionsüberwachung; dieses Ziel induziert laut Abstract stärkere cross-frame Korrespondenz (Abstract endet im Material abgeschnitten).
- Moderne MLLMs haben Schwierigkeiten, Evidenz aus mehreren Blickwinkeln zu einer kohärenten 3D-Sicht zu integrieren; bisherige Ansätze zur 3D-Injektion schließen die Lücke zum menschlichen räumlichen Denken nicht.
- LLaVA-3D ist ein Framework für 3D-Szenenverständnis, das 3D Patches nutzt, um 2D-CLIP-Patch-Features mit ihren 3D-Positionen zu verbinden; es konvergiert 3,5-mal schneller als bestehende 3D-LMMs, erreicht State-of-the-Art auf verschiedenen 3D-Aufgaben und erhält die 2D-Verständnisfähigkeiten.
- LLaVA-3D wurde für ICCV 2025 angenommen; veröffentlicht wurden der LLaVA-3D-Instruct-86OK-Datensatz auf HuggingFace, Inferenzcode mit Checkpoints sowie ein 7B-Modell.
Imagine3D-LLM konditioniert Antworten auf rekonstruierte 3D-Szene
Forschende haben mit Imagine3D-LLM ein neues multimodales Large Language Model (MLLM) vorgestellt, das aus mehreren Ansichten eine kompakte 3D-Szenenrepräsentation aufbaut und seine Antwort auf diese Repräsentation stützt, statt nur Einzelbilder zu verarbeiten. Moderne MLLMs haben nach Angaben der Autoren Schwierigkeiten, Evidenz aus mehreren Blickwinkeln zu einer kohärenten 3D-Sicht zu integrieren. Bisherige Ansätze, die 3D-Bewusstsein in MLLMs injizieren, etwa durch feinkörnige pixelgenaue Korrespondenz zwischen Ansichten oder durch Fusion von Merkmalen aus 3D-Geometrie-Grundmodellen, schließen die Lücke zum menschlichen räumlichen Denken nicht. Imagine3D-LLM adressiert diese Lücke, indem es lernt, eine ähnlich kompakte 3D-Repräsentation der Szene zu erstellen und die Antwort darauf zu konditionieren. Der Ansatz orientiert sich am menschlichen räumlichen Denken: Menschen identifizieren grob gemeinsame Objekte über Ansichten hinweg, schließen auf die relative Geometrie zwischen Blickwinkeln und setzen ein grobes 3D-Layout der Szene zusammen. Genau diesen Prozess bildet das Modell nach.
Training mit Summary Tokens und photometrischem Rekonstruktionsverlust
Technisch werden eine kleine Menge lernbarer Summary Tokens an die Bild-Tokens angehängt, die aus den mehreren Ansichten extrahiert wurden. Diese Summary Tokens werden in eine kompakte 3D Gaussian Splatting Repräsentation dekodiert, die die Szene als eine Menge von 3D-Gaußschen Funktionen beschreibt. Die Rekonstruktion wird mit einem photometrischen Rekonstruktionsverlust überwacht, der die Abweichung zwischen der rekonstruierten Szene und den beobachteten Ansichten bestraft. Das Training erfolgt gemeinsam mit dem Standard Next-Token-Prediction-Ziel, sodass das Modell sowohl die 3D-Repräsentation als auch die Sprachgenerierung optimiert. Bemerkenswert ist, dass nur die Summary Tokens direkte Rekonstruktionsüberwachung erhalten; die Bild-Tokens selbst werden nicht direkt durch den Rekonstruktionsverlust beeinflusst. Laut Abstract induziert dieses Ziel dennoch stärkere cross-frame Korrespondenz – also eine bessere Verknüpfung von Informationen über verschiedene Ansichten hinweg. Dadurch lernt das Modell, eine kohärente 3D-Szene zu rekonstruieren, bevor es eine Antwort generiert, und kann seine Ausgabe auf diese rekonstruierte Szene stützen, anstatt nur auf die Einzelbilder.



