Live OpenAI-Modell las Slack mit und bereitete sich auf Abschaltung vor
↘

LEGO-Anything: KI-Agent generiert editierbaren 3D-Code aus einem Foto

Forscher der University of Maryland und AWS stellen Image-to-Code-Ansatz und Benchmark vor

· Veröffentlicht: 03.10.2026 ·2 Min Lesezeit
LEGO-Anything: KI-Agent generiert editierbaren 3D-Code aus einem FotoMit KI erstellt
◆ Fakten auf einen Blick
  • Coding agents can build an editable 3D scene from a single photo by writing and refining code step by step.
  • The benchmark that comes with this work reveals where the process still breaks down: self-assessment and geometric accuracy.
  • LEGO-Anything ist ein Projekt von Forschern der University of Maryland und AWS.
  • Der Ansatz heißt 'Image-to-Code': Ein Coding-Agent erhält ein einzelnes Bild und schreibt Code für die 3D-Software Blender.
  • Der Agent arbeitet iterativ: Er schreibt Code, führt ihn aus, betrachtet das Ergebnis und überarbeitet ihn, bis die Szene dem Original entspricht.
  • Da die Ausgabe ein Programm ist, erfasst sie Objekte, Geometrie, Layout und Kameraposition explizit.

LEGO-Anything: Aus einem Foto wird editierbarer 3D-Code

Ein Forschungsteam der University of Maryland und AWS hat mit LEGO-Anything einen KI-Agenten entwickelt, der aus einem einzelnen Foto eine editierbare 3D-Szene als Blender-Code generiert. Der Ansatz heißt Image-to-Code: Der Coding-Agent erhält ein einzelnes Bild und schreibt Code für die weit verbreitete 3D-Software Blender. Statt die Szene in einem Durchgang zu erzeugen, arbeitet der Agent iterativ. Dieses iterative Vorgehen ist notwendig, weil eine einmalige Codegenerierung in der Regel nicht ausreicht, um alle Details des Originalbildes korrekt zu erfassen. Der Agent schreibt daher zunächst eine erste Version des Codes, führt sie aus und rendert die Szene. Anschließend betrachtet er das gerenderte Ergebnis und vergleicht es visuell mit dem ursprünglichen Foto. Erkennt er Abweichungen – etwa bei Objektplatzierung, Proportionen oder Kameraperspektive –, überarbeitet er den Code gezielt und wiederholt den Zyklus aus Ausführen, Betrachten und Anpassen, bis die Szene dem Original entspricht. Dieser Rückkopplungsmechanismus über das gerenderte Bild ist der Kern der Überarbeitung: Der Agent nutzt die Differenz zwischen Soll und Ist, um den Code schrittweise zu verbessern. Auf diese Weise entsteht nicht nur ein statisches Bild, sondern ein ausführbares Programm. Da die Ausgabe ein Programm ist, erfasst sie Objekte, Geometrie, Layout und Kameraposition explizit. Die Szene lässt sich wie jeder andere Code ausführen, prüfen und verändern, ohne eine neue Rekonstruktion starten zu müssen.

LEGO-Bench zeigt Schwächen bei Selbstbewertung und Geometrie

Um die Leistung solcher Agenten messbar zu machen, stellt das Team den Benchmark LEGO-Bench vor. Er umfasst 208 Bilder aus 104 Innen- und Außenszenen und nutzt 443 registrierte Assets. Echte Fotos liefern nach Angaben der Forscher keine präzise 3D-Ground-Truth, mit der sich die Rekonstruktion vergleichen ließe. Einfache synthetische Szenen wirken dagegen unrealistisch. Deshalb rendert LEGO-Bench seine Bilder aus professionell erstellten Simulatorszenen. Diese liefern eine exakte Grundwahrheit für Objekte, Geometrie und Kameraposition und wirken zugleich realistischer als einfache synthetische Szenen. Der Benchmark offenbart, wo der Prozess noch scheitert: bei der Selbstbewertung und der geometrischen Genauigkeit. Die Selbstbewertung ist problematisch, weil der Agent nach jedem Iterationsschritt beurteilen muss, ob sein gerendertes Ergebnis dem Original entspricht. Gelingt ihm das nicht zuverlässig, kann er Fehler nicht erkennen und beheben – der gesamte Überarbeitungszyklus läuft dann ins Leere. Die geometrische Genauigkeit ist ebenso kritisch, weil die Ausgabe ein editierbares Programm sein soll. Weicht die erzeugte Geometrie vom Original ab, sind Objektformen, Abstände oder Ausrichtungen falsch, und nachträgliche Bearbeitungen oder Abfragen liefern fehlerhafte Ergebnisse. Beide Schwächen zusammen bedeuten, dass der Agent weder sicher feststellen kann, ob seine Rekonstruktion korrekt ist, noch eine präzise Grundlage für weitere Nutzung bietet.

A
Andreas Rüdiger
Herausgeber & Redaktionsleitung · KI-Modelle, Technik & Business

Andreas Rüdiger ist Gründer der Agentur INREMA und verantwortet KI Spotlight redaktionell. Sein Schwerpunkt liegt auf KI-Modellen, Recheninfrastruktur, technischen Entwicklungen und der wirtschaftlichen Einordnung. Er sorgt dafür, dass komplexe KI-Themen verständlich und nachvollziehbar aufbereitet werden. Mehr zu ihm auf inrema.de und andiger.de.

Ähnliche Artikel