Studie in Current Biology: KI-Vision kodiert Position physikalisch statt wahrnehmungsbezogen
York-Studie kombiniert neuronale Ableitungen und Wahrnehmungsexperimente, um eine Lücke in KI-Vision aufzudecken.
Mit KI erstellt◆ Fakten auf einen Blick
- Die Studie wurde in der Fachzeitschrift Current Biology veröffentlicht.
- Die Studie stammt von Forschern der York University; Seniorautor ist Kohitij Kar, Erstautorin ist Elizaveta Yakubovskaya.
- Die Studie untersucht den Motion-Aftereffect, bei dem nach längerer Betrachtung einer gerichteten Bewegung ein anschließend betrachtetes stationäres Objekt scheinbar in die Gegenrichtung verschoben erscheint.
- Die Studie zeigt, dass der inferiore Temporallappen (IT) bei Primaten die Objektposition in wahrnehmungsbezogenen Koordinaten kodiert, während aktuelle KI-Vision-Modelle die Position strikt nach physikalischen Bildkoordinaten kodieren.
- Die Studie kombiniert neuronale Ableitungen bei Makaken mit menschlichen Wahrnehmungsexperimenten.
- Die Studie kommt zu dem Schluss, dass aktuelle KI-Vision-Systeme diesen Mechanismus nicht besitzen.
Studie in Current Biology: KI-Vision kodiert Position physikalisch statt wahrnehmungsbezogen
Eine in Current Biology veröffentlichte Studie der York University zeigt, dass aktuelle KI-Vision-Modelle eine zentrale Eigenheit biologischer Wahrnehmung nicht nachbilden: die Verschiebung der Objektposition nach Bewegungsadaptation. Die Arbeit trägt den Titel 'The macaque IT cortex but not current artificial vision networks encode object position in perceptually aligned coordinates'. Seniorautor Kohitij Kar und Erstautorin Elizaveta Yakubovskaya kombinierten neuronale Ableitungen bei Makaken mit menschlichen Wahrnehmungsexperimenten. Als Test diente der Motion-Aftereffect: Wer längere Zeit eine gerichtete Bewegung betrachtet, nimmt ein anschließend gezeigtes stationäres Objekt leicht in die Gegenrichtung verschoben wahr, obwohl sich das Bild nicht ändert. Die physikalische Projektion auf die Netzhaut bleibt dabei unverändert; die bewusste Lokalisierung verschiebt sich. Im inferioren Temporallappen (IT) der Primaten kodieren Neuronen die Position des Objekts in wahrnehmungsbezogenen Koordinaten – also so, wie der Beobachter das Objekt erlebt. Die untersuchten KI-Vision-Modelle dagegen kodieren die Position strikt nach physikalischen Bildkoordinaten und ignorieren die wahrnehmungsbezogene Verschiebung. Der Grund liegt in der Architektur: Aktuelle KI-Modelle verarbeiten in der Regel nur statische Bildinformationen und besitzen keine internen Gedächtnis- oder Adaptationsmechanismen, die eine zuvor gesehene Bewegungsrichtung speichern und in die Positionskodierung einfließen lassen könnten. Das IT-Kortex-Netzwerk der Primaten integriert dagegen die Bewegungs-History und verschiebt die neuronale Repräsentation der Objektposition entsprechend der wahrgenommenen, nicht der physikalischen Position. Damit fehlt ihnen der history-abhängige Mechanismus, den die Studie erstmals anhand des Motion-Aftereffect im IT nachweist. Die Ergebnisse offenbaren eine spezifische Lücke in der KI-Wahrnehmung: Die Netze verarbeiten den visuellen Reiz korrekt nach Bilddaten, aber nicht so, wie biologische Systeme die Position nach vorheriger Bewegungsadaptation repräsentieren.
Abgrenzung zu anderen Illusionsstudien: Nicht alle KI-Modelle gleich
Der Befund steht nicht im Widerspruch zu anderen Arbeiten, wonach einige KI-Modelle bestimmte visuelle Illusionen nachbilden können oder anfällig für Illusionen sind. So zeigen Untersuchungen zu statischen Mustern wie der Rotating-Snakes-Illusion, dass einzelne Architekturen unter bestimmten Bedingungen menschenähnliche Bewegungswahrnehmung erzeugen können. Laut einer Studie scheitern die meisten getesteten Optical-Flow-Modelle daran, für die Rotating-Snakes-Illusion menschenähnliche Flussfelder zu erzeugen. Nur das am Menschen orientierte Dual-Channel-Modell zeigt unter simulierten sakkadischen Augenbewegungen die erwartete Rotationsbewegung, wobei die beste Übereinstimmung während der Sakkaden-Simulation auftritt. Ablationsanalysen zeigen, dass sowohl luminanzbasierte als auch höhere farbmerkmalsbasierte Bewegungssignale zu diesem Verhalten beitragen und ein rekurrenter Aufmerksamkeitsmechanismus entscheidend für die Integration lokaler Hinweise ist. Diese abweichenden Befunde betreffen vor allem statische Illusionen, bei denen keine vorherige Bewegungsadaptation nötig ist. Die neue Studie fokussiert dagegen auf den Bewegungsnacheffekt und die Positionskodierung nach Bewegungsadaptation; andere Studien untersuchen Bewegungswahrnehmung in statischen Bildern oder allgemeine Illusionsanfälligkeit. Die Unterschiede liegen damit in Illusionstyp, Modellarchitektur und Aufgabenstellung. Statische Illusionen wie Rotating Snakes erfordern die Extraktion von Bewegungssignalen aus einem einzelnen Bild, was andere Netzwerkarchitekturen beansprucht: Optical-Flow-Modelle sind auf die Schätzung echter Bewegung zwischen aufeinanderfolgenden Frames trainiert und scheitern daher an der illusorischen Bewegung im statischen Muster. Das Dual-Channel-Modell mit rekurrentem Aufmerksamkeitsmechanismus kann dagegen lokale Hinweise integrieren und menschenähnliche Flussfelder erzeugen. Auch die Trainingsziele unterscheiden sich: Während die Optical-Flow-Modelle auf Bewegungsschätzung zwischen Bildern optimiert sind, zielt die neue Studie auf die Positionskodierung nach Bewegungsadaptation, die eine zeitliche Komponente erfordert, die in typischen KI-Vision-Modellen fehlt. Für die Entwicklung menschähnlicher Sehsysteme bleibt die Lücke bei history-abhängiger Positionskodierung ein offener Benchmark. Verwandte KI-Vision-Entwicklungen: [Google startet Guided Vision in Gemini Live](/news/Google-startet-Guided-Vision-in-Gemini-Live).



