Live Meta Connect 2026: Drei Brillen und ein Schlüsselanhänger für Muse

Tri-PvP: Neues Benchmark zeigt visuellen Bias in omni-modalen LLMs

Forschende decken systematische Verzerrungen in der Modalitätsverarbeitung auf.

· Veröffentlicht: 23.09.2026 ·2 Min Lesezeit
Tri-PvP: Neues Benchmark zeigt visuellen Bias in omni-modalen LLMsMit KI erstellt
Inhalt
◆ Fakten auf einen Blick
  • Tri-PvP ist ein Benchmark mit 8.000 tri-modalen Konfliktsamples, das Vision, Audio und Text kreuzt, wobei Vision und Audio jeweils in perceptualer oder propositionaler Form vorliegen.
  • Es wurden fünf OLLMs evaluiert.
  • Es wurde ein robuster visueller Bias über die meisten Modelle und Evidenztyp-Bedingungen gefunden.
  • Es besteht eine systematische Asymmetrie im Evidenzform-Bias: Modelle zeigen einen stärkeren Bias zu perceptualem Signal bei Vision, aber zu propositionalem bei Audio.
  • Layer-wise linear probing und contrastive decoding zeigen, dass Modality Bias bereits in frühen Repräsentationsschichten linear dekodierbar ist und nur teilweise mitigiert werden kann.
  • Der Code zu Tri-PvP ist auf GitHub verfügbar unter https://github.com/MiuLab/Tri-PvP.

Tri-PvP: 8.000 Konfliktsamples für Vision, Audio und Text

Omni-modale Large Language Models (OLLMs) verarbeiten gemeinsam Vision, Audio und Text, doch ihr Modality Bias unter modalübergreifenden Konflikten ist bislang wenig erforscht. Tri-PvP ist ein neues Benchmark, das diese Lücke schließt. Es umfasst 8.000 tri-modale Konfliktsamples, die Vision, Audio und Text miteinander kreuzen. Dabei liegen Vision und Audio jeweils in zwei Formen vor: als perceptuales Signal, etwa ein Foto oder eine Tonaufnahme, oder als propositionales Signal, etwa die Aussage „Dies ist ein Hund“. Diese Unterscheidung ist wichtig, weil bisherige Benchmarks die beiden Evidenzformen innerhalb einer Modalität vermischten, sodass ein gemessener Modalitäts-Bias nicht sauber von einem Evidenzform-Bias getrennt werden konnte. Für die Evaluation wurden fünf OLLMs getestet.

Robuster visueller Bias und Evidenzform-Asymmetrie

Die Auswertung zeigt einen robusten visuellen Bias: Über die meisten Modelle und Evidenztyp-Bedingungen hinweg bevorzugen die OLLMs visuelle Informationen gegenüber anderen Modalitäten. Da Tri-PvP die Evidenzformen sauber trennt, lässt sich dieser Bias eindeutig der Modalität selbst zuschreiben und nicht einer Vermischung mit der Evidenzform. Zusätzlich fanden die Forschenden eine systematische Asymmetrie im Evidenzform-Bias: Bei Vision neigen die Modelle stärker zu perceptualem Signal (z. B. Bildern), bei Audio dagegen zu propositionalem Signal (z. B. sprachlichen Aussagen). Diese Asymmetrie zeigt, dass die Modelle Modalitäten nicht einheitlich verarbeiten, sondern je nach Modalität unterschiedliche Evidenzformen bevorzugen.

Bias früh dekodierbar, nur teilweise mitigierbar

Layer-wise linear probing und contrastive decoding zeigen, dass der Modality Bias bereits in frühen Repräsentationsschichten linear dekodierbar ist. Das bedeutet, die Verzerrung ist tief in den internen Repräsentationen verankert und nicht nur ein oberflächliches Artefakt der Ausgabeschicht. Entsprechend lässt sich der Bias nur teilweise mitigieren: Oberflächliche Interventionen wie einfache Prompts oder Feinabstimmungen greifen zu kurz, weil die zugrunde liegenden Repräsentationen bereits früh modalitätsspezifisch geprägt sind. Die Autoren fordern daher Strategien jenseits oberflächlicher Interventionen. Code: GitHub, Paper: arXiv-Preprint.

A
Andreas Rüdiger
Herausgeber & Redaktionsleitung · KI-Modelle, Technik & Business

Andreas Rüdiger ist Gründer der Agentur INREMA und verantwortet KI Spotlight redaktionell. Sein Schwerpunkt liegt auf KI-Modellen, Recheninfrastruktur, technischen Entwicklungen und der wirtschaftlichen Einordnung. Er sorgt dafür, dass komplexe KI-Themen verständlich und nachvollziehbar aufbereitet werden. Mehr zu ihm auf inrema.de und andiger.de.

Ähnliche Artikel