HEAL: Neues Verfahren gegen Halluzinationen in multimodalen LLMs
Studie zeigt: Drift der Informationsverteilung in Synergy-Heads ist Hauptursache – nicht Menge modalitätsspezifischer Heads
Mit KI erstellt◆ Fakten auf einen Blick
- HEAL ist ein Verfahren zur Identifikation und Minderung von Halluzinationen in multimodalen LLMs.
- HEAL filtert zunächst kausal redundante Heads durch kausale Rauschintervention auf Multi-Head-Ausgaben.
- Anschließend disentangelt HEAL die Informationsverteilung in den verbleibenden Heads mittels kontrafaktischer Difference-in-Differences und kategorisiert Heads in vier Typen.
- Die Analyse ergibt: Halluzinationen treten auf, wenn die Informationsverteilung in Synergy-Heads vom gesunden Gleichgewicht abdriftet; kein starker Zusammenhang mit Menge oder Stärke modalitätsspezifischer Heads.
- HEAL injiziert dynamische Informationskalibrierungsfaktoren in die Value-Vektoren der Synergy-Heads und reguliert aktiv visuell-sprachliche Abhängigkeiten, um die Ausgabeverteilung in Richtung faktischer Evidenz zu lenken.
- Bestehende aufmerksamkeitsbasierte Methoden stützen sich auf indirekte Signale wie Attention-Gewichte, die den tatsächlichen Informationsshift bei der Halluzinationsentstehung nicht genau abbilden.
HEAL: Neues Verfahren gegen Halluzinationen in multimodalen LLMs
Laut der Studie (Abstract) haben Forschende mit HEAL ein Verfahren vorgestellt, das Halluzinationen in multimodalen Large Language Models (MLLMs) erkennen und reduzieren soll. Halluzinationen behindern den zuverlässigen praktischen Einsatz. Die Autoren berichten, dass Halluzinationen auftreten, wenn die Informationsverteilung in sogenannten Synergy-Heads von einem gesunden Gleichgewicht abdriftet. Synergy-Heads sind nach der in der Studie verwendeten informationstheoretischen Analyse für die integrative Verarbeitung visueller und sprachlicher Informationen zuständig; ein Drift bedeutet, dass die Balance zwischen den Modalitäten gestört wird, sodass die Ausgabe nicht mehr durch faktische Evidenz gestützt wird, sondern durch fehlerhafte Muster. Die Analyse zeigt zudem, dass kein starker Zusammenhang mit der Menge oder Stärke modalitätsspezifischer Heads besteht – die statistische Auswertung ergab, dass diese Größen die Halluzinationsneigung nicht signifikant beeinflussen. Bestehende aufmerksamkeitsbasierte Methoden nutzen nur indirekte Signale wie Attention-Gewichte; diese bilden den tatsächlichen Informationsshift, der der Halluzinationsentstehung zugrunde liegt, nicht genau ab, weil sie lediglich die Aufmerksamkeitsverteilung messen, nicht aber die tatsächliche Informationsverarbeitung in den Heads. HEAL setzt an, indem es die Informationsverteilung auf Head-Ebene direkt disentangelt und kalibriert.
Methode: Kausale Filterung und Informationskalibrierung
Für HEAL filtern die Autoren zunächst kausal redundante Heads durch eine kausale Rauschintervention auf den Multi-Head-Ausgaben. Dabei wird Rauschen in die Ausgaben einzelner Heads injiziert und beobachtet, wie sich die finale Vorhersage ändert; Heads, deren Störung keinen Einfluss auf das Ergebnis hat, gelten als kausal redundant und werden entfernt. Anschließend wird die Informationsverteilung in den verbleibenden Heads mittels kontrafaktischer Difference-in-Differences disentangelt: Durch den Vergleich von Szenarien mit und ohne bestimmte Modalitätsbeiträge werden die Anteile an redundanter, visuell-eindeutiger, sprachlich-eindeutiger und synergistischer Information getrennt und die Heads entsprechend in vier Typen kategorisiert. Auf Basis der Beobachtung zu Synergy-Heads injiziert HEAL dynamische Informationskalibrierungsfaktoren in deren Value-Vektoren. Diese Faktoren werden abhängig vom aktuellen Informationszustand berechnet und skalieren die Value-Vektoren so, dass die Ausgabeverteilung in Richtung faktischer Evidenz gelenkt wird, indem visuell-sprachliche Abhängigkeiten aktiv reguliert werden. Die Autoren berichten, dass HEAL Halluzinationen über mehrere MLLMs hinweg effektiv reduziert und einen einfachen, interpretierbaren Weg zur Erhöhung der Vertrauenswürdigkeit bietet.



