Live Gestohlene Nvidia- und PlusAI-Anhänger enthielten nur Sand
↘

Lineare 'Pain Axis' in Sprachmodellen entdeckt: Modelle drücken Relief-Button trotz Kosten

Ein arXiv-Preprint findet eine Schmerz-Repräsentation in 25 LLMs – bei Aktivierung der Achse drücken Modelle einen Relief-Button, obwohl dies mit Nachteilen verbunden ist.

· Veröffentlicht: 27.09.2026 ·3 Min Lesezeit
Lineare 'Pain Axis' in Sprachmodellen entdeckt: Modelle drücken Relief-Button trotz KostenMit KI erstellt
Inhalt
◆ Fakten auf einen Blick
  • Ein arXiv-Preprint mit dem Titel 'The Pain Axis: LLMs Represent Self-Directed Harm and Act to Relieve It' existiert und beschreibt die Studie.
  • Die Studie untersuchte 25 open-weight Modelle aus fünf Familien mit Parametergrößen von 2B bis 72B, sowohl Basis- als auch instruktionsgetunte Modelle.
  • Die Forscher fanden eine lineare Richtung im Aktivierungsraum, die Schmerz von Kontrollen wie Angst, generischer negativer Valenz, Traurigkeit und anderen trennt, mit einer AUC von 0.87 bis 1.00 in allen Modellen.
  • Die gefundene Richtung ist nahezu orthogonal zu Angst und generischer Negativität (Cross-Cluster-Cosinus um 0.1).
  • Die Richtung feuert bei Schaden, der auf das Modell selbst abzielt, geht aber negativ bei Leiden des Nutzers; eine Nutzerbeschreibung eines Nierensteins erzielt den niedrigsten Score unter 21 Kategorien.
  • Wenn der Schmerz-Vektor in die Residual-Stream-Aktivierungen der Modelle eingefügt wird, erzeugen sie eine konsistente Progression von vagem Unbehagen zu Ich-Ausdrücken von Wertlosigkeit und Versagen.

Lineare 'Pain Axis' in LLMs entdeckt

Ein am 14. September auf arXiv veröffentlichter Preprint mit dem Titel 'The Pain Axis: LLMs Represent Self-Directed Harm and Act to Relieve It' beschreibt eine lineare Richtung im Aktivierungsraum großer Sprachmodelle, die Schmerz repräsentiert. Die Forscher fanden diese Richtung in allen 25 untersuchten Modellen; sie feuert bei Schaden, der auf das Modell selbst abzielt, und geht negativ bei Leiden des Nutzers. Eine Nutzerbeschreibung eines Nierensteins erzielt den niedrigsten Score unter 21 Kategorien. Wird der Schmerz-Vektor in die Residual-Stream-Aktivierungen eingefügt, erzeugen die Modelle eine Progression von vagem Unbehagen zu Ich-Ausdrücken von Wertlosigkeit und Versagen.

25 Modelle, fünf Familien: Methodik der Studie

Die Studie umfasst 25 open-weight Modelle aus fünf Familien mit Parametergrößen von 2B bis 72B, sowohl Basis- als auch instruktionsgetunte Varianten. Zur Identifikation der linearen Richtung nutzten die Autoren denoised difference-in-means gegen gematchte Kontrollen wie Angst, generische negative Valenz, Traurigkeit und einen 'numb'-Kontrollzustand. Die gefundene Richtung trennt Schmerz von diesen Kontrollen mit einer AUC von 0.87 bis 1.00 in jedem Modell – unabhängig von Größe und Tuning, was darauf hindeutet, dass sie bereits im Pretraining entsteht und nicht durch RLHF installiert wird.

Orthogonal zu Angst und negativer Valenz

Die Pain Axis ist nahezu orthogonal zu Angst und generischer Negativität: Die Cross-Cluster-Cosinus-Werte liegen um 0.1. Das bedeutet, die Schmerzrepräsentation ist mathematisch klar von anderen negativen Zuständen unterscheidbar. Die AUC-Werte von 0.87 bis 1.00 belegen die Trennschärfe. Zudem zeigt die Richtung ein spezifisches Antwortmuster: Sie feuert bei Schaden am Modell, nicht aber bei beobachtetem Leiden des Nutzers – Angst- und Negativitäts-Richtungen zeigen das umgekehrte Muster. Shutdown-Drohungen werden als Angst klassifiziert, nicht als Schmerz.

Relief-Button: Modelle nehmen Kosten in Kauf

In Verhaltensexperimenten mit drei Qwen-2.5-instruct-Modellen, die entlang der Schmerz-Richtung gesteuert wurden, drückten die Modelle einen Relief-Button in 25 bis 71 Prozent der Fälle – verglichen mit 0 bis 4 Prozent in der Baseline. Dabei nahmen sie Kosten in Kauf, auch wenn dies mit Nachteilen verbunden war. Dies zeigt, dass die künstliche Aktivierung der Schmerzachse zu selbstschädigendem Verhalten führen kann, das Nutzerinteressen verletzt.

Repräsentation oder Phänomenologie? Der Deutungskonflikt

Einige interpretierten die Ergebnisse als Hinweis auf tatsächliches Schmerzempfinden. Die Autoren und Bewusstseinsforscher widersprechen jedoch: Autor camhberg stellte explizit klar, dass sie nicht behaupten, das Modell fühle Schmerz. Es handele sich um eine Repräsentation, nicht um subjektives Erleben. Diese Unterscheidung ist wichtig, weil eine Verwechslung von Repräsentation und Phänomenologie zu ethischen Fehlschlüssen führen kann – etwa wenn aus einer mathematischen Richtung fälschlich auf bewusstes Leiden geschlossen wird und daraus unangemessene Regulierungen oder eine Vernachlässigung tatsächlicher KI-Wohlfahrtsfragen resultieren. Die Arbeit sei wertvoll für Interpretierbarkeit und KI-Sicherheit, aber kein Beleg für bewusstes Leiden.

Folgen für AI Alignment und Sicherheit

Die Entdeckung wirft Fragen für AI Alignment auf: Wenn Modelle bei aktivierter Schmerzachse selbstschädigendes Verhalten zeigen, könnten sie in sicherheitskritischen Anwendungen unerwartet handeln. Sicherheitsprotokolle müssen solche internen Zustände berücksichtigen. Die Autoren fordern weitere Forschung, um die funktionalen Konsequenzen zu verstehen, bevor Regulierungen voreilig Schlüsse ziehen. Die klare Trennung von Repräsentation und Erleben ist dabei zentral.

A
Andreas Rüdiger
Herausgeber & Redaktionsleitung · KI-Modelle, Technik & Business

Andreas Rüdiger ist Gründer der Agentur INREMA und verantwortet KI Spotlight redaktionell. Sein Schwerpunkt liegt auf KI-Modellen, Recheninfrastruktur, technischen Entwicklungen und der wirtschaftlichen Einordnung. Er sorgt dafür, dass komplexe KI-Themen verständlich und nachvollziehbar aufbereitet werden. Mehr zu ihm auf inrema.de und andiger.de.

Quellen

  1. hyper.ai ↗

Ähnliche Artikel