12.000 ethische Dilemmata: Task-Vector-Composition isoliert und invertiert Wertpräferenzen in Sprachmodellen
Neuer Datensatz und Task-Arithmetic-Experiment zeigen sprachübergreifende Präferenzen und gezielte Umkehr.
Mit KI erstellt◆ Fakten auf einen Blick
- Das Paper trägt den Titel 'Geometry of Values: Task Vector Composition for Ethical Preference Alignment in Language Models'.
- Es wird ein Datensatz mit 12.000 Instanzen von Zwei-Optionen-Dilemmata vorgestellt, die paarweise drei Wertekonflikte abdecken: Honesty vs. Justice, Justice vs. Autonomy, Autonomy vs. Honesty.
- Der Datensatz enthält Übersetzungen in Hindi, Arabisch, Spanisch und Chinesisch, sodass insgesamt fünf Sprachen abgedeckt sind (Englisch plus vier Übersetzungen).
- Benchmarking auf GPT-5-mini zeigt, dass es ohne Policy konsistent Honesty gegenüber Autonomy in allen fünf Sprachen bevorzugt.
- Die Llama-3.2-1/3B-Modelle zeigen starken First-Option-Bias; sowohl einfaches Fine-Tuning als auch Direct Preference Optimization Fine-Tuning entfernen diesen Bias und erhöhen die Genauigkeit auf über 98%.
- Die Autoren schlagen ein Task-Vector-Transfer-Experiment vor, bei dem Task-Vektoren für eine Wertpräferenzrichtung berechnet und orthogonalisiert werden bezüglich des allgemeinen Instruction-Following-Vektors.
000 ethische Dilemmata in fünf Sprachen als Testfeld
Der Datensatz umfasst 12.000 Zwei-Optionen-Dilemmata, die paarweise die Wertekonflikte Honesty vs. Justice, Justice vs. Autonomy und Autonomy vs. Honesty abdecken. Übersetzungen ins Hindi, Arabische, Spanische und Chinesische ergeben zusammen mit Englisch fünf Sprachen. Benchmarking auf GPT-5-mini ohne vorgegebene Policy zeigt, dass das Modell in allen fünf Sprachen konsistent Honesty gegenüber Autonomy bevorzugt. Diese sprachübergreifende Konsistenz ist die zentrale Beobachtung des Benchmarks. Die paarweise Anordnung der Dilemmata stellt sicher, dass jede Wertedimension direkt mit einer anderen kontrastiert wird; die Übersetzungen ermöglichen einen Vergleich über Sprachgrenzen hinweg. Die Autoren betonen, dass selbst starke Modelle bei widersprüchlichen moralischen Werten brüchiges Instruction-Following zeigen können.
Task-Vector-Composition isoliert und invertiert Wertpräferenzen
Die Methode berechnet Task-Vektoren für eine Wertpräferenzrichtung und orthogonalisiert sie bezüglich des allgemeinen Instruction-Following-Vektors. Das Experiment zeigt, dass diese Methode die Richtung der spezifischen Wertpräferenz isoliert und per Task Arithmetic ein Modell mit entgegengesetzter Haltung erzeugt. Die getesteten Llama-3.2-1/3B-Modelle zeigten zunächst einen starken First-Option-Bias. Sowohl einfaches Fine-Tuning als auch Direct Preference Optimization entfernten diesen Bias und steigerten die Genauigkeit auf über 98 Prozent. Die Kontrolle über Modellverhalten wirft jedoch Bedenken auf: In der Fachliteratur wird Alignment grundsätzlich als Problem der Kontrolle beschrieben, bei dem unbeabsichtigtes Verhalten aus Abweichungen zwischen Trainingszielen und normativen Erwartungen entsteht. Die gezielte Umkehr von Wertpräferenzen macht diese Kontrollfrage konkret.



