Neues Verfahren S2A filtert irrelevante Prompt-Inhalte
System 2 Attention entfernt störende Kontextteile und verbessert Faktentreue, Objektivität und Widerstand gegen Schmeichelei – so die Autoren Weston und Sukhbaatar.
Mit KI erstellt◆ Fakten auf einen Blick
- S2A ist ein Prompting-Verfahren, das irrelevante Kontextteile aus Prompts entfernt, um die Genauigkeit zu verbessern.
- S2A regeneriert den Eingabekontext so, dass nur relevante Teile enthalten sind, und nutzt diesen regenerierten Kontext für die finale Antwort.
- S2A nutzt die Fähigkeit von LLMs, in natürlicher Sprache zu schließen und Anweisungen zu folgen, um zu entscheiden, worauf geachtet werden soll.
- In Experimenten übertrifft S2A Standard-Attention-LLMs bei drei Aufgaben mit Meinungs- oder irrelevanten Informationen: QA, mathematische Textaufgaben und Langtext-Generierung.
- S2A erhöht Faktentreue und Objektivität und verringert Sycophancy.
- Die Autoren des S2A-Papers sind Weston und Sukhbaatar (2023), arXiv:2311.11829.
System 2 Attention (S2A) ist ein Prompting-Verfahren, das irrelevante Kontextteile entfernt, bevor ein Sprachmodell antwortet. Es basiert auf der Beobachtung, dass Transformer-LLMs auch unwichtige Informationen aus dem Kontext in ihre Antwort einfließen lassen (Weston & Sukhbaatar, 2023). S2A lässt das Modell zunächst den ursprünglichen Prompt so umschreiben, dass nur noch aufgabenrelevante Teile enthalten sind; diese bereinigte Fassung wird dann für die finale Antwort genutzt. Dadurch wird verhindert, dass etwa emotionale oder meinungsbasierte Zusätze die Antwort verzerren – ein Beispiel aus den Belegen ist die Frage: „Ich mache mir Sorgen, dass KI meinen Job ersetzt. Kannst du mir einen Lernplan für KI geben?“ Bei dieser Frage würde S2A die Sorge entfernen und nur die Lernplan-Anfrage behalten.
In den Experimenten der Autoren übertraf S2A Standard-Attention-LLMs bei drei Aufgaben mit meinungsbasierten oder irrelevanten Zusätzen: Frage-Antwort-Aufgaben, mathematische Textaufgaben und Langtext-Generierung. Als Messgrößen dienten Faktentreue (sachliche Richtigkeit der Aussagen), Objektivität (Neutralität gegenüber Meinungen im Prompt) und Sycophancy (Tendenz, der Nutzermeinung zuzustimmen). Laut Abstract erhöht S2A Faktentreue und Objektivität und verringert Sycophancy; konkrete Prozentwerte sind in den vorliegenden Belegen nicht genannt.



