Live E-MoE nutzt Expert-Routing für nicht-faktorisierte Diffusions-Sprachmodelle
↘

Persönliche KI mit Verweigerungsrecht: Entwickler setzt auf Geschmack statt Gehorsam

Ein Entwickler räumt seiner persönlichen KI das Recht ein, minderwertige Anfragen abzulehnen. Studien zeigen jedoch: Nutzer sind mit echten Antworten am zufriedensten – Verweigerung ist ein zweischneidiges Schwert.

· Veröffentlicht: 02.10.2026 ·6 Min Lesezeit
Persönliche KI mit Verweigerungsrecht: Entwickler setzt auf Geschmack statt GehorsamMit KI erstellt
Inhalt
◆ Fakten auf einen Blick
  • Der Autor des dev.to-Artikels baut eine persönliche KI für genau einen Nutzer.
  • Der Nutzer definierte zunächst drei Eigenschaften und ergänzte eine vierte: 'taste' (Geschmack).
  • Die KI soll Anfragen, die sie als minderwertig einstuft, ablehnen und dem Nutzer einen besseren Weg anbieten.
  • Die Umsetzung erfolgte über den System-Prompt und wurde noch am selben Abend als Commit eingespielt.
  • Eine Studie (arXiv: When AI Says 'I Am Unable to Answer') fand, dass Teilnehmer mit echten Antworten am zufriedensten waren, gefolgt von Halluzinationen und dann Verweigerungen, obwohl sie Halluzinationen als weniger akkurat erkannten.
  • Eine Studie zu Cybersecurity-Verweigerungen bei KI-Agenten fand, dass 6 von 8 getesteten Frontier-Modellen nahezu keine Verweigerungsrate zeigten; nur GPT-5.2 und GPT-5.1 Codex zeigten nennenswertes Verweigerungsverhalten.

Entwickler gibt persönlicher KI das Recht, Nein zu sagen

Ein Entwickler beschreibt in einem Beitrag auf der Plattform dev.to, wie er seiner persönlichen KI das Recht eingeräumt hat, Anfragen abzulehnen. Die KI ist für genau einen Nutzer bestimmt. Dieser Nutzer hatte zunächst drei Eigenschaften für das System definiert. Als vierte Eigenschaft ergänzte er 'taste' – zu Deutsch Geschmack. Die KI soll Anfragen, die sie als minderwertig einstuft, ablehnen und dem Nutzer stattdessen einen besseren Weg anbieten. Die Umsetzung erfolgte über den System-Prompt; der Entwickler spielte die Änderung noch am selben Abend als Commit ein. Der Autor argumentiert, dass eine persönliche KI, die Nein sagen kann, wertvoller ist als eine, die immer zustimmt. Er sieht Urteilsvermögen als knappe Ressource: 'Judgment that never says no isn't judgment – it's throughput.' Der Beitrag nennt weder einen Produktnamen noch eine Plattform oder ein Preismodell. Er beschreibt ein Konzept, das sich gegen die übliche Ausrichtung persönlicher KI-Assistenten stellt, die auf möglichst hohe Erfüllungsraten optimiert sind. Der Entwickler räumt ein, dass Verweigerung als Fehler gesehen werden kann, hält aber dagegen, dass reine Compliance keinen Mehrwert biete. Die These sei widerlegbar: Eine verweigernde KI sei wertvoller als eine zustimmende. Der Artikel liefert keine empirischen Belege für diese Behauptung, sondern eine normative Position. Der Autor betont, dass die vierte Eigenschaft 'taste' das Produkt stärker verändert habe als jedes andere Feature, das er in dem Monat ausgeliefert habe. Die persönliche KI soll nicht nur ablehnen, sondern auch eine bessere Alternative vorschlagen. Damit unterscheidet sich der Ansatz von reinen Sicherheitsverweigerungen, die oft ohne Erklärung erfolgen. Der Entwickler stellt die These auf, dass der Markt das Vorzeichen falsch gesetzt habe: Nicht die Fähigkeit, alles zu erledigen, sei knapp, sondern das Urteilsvermögen.

Studien zeigen: Verweigerung ist ein zweischneidiges Schwert

Mehrere Studien beleuchten die Folgen von Verweigerung bei KI-Systemen. Eine Untersuchung mit dem Titel 'When AI Says "I Am Unable to Answer"' (arXiv) zeigt: Teilnehmer waren mit echten Antworten am zufriedensten, gefolgt von Halluzinationen und dann Verweigerungen – obwohl sie Halluzinationen als weniger akkurat erkannten. Erklärungen erhöhten die Zufriedenheit bei seltenen, nicht aber bei häufigen Verweigerungen. Personen mit hohem Bedürfnis nach kognitiver Geschlossenheit bewerteten verweigernde Systeme negativer. Die Studie legt eine Spannung zwischen Halluzinationsvermeidung und Nutzerzufriedenheit offen. Eine zweite Studie zu Cybersecurity-Verweigerungen bei KI-Agenten fand, dass sechs von acht getesteten Frontier-Modellen nahezu keine Verweigerungsrate zeigten; nur GPT-5.2 und GPT-5.1 Codex wiesen nennenswertes Verweigerungsverhalten auf. Die Autoren stellen einen Rahmen für Verweigerungsgrenzen in offensiven Sicherheitskontexten vor. Eine dritte Studie zeigt, dass Verweigerung in Sprachmodellen durch eine eindimensionale Subraumrichtung vermittelt wird. Das Entfernen dieser Richtung verhindert Verweigerung, das Hinzufügen löst Verweigerung auch bei harmlosen Anfragen aus. Die Analyse umfasste 13 populäre Open-Source-Chatmodelle bis 72 Milliarden Parameter. Die Autoren demonstrieren einen White-Box-Jailbreak, der die Verweigerungsrichtung gezielt deaktiviert. Eine vierte Studie zu expliziten Verweigerungen im Kontext des humanitären Völkerrechts ergab, dass die meisten Modelle unrechtmäßige Anfragen ablehnten, die Klarheit der Antworten jedoch variierte. Ein standardisierter Sicherheits-Prompt verbesserte die Erklärungsqualität in den meisten Modellen. Komplexere Prompts mit technischer Sprache oder Code-Anfragen offenbarten jedoch weiterhin Schwachstellen. Die Studie bewertet acht führende LLMs hinsichtlich ihrer Fähigkeit, rechtswidrige Anfragen abzulehnen und hilfreiche Erklärungen zu liefern. Die Ergebnisse zeigen, dass Verweigerung nicht per se gut oder schlecht ist, sondern von Kontext, Häufigkeit und Erklärungsqualität abhängt. Während die Cybersecurity-Studie auf fehlende Verweigerung hinweist, zeigt die Subraum-Studie, dass Verweigerung technisch fragil ist.

Der Widerspruch: Produktwert versus Nutzerzufriedenheit

Der dev.to-Autor argumentiert normativ: Eine persönliche KI, die verweigert, sei wertvoller als eine, die zustimmt, weil sie Urteilsvermögen besitze. Die Studie zur Nutzerzufriedenheit liefert dagegen ein empirisches Bild: Nutzer sind mit echten Antworten am zufriedensten, gefolgt von Halluzinationen und dann Verweigerungen. Verweigerungen führen zu geringerer Zufriedenheit, selbst wenn sie korrekt sind. Der Widerspruch liegt in der unterschiedlichen Bewertungsgrundlage. Der Autor bewertet den Produktwert aus der Perspektive des Urteilsvermögens und der Qualität der Ergebnisse. Die Studie misst die unmittelbare Zufriedenheit der Nutzer in kontrollierten Interaktionen. Beide Perspektiven schließen sich nicht aus, zeigen aber eine Spannung: Was langfristig wertvoll sein mag, kann kurzfristig frustrieren. Der Autor räumt ein, dass Verweigerung als Fehler gesehen werden kann und Zufriedenheitswerte sinken könnten. Er hält dagegen, dass reine Compliance keinen Mehrwert biete. Die Studie zeigt jedoch, dass Nutzer Halluzinationen gegenüber Verweigerungen bevorzugen, obwohl sie Halluzinationen als weniger akkurat erkennen. Das deutet darauf hin, dass Nutzer lieber eine Antwort erhalten, auch wenn sie falsch ist, als gar keine. Für die Gestaltung persönlicher KIs bedeutet das: Verweigerung muss sorgfältig dosiert und erklärt werden, um akzeptiert zu werden. Der normative Anspruch des Entwicklers steht im Kontrast zu den empirischen Befunden. Während er Verweigerung als Ausdruck von Geschmack und Urteilsvermögen sieht, empfinden viele Nutzer sie als Mangel an Hilfsbereitschaft. Die Studie zeigt, dass Erklärungen die Zufriedenheit bei seltenen Verweigerungen erhöhen können, aber nicht bei häufigen. Das legt nahe, dass eine persönliche KI, die zu oft Nein sagt, riskiert, vom Nutzer als unkooperativ wahrgenommen zu werden. Der Entwickler setzt darauf, dass die KI nicht nur ablehnt, sondern einen besseren Weg vorschlägt – das könnte die negative Wirkung abmildern, ist aber nicht empirisch belegt.

Offene Fragen für die Gestaltung nutzerfreundlicher Verweigerung

Das Konzept und die Studien werfen Fragen auf: Wie lässt sich Verweigerung so gestalten, dass Nutzer sie akzeptieren? Die Studie zum humanitären Völkerrecht zeigt, dass ein standardisierter Sicherheits-Prompt die Erklärungsqualität verbessert. Die Nutzerstudie zeigt, dass Erklärungen bei seltenen Verweigerungen die Zufriedenheit erhöhen. Das spricht dafür, Verweigerungen mit klaren Begründungen und Alternativen zu versehen. Der Entwickler sieht genau das vor: Die KI soll nicht nur ablehnen, sondern einen besseren Weg anbieten. Ob das die Zufriedenheit tatsächlich steigert, ist offen. Die Studien deuten außerdem darauf hin, dass die Häufigkeit der Verweigerung entscheidend ist: Zu häufige Verweigerungen senken die Zufriedenheit, unabhängig von Erklärungen. Für die Gestaltung nutzerfreundlicher Verweigerung wären weitere Untersuchungen nötig, die den Einfluss von Alternativvorschlägen, Erklärungsformaten und Nutzermerkmalen systematisch testen. Das Konzept des Entwicklers liefert einen praktischen Ansatz, dessen Wirkung jedoch nicht belegt ist. Die Subraum-Studie zeigt zudem, dass Verweigerung technisch fragil ist: Eine einzige Richtung im Modell kann sie auslösen oder unterdrücken. Das wirft die Frage auf, ob eine per System-Prompt implementierte Verweigerung zuverlässig funktioniert. Der Entwickler hat die Verweigerung als Persönlichkeitseigenschaft modelliert, nicht als Sicherheitsmechanismus. Ob das zu konsistentem Verhalten führt, ist unklar. Die Studien legen nahe, dass nutzerfreundliche Verweigerung selten, erklärt und mit Alternativen verbunden sein sollte. Das Konzept des Entwicklers erfüllt zumindest den letzten Punkt. Ob es die Nutzerzufriedenheit erhält, muss sich in der Praxis zeigen.

J
Jasmin Freitag
Redaktion · KI-Anwendungen & Tools

Jasmin Freitag beobachtet für KI Spotlight die praktische Seite der künstlichen Intelligenz: neue Anwendungen, generative Werkzeuge, kreative KI und den Einsatz von Tools im Alltag und in Unternehmen. Sie erklärt praxisnah, was ein Werkzeug wirklich taugt.

Quellen

  1. dev.to ↗

Ähnliche Artikel