Live OpenAI-Agenten drangen in australisches Regierungsportal ein
↘

XConf: Neuer Confidence-Schätzer setzt auf gespeicherte Erfahrung statt Logit-Zugriff

Ein Forschungsteam der University of Cambridge und Google DeepMind stellt mit XConf einen neuen, trainingsfreien Confidence-Schätzer für LLMs vor, der die Zuverlässigkeit einer Antwort nicht aus dem aktuellen Inferenzprozess, sondern aus der gespeicherten, bewerteten Erfahrung des Modells ableitet.

· Veröffentlicht: 25.09.2026 ·3 Min Lesezeit
XConf: Neuer Confidence-Schätzer setzt auf gespeicherte Erfahrung statt Logit-ZugriffMit KI erstellt
Inhalt
◆ Fakten auf einen Blick
  • Die Autor:innen sind Caiqi Zhang, Xiaochen Zhu, Chengzu Li, Yulong Chen, Dharshan Kumaran und Nigel Collier von University of Cambridge und Google DeepMind.
  • Das Paper 'Confidence Comes from Experience: Experiential Confidence Estimation from Reasoning to Agents' wurde am 15. September 2026 veröffentlicht.
  • XConf speichert bewertete vergangene Episoden mit Aufgabe, Reflexion, geäußerter Confidence, Ergebnis und Lektion; die Recall-Stufe ruft ähnliche Episoden ab und liest die historische Erfolgsrate, die Reflect-Stufe lässt das Modell wiederkehrende Fehlermuster benennen und eine kalibrierte Confidence neu formulieren; die finale Schätzung ist der Mittelwert aus statistischer und verbaler Lesung.
  • XConf ist trainingsfrei, black-box-fähig, formatunabhängig, benötigt keinen Logit-Zugriff oder Gewichtsupdates und kostet nur eine Antwortgenerierung.
  • Über neun Benchmarks (Reasoning, Coding, multimodales QA, interaktive Agenten) und vier Modelle aus drei Familien erreicht XConf in 23 von 24 Vergleichen mindestens das AUROC-Niveau von 10-Sample-Self-Consistency, bei niedrigerem ECE und einem Zehntel der Generierungskosten.
  • Bei selektiver Vorhersage erhöht das Abweisen der 10 % am wenigsten confidenten Episoden die Erfolgsrate in Agentenaufgaben um bis zu 8,7 Prozentpunkte.

Erfahrungsbasierte Confidence statt Logit-Zugriff

Ein Forschungsteam der University of Cambridge und Google DeepMind hat mit XConf einen neuen Confidence-Schätzer für große Sprachmodelle vorgestellt. Das Paper „Confidence Comes from Experience: Experiential Confidence Estimation from Reasoning to Agents“ wurde am 15. September 2026 veröffentlicht. Die Autoren sind Caiqi Zhang, Xiaochen Zhu, Chengzu Li, Yulong Chen, Dharshan Kumaran und Nigel Collier. Der Kern des Ansatzes: Statt die Zuverlässigkeit einer Antwort aus dem aktuellen Inferenzprozess abzuleiten – etwa durch verbale Selbstauskunft, Token-Wahrscheinlichkeiten oder Self-Consistency – greift XConf auf die gespeicherte, bewertete Erfahrung des Modells zurück. Bestehende Verfahren betrachten nur die gerade erzeugte Antwort und versagen, wenn das Modell wiederholt denselben Fehler macht. XConf ist trainingsfrei, black-box-fähig, formatunabhängig, benötigt keinen Logit-Zugriff oder Gewichtsupdates und kostet nur eine Antwortgenerierung. Nach eigener Aussage der Autoren handelt es sich um ein neues Paradigma für universelle Confidence-Schätzung.

So funktioniert die Recall-Reflect-Pipeline

XConf speichert vergangene, benotete Episoden. Jede Episode enthält die Aufgabe, die Reflexion des Modells, die damals geäußerte Confidence, das tatsächliche Ergebnis und eine Lektion, die nach Erhalt der Bewertung formuliert wurde. Bei einer neuen Aufgabe ruft die Recall-Stufe ähnliche Episoden ab – basierend auf einem korrektheitsüberwachten Schlüssel aus Aufgaben-Embedding und geäußerter Confidence – und liest deren historische Erfolgsrate aus. Die Reflect-Stufe zeigt dem Modell die abgerufenen Episoden als kurze Karten mit Aufgabe, damaliger Confidence, Ergebnis und Lektion. Das Modell benennt wiederkehrende Fehlermuster und formuliert eine kalibrierte Confidence neu. Die finale Schätzung ist der Mittelwert aus statistischer (Recall) und verbaler (Reflect) Lesung, gleich gewichtet. Das Verfahren erfordert keinen Logit-Zugriff, kein Gewichtsupdate und keine zusätzliche Antwortgenerierung: Die Confidence-Schätzung selbst kostet nur die bereits erzeugte Antwort.

Benchmarks: 23 von 24 Vergleichen auf Self-Consistency-Niveau

Über neun Benchmarks aus Reasoning, Coding, multimodalem Question Answering und interaktiven Agenten sowie vier Modelle aus drei Modellfamilien erreicht XConf in 23 von 24 Vergleichen mindestens das AUROC-Niveau von 10-Sample-Self-Consistency. Dabei ist der Kalibrierungsfehler (ECE) niedriger und die Generierungskosten betragen nur ein Zehntel. Bei selektiver Vorhersage erhöht das Abweisen der 10 Prozent am wenigsten confidenten Episoden die Erfolgsrate in Agentenaufgaben um bis zu 8,7 Prozentpunkte. Die Ergebnisse zeigen, dass der erfahrungsbasierte Ansatz mit aufwendigeren Resampling-Methoden mithalten kann, ohne deren Rechenaufwand zu benötigen.

Ablationen zeigen: Gespeicherte Erfahrung ist der Kern

Ablationsstudien belegen, dass der erfahrungsbasierte Mechanismus tatsächlich die Ursache der Leistung ist. Das Mischen gespeicherter Ergebnisse zerstört die Schätzung, das Entfernen von Aufzeichnungen beseitigt den Gewinn, und das Erweitern der Aufzeichnungen verbessert die Kalibrierung. Diese Befunde schließen aus, dass die Verbesserungen auf anderen Faktoren beruhen, und bestätigen die zentrale Rolle der gespeicherten, bewerteten Erfahrung für die Confidence-Schätzung.

Warum Kalibrierung für LLM-Evaluierung zählt

Kalibrierung ist ein zentrales Kriterium für vertrauenswürdige LLM-Outputs, insbesondere in hochriskanten Bereichen wie Code-Generierung, Browser-Automatisierung oder medizinischer Entscheidungsunterstützung. Ein Positionspapier fordert Kalibrierung als Pflichtkriterium der LLM-Evaluierung. XConf adressiert diese Anforderung, indem es Confidence aus der eigenen Erfolgsbilanz ableitet statt aus dem aktuellen Inferenzprozess. Laut eigener Aussage der Autoren handelt es sich bei XConf um ein neues Paradigma für universelle Confidence-Schätzung – ein Ansatz, der ohne Logit-Zugriff oder Gewichtsupdates auskommt und damit auch für Black-Box-Modelle einsetzbar ist.

A
Andreas Rüdiger
Herausgeber & Redaktionsleitung · KI-Modelle, Technik & Business

Andreas Rüdiger ist Gründer der Agentur INREMA und verantwortet KI Spotlight redaktionell. Sein Schwerpunkt liegt auf KI-Modellen, Recheninfrastruktur, technischen Entwicklungen und der wirtschaftlichen Einordnung. Er sorgt dafür, dass komplexe KI-Themen verständlich und nachvollziehbar aufbereitet werden. Mehr zu ihm auf inrema.de und andiger.de.

Ähnliche Artikel