Studie unterscheidet horizontale und vertikale Proaktivität bei KI-Agenten
Neue Methode Q&D trainiert Frageverhalten ohne Belohnungsmodell
Mit KI erstellt◆ Fakten auf einen Blick
- Die Studie führt die Konzepte horizontaler und vertikaler Proaktivität bei KI-Agenten ein.
- Horizontale Proaktivität verfolgt unausgesprochene Informationen, die der aktuelle Kontext bereits identifiziert.
- Vertikale Proaktivität verfolgt Bedürfnisse, die nur frühere Evidenz aufdeckt.
- Die Studie schlägt die Methode Q&D (questioner and drafter) vor, die einen Questioner trainiert, die Frage zu bevorzugen, deren Fortsetzung mehr der benötigten Evidenz abruft, ohne Reward-Modell oder Judge.
- Auf held-out splits von drei Multi-Hop-QA-Benchmarks verbessert der trainierte Questioner beide Formen der Proaktivität gegenüber demselben Modell, prompted, und übertrifft ein prompted Modell, das 15-mal größer ist, auf zwei von drei Benchmarks.
- Der Gewinn bleibt nach Kontrolle von Fragenvolumen und -länge bestehen.
Zwei Formen proaktiver KI: horizontal und vertikal
Die Studie stellt fest, dass bisherige Arbeiten zu proaktiven Agenten vor allem untersuchen, ob und wann ein Agent eigenständig handeln sollte – nicht jedoch, welche Informationen er dabei verfolgen sollte. Ein Agent, der Werkzeuge nutzt, reagiert typischerweise auf explizite Anfragen; die Aufgabenerfüllung kann aber Informationen erfordern, die nie angefragt wurden. Die Autoren führen deshalb eine eigene Achse der Proaktivität ein: ihren Inhalt. Horizontale Proaktivität verfolgt unausgesprochene Informationen, die der aktuelle Kontext bereits identifiziert. Das sind naheliegende Ergänzungen, die sich unmittelbar aus der Situation ergeben – etwa wenn ein Agent bei einer Frage nach einem Restaurant automatisch auch die Öffnungszeiten prüft, weil der Kontext dies nahelegt. Vertikale Proaktivität geht tiefer: Sie verfolgt Bedürfnisse, die nur frühere Evidenz aufdeckt. Das sind Informationen, die erst durch vorherige Schritte oder abgeleitete Abhängigkeiten sichtbar werden – etwa wenn ein Agent aus einer früheren Anfrage schließt, dass der Nutzer eine bestimmte Vorliebe hat, und diese Information später proaktiv einbezieht. Um beide Formen messbar zu machen, rekonstruiert die Studie aus der Zerlegung eines Benchmarks einen Bedürfnisgraphen. Dieser Graph zeichnet auf, welche Bedürfnisse voneinander abhängen, sodass horizontale und vertikale Proaktivität sowie das rechtzeitige Stoppen des Agenten allein aus einem Transkript bewertet werden können – ohne Modellrichter. Indem die Studie den Inhalt als messbare Größe etabliert, verlagert sie den Fokus von der Frage, ob ein Agent aktiv werden soll, hin zu der Frage, was er inhaltlich anstrebt.
Q&D: Frageverhalten trainieren ohne Belohnungsmodell
Um das gewünschte Frageverhalten zu erlernen, schlägt die Studie die Methode Q&D vor – kurz für questioner and drafter. Dabei wird ein Questioner trainiert, diejenige Frage zu bevorzugen, deren Fortsetzung mehr der benötigten Evidenz abruft. Das Training kommt ohne Belohnungsmodell oder externen Richter aus; die Präferenz ergibt sich direkt aus dem Abruf der erforderlichen Belege. Der Questioner lernt also, Fragen so zu stellen, dass die Antworten möglichst viele der noch fehlenden Informationen liefern, anstatt auf eine nachträgliche Bewertung durch einen Judge angewiesen zu sein. Auf zurückgehaltenen Testdaten von drei Benchmarks für mehrstufige Frage-Antwort-Aufgaben verbessert der trainierte Questioner beide Formen der Proaktivität gegenüber demselben Modell, das lediglich per Prompt angesteuert wird. Zudem übertrifft er ein per Prompt angesteuertes Modell, das 15-mal größer ist, auf zwei der drei Benchmarks. Der gemessene Gewinn bleibt bestehen, wenn man Fragenvolumen und -länge kontrolliert. Das bedeutet, der Vorteil ist nicht darauf zurückzuführen, dass der trainierte Questioner einfach mehr oder längere Fragen stellt; auch bei gleichem Aufwand an Fragen ist er überlegen. Ohne weiteres Training wird der Questioner in einen interaktiven Kundenservice-Agenten mit simuliertem Kunden eingesetzt. Das zeigt, dass sich das trainierte Verhalten auf eine andere Anwendung übertragen lässt, ohne dass eine erneute Anpassung nötig ist.



