NVIDIA: KI-Agenten-Evaluierung bewertet ganze Aufgaben statt einzelner Tool-Calls
Blogpost beschreibt Framework mit Ausführungsumgebung und zwei Scoring-Ebenen
Mit KI erstellt◆ Fakten auf einen Blick
- OpenAI Platform bietet Evaluierungstools, darunter Trace grading, Datasets und eval runs.
- AgentBench ist ein multi-dimensionaler Benchmark mit 8 Umgebungen zur Bewertung von LLM-as-Agent.
- Das im NVIDIA-Blog beschriebene Evaluierungskonzept umfasst zwei Scoring-Ebenen: Step-level (Process Scoring) und Task-level.
NVIDIA: Evaluierung von KI-Agenten misst jetzt ganze Aufgaben statt einzelner Tool-Calls
Wie NVIDIA in einem Blogpost beschreibt, hat sich die Evaluierung von KI-Agenten grundlegend verändert: Statt einzelner Tool-Calls wird nun die gesamte Aufgabenabwicklung bewertet. Der entscheidende Punkt beim Einsatz eines Agenten sei, ob er eine Kette von Arbeitsschritten über Dutzende sequenzieller Tool-Calls in einer Live-Umgebung ausführen und sich von Fehlern erholen kann. Ob die Antwort des Modells plausibel klingt, sage fast nichts darüber aus, ob die Arbeit tatsächlich erledigt wurde. Diese Lücke habe die Entwicklung vorangetrieben: von der Bewertung eines einzelnen Funktionsaufrufs hin zur Bewertung einer ganzen Aufgabe, wobei Tool-Calls das verbindende Element darstellen. Ursprüngliche Testumgebungen waren für statische Aufgaben ausgelegt, doch Agenten arbeiten über mehrere Schritte, rufen Werkzeuge auf, behandeln Fehler und beobachten Ergebnisse. Ein einzelner Ausgabestring reicht nicht mehr aus. Das Berkeley Function-Calling Leaderboard (BFCL) bewertet zwar die Auswahl von Funktionen und die Genauigkeit der Argumente, prüft aber nur einzelne Aufrufe – ein formal korrekter Aufruf kann dennoch scheitern, wenn zugrunde liegende Prüfungen oder Aktualisierungen übersprungen wurden.
Zwei Scoring-Ebenen und echte Ausführungsumgebung als Kern des Frameworks
Für eine vollständige agentische Evaluierung sei laut NVIDIA eine vollständige Ausführungsumgebung erforderlich. Diese führt jeden Tool-Call tatsächlich aus, verfolgt den Zustand über alle Schritte hinweg und liest anschließend den Weltzustand, um zu entscheiden, ob die Arbeit erledigt wurde. Auf dieser Umgebung sitzen zwei Scoring-Ebenen. Die Step-level-Ebene, auch Process Scoring genannt, fragt, ob der einzelne Aufruf korrekt war. Die Task-level-Ebene bewertet das Gesamtergebnis der Aufgabe. Damit werden sowohl die Qualität einzelner Schritte als auch der Endzustand beurteilt. Der Blogpost betont, dass nahezu jeder ernsthafte Agenten-Benchmark inzwischen auf Tool-Nutzung beruht. Die Ausführungsumgebung ist der Kern des Frameworks, weil sie es ermöglicht, nicht nur die Antworten des Modells zu prüfen, sondern die tatsächliche Wirkung der Tool-Calls in einer simulierten oder realen Umgebung zu messen. So lässt sich feststellen, ob ein Agent eine Aufgabe wirklich abgeschlossen hat, statt nur plausible Zwischenschritte zu liefern.



