Live Chatham Financial reduziert Prüfzeit von 30 Minuten auf unter 4 Minuten mit OpenAI-Modellen
↘

Argo-Bench: Neuer Benchmark für Data Agents – bestes Modell erreicht nur 34,8 Prozent Top-Score

TextQL Labs veröffentlicht ein Evaluierungs-Framework, das Agenten anhand der Konsequenzen ihrer Handlungen in einer simulierten Unternehmensumgebung bewertet.

· Veröffentlicht: 02.10.2026 ·1 Min Lesezeit
Argo-Bench: Neuer Benchmark für Data Agents – bestes Modell erreicht nur 34,8 Prozent Top-ScoreMit KI erstellt
◆ Fakten auf einen Blick
  • Argo-Bench ist ein Evaluierungs-Framework mit 210 Data-Science- und Analytics-Aufgaben.
  • Es simuliert eine Essenslieferplattform in New York City mit 81 Millionen Bestellungen im Jahr 2024, inklusive realistischer Ökonomie, Betrugsmustern und Marktanreizen.
  • Die Simulation wird in ein ERP-Warehouse mit 235 Tabellen und 7,5 Milliarden Zeilen exportiert, modelliert nach dem Oracle E-Business Suite Schema.
  • Der Ground-Truth-Zustand des Simulators wird dem Agenten vorenthalten; Aufgaben erfordern die Rekonstruktion von Fakten durch Navigation im Warehouse, bevor gehandelt wird.
  • Argo-Bench geht über Text-to-SQL hinaus: Agenten reichen Aktionen ein (z. B. Sperren betrügerischer Konten, Zuweisen von Kurier-Anreizbudgets, Auszahlen von Nachzahlungen); die Bewertung erfolgt anhand der Konsequenzen im Simulator.
  • Jede Aufgabe hat eine ausführbare Referenzlösung, die die Lösbarkeit nur mit dem Warehouse demonstriert.

Neuer Benchmark Argo-Bench: Bestes Modell erreicht nur 34,8 Prozent Top-Score

TextQL Labs hat mit Argo-Bench ein neues Evaluierungs-Framework für Data Agents vorgestellt. Der Benchmark umfasst 210 Data-Science- und Analytics-Aufgaben, die in einer simulierten Essenslieferplattform in New York City angesiedelt sind. Die Simulation basiert auf 81 Millionen Bestellungen aus dem Jahr 2024 und enthält realistische Ökonomie, Betrugsmuster und Marktanreize. Sie wird in ein ERP-Warehouse mit 235 Tabellen und 7,5 Milliarden Zeilen exportiert, das dem Schema der Oracle E-Business Suite nachempfunden ist. In einer ersten Evaluation von 14 Frontier- und Open-Weight-Modellen erreichte das beste Modell, Claude Opus 5.5, nur bei 34,8 Prozent der Aufgaben einen Score von 95 oder höher. Im Durchschnitt erzielte es 59,5 von 100 Punkten. Das Paper wurde am 1. Oktober auf arXiv veröffentlicht (arXiv:2610.02122) und umfasst 41 Seiten. Die Autoren sind Gabriel Tomitsuka, Arman Raayatsanati, Emma Xing, Duke Gand und Joseph J. Ma von TextQL Labs.

Bewertung anhand von Handlungskonsequenzen statt Query-Korrektheit

Der entscheidende Unterschied zu bisherigen Text-to-SQL-Benchmarks liegt in der Bewertungsmethode. Argo-Bench misst nicht die Korrektheit von SQL-Queries, sondern die Konsequenzen der Aktionen, die ein Agent im Simulator einreicht. Dazu reicht der Agent über eine Mission-Control-Konsole Handlungen ein – etwa das Sperren betrügerischer Konten, die Zuweisung von Kurier-Anreizbudgets oder die Auszahlung von Nachzahlungen. Der Grader bewertet jede Aktion anhand ihrer Auswirkungen im Simulator, beispielsweise verhinderte Betrugsverluste oder Prognosen gegen zurückgehaltene Monate. Der Ground-Truth-Zustand des Simulators wird dem Agenten vorenthalten; jede Aufgabe erfordert die Rekonstruktion von Fakten durch Navigation im Warehouse. Jede Aufgabe besitzt eine ausführbare Referenzlösung, die die Lösbarkeit allein mit dem Warehouse demonstriert. Das zugehörige Repository enthält die Fragen, einen Referenz-Agenten auf Basis von Inspect AI, zwei Tool-Server, Sandboxes und Modellkonfigurationen. Das Warehouse wird separat veröffentlicht, die Antwortschlüssel werden zurückgehalten. Ein separater Beitrag zu Webservices für KI-Agenten skizziert drei Prinzipien und einen radikalen Gegenentwurf.

J
Jasmin Freitag
Redaktion · KI-Anwendungen & Tools

Jasmin Freitag beobachtet für KI Spotlight die praktische Seite der künstlichen Intelligenz: neue Anwendungen, generative Werkzeuge, kreative KI und den Einsatz von Tools im Alltag und in Unternehmen. Sie erklärt praxisnah, was ein Werkzeug wirklich taugt.

Ähnliche Artikel