Live dev.to-Leitfaden nennt fünf Guardrails für LLM-Agenten – Benchmarks zeigen strukturelle Grenzen

BI-Agent und BI-Bench: LLMs scheitern an End-to-End-Business-Intelligence

Studie zeigt: Selbst führende Sprachmodelle erreichen weniger als 50 Prozent Genauigkeit bei realen BI-Aufgaben

· Veröffentlicht: 22.09.2026 ·2 Min Lesezeit
BI-Agent und BI-Bench: LLMs scheitern an End-to-End-Business-IntelligenceMit KI erstellt
◆ Fakten auf einen Blick
  • BI-Agent zerlegt BI-Workflows in Teilaufgaben auf strukturierten Daten wie Suche, Join und Transformation und orchestriert spezialisierte Datenmanagement-Methoden über die BI-Stufen hinweg.
  • BI-Bench wurde aus einer großen Sammlung realer BI-Projekte aus öffentlichen Quellen gewonnen; daraus wurden Paare aus Fragen und Ground-Truth-Antworten aus echten Nutzer-Dashboards extrahiert.
  • Selbst führende LLMs erreichen auf BI-Bench eine Genauigkeit von weniger als 50%.
  • Die Autoren entwickeln ein Post-Training-Framework, das Trainings-Trajektorien aus realen BI-Projekten synthetisiert, um BI-Agent zu verbessern.
  • Traditionelle BI-Workflows umfassen die Schritte: relevante Tabellen identifizieren, Datentransformationen durchführen, Join-Beziehungen aufbauen und anschließend Geschäftsfragen beantworten.
  • BI-Bench wird als erster Benchmark bezeichnet, der die Fähigkeit von LLMs für End-to-End-BI systematisch untersucht.

BI-Agent zerlegt BI-Workflows in Teilaufgaben

Traditionelle BI-Workflows in Werkzeugen wie Power BI oder Tableau verlangen von Nutzern, relevante Tabellen zu identifizieren, Datentransformationen durchzuführen, Join-Beziehungen aufzubauen und erst dann Geschäftsfragen zu beantworten. Diese Schritte sind komplex und zeitaufwendig. Um die Fähigkeit von Large Language Models (LLMs) zu untersuchen, BI-Fragen Ende-zu-Ende zu beantworten, ohne dass Nutzer die manuellen Vorbereitungsschritte durchführen müssen, haben die Autoren der Studie einen tool-unterstützten BI-Agent entwickelt. Dieser Agent zerlegt BI-Workflows in Teilaufgaben auf strukturierten Daten – etwa Suche, Join und Transformation – und orchestriert spezialisierte Datenmanagement-Methoden über alle BI-Stufen hinweg. Die Zerlegung in Teilaufgaben ermöglicht es, für jede Aufgabe geeignete Methoden einzusetzen, anstatt den gesamten Workflow in einem einzigen Schritt zu bewältigen: So kann die Suche nach relevanten Tabellen auf spezialisierte Tabellenerkennungsverfahren zurückgreifen, während Joins und Transformationen jeweils mit dafür optimierten Datenmanagement-Methoden bearbeitet werden. Der BI-Agent ersetzt die manuellen Vorbereitungsschritte technisch, indem er die Tabellensuche automatisiert durchführt, Join-Beziehungen selbstständig aufbaut und Datentransformationen eigenständig vornimmt – Nutzer müssen diese Schritte nicht mehr von Hand ausführen. Die Teilaufgaben Suche, Join und Transformation entsprechen den manuellen Schritten, die Nutzer in traditionellen BI-Workflows ausführen müssen. Der Agent orchestriert diese Methoden über alle BI-Stufen hinweg, von der Datenvorbereitung bis zur Beantwortung der Geschäftsfrage.

BI-Bench: LLMs erreichen unter 50 Prozent Genauigkeit

Der zugehörige Benchmark BI-Bench wurde aus einer großen Sammlung realer BI-Projekte aus öffentlichen Quellen gewonnen. Die Forscher extrahierten daraus manuell Paare aus Fragen und Ground-Truth-Antworten aus echten Nutzer-Dashboards. Nach Angaben des Teams ist BI-Bench der erste Benchmark, der die Fähigkeit von LLMs für End-to-End-BI systematisch untersucht. Die Ergebnisse zeigen: Selbst führende LLMs erreichen auf BI-Bench eine Genauigkeit von weniger als 50 Prozent. Besonders schwach sind die Modelle bei der Identifikation relevanter Tabellen, beim Aufbau korrekter Join-Beziehungen und bei der Durchführung passender Datentransformationen – genau jene Teilaufgaben, die in traditionellen BI-Workflows manuell erledigt werden. Die geringe Genauigkeit zeigt, dass End-to-End-BI für LLMs eine große Herausforderung darstellt. Die Modelle müssen dabei relevante Tabellen identifizieren, Datentransformationen durchführen, Join-Beziehungen aufbauen und schließlich die Geschäftsfrage beantworten – alles ohne manuelle Eingriffe. Um diese Einschränkungen zu adressieren, entwickeln die Autoren ein Post-Training-Framework, das Trainings-Trajektorien aus realen BI-Projekten synthetisiert. Dieses Framework soll BI-Agent verbessern, indem es aus den Abläufen echter BI-Workflows Trainingssequenzen erzeugt, die die einzelnen Schritte des Agenten nachbilden. Ziel ist es, BI-Agent mit realistischen Trainingsdaten zu versorgen, die aus tatsächlichen BI-Projekten stammen.

J
Jasmin Freitag
Redaktion · KI-Anwendungen & Tools

Jasmin Freitag beobachtet für KI Spotlight die praktische Seite der künstlichen Intelligenz: neue Anwendungen, generative Werkzeuge, kreative KI und den Einsatz von Tools im Alltag und in Unternehmen. Sie erklärt praxisnah, was ein Werkzeug wirklich taugt.

Ähnliche Artikel