BI-Agent und BI-Bench: LLMs scheitern an End-to-End-Business-Intelligence
Studie zeigt: Selbst führende Sprachmodelle erreichen weniger als 50 Prozent Genauigkeit bei realen BI-Aufgaben
Mit KI erstellt◆ Fakten auf einen Blick
- BI-Agent zerlegt BI-Workflows in Teilaufgaben auf strukturierten Daten wie Suche, Join und Transformation und orchestriert spezialisierte Datenmanagement-Methoden über die BI-Stufen hinweg.
- BI-Bench wurde aus einer großen Sammlung realer BI-Projekte aus öffentlichen Quellen gewonnen; daraus wurden Paare aus Fragen und Ground-Truth-Antworten aus echten Nutzer-Dashboards extrahiert.
- Selbst führende LLMs erreichen auf BI-Bench eine Genauigkeit von weniger als 50%.
- Die Autoren entwickeln ein Post-Training-Framework, das Trainings-Trajektorien aus realen BI-Projekten synthetisiert, um BI-Agent zu verbessern.
- Traditionelle BI-Workflows umfassen die Schritte: relevante Tabellen identifizieren, Datentransformationen durchführen, Join-Beziehungen aufbauen und anschließend Geschäftsfragen beantworten.
- BI-Bench wird als erster Benchmark bezeichnet, der die Fähigkeit von LLMs für End-to-End-BI systematisch untersucht.
BI-Agent zerlegt BI-Workflows in Teilaufgaben
Traditionelle BI-Workflows in Werkzeugen wie Power BI oder Tableau verlangen von Nutzern, relevante Tabellen zu identifizieren, Datentransformationen durchzuführen, Join-Beziehungen aufzubauen und erst dann Geschäftsfragen zu beantworten. Diese Schritte sind komplex und zeitaufwendig. Um die Fähigkeit von Large Language Models (LLMs) zu untersuchen, BI-Fragen Ende-zu-Ende zu beantworten, ohne dass Nutzer die manuellen Vorbereitungsschritte durchführen müssen, haben die Autoren der Studie einen tool-unterstützten BI-Agent entwickelt. Dieser Agent zerlegt BI-Workflows in Teilaufgaben auf strukturierten Daten – etwa Suche, Join und Transformation – und orchestriert spezialisierte Datenmanagement-Methoden über alle BI-Stufen hinweg. Die Zerlegung in Teilaufgaben ermöglicht es, für jede Aufgabe geeignete Methoden einzusetzen, anstatt den gesamten Workflow in einem einzigen Schritt zu bewältigen: So kann die Suche nach relevanten Tabellen auf spezialisierte Tabellenerkennungsverfahren zurückgreifen, während Joins und Transformationen jeweils mit dafür optimierten Datenmanagement-Methoden bearbeitet werden. Der BI-Agent ersetzt die manuellen Vorbereitungsschritte technisch, indem er die Tabellensuche automatisiert durchführt, Join-Beziehungen selbstständig aufbaut und Datentransformationen eigenständig vornimmt – Nutzer müssen diese Schritte nicht mehr von Hand ausführen. Die Teilaufgaben Suche, Join und Transformation entsprechen den manuellen Schritten, die Nutzer in traditionellen BI-Workflows ausführen müssen. Der Agent orchestriert diese Methoden über alle BI-Stufen hinweg, von der Datenvorbereitung bis zur Beantwortung der Geschäftsfrage.
BI-Bench: LLMs erreichen unter 50 Prozent Genauigkeit
Der zugehörige Benchmark BI-Bench wurde aus einer großen Sammlung realer BI-Projekte aus öffentlichen Quellen gewonnen. Die Forscher extrahierten daraus manuell Paare aus Fragen und Ground-Truth-Antworten aus echten Nutzer-Dashboards. Nach Angaben des Teams ist BI-Bench der erste Benchmark, der die Fähigkeit von LLMs für End-to-End-BI systematisch untersucht. Die Ergebnisse zeigen: Selbst führende LLMs erreichen auf BI-Bench eine Genauigkeit von weniger als 50 Prozent. Besonders schwach sind die Modelle bei der Identifikation relevanter Tabellen, beim Aufbau korrekter Join-Beziehungen und bei der Durchführung passender Datentransformationen – genau jene Teilaufgaben, die in traditionellen BI-Workflows manuell erledigt werden. Die geringe Genauigkeit zeigt, dass End-to-End-BI für LLMs eine große Herausforderung darstellt. Die Modelle müssen dabei relevante Tabellen identifizieren, Datentransformationen durchführen, Join-Beziehungen aufbauen und schließlich die Geschäftsfrage beantworten – alles ohne manuelle Eingriffe. Um diese Einschränkungen zu adressieren, entwickeln die Autoren ein Post-Training-Framework, das Trainings-Trajektorien aus realen BI-Projekten synthetisiert. Dieses Framework soll BI-Agent verbessern, indem es aus den Abläufen echter BI-Workflows Trainingssequenzen erzeugt, die die einzelnen Schritte des Agenten nachbilden. Ziel ist es, BI-Agent mit realistischen Trainingsdaten zu versorgen, die aus tatsächlichen BI-Projekten stammen.



