Live Restock: Beispiel-Agent kauft über Slack mit MPP und Stripe Link ein
↘

NVIDIA KGMON: Platz zwei beim KDD Cup 2026 mit schlankerem Agenten-Harness

Wie ein kleineres, klareres Harness ein kleines LLM zuverlässig macht

· Veröffentlicht: 10.10.2026 ·2 Min Lesezeit
NVIDIA KGMON: Platz zwei beim KDD Cup 2026 mit schlankerem Agenten-HarnessMit KI erstellt
◆ Fakten auf einen Blick
  • Das NVIDIA KGMON-Team belegte beim KDD Cup 2026 Data Agents Wettbewerb den zweiten Platz.
  • Das System wurde um die Idee herum gebaut, den Agenten-Harness kleiner, klarer und leichter verifizierbar zu machen.
  • Der Wettbewerb verlangte die Beantwortung natürlichsprachlicher Fragen über heterogene Datenquellen: Datenbanken, CSV-/JSON-Dateien, Prosadokumente, PDFs und Briefing-Videos.
  • Jede Aufgabe erforderte mehr als reine Retrieval: Daten inspizieren, passende Tools wählen, über Quellen hinweg schlussfolgern, eine finale Antwortdatei erzeugen und mit Fallstricken umgehen.
  • Der KDD Cup verlangte von den Teams, mit einem kleinen, festen LLM zu arbeiten; dadurch wurde der Harness zur Haupt-Optimierungsfläche.
  • Das Team zielte darauf ab, die Aufgabe für das verfügbare Modell durch Vorverarbeitung, eingeschränkte Tools, persistenten Zustand und Evaluation zu erleichtern.

Zweiter Platz mit schlankem Harness statt großem Modell

Das NVIDIA KGMON-Team hat beim KDD Cup 2026 Data Agents Wettbewerb den zweiten Platz belegt. Der Ansatz beruht nach Angaben des Unternehmens darauf, den Agenten-Harness kleiner, klarer und leichter verifizierbar zu machen. Der Wettbewerb verlangte, natürlichsprachliche Fragen über heterogene Datenquellen zu beantworten: Datenbanken, CSV- und JSON-Dateien, Prosadokumente, PDFs und Briefing-Videos. Jede Aufgabe erforderte mehr als reine Suche: Der Agent musste verfügbare Daten inspizieren, passende Werkzeuge wählen, über Quellen hinweg schlussfolgern, eine finale Antwortdatei erzeugen und mit Fallstricken in Analyse-Workflows umgehen. Entscheidend war eine Vorgabe des Wettbewerbs: Die Teams mussten mit einem kleinen, festen LLM arbeiten. Dadurch wurde der Harness zur zentralen Optimierungsfläche. Das Team zielte darauf ab, die Aufgabe für das verfügbare Modell durch Vorverarbeitung, eingeschränkte Tools, persistenten Zustand und Evaluation zu erleichtern. Zwei Prinzipien prägten das System: den Aktionsraum einschränken und den Datenzugriff vereinheitlichen. Ein zu großer Aktionsraum – zu viele Wege, Daten zu inspizieren, Werkzeuge aufzurufen, Dateien zu schreiben oder Fehler zu beheben – kann bei einem kleinen Modell schnell zu Fehlschlägen führen. Die Vereinheitlichung des Datenzugriffs reduziert die kognitive Last, indem alle Quellen über eine einheitliche Schnittstelle erreichbar sind.

Playbook: Vorverarbeitung, eingeschränkte Tools, persistenter Zustand

Das veröffentlichte Playbook beschreibt, wie jede Maßnahme die Aufgabe für das kleine LLM konkret erleichtert. Vorverarbeitung vereinheitlicht die heterogenen Datenquellen in SQLite, sodass das Modell nicht mit unterschiedlichen Formaten und Zugriffswegen umgehen muss. Eingeschränkte Tools reduzieren den Entscheidungsraum: Statt vieler möglicher Werkzeuge steht nur ein kleines, spezialisiertes Set zur Verfügung, und finale Antworten müssen einem festen Format folgen – das verhindert beliebige Ausgaben und erleichtert die Verifikation. Persistenter Zustand wird durch einen stateful Python-Interpreter realisiert, der es dem Agenten erlaubt, schrittweise zu arbeiten, ohne den Kontext zwischen Aufrufen zu verlieren. Evaluation erfolgt über Traces und menschliche Überprüfung, wodurch Fehler im Ablauf sichtbar und systematisch behoben werden können. Die Architektur nutzt das NVIDIA NeMo Agent Toolkit, um die Agenten-Schleifen mit Werkzeugen aus der Perspektive eines Datenwissenschaftlers zu realisieren. Für offene explorative Datenanalyse wird ein ReAct-Agent mit einem Jupyter-Notebook-Tool gepaart, was eine kontinuierliche, bidirektionale Interaktion ermöglicht. Für mehrstufige regelbasierte tabellarische Q&A kommt ein Tool-Calling-Agent zum Einsatz, der mit einem stateful Python-Interpreter, einem Retriever und einem Dateistruktur-Detektor interagiert. Die Zusammenfassung des Teams: Daten in SQLite vereinheitlichen, Tools einschränken, Schemata scouten und durch Traces und menschliche Überprüfung verbessern.

J
Jasmin Freitag
Redaktion · KI-Anwendungen & Tools

Jasmin Freitag beobachtet für KI Spotlight die praktische Seite der künstlichen Intelligenz: neue Anwendungen, generative Werkzeuge, kreative KI und den Einsatz von Tools im Alltag und in Unternehmen. Sie erklärt praxisnah, was ein Werkzeug wirklich taugt.

Ähnliche Artikel