Live OmniVBench: Neuer Benchmark für Omni-Reference-to-Video-Generierung

NVIDIA, NTU und MIT veröffentlichen SoL-Pi: Auto-Research-Mechanismen senken Token-Verbrauch um bis zu 49%

Vier überlebende Effizienz-Mechanismen reduzieren Token-Verkehr und API-Kosten bei vergleichbarer Leistung – quelloffen unter MIT-Lizenz

· Veröffentlicht: 21.09.2026 ·3 Min Lesezeit
NVIDIA, NTU und MIT veröffentlichen SoL-Pi: Auto-Research-Mechanismen senken Token-Verbrauch um bis zu 49%Mit KI erstellt
Inhalt
◆ Fakten auf einen Blick
  • SoL-Pi ist eine eigenständige Erweiterung für den Pi-Agent-Harness und keine offizielle Distribution von Pi.
  • SoL-Pi umfasst vier Mechanismen: Action Fusion, Online Context Compact, ObservationPack und Evidence-Preserving Reducer.
  • Auf dem 51 Aufgaben umfassenden EdgeBench-Benchmark erreicht SoL-Pi eine mit Pi vergleichbare Leistung über GPT-5.6 Sol und Opus 5, reduziert aber den aufgezeichneten Token-Verkehr um 44,7–49,0 % und die API-Kosten um etwa ein Drittel.
  • Geschätzte stündliche Einsparungen betragen 8,75–13,50 US-Dollar gegenüber nativen Codex- und Claude-Code-Harnessen und 4,36–5,71 US-Dollar gegenüber Pi.
  • Der Auto-Research-Suchprozess umfasste etwa 150 vorgeschlagene Richtungen, etwa 500 ausführbare Umgebungen, über 3.000 Läufe und über 60.000 Agent-Umgebungs-Interaktionen.
  • SoL-Pi wird als Open Source unter MIT-Lizenz veröffentlicht und ist über den Befehl 'pi install git:github.com/NVlabs/SoL-Pi' installierbar.

SoL-Pi veröffentlicht: NVIDIA, NTU und MIT präsentieren Effizienz-Erweiterung für Pi-Agent-Harness

NVIDIA, NTU und MIT haben SoL-Pi veröffentlicht, eine quelloffene Effizienz-Erweiterung für den Pi-Agent-Harness. Das Paper auf arXiv und der Code auf GitHub dokumentieren vier Mechanismen, die per Auto-Research entdeckt wurden. Auf dem 51 Aufgaben umfassenden EdgeBench-Benchmark erreicht SoL-Pi eine mit Pi vergleichbare Leistung über GPT-5.6 Sol und Opus 5, reduziert den aufgezeichneten Token-Verkehr um 44,7 bis 49,0 Prozent und die API-Kosten um etwa ein Drittel.

Vier Mechanismen im Detail: Action Fusion, Online Context Compact, ObservationPack und Evidence-Preserving Reducer

Die vier Mechanismen sind Action Fusion, Online Context Compact, ObservationPack und Evidence-Preserving Reducer. Action Fusion bündelt Dateiänderung und Validierung in einem einzigen Modellaufruf. Normalerweise folgt auf eine Dateiänderung ein separater Aufruf, um den Erfolg per Test oder Befehl zu prüfen – dieser zusätzliche Round-Trip überträgt den gesamten bisherigen Kontext erneut als Token. Durch die Fusion entfällt dieser zweite Aufruf, wodurch der Kontext nicht doppelt gesendet wird und Token eingespart werden. Online Context Compact verdichtet abgeschlossene Teilschritte. Ohne diese Verdichtung bleiben abgeschlossene Arbeiten im aktiven Kontext erhalten und werden bei jedem weiteren Modellaufruf erneut als Token übertragen. Durch die Kompaktierung werden frühere Kontext-Tokens nicht mehr bei jedem weiteren Modellaufruf übertragen, was den Token-Verbrauch senkt. ObservationPack ersetzt große Ausgaben wie Logs oder Dateien durch stabile Handles mit einem Seitenindex. Dadurch wird verhindert, dass die kompletten Log-Daten bei jedem Agenten-Aufruf als Token gesendet werden; der Agent ruft bei Bedarf nur die relevanten Seiten ab. Evidence-Preserving Reducer lässt ein günstigeres Modell lange Logs zuerst lesen und zusammenfassen, akzeptiert die Zusammenfassung aber nur, wenn jede zitierte Zeile wörtlich mit dem Archiv übereinstimmt. So vermeidet ein teures Frontier-Modell eine volle Anfrage zum Lesen eines Logs, wenn nur wenige Zeilen entscheidend sind. Alle Mechanismen sind opt-in und standardmäßig deaktiviert.

Benchmark-Ergebnisse: Vergleichbare Leistung bei deutlich weniger Token und Kosten

Auf EdgeBench mit 51 Aufgaben bleibt die Leistung vergleichbar, während der Token-Verkehr um 44,7 bis 49,0 Prozent sinkt und die API-Kosten um etwa ein Drittel. Die geschätzten stündlichen Einsparungen betragen 8,75 bis 13,50 US-Dollar gegenüber nativen Codex- und Claude-Code-Harnessen und 4,36 bis 5,71 US-Dollar gegenüber Pi. Die Werte stammen aus dem Paper; eine Zusammenfassung auf picx.dev nennt nur die Maximalwerte 13,50 beziehungsweise 5,71 US-Dollar.

Auto-Research-Suchprozess und Open-Source-Veröffentlichung

Der Auto-Research-Suchprozess umfasste etwa 150 vorgeschlagene Richtungen, etwa 500 ausführbare Umgebungen, über 3.000 Läufe und über 60.000 Agent-Umgebungs-Interaktionen. SoL-Pi wird als Open Source unter MIT-Lizenz veröffentlicht und ist über den Befehl `pi install git:github.com/NVlabs/SoL-Pi` installierbar. Die Erweiterung setzt auf eine unveränderte Pi-Installation auf und nutzt die öffentlichen Erweiterungs-APIs.

Community-Adaption für DeepSeek und Widerspruch bei Einsparungsangaben

Für den DeepSeek Harness Cordis existiert eine nicht-offizielle Community-Adaption namens dsh-sol-pi. Sie paketiert die vier Mechanismen für DSH Web, TUI und Headless, stammt aber weder von NVIDIA noch von DeepSeek. Ein Widerspruch betrifft die stündlichen Einsparungen: Paper und Abstract nennen Spannen von 8,75 bis 13,50 beziehungsweise 4,36 bis 5,71 US-Dollar, während die Zusammenfassung auf picx.dev nur die Maximalwerte 13,50 und 5,71 US-Dollar angibt.

Open-Source-Effizienz: Warum SoL-Pi Entwicklern hilft und Anbieter unter Druck setzt

Für Entwickler, die Pi oder ähnliche Harnesse nutzen, bietet SoL-Pi eine quelloffene, opt-in nutzbare Möglichkeit, Token-Verbrauch und Kosten zu senken, ohne die Aufgabenleistung wesentlich zu beeinträchtigen. Anbieter nativer Harnesse und Cloud-Dienste könnten unter Wettbewerbs- und Kostendruck geraten: Da SoL-Pi unter MIT-Lizenz frei verfügbar ist, können Entwickler die Einsparungen ohne Anbieterwechsel realisieren. Wenn Kunden durch SoL-Pi deutlich geringere Token-Kosten erzielen, steigt die Nachfrage nach ähnlichen Effizienzmechanismen in nativen Harnessen und Cloud-Angeboten. Anbieter, die solche Optimierungen nicht integrieren, riskieren, Kunden an günstigere Alternativen zu verlieren – insbesondere bei langlaufenden, unbeaufsichtigten Agenten, wo die stündlichen Einsparungen erheblich sind.

A
Andreas Rüdiger
Herausgeber & Redaktionsleitung · KI-Modelle, Technik & Business

Andreas Rüdiger ist Gründer der Agentur INREMA und verantwortet KI Spotlight redaktionell. Sein Schwerpunkt liegt auf KI-Modellen, Recheninfrastruktur, technischen Entwicklungen und der wirtschaftlichen Einordnung. Er sorgt dafür, dass komplexe KI-Themen verständlich und nachvollziehbar aufbereitet werden. Mehr zu ihm auf inrema.de und andiger.de.

Quellen

  1. hyper.ai ↗

Ähnliche Artikel