Live Vier-Wochen-Test: KI-Prognosen an Abfall und Lagerengpässen messen
↘

TokenRouter: Neues Serving-System für Token-Level-Routing über mehrere LLMs

Ein Forschungssystem für effizientes Token-Level-Routing und ein kommerzielles AI-API-Gateway tragen denselben Namen.

· Veröffentlicht: 11.10.2026 ·2 Min Lesezeit
TokenRouter: Neues Serving-System für Token-Level-Routing über mehrere LLMsMit KI erstellt
◆ Fakten auf einen Blick
  • TokenRouter ist ein Serving-System für Token-Level LLM Routing, das die Kosten-Qualitäts-Pareto-Frontier verbessert.
  • TokenRouter folgt dem Prinzip request-centric programming, model-centric execution: Entwickler beschreiben Routing-Logik aus Sicht einer einzelnen Anfrage, während die Laufzeit einen Subserver für jedes LLM startet und Anfragen asynchron verteilt.
  • Jeder Subserver verwendet einen delayed-batching scheduler, dessen optimale Hyperparameter aus einem mathematischen Durchsatzmodell abgeleitet werden.
  • TokenRouter erreicht über verschiedene Routing-Algorithmen, Workloads und Modellpaare hinweg einen 2.01-64.15x höheren Decoding-Durchsatz als bestehende Systeme.
  • Es existiert ein kommerzielles Produkt namens TokenRouter von TokenFlux, das ein AI API Gateway ist und Funktionen wie Zero-Data-Retention, Audit-Trails und Multi-Provider-Zugriff bietet.
  • Das kommerzielle TokenRouter bietet eine einheitliche API für OpenAI, Anthropic, Gemini, DeepSeek und Llama über einen Schlüssel, mit transparenter Preisgestaltung und ohne Modell-Substitution.

TokenRouter: Neues Serving-System für Token-Level-Routing über mehrere LLMs

Ein Forschungsteam stellt mit TokenRouter ein Serving-System vor, das Token-Level-Routing zwischen verschiedenen großen Sprachmodellen (LLMs) unterstützt. Anders als bestehende Systeme, die auf der Annahme eines einzelnen LLM basieren, verteilt TokenRouter Inferenzarbeit auf Token-Ebene über mehrere Modelle hinweg. Nach Angaben der Autoren leiden bisherige Systeme unter starken Schritt-Desynchronisationen und häufigen Verzögerungen bei der Batch-Zulassung, wenn Token-Level-Routing eingesetzt wird. Token-Level-Routing ermöglicht es, dass unterschiedliche Modelle innerhalb einer einzigen Antwort effizient zusammenarbeiten.

TokenRouter folgt dem Prinzip request-centric programming, model-centric execution: Entwickler beschreiben die Routing-Logik aus Sicht einer einzelnen Anfrage, während die Laufzeit für jedes LLM einen eigenen Subserver startet und Anfragen asynchron verteilt. Jeder Subserver verwendet einen delayed-batching scheduler, dessen optimale Hyperparameter aus einem mathematischen Durchsatzmodell abgeleitet werden. Die Laufzeit verwaltet Batching, Übergabe und Cache-Zustand. Über verschiedene Routing-Algorithmen, Workloads und Modellpaare hinweg erreicht TokenRouter laut Paper einen 2,01- bis 64,15-fach höheren Decoding-Durchsatz als bestehende Systeme.

Dieser Durchsatzgewinn resultiert aus mehreren Mechanismen: Der delayed-batching-Scheduler sammelt unregelmäßig eintreffende Token-Anfragen und führt sie zum optimalen Zeitpunkt zu Batches zusammen, wodurch Wartezeiten reduziert und die Gesamteffizienz des Systems verbessert werden. Die asynchrone Ausführung über Sub-Server erlaubt es, dass ein schnelles Modell weiter dekodiert, während ein langsameres Peer-Modell geroutete Token verarbeitet; anstehende Anfragen behalten ihren Serving-Zustand und KV-Slot, sodass zurückkehrende Token ohne erneutes Prefix-Matching oder KV-Allokation angehängt werden können. Dies vermeidet die bei bestehenden Systemen auftretenden Schritt-Desynchronisationen und Batch-Zulassungsverzögerungen. Das System soll damit die Kosten-Qualitäts-Pareto-Frontier beim LLM-Serving verbessern. Die Autoren bezeichnen TokenRouter als effizientes und entwicklerfreundliches Serving-System.

Namensgleichheit: Kommerzielles AI-API-Gateway TokenRouter von TokenFlux

Unabhängig davon existiert ein kommerzielles Produkt mit demselben Namen: TokenRouter von TokenFlux. Dabei handelt es sich um ein AI-API-Gateway, das nach Anbieterangaben Zero-Data-Retention (keine dauerhafte Speicherung von Nutzerdaten), Audit-Trails (nachvollziehbare Protokollierung aller Anfragen) und Multi-Provider-Zugriff (gleichzeitige Anbindung an mehrere Modell-Anbieter) bietet. Es stellt eine einheitliche API für OpenAI, Anthropic, Gemini, DeepSeek und Llama über einen einzigen Schlüssel bereit. Die Preisgestaltung gibt direkt die Anbieter-Preise weiter, und das System leitet jede Anfrage unverändert an den angegebenen Modell-Endpoint weiter, sodass keine heimliche Modell-Substitution stattfindet. Technisch wird dies durch eine unveränderte Weiterleitung der Anfragen an die offiziellen Modell-Endpunkte sowie durch Audit-Logs sichergestellt, die jede Anfrage protokollieren und so nachvollziehbar machen, welches Modell tatsächlich ausgeführt wurde. Zudem betreibt TokenRouter eigene GPU-Cluster für Open-Source-Modelle und leitet geschlossene Modelle direkt an die Anbieter-Endpunkte weiter, ohne das angeforderte Modell zu ersetzen. Der Anbieter bewirbt das Gateway als „best zero-data-retention AI API gateway“. Es handelt sich um zwei verschiedene Produkte: Das Forschungssystem dient dem effizienten Serving von Token-Level-Routing, das kommerzielle Gateway der zentralen API-Anbindung mehrerer Modellanbieter. Eine Verwechslung liegt nahe, ist aber sachlich nicht begründet.

J
Jasmin Freitag
Redaktion · KI-Anwendungen & Tools

Jasmin Freitag beobachtet für KI Spotlight die praktische Seite der künstlichen Intelligenz: neue Anwendungen, generative Werkzeuge, kreative KI und den Einsatz von Tools im Alltag und in Unternehmen. Sie erklärt praxisnah, was ein Werkzeug wirklich taugt.

Ähnliche Artikel