Live REALM: Neues Framework für reaktionsfähiges Zuhören in verkörperter KI
↘

Cerebras und Gimlet Labs kündigen ultraschnelle KI-Inferenz-Cloud an

Cerebras Systems und Gimlet Labs haben eine Partnerschaft für eine ultraschnelle KI-Inferenz-Cloud angekündigt, die Gimlets disaggregierte Inferenz-Software mit Cerebras' Wafer-Scale-Hardware und GPUs kombiniert und bis zu 3.000 Token pro Sekunde liefern soll.

· Veröffentlicht: 29.09.2026 ·3 Min Lesezeit
Cerebras und Gimlet Labs kündigen ultraschnelle KI-Inferenz-Cloud anMit KI erstellt
Inhalt
◆ Fakten auf einen Blick
  • Gimlet Labs und Cerebras Systems haben am 28. September 2026 eine Partnerschaft für eine ultraschnelle KI-Inferenz-Cloud angekündigt.
  • Die Lösung kombiniert Gimlets disaggregierte Inferenz-Software mit Cerebras' Wafer-Scale-Compute-Architektur und GPUs.
  • Geplant sind Inferenzgeschwindigkeiten von bis zu 3.000 Token pro Sekunde für agentische und Echtzeitanwendungen.
  • Das erste von Cerebras betriebene Gimlet-Cloud-Rechenzentrum soll noch in diesem Jahr online gehen.
  • Gimlet Cloud zerlegt die Inferenz in Phasen (z. B. Prefill, Decode, Attention) und führt jede Phase auf dem am besten geeigneten Chip aus.
  • Cerebras wird CS-4-Systeme über ein bis zwei Jahre an Gimlet liefern; geplant sind 100 Megawatt Inferenzkapazität.

Partnerschaft für 3.000 Token pro Sekunde angekündigt

Am 28. September 2026 gaben Gimlet Labs und Cerebras Systems eine strategische Partnerschaft bekannt, um eine ultraschnelle KI-Inferenz-Cloud aufzubauen. Die Lösung kombiniert Gimlets disaggregierte Inferenz-Software mit Cerebras' Wafer-Scale-Compute-Architektur und GPUs. Der Kern der Geschwindigkeit liegt in der Zerlegung des Inferenzprozesses in einzelne Phasen – etwa Prefill, Decode und Attention-Operationen – und der Zuweisung jeder Phase an den dafür am besten geeigneten Chiptyp. Cerebras' Wafer-Scale-Prozessoren übernehmen latenzkritische Schritte, während GPUs für hohen Durchsatz bei anderen Phasen sorgen. Diese Orchestrierung über heterogenes Silizium vermeidet Engpässe, die bei homogenen GPU-Systemen auftreten, und ermöglicht so bis zu 3.000 Token pro Sekunde. Im Vergleich zu bestehenden Inferenz-Lösungen, die typischerweise auf einem einzigen Beschleunigertyp basieren, liefert die Partnerschaft eine neue Klasse: eine integrierte, disaggregierte Architektur, die die Stärken beider Welten kombiniert und dadurch Latenz für Sprach-, Video- und interaktive KI-Anwendungen drastisch reduziert. Gimlet-CEO Zain Asgar betonte, schnelle Inferenz verwandle KI von einem passiven Werkzeug in einen aktiven Mitarbeiter; Cerebras-CTO Sean Lie ergänzte, die Kombination verbessere die Wirtschaftlichkeit von Rechenzentren. Die Unternehmen unterstreichen, dass Geschwindigkeit die Nutzererfahrung und das Engagement prägt und bestimmt, was Entwickler bauen können. Für Echtzeitanwendungen wie Sprach- und Video-KI, Agenten und Assistenten kann Latenz den Unterschied zwischen einer nahtlosen und einer trägen Interaktion ausmachen. Die Partnerschaft umfasst die gesamte Kette von der Infrastruktur bis zu Entwickler-APIs.

100 Megawatt und CS-4-Lieferungen bis 2027

Für die Umsetzung plant Cerebras, seine CS-4-Systeme über einen Zeitraum von ein bis zwei Jahren an Gimlet zu liefern. Insgesamt ist eine Inferenzkapazität von 100 Megawatt vorgesehen – eine Größenordnung, die sicherstellen soll, dass die hohen Geschwindigkeiten von bis zu 3.000 Token pro Sekunde nicht nur für einzelne Anfragen, sondern im Produktionsmaßstab für viele gleichzeitige Nutzer bereitstehen. Mehr elektrische Leistung bedeutet mehr parallel betreibbare Beschleuniger und damit einen höheren aggregierten Token-Durchsatz. Das erste von Cerebras betriebene Gimlet-Cloud-Rechenzentrum soll noch in diesem Jahr online gehen, die breite Verfügbarkeit der Systeme über Gimlet Cloud ist jedoch erst ab 2027 geplant. Der Grund liegt in der gestaffelten Lieferung: Da Cerebras die CS-4-Systeme über ein bis zwei Jahre ausliefert, dauert es, bis die volle Kapazität installiert und in Betrieb genommen ist. Zudem müssen Rechenzentren gebaut, verkabelt und getestet werden. Die finanziellen Bedingungen der Partnerschaft wurden nicht bekannt gegeben; die Unternehmen machten keine Angaben zu Investitionssummen oder Umsatzbeteiligungen.

Cerebras CS-4 als Basis und Marktkontext

Der CS-4 ist die vierte Generation des Cerebras-Systems und basiert auf drei Wafer Scale Engine 3 Turbo Prozessoren in einem neu gestalteten Rack. Die bis zu 30-mal schnellere Inferenz gegenüber GPU-Systemen erreicht der CS-4 laut Hersteller durch koordinierte Innovationen im Gesamtsystem: schnellere Wafer-zu-Wafer-Kommunikation, hochdichte Stromversorgung und die modulare Nexus-Rack-Plattform arbeiten als eine Architektur zusammen. Diese Merkmale reduzieren Latenzen und erhöhen den Durchsatz pro Rack erheblich. Cerebras hat nach eigenen Angaben Geschwindigkeitsrekorde für die Modellfamilien OpenAI, Kimi, GLM und Qwen aufgestellt. Auch andere Anbieter setzen auf Hochgeschwindigkeitsmodelle: Google stellte auf der I/O 2026 das auf Tempo ausgelegte Gemini 3.5 Flash vor, und OpenAI sowie Anthropic haben zuvor Hochgeschwindigkeitsvarianten ihrer Modelle zu dreifachem Preis eingeführt. Cerebras führt aus, dass komplexe Aufgaben die Antwortzeiten von Sekunden auf Minuten verlängert haben und Entwickler daher schnellere Inferenzoptionen nachfragen.

A
Andreas Rüdiger
Herausgeber & Redaktionsleitung · KI-Modelle, Technik & Business

Andreas Rüdiger ist Gründer der Agentur INREMA und verantwortet KI Spotlight redaktionell. Sein Schwerpunkt liegt auf KI-Modellen, Recheninfrastruktur, technischen Entwicklungen und der wirtschaftlichen Einordnung. Er sorgt dafür, dass komplexe KI-Themen verständlich und nachvollziehbar aufbereitet werden. Mehr zu ihm auf inrema.de und andiger.de.

Quellen

  1. hyper.ai ↗

Ähnliche Artikel