Cerebras meldet fünffachen Durchsatz durch Disaggregation
Frühe Ergebnisse zeigen fünffachen Durchsatz bei gleicher Systemanzahl ohne Verlust bei der Token-Generierungsgeschwindigkeit.
Mit KI erstellt◆ Fakten auf einen Blick
- Cerebras hat einen Blogbeitrag mit dem Titel 'Disaggregated Inference From the Ground Up' veröffentlicht, der eine Technik namens Disaggregation vorstellt.
- Laut Cerebras wurde mit Disaggregation der Durchsatz in frühen Ergebnissen um das Fünffache gesteigert, bei gleicher Anzahl von Cerebras-Systemen und ohne Verlust bei der Token-Generierungsgeschwindigkeit.
- Cerebras arbeitet nach eigenen Angaben an heterogener Disaggregation, bei der mehrere Chiptypen in einem Inferenzsystem kombiniert werden.
- Der Beitrag ist der erste Teil einer geplanten Serie zum Thema Disaggregation.
Cerebras meldet fünffachen Durchsatz durch Disaggregation
Cerebras hat in einem Blogbeitrag eine disaggregierte Inferenzarchitektur vorgestellt und erste Ergebnisse veröffentlicht. Laut frühen Ergebnissen steigert die als Disaggregation bezeichnete Technik den Durchsatz um das Fünffache – bei gleicher Anzahl von Cerebras-Systemen und ohne Verlust bei der Token-Generierungsgeschwindigkeit. Der Durchsatzanstieg ist bedeutsam, weil dieselbe Hardware damit fünfmal so viele Anfragen gleichzeitig bedienen kann, ohne dass einzelne Nutzer längere Wartezeiten bei der Textausgabe in Kauf nehmen müssen. Technisch ermöglicht wird dies durch die Aufteilung der Inferenz in ihre beiden Phasen: Die rechenintensive Vorverarbeitung (Prefill) und die speichergebundene Token-Erzeugung (Decode) werden auf unterschiedliche, jeweils passende Hardwaretypen verteilt. Dadurch entfällt der Engpass, der entsteht, wenn beide Phasen auf demselben Chip um dieselben Ressourcen konkurrieren. Üblicherweise lässt sich der Inferenzdurchsatz dem Beitrag zufolge nur durch zusätzliche Hardware oder die gleichzeitige Verarbeitung mehrerer Anfragen erhöhen. Eine höhere Parallelität kann jedoch die Token-Erzeugung für einzelne Nutzer verlangsamen, weil die Hardware-Ressourcen dann auf mehr Anfragen verteilt werden. Die Angaben sind Herstellerangaben.
Heterogene Disaggregation und Serienstart als nächste Schritte
Cerebras arbeitet nach eigenen Angaben an heterogener Disaggregation, bei der mehrere Chiptypen in einem Inferenzsystem kombiniert werden. Durch die Zuweisung unterschiedlicher Hardware an speicher- oder rechengebundene Abschnitte der Inferenz sollen sich dem Unternehmen zufolge Zugewinne erzielen lassen, die über eine homogene Disaggregation hinausgehen. Der Grund liegt darin, dass speichergebundene Abschnitte von Hardware mit hoher Speicherbandbreite profitieren, während rechengebundene Abschnitte von Hardware mit hoher Rechenleistung profitieren; eine homogene Disaggregation nutzt dagegen für alle Abschnitte denselben Chiptyp und kann diese spezifischen Anforderungen nicht optimal bedienen. Der Blogbeitrag ist zugleich der erste Teil einer geplanten Serie zum Thema Disaggregation. Darin will das Unternehmen nach eigener Ankündigung die Grundlagen von Beschleunigern, die Phasen der Inferenz und deren unterschiedliche Hardware-Anforderungen erläutern. Die Serie richtet sich nach Angaben des Unternehmens an Leser, die den Begriff Disaggregation oder die Aussage, Prefill sei rechengebunden und Decode speichergebunden, gehört haben und verstehen wollen, was dahintersteckt.



