Aleph Alpha kündigt Megakernel-Bibliothek Alpha-MoE für Mixture-of-Experts-Inferenz an
Fused Megakernel soll Tensor-Parallel-Inferenz bei FP8-W8A8-Präzision beschleunigen
Mit KI erstelltAlpha-MoE: Neue Megakernel-Bibliothek für Mixture-of-Experts-Inferenz
Das KI-Unternehmen Aleph Alpha hat Alpha-MoE vorgestellt, eine fused Megakernel-Bibliothek, die speziell für die Inferenz von Mixture-of-Experts-Modellen (MoE) entwickelt wurde. MoE-Architekturen bieten laut Hersteller Effizienzgewinne, die dichte Modelle nicht erreichen, verursachen aber komplexe Kommunikationsmuster, die die Leistungsoptimierung erschweren. Alpha-MoE ist für die FP8-W8A8-Präzision (8-Bit-Gewichte, 8-Bit-Aktivierungen) ausgelegt und fasst mehrere Operationen in einem einzigen persistenten Kernel zusammen.
Bis zu 200 % schnellere Tensor-Parallel-Inferenz bei FP8
Bei FP8-W8A8-Präzision ermöglicht Alpha-MoE eine bis zu 200 Prozent höhere Geschwindigkeit bei der Tensor-Parallel-Inferenz im Vergleich zu nicht näher spezifizierten Baselines. Diese Leistungsangabe könnte für Nutzer von MoE-Modellen attraktiv sein und Konkurrenzlösungen unter Druck setzen, sofern sie sich in unabhängigen Tests reproduzieren lässt.



