Red Hat AI veröffentlicht FP8-Quantisierung für Nemotron 3.5 Lightning
Speicher- und Festplattenbedarf sinken um etwa 50 Prozent, auf FP8-Hardware verdoppelt sich der Matmul-Durchsatz.
Mit KI erstelltInhalt
◆ Fakten auf einen Blick
- Red Hat AI hat eine FP8-quantisierte Version des NVIDIA Nemotron 3.5 Lightning 30B A3B veröffentlicht.
- Die Quantisierung erfolgt als FP8 für Gewichte und Aktivierungen, per-tensor static, nur für lineare Operatoren in Transformer-Blöcken, unter Verwendung von LLM Compressor und Kalibrierung mit UltraChat.
- Die FP8-Quantisierung reduziert die Bits pro Parameter von 16 auf 8 und senkt GPU-Speicher- und Festplattenbedarf um etwa 50 Prozent; auf FP8-fähiger Hardware verdoppelt sich etwa der Matmul-Durchsatz.
- Das Basismodell ist ein hybrides Mamba-2 + MoE + Attention-Modell mit 30B Gesamtparametern und 3B aktiven Parametern.
- Das FP8-Modell wurde am 2026-08-13 veröffentlicht.
- Zum Zeitpunkt der Berichterstattung verzeichnete der Checkpoint über 780.000 Downloads auf Hugging Face.
FP8-Quantisierung halbiert Speicher- und Festplattenbedarf
Red Hat AI hat am 13. August 2026 eine FP8-quantisierte Version des NVIDIA Nemotron 3.5 Lightning 30B A3B veröffentlicht. Die Quantisierung reduziert Gewichte und Aktivierungen der linearen Operatoren in den Transformer-Blöcken auf 8 Bit; sie erfolgt per-tensor static, wurde mit LLM Compressor umgesetzt und mit Kalibrierungsdaten aus UltraChat erstellt. FP8 speichert jeden quantisierten Wert in acht Bit, verglichen mit 16 Bit bei BF16. Da die Parameterzahl unverändert bleibt, aber jeder Parameter nur noch halb so viele Bits belegt, halbiert sich der Speicherbedarf für die Gewichte. Die Quantisierung der Aktivierungen senkt zusätzlich den Speicherbedarf während der Inferenz. Dadurch sinken GPU-Speicher- und Festplattenbedarf gegenüber dem BF16-Referenzmodell um etwa 50 Prozent. Auf FP8-fähiger Hardware verdoppelt sich nach Angaben von Red Hat AI der Matmul-Durchsatz etwa. Einige präzisionssensitive Komponenten wie Conv1d-Schichten, Embeddings, latente Projektionen, MoE-Gates und Multi-Token-Prediction-Schichten bleiben unquantisiert. Die Veröffentlichung zielt darauf ab, das 30-Milliarden-Parameter-Modell auf einem einzelnen Beschleuniger leichter einsetzbar zu machen. Der Checkpoint ist über Hugging Face verfügbar und kann mit vLLM, SGLang oder Docker auf einer einzelnen H100 oder DGX Spark eingesetzt werden.
Hybrides 30B-Modell mit 3B aktiven Parametern als Basis
Das Basismodell ist ein hybrides Mamba-2-, Mixture-of-Experts- und Attention-Modell mit 30 Milliarden Gesamtparametern, von denen pro Token nur 3 Milliarden aktiv sind. Durch die Mamba-2-Schichten lassen sich lange Kontexte effizient verarbeiten, die MoE-Schichten aktivieren nur einen Teil der Experten pro Token, und ausgewählte Attention-Schichten ergänzen globale Abhängigkeiten. Das Modell ist textbasiert und reasoning-fähig. Die FP8-Version wurde am 13. August 2026 veröffentlicht. Zum Berichtszeitpunkt verzeichnete der Checkpoint über 780.000 Downloads auf Hugging Face; die Zahl misst Datei-Downloads und nicht eindeutige Nutzer oder Produktions-Deployments. Der Checkpoint unterstützt laut alphasignal.ai bis zu 1 Million Token Kontext, schaltbares Reasoning, Tool Calling und sechs Sprachen.
Unabhängige Tests melden Schwächen bei Coding und Reasoning
NVIDIA bewirbt Nemotron 3.5 Lightning als für Reasoning und Tool Calling führend und als optimiert für hochvolumige, latenzarme Ausführung in autonomen Agenten. Demgegenüber berichtet alphasignal.ai, dass das FP8-Modell bei Coding- und schweren Reasoning-Benchmarks zurückliegt. Die genauen Benchmarks von alphasignal.ai sind nicht offengelegt, sodass die Abweichung auf unterschiedliche Test-Sets, Quantisierungsverluste durch FP8 oder abweichende Bewertungsmaßstäbe zurückgehen könnte. Die Herstellerangaben stammen aus NVIDIA-Materialien und sind nicht unabhängig verifiziert. alphasignal.ai nennt keine konkreten Benchmark-Namen oder Vergleichswerte. Der Widerspruch betrifft insbesondere die Eignung für agentische Workloads, bei denen Tool Calling und Reasoning zentral sind.



