Nari Labs erreicht sub-50ms TTFA für Qwen3-TTS
Einzige von fünf getesteten Implementierungen erreicht das Ziel bei 10 Anfragen pro Sekunde auf einer H100 SXM.
Mit KI erstellt◆ Fakten auf einen Blick
- Qwen3-TTS ist eine Serie von Text-to-Speech-Modellen, entwickelt vom Qwen-Team bei Alibaba Cloud, mit Unterstützung für Voice Cloning, Voice Design und Streaming.
- Qwen3-TTS wurde auf über 5 Millionen Stunden Sprachdaten trainiert und deckt 10 Sprachen ab.
- Nari Labs' Implementierung von Qwen3-TTS 1.7B CustomVoice erreicht 10 Anfragen pro Sekunde (RPS) und eine p95-Zeit bis zum ersten Audio (TTFA) von unter 50 ms auf einer einzelnen NVIDIA H100 SXM.
- Nari Labs vergleicht fünf Implementierungen: ihre eigene, vLLM-Omni, SGLang-Omni△, VoxServe und M*, unter Poisson-Open-Loop-Verkehr.
- Nach Optimierung jeder Implementierung für Low-Latency-Streaming ist die von Nari Labs die einzige, die eine p95-TTFA von unter 50 ms erreicht; sie hält diese bis 10 RPS und bleibt bei 20 RPS unter 100 ms.
- Das System von Nari Labs erzeugt bei 10 RPS etwa 630 Zeichen pro Sekunde.
Nari Labs hat nach eigenen Angaben eine Implementierung des Qwen3-TTS-1.7B-CustomVoice-Modells optimiert, die eine p95-Zeit bis zum ersten Audio (TTFA) von unter 50 Millisekunden bei 10 Anfragen pro Sekunde auf einer einzelnen NVIDIA H100 SXM erreicht. Das Unternehmen verglich fünf Implementierungen – die eigene, vLLM-Omni, SGLang-Omni△, VoxServe und M* – unter Poisson-Open-Loop-Verkehr. Nach Optimierung jeder Implementierung für Low-Latency-Streaming sei die von Nari Labs die einzige, die das Ziel von unter 50 ms p95 TTFA erreiche; sie halte diese bis 10 RPS und bleibe auch bei 20 RPS unter 100 ms. Das System erzeuge bei 10 RPS etwa 630 Zeichen pro Sekunde.



