Live KI-Führer „Hallo Franz“ startet am 31. Juli

Nari Labs erreicht sub-50ms TTFA für Qwen3-TTS

Einzige von fünf getesteten Implementierungen erreicht das Ziel bei 10 Anfragen pro Sekunde auf einer H100 SXM.

· Veröffentlicht: 22.08.2026 ·1 Min Lesezeit
Nari Labs erreicht sub-50ms TTFA für Qwen3-TTSMit KI erstellt
◆ Fakten auf einen Blick
  • Qwen3-TTS ist eine Serie von Text-to-Speech-Modellen, entwickelt vom Qwen-Team bei Alibaba Cloud, mit Unterstützung für Voice Cloning, Voice Design und Streaming.
  • Qwen3-TTS wurde auf über 5 Millionen Stunden Sprachdaten trainiert und deckt 10 Sprachen ab.
  • Nari Labs' Implementierung von Qwen3-TTS 1.7B CustomVoice erreicht 10 Anfragen pro Sekunde (RPS) und eine p95-Zeit bis zum ersten Audio (TTFA) von unter 50 ms auf einer einzelnen NVIDIA H100 SXM.
  • Nari Labs vergleicht fünf Implementierungen: ihre eigene, vLLM-Omni, SGLang-Omni△, VoxServe und M*, unter Poisson-Open-Loop-Verkehr.
  • Nach Optimierung jeder Implementierung für Low-Latency-Streaming ist die von Nari Labs die einzige, die eine p95-TTFA von unter 50 ms erreicht; sie hält diese bis 10 RPS und bleibt bei 20 RPS unter 100 ms.
  • Das System von Nari Labs erzeugt bei 10 RPS etwa 630 Zeichen pro Sekunde.

Nari Labs hat nach eigenen Angaben eine Implementierung des Qwen3-TTS-1.7B-CustomVoice-Modells optimiert, die eine p95-Zeit bis zum ersten Audio (TTFA) von unter 50 Millisekunden bei 10 Anfragen pro Sekunde auf einer einzelnen NVIDIA H100 SXM erreicht. Das Unternehmen verglich fünf Implementierungen – die eigene, vLLM-Omni, SGLang-Omni△, VoxServe und M* – unter Poisson-Open-Loop-Verkehr. Nach Optimierung jeder Implementierung für Low-Latency-Streaming sei die von Nari Labs die einzige, die das Ziel von unter 50 ms p95 TTFA erreiche; sie halte diese bis 10 RPS und bleibe auch bei 20 RPS unter 100 ms. Das System erzeuge bei 10 RPS etwa 630 Zeichen pro Sekunde.

A
Andreas Rüdiger
Herausgeber & Redaktionsleitung · KI-Modelle, Technik & Business

Andreas Rüdiger ist Gründer der Agentur INREMA und verantwortet KI Spotlight redaktionell. Sein Schwerpunkt liegt auf KI-Modellen, Recheninfrastruktur, technischen Entwicklungen und der wirtschaftlichen Einordnung. Er sorgt dafür, dass komplexe KI-Themen verständlich und nachvollziehbar aufbereitet werden. Mehr zu ihm auf inrema.de und andiger.de.

Ähnliche Artikel