Live Meta stellt kameralose Audio-Brille Ray-Ban Meta Audio vor

Qwen-Audio 3.1: Fünf Modelle für ASR, TTS und Echtzeit-Interaktion

Alibaba veröffentlicht neue Modellfamilie mit ASR-Next und TTS-Next und senkt API-Preise um bis zu 95 Prozent.

· Veröffentlicht: 23.09.2026 ·3 Min Lesezeit
Qwen-Audio 3.1: Fünf Modelle für ASR, TTS und Echtzeit-InteraktionMit KI erstellt
Inhalt
◆ Fakten auf einen Blick
  • Alibaba hat Qwen-Audio 3.1 veröffentlicht, eine Familie von fünf Modellen für automatische Spracherkennung (ASR), Text-to-Speech (TTS) und Echtzeit-Sprachinteraktion.
  • Die fünf Modelle umfassen ASR, TTS, Realtime sowie die neuen Modelle ASR-Next und TTS-Next.
  • ASR-Next kann mehrere Sprecher identifizieren (Diarization), Zeitstempel vergeben sowie Emotionen, Umgebungsgeräusche und Maschinengeräusche erkennen.
  • TTS-Next kombiniert ein Sprachmodell mit einem Diffusionsansatz, um Sprache, Soundeffekte und Hintergrundaudio in einem einzigen Durchgang zu erzeugen.
  • Das Realtime-Modell unterstützt gleichzeitiges Sprechen und Zuhören mit sofortiger Unterbrechung und reagiert bei erkannter niedriger Stimmung langsamer und empathischer.
  • Die API-Preise werden gesenkt: TTS um etwa 70 Prozent, Realtime um etwa 85 Prozent und ASR um bis zu 95 Prozent.

Alibaba veröffentlicht Qwen-Audio 3.1 mit fünf Modellen

Alibaba hat die Sprachmodell-Familie Qwen-Audio 3.1 veröffentlicht. Sie umfasst nach Angaben des Unternehmens fünf Modelle für automatische Spracherkennung (ASR), Text-to-Speech (TTS) und Echtzeit-Sprachinteraktion. Neben den aktualisierten Modellen ASR, TTS und Realtime führt Qwen zwei neue Modellreihen ein: ASR-Next für erweiterte Audioanalyse und TTS-Next für die kombinierte Erzeugung von Sprache, Soundeffekten und Hintergrundaudio. Die Ankündigung erfolgte auf der Yunqi-Konferenz. Laut Alibaba wurde die Familie vollständig aufgerüstet. Die fünf Modelle sind ASR, TTS, Realtime, ASR-Next und TTS-Next. Damit deckt die Familie nach Herstellerangaben den gesamten Audio-Stack von Verstehen über Generieren bis zur Interaktion ab. Transkription, Sprachsynthese und Gesprächsführung lassen sich so aus einer Modellfamilie beziehen, was den Integrationsaufwand reduzieren kann.

ASR-Next erkennt Sprecher, Emotionen und Umgebungsgeräusche

ASR-Next erweitert die Spracherkennung um eine Analyse des vollständigen Audioinhalts. Laut Qwen kann das Modell mehrere Sprecher identifizieren (Diarization), Zeitstempel vergeben sowie Emotionen, Umgebungsgeräusche und Maschinengeräusche erkennen. Die technische Umsetzung basiert nach Herstellerangaben auf einer Next-Generation-Architektur, die Audio nicht nur als Text, sondern als vollständiges Signal verarbeitet. Konkrete Implementierungsdetails wurden nicht veröffentlicht. Die Architektur soll über die reine Transkription hinausgehen und den gesamten akustischen Kontext erfassen. Damit lassen sich nach Angaben von Qwen Aufgaben wie Klangbeschreibung, Ereignislokalisierung, audiobasierte Fragen und Schlussfolgerungen bearbeiten. So könne das Modell etwa beantworten, welche Emotionen die Personen in einer Aufnahme zeigen. Die Erkennung von Maschinengeräuschen erlaube zudem die Analyse industrieller Umgebungen.

TTS-Next erzeugt Sprache, Soundeffekte und Hintergrundaudio in einem Durchgang

TTS-Next kombiniert nach Angaben von Qwen ein Sprachmodell mit einem Diffusionsansatz, um Sprache, Soundeffekte und Hintergrundaudio in einem einzigen Durchgang zu erzeugen. Das Sprachmodell verarbeitet die Eingaben – Text, Zeitstempel und Referenzaudio – und steuert die inhaltliche Struktur der Audiospur. Der Diffusionsansatz generiert daraus schrittweise die akustischen Signale, wobei alle Komponenten – Stimme, Effekte und Umgebungsgeräusche – in einem gemeinsamen Prozess entstehen. Die Architektur generiert auf Basis eines Skripts eine komplette Audiospur mit Dialog und Umgebungsgeräuschen. Das Modell unterstützt laut Hersteller 16 Sprachen und 20 chinesische Dialekte und kann eine dreiminütige Langform-Synthese in einem Durchgang erstellen. Es richtet sich an professionelle Produktionen wie Hörbücher, Filme, Serien und Podcasts. Die einpassige Generierung könne die Effizienz solcher Arbeitsabläufe erhöhen, so Qwen.

API-Preise sinken um bis zu 95 Prozent

Alibaba gibt an, die Preise für die Voice-API deutlich zu senken: TTS wird um etwa 70 Prozent günstiger, Realtime um etwa 85 Prozent, ASR um bis zu 95 Prozent. Die Modelle sind nach Angaben des Unternehmens in Qwen Office und Qoder integriert und in Hardwareprodukten wie QwenNote A2, QwenNote Eva und der Qwen AI-Brille verfügbar. Das Realtime-Modell unterstützt laut Qwen gleichzeitiges Sprechen und Zuhören mit sofortiger Unterbrechung und reagiert bei erkannter niedriger Stimmung langsamer und empathischer. Realtime Plus bietet zudem 262K Kontext, Full-Duplex, Function Calling und Voice Cloning. Damit lassen sich Transkription, Sprachsynthese und Gesprächsführung aus einer gehosteten Modellfamilie beziehen, was Integrationsaufwand reduzieren kann.

Vom Vorgänger Qwen-Audio 3.0 zu 3.1

Der Vorgänger Qwen-Audio 3.0 unterstützte 30 Sprachen und 16 chinesische Dialektvarianten und basierte auf einer Mixture-of-Experts (MoE) LLM-Architektur. Mit Qwen-Audio 3.1 führt Alibaba die neuen Modellreihen ASR-Next und TTS-Next ein und senkt zugleich die API-Preise drastisch. Der Fortschritt liegt nach Angaben von Qwen in der erweiterten Audioanalyse, der einpassigen Audiogenerierung und den deutlich niedrigeren Kosten für Sprachdienste. Während der Vorgänger auf Transkription fokussiert war, deckt die neue Version auch Audioverstehen und Audioproduktion ab. Die neuen Modellreihen basieren laut Hersteller auf einer Next-Generation-Architektur. Damit erweitert Alibaba sein Sprachportfolio über die reine Erkennung hinaus.

A
Andreas Rüdiger
Herausgeber & Redaktionsleitung · KI-Modelle, Technik & Business

Andreas Rüdiger ist Gründer der Agentur INREMA und verantwortet KI Spotlight redaktionell. Sein Schwerpunkt liegt auf KI-Modellen, Recheninfrastruktur, technischen Entwicklungen und der wirtschaftlichen Einordnung. Er sorgt dafür, dass komplexe KI-Themen verständlich und nachvollziehbar aufbereitet werden. Mehr zu ihm auf inrema.de und andiger.de.

Ähnliche Artikel