Meta veröffentlicht Echtzeit-Transkriptionsmodell Muse Voice Transcribe
Streaming-Spracherkennung, Diarisierung und Endpunkterkennung in einem Modell – zu 0,18 US-Dollar pro Stunde.
Mit KI erstellt◆ Fakten auf einen Blick
- Meta Superintelligence Labs hat am 1. September 2026 das Modell Muse Voice Transcribe veröffentlicht.
- Muse Voice Transcribe ist ein Echtzeit-Audio-Wahrnehmungsmodell, das Streaming-Spracherkennung (ASR), Sprecher-Diarisierung und Endpunkterkennung in einem einzigen Modell vereint.
- Das Modell unterstützt die Diarisierung von mehr als 20 Sprechern gleichzeitig.
- Muse Voice Transcribe ist mehrsprachig; zum Start sind 25 Sprachen validiert, trainiert wurde auf über 70 Sprachen.
- Das Modell verarbeitet Audio in 80-Millisekunden-Chunks und nutzt eine adaptive Verzögerung, die die Wartezeit pro Wort dynamisch anpasst.
- Auf dem Artificial-Analysis-Streaming-Benchmark erreicht Muse Voice Transcribe eine Wortfehlerrate von 3,1 % und liegt damit vor Cartesia Ink-2 (3,4 %), ElevenLabs Scribe v2 Realtime (3,6 %), GPT Live Transcribe (3,9 %) und Gemini 3.5 Transcribe Live (4 %).
Kapitel 1: Meta veröffentlicht Muse Voice Transcribe
Meta Superintelligence Labs hat am 1. September 2026 Muse Voice Transcribe vorgestellt. Das Modell vereint Streaming-Spracherkennung, Diarisierung für über 20 Sprecher und Endpunkterkennung in einem Aufruf. Laut Meta verarbeitet es Audio in 80-Millisekunden-Blöcken und nutzt eine per bestärkendem Lernen trainierte adaptive Verzögerung, die Wortfehlerrate und Latenz ausbalanciert. Durch die Verarbeitung in 80-ms-Schritten entsteht praktisch keine hörbare Verzögerung, sodass gesprochene Worte sofort im Text erscheinen. Auf dem Artificial-Analysis-Streaming-Benchmark erreicht es nach Meta-Angaben 3,1 Prozent Wortfehlerrate und liegt vor Cartesia, ElevenLabs, OpenAI und Google. Das bedeutet, dass von 1000 gesprochenen Wörtern nur etwa 31 fehlerhaft transkribiert werden – deutlich weniger als bei den Konkurrenzmodellen, was die Nachbearbeitungskosten reduziert.
Kapitel 2: Preis und API-Verfügbarkeit
Das Modell ist über die Meta Model API verfügbar. Laut Meta beträgt der Preis 3 US-Dollar pro 1.000 Audiominuten (0,18 US-Dollar pro Stunde). Dieser Preis ist deutlich günstiger als viele spezialisierte Transkriptionsdienste und senkt die Kosten für umfangreiche Audioverarbeitung. In Meta AI für Mac ist es als systemweite Diktierfunktion integriert: Halten der Fn-Taste ermöglicht Diktat in jede Anwendung. So können Nutzer in jeder Anwendung direkt diktieren, ohne die App zu wechseln, was den Arbeitsfluss beschleunigt. Während ein Bericht zunächst nur die Mac-App-Verfügbarkeit erwähnte, bestätigen andere Quellen den sofortigen API-Zugang und die Integration in Muse Code. Die Modellgewichte werden laut Meta nicht veröffentlicht.



