Live Google Gemini unterschätzt Aufstiegszeit am Mount Shasta – Rettungseinsatz für drei Wanderer

Meta veröffentlicht Echtzeit-Audio-Modell Muse Voice Transcribe

Meta Superintelligence Labs veröffentlicht Muse Voice Transcribe: Echtzeit-Transkription, Sprechertrennung und Endpunkterkennung in einem Modell.

· Veröffentlicht: 06.09.2026 ·2 Min Lesezeit
Meta veröffentlicht Echtzeit-Audio-Modell Muse Voice TranscribeMit KI erstellt
◆ Fakten auf einen Blick
  • Muse Voice Transcribe wurde am 1. September 2026 von Meta Superintelligence Labs veröffentlicht.
  • Das Modell führt Streaming-Spracherkennung (ASR), Sprechertrennung (Diarization) und Endpunkterkennung (Endpointing) in einem einzigen Modell durch.
  • Das Modell kann 20 oder mehr Sprecher unterscheiden.
  • Der Preis beträgt 3 US-Dollar pro 1.000 Audiominuten, entsprechend 0,18 US-Dollar pro Stunde.
  • Das Modell ist über die Meta Model API verfügbar, unter dem Modellnamen muse-voice-transcribe-1.0.
  • Das Modell ist in Meta AI für Mac als systemweite Diktierfunktion integriert (Fn-Taste aktiviert Audio-Eingabe in beliebige Anwendungen).

Drei Audio-Aufgaben in einem Modell

Meta Superintelligence Labs hat am 1. September 2026 das Echtzeit-Audio-Modell Muse Voice Transcribe veröffentlicht. Es handelt sich nach Angaben des Unternehmens um das erste Echtzeit-Audio-Wahrnehmungsmodell des Labors und gehört zur Muse-Spark-Familie. Das Modell ist als autoregressives multimodales System konzipiert und führt drei Aufgaben in einem einzigen Modellaufruf zusammen: Streaming-Spracherkennung, Sprechertrennung für 20 oder mehr gleichzeitige Sprecher sowie Endpunkterkennung. Üblicherweise werden diese Funktionen über getrennte Pipelines abgewickelt – ein Modell transkribiert, ein zweites ordnet Sprecher zu, ein drittes erkennt Satzenden. Muse Voice Transcribe verarbeitet eingehende Audiodaten stattdessen in 80-Millisekunden-Blöcken. Nach jedem Block entscheidet das Modell, ob es weiter zuhört oder das nächste Wort als Text ausgibt. Diese adaptive Verzögerung wird laut Meta mit Reinforcement Learning trainiert, um Wortfehlerrate und Latenz pro Wort auszubalancieren: Einfachere Wörter werden schneller ausgegeben, schwierigere erhalten mehr Kontext. Die Sprechertrennung erfolgt ohne separate Nachbearbeitung. Das Modell unterstützt nach Herstellerangabe mehr als 70 Sprachen (25 davon validiert), nahtloses Code-Switching sowie Biasing nach Sprache, Schlüsselwörtern und Kontext. Audiositzungen von über einer Stunde Länge sind möglich. Meta gibt an, auf dem Artificial-Analysis-Benchmark für Streaming-Spracherkennung sowie auf öffentlichen Diarisierungs-Benchmarks den ersten Platz zu belegen.

API-Preis und Integration in Meta-Produkte

Das Modell ist über die Meta Model API unter dem Namen muse-voice-transcribe-1.0 verfügbar. Der Preis beträgt 3 US-Dollar pro 1.000 Audiominuten, was 0,18 US-Dollar pro Stunde entspricht. Der API-Endpunkt ist so implementiert, dass er mit dem OpenAI SDK funktioniert; bestehender Transkriptionscode benötigt daher in der Regel nur eine neue Basis-URL und einen neuen Modellnamen. Durch die Nutzung des bekannten OpenAI‑SDK können Entwickler ihre bestehende Infrastruktur mit minimalem Aufwand anpassen, weil nur die Endpunkt‑URL und der Modell‑Identifier ausgetauscht werden müssen. Meta bietet für die API zudem eine Zero-Data-Retention-Stufe an. Zero‑Data‑Retention bedeutet, dass Meta keine Audiodaten speichert, sobald die Transkription abgeschlossen ist – ein wichtiges Feature für datenschutz‑sensible Anwendungen. Bereits integriert ist Muse Voice Transcribe in Meta AI für Mac als systemweite Diktierfunktion: Halten der Fn-Taste aktiviert die Audio-Eingabe in beliebige Anwendungen. Auch Muse Code nutzt das Modell. Die Gewichte veröffentlicht Meta nicht; eine Selbst-Hosting-Option gibt es damit nicht.

A
Andreas Rüdiger
Herausgeber & Redaktionsleitung · KI-Modelle, Technik & Business

Andreas Rüdiger ist Gründer der Agentur INREMA und verantwortet KI Spotlight redaktionell. Sein Schwerpunkt liegt auf KI-Modellen, Recheninfrastruktur, technischen Entwicklungen und der wirtschaftlichen Einordnung. Er sorgt dafür, dass komplexe KI-Themen verständlich und nachvollziehbar aufbereitet werden. Mehr zu ihm auf inrema.de und andiger.de.

Ähnliche Artikel