Live Einstiegsjobs in New Yorker Tech-Branche brechen um 49 Prozent ein
↘

Nvidia veröffentlicht Nemotron 3 Diarization als Open-Weight-Modell

Ein 100M-Parameter-Modell für Sprecherdiarisierung mit Streaming- und Offline-Inferenz, das bis zu acht Sprecher unterscheidet und überlappende Sprache erkennt.

· Veröffentlicht: 27.09.2026 ·2 Min Lesezeit
Nvidia veröffentlicht Nemotron 3 Diarization als Open-Weight-ModellMit KI erstellt
◆ Fakten auf einen Blick
  • Nvidia veröffentlicht Nemotron 3 Diarization als Open-Weight-Modell mit ca. 100 Millionen Parametern.
  • Das Modell identifiziert bis zu acht Sprecher und unterstützt sowohl Streaming- als auch Offline-Inferenz.
  • Das Modell erkennt überlappende Sprache, also wenn mehrere Personen gleichzeitig sprechen.
  • Die Architektur basiert auf Streaming Sortformer und verwendet einen Arrival-Order Speaker Cache (AOSC) sowie eine FIFO-Queue, um Sprecheridentitäten über Chunks hinweg zu erhalten.
  • Ein einzelner Checkpoint unterstützt konfigurierbare Latenz von 80 ms bis 30,4 s Eingabepuffer; empfohlen sind 0,32 s für Live-Anwendungen und 30,4 s für Offline-Verarbeitung.
  • Die Ausgabe-Frame-Auflösung ist in Schritten von 10 ms konfigurierbar; bei Chunked Inference ist die maximale Audiodauer unbegrenzt.

Nvidia veröffentlicht Nemotron 3 Diarization als Open-Weight-Modell

Nvidia hat Nemotron 3 Diarization veröffentlicht, ein quelloffenes Modell zur Sprecherdiarisierung mit rund 100 Millionen Parametern. Das Modell bestimmt in Audiodaten, welcher Sprecher zu welchem Zeitpunkt spricht, und kann dabei bis zu acht Sprecher unterscheiden. Es unterstützt sowohl Streaming-Inferenz für Live-Anwendungen als auch Offline-Verarbeitung von Aufzeichnungen.

Sprecherdiarisierung identifiziert die Zeitintervalle, in denen jeder Sprecher aktiv ist – auch dann, wenn Personen gleichzeitig sprechen. Das Modell erkennt überlappende Sprache, indem es für jeden 10-Millisekunden-Frame eine Matrix von Sprecher-Aktivitätswahrscheinlichkeiten ausgibt: Für jeden Zeitpunkt kann mehr als ein Sprecher eine hohe Wahrscheinlichkeit aufweisen, sodass parallele Sprachanteile mehreren Kanälen zugeordnet werden. Damit eignet es sich für Szenarien wie Meetings, Kundengespräche oder Podcasts, in denen Unterbrechungen und paralleles Sprechen häufig vorkommen.

Die Gewichte des Modells sind frei verfügbar. Der Checkpoint steht über Hugging Face sowie über die Toolchain NVIDIA NeMo Speech bereit; auch die Laufzeitumgebung NeMo-Speech.cpp unterstützt das Modell für lokale Diarisierung. Das Modell ist der Nachfolger von Streaming Sortformer v2.1 und wird unter der Lizenz OpenMDW 1.1 veröffentlicht, die sowohl kommerzielle als auch nicht-kommerzielle Nutzung erlaubt.

Architektur, Latenz und Benchmark: Die Technik hinter Nemotron 3 Diarization

Die Architektur basiert auf dem Streaming Sortformer, einem Ansatz, der Sprecherpermutationen auflöst, indem die Ausgabekanäle nach der ersten Ankunft jedes Sprechers im Eingabesignal geordnet werden. Für die Streaming-Inferenz kommen zwei Zustandskomponenten hinzu: ein Arrival-Order Speaker Cache (AOSC), der Sprecherinformationen aus früheren Chunks speichert, um Sprecheridentitäten über die Zeit zu erhalten, sowie eine FIFO-Queue, die den aktuellen Frame-Kontext für jeden Verarbeitungsschritt bereitstellt.

Ein einzelner Checkpoint unterstützt konfigurierbare Latenzen: Der Eingabepuffer kann von 80 Millisekunden bis 30,4 Sekunden reichen. Kürzere Puffer ermöglichen geringere Verzögerung, reduzieren jedoch im Allgemeinen die Genauigkeit, da weniger Kontext für die Sprecherzuordnung zur Verfügung steht. Für Live-Anwendungen empfiehlt Nvidia 0,32 Sekunden als niedrigste praktikable Einstellung, während der Offline-Stil mit 30,4 Sekunden maximale Genauigkeit bietet. Die Ausgabe-Frame-Auflösung ist in Schritten von 10 Millisekunden einstellbar; bei Chunked Inference ist die maximale Audiodauer unbegrenzt.

Das Modell ist unter der Lizenz OpenMDW 1.1 veröffentlicht und über Hugging Face sowie NVIDIA NeMo Speech verfügbar. Auf dem VoiceArena Diarization-Bench erreicht es Platz 1 mit einer Diarization Error Rate (DER) von 14,72 Prozent. Der Benchmark ist streng: Überlappende Sprache wird gewertet, und bereits kleine Fehlausrichtungen an Sprecherwechseln zählen als Fehler. Im Vergleich zum Vorgänger Streaming Sortformer reduziert das Modell die Fehlerrate bei einem 1,04-Sekunden-Puffer um durchschnittlich 41 Prozent über acht Testszenarien.

Das Modell lässt sich mit ASR-Systemen wie Nvidia Parakeet oder Nemotron 3.5 ASR koppeln, um sprecherattributierte Transkripte zu erzeugen. Der Anbieter Baseten bietet optimierte Presets auf einer NVIDIA RTX PRO 6000 an und gibt an, über 500 parallele einstündige Diarisations-Streams zu unterstützen.

A
Andreas Rüdiger
Herausgeber & Redaktionsleitung · KI-Modelle, Technik & Business

Andreas Rüdiger ist Gründer der Agentur INREMA und verantwortet KI Spotlight redaktionell. Sein Schwerpunkt liegt auf KI-Modellen, Recheninfrastruktur, technischen Entwicklungen und der wirtschaftlichen Einordnung. Er sorgt dafür, dass komplexe KI-Themen verständlich und nachvollziehbar aufbereitet werden. Mehr zu ihm auf inrema.de und andiger.de.

Ähnliche Artikel