NVIDIA veröffentlicht Nemotron VoiceChat als offenes Vollduplex-Sprachmodell
NVIDIA veröffentlicht mit Nemotron VoiceChat ein offenes, 11–12 Milliarden Parameter großes Sprachmodell, das Sprachverstehen, -modellierung und -ausgabe in einer einzigen Architektur vereint und erstmals Vollduplex-Gespräche in Echtzeit ermöglicht.
Mit KI erstellt◆ Fakten auf einen Blick
- NVIDIA hat ein Modell mit der Bezeichnung 'Nemotron VoiceChat' bzw. 'Nemotron 3 VoiceChat' veröffentlicht.
- Das Modell ist ein Vollduplex-Sprach-zu-Sprach-Modell, das Spracheingabe und -ausgabe in Echtzeit in einer einzigen Architektur vereint (End-to-End).
- Es ist quelloffen; der Code ist auf GitHub verfügbar.
- Das Modell unterstützt natürliche Gesprächsübernahme (Turn-Taking, Barge-In) und Werkzeugaufrufe (Tool Calling) während des Gesprächs.
- Es gibt einen Guided Fine-Tuning-Pfad für domänenspezifische Anpassungen.
- Das Modell nutzt einen 'latent reasoning mechanism', der ohne zusätzliche Überwachungsdaten oder Inferenzlatenz auskommt.
NVIDIA veröffentlicht Nemotron VoiceChat
NVIDIA hat das Sprachmodell Nemotron VoiceChat als Open Source veröffentlicht. Der Code und die Modellgewichte sind auf GitHub öffentlich zugänglich. Es handelt sich um ein Vollduplex-Sprach-zu-Sprach-Modell mit 11 Milliarden Parametern, das Spracheingabe und -ausgabe in Echtzeit in einer einzigen Architektur vereint, indem es Sprachverstehen und Sprachgenerierung in einem gemeinsamen Streaming-Prozess zusammenführt und so separate Modelle oder API-Übergaben überflüssig macht.
Offene Architektur ersetzt klassische Kaskade
Statt der klassischen Kaskade aus ASR, LLM und TTS setzt Nemotron VoiceChat auf eine einheitliche End-to-End-Architektur, die alle Schritte in einem Modell vereint und so separate Modelle und API-Übergaben eliminiert. Dadurch entfallen Latenzen durch Modellwechsel und API-Aufrufe, was eine schnellere Reaktion ermöglicht. Der Code ist auf GitHub verfügbar. Das Modell unterstützt natürliche Gesprächsübernahme (Turn-Taking), Unterbrechungen (Barge-In) sowie Werkzeugaufrufe (Tool Calling), bei denen das Modell während des Gesprächs externe Funktionen ansteuern kann.



