Live Richterin erklärt Pentagon-Strafen gegen Anthropic für illegal

NVIDIA veröffentlicht Nemotron VoiceChat als offenes Vollduplex-Sprachmodell

NVIDIA veröffentlicht mit Nemotron VoiceChat ein offenes, 11–12 Milliarden Parameter großes Sprachmodell, das Sprachverstehen, -modellierung und -ausgabe in einer einzigen Architektur vereint und erstmals Vollduplex-Gespräche in Echtzeit ermöglicht.

· Veröffentlicht: 11.08.2026 ·1 Min Lesezeit
NVIDIA veröffentlicht Nemotron VoiceChat als offenes Vollduplex-SprachmodellMit KI erstellt
◆ Fakten auf einen Blick
  • NVIDIA hat ein Modell mit der Bezeichnung 'Nemotron VoiceChat' bzw. 'Nemotron 3 VoiceChat' veröffentlicht.
  • Das Modell ist ein Vollduplex-Sprach-zu-Sprach-Modell, das Spracheingabe und -ausgabe in Echtzeit in einer einzigen Architektur vereint (End-to-End).
  • Es ist quelloffen; der Code ist auf GitHub verfügbar.
  • Das Modell unterstützt natürliche Gesprächsübernahme (Turn-Taking, Barge-In) und Werkzeugaufrufe (Tool Calling) während des Gesprächs.
  • Es gibt einen Guided Fine-Tuning-Pfad für domänenspezifische Anpassungen.
  • Das Modell nutzt einen 'latent reasoning mechanism', der ohne zusätzliche Überwachungsdaten oder Inferenzlatenz auskommt.

NVIDIA veröffentlicht Nemotron VoiceChat

NVIDIA hat das Sprachmodell Nemotron VoiceChat als Open Source veröffentlicht. Der Code und die Modellgewichte sind auf GitHub öffentlich zugänglich. Es handelt sich um ein Vollduplex-Sprach-zu-Sprach-Modell mit 11 Milliarden Parametern, das Spracheingabe und -ausgabe in Echtzeit in einer einzigen Architektur vereint, indem es Sprachverstehen und Sprachgenerierung in einem gemeinsamen Streaming-Prozess zusammenführt und so separate Modelle oder API-Übergaben überflüssig macht.

Offene Architektur ersetzt klassische Kaskade

Statt der klassischen Kaskade aus ASR, LLM und TTS setzt Nemotron VoiceChat auf eine einheitliche End-to-End-Architektur, die alle Schritte in einem Modell vereint und so separate Modelle und API-Übergaben eliminiert. Dadurch entfallen Latenzen durch Modellwechsel und API-Aufrufe, was eine schnellere Reaktion ermöglicht. Der Code ist auf GitHub verfügbar. Das Modell unterstützt natürliche Gesprächsübernahme (Turn-Taking), Unterbrechungen (Barge-In) sowie Werkzeugaufrufe (Tool Calling), bei denen das Modell während des Gesprächs externe Funktionen ansteuern kann.

A
Andreas Rüdiger
Herausgeber & Redaktionsleitung · KI-Modelle, Technik & Business

Andreas Rüdiger ist Gründer der Agentur INREMA und verantwortet KI Spotlight redaktionell. Sein Schwerpunkt liegt auf KI-Modellen, Recheninfrastruktur, technischen Entwicklungen und der wirtschaftlichen Einordnung. Er sorgt dafür, dass komplexe KI-Themen verständlich und nachvollziehbar aufbereitet werden. Mehr zu ihm auf inrema.de und andiger.de.

Ähnliche Artikel