PolyAI stellt Dialog-RSN-1 vor: Audio-natives Modell vereint Spracherkennung und Dialog
Erstmals fusioniert ein Modell Turn-Taking, Spracherkennung und Antwortgenerierung direkt aus dem Audiosignal – mit unter 300 ms Latenz im Live-Betrieb.
Mit KI erstellt◆ Fakten auf einen Blick
- PolyAI hat das Modell Dialog‑RSN‑1 veröffentlicht.
- Dialog‑RSN‑1 nimmt das Audio des Nutzers direkt wahr (audio‑nativ).
- Das Modell vereint Turn‑Taking, Spracherkennung, Funktionsaufrufe und Antwortgenerierung in einem einzigen Modell.
- Dialog‑RSN‑1 ist bereits im Produktiveinsatz und bearbeitet Live‑Anrufe.
- Das Modell erreicht die niedrigsten Latenzen, die PolyAI je gemessen hat.
- Die Audio‑Wahrnehmung bleibt auf der Eingabeseite; die Sprachausgabe erfolgt über ein separates Text‑to‑Speech‑System, damit Unternehmen die Kontrolle über die gehörte Stimme behalten.
Audio-natives Modell vereint vier Komponenten
PolyAI hat heute Dialog-RSN-1 vorgestellt, ein Echtzeit-Sprachdialogmodell, das erstmals Audio direkt wahrnimmt und verarbeitet. Das Modell fusioniert Turn-Taking, Spracherkennung, Funktionsaufrufe und Antwortgenerierung in einer einzigen audio-nativen Architektur. Herkömmliche Systeme arbeiten meist kaskadiert: Eine Spracherkennung wandelt Audio in Text, ein Sprachmodell generiert eine Antwort, und ein Text-to-Speech-System gibt sie aus. Dialog-RSN-1 hingegen verarbeitet das rohe Audiosignal des Nutzers unmittelbar und vereint alle Schritte in einem Modell.
Diese Integration führt zu spürbar flüssigeren und intelligenteren Gesprächen. Da das Modell direkt das Audiosignal verarbeitet, entfallen die typischen Verzögerungen und Informationsverluste, die bei der Umwandlung von Audio zu Text und zurück entstehen. Zudem kann das System nonverbale auditive Hinweise wie Tonfall, Sprechpausen und Unterbrechungen unmittelbar nutzen, um das Turn-Taking natürlicher zu gestalten und die Nutzerintention präziser zu erfassen. PolyAI zufolge bringt dies die kontextuelle Intelligenz eines großen Sprachmodells (LLM) in den gesamten Audio-Stack, sodass Gespräche deutlich flüssiger und intelligenter wirken als mit kaskadierten Systemen. Das Modell ist bereits im Produktiveinsatz und bearbeitet Live-Anrufe.
Unter 300 ms Latenz und bereits im Live-Einsatz
Die Antwortzeit von Dialog-RSN-1 liegt nach Unternehmensangaben unter 300 Millisekunden – die niedrigsten Latenzen, die PolyAI nach eigenen Messungen je erreicht hat. Ermöglicht wird diese Geschwindigkeit durch die audio-native Architektur, die auf separate Spracherkennungs- und Textgenerierungsschritte verzichtet und stattdessen das rohe Audiosignal direkt verarbeitet. Dadurch entfallen die Latenzen der Zwischentransformationen, und das Modell kann nahezu verzögerungsfrei reagieren.
Die Audio-Wahrnehmung bleibt dabei auf der Eingabeseite; für die Sprachausgabe setzt PolyAI weiterhin auf ein separates Text-to-Speech-System. So behalten Unternehmen die Kontrolle über die Stimme, die Anrufer hören. In einem eigenen Benchmark, der auf echten Kundenanrufen basiert und die Metriken Audioverständnis sowie Sicherheit der Antworten misst, übertrifft Dialog-RSN-1 laut PolyAI jedes getestete echtzeitfähige Modell – einschließlich der Angebote von OpenAI und Google. Das Benchmark-Setup nutzt reale Gesprächsdaten und bewertet, wie präzise ein Modell Kundenanliegen akustisch erfasst und wie zuverlässig es dabei Falschaussagen vermeidet. PolyAI trainierte Dialog-RSN-1 auf Millionen realer Unternehmensgespräche, was die Aussagekraft des Benchmarks unterstreicht. Das Modell ist bereits im Live-Einsatz und verarbeitet produktive Anrufe. PolyAI führt diesen Vorsprung auf die gezielte Fokussierung auf reale Unternehmensgespräche zurück, statt auf ein generisches Modell zu setzen.



