Nutzer meldet Stimmenwechsel und Wiederholungen bei gpt-live-1
Bericht über inkonsistente Stimmidentität in Live-Sprachgesprächen
Mit KI erstelltInhalt
◆ Fakten auf einen Blick
- gpt-live-1 ist ein Sprachmodell von OpenAI, das in ChatGPT Voice und über die API verfügbar ist.
- gpt-live-1 unterstützt full-duplex, d.h. es kann gleichzeitig zuhören und sprechen.
- Bei der Erstellung einer Session kann eine Stimme über den Parameter audio.output.voice festgelegt werden.
- Ein Nutzer hat in der OpenAI-Community einen Bericht über Stimmenwechsel und Wiederholungen bei gpt-live-1 veröffentlicht.
Stimmenwechsel und Wiederholungen in Live-Gesprächen gemeldet
Ein Nutzer berichtet in der OpenAI-Community von einem auffälligen Problem bei Live-Sprachgesprächen mit dem Sprachmodell gpt-live-1. Während eines einzelnen Anrufs wechsle die Stimme unerwartet zwischen einer maskulin und einer feminin klingenden Stimme, teilweise mehrfach. Es klinge, als würden verschiedene Personen abwechselnd in derselben Konversation sprechen. Zudem wiederhole das Modell gelegentlich eigenen Sprachoutput. Der Nutzer beschreibt dies als störend und die Konversation als unzuverlässig. Er betont, dass er das Modell nicht dazu auffordere, verschiedene Sprecher zu simulieren, und dass seine Integration bei der Erstellung der Session explizit den Parameter audio.output.voice setzt. Eine minimale Reproduktion habe er bislang nicht isolieren können; er könne daher nicht sagen, ob es sich um modellseitigen Voice Drift, eine Wechselwirkung zwischen Audio und Kontext oder ein Problem in seiner Integration handelt. Dieser Bericht ist die erste Meldung dieses spezifischen Problems, die in den vorliegenden Belegen dokumentiert ist. Zuvor gab es lediglich allgemeine Produktinformationen zu gpt-live-1 sowie einen separaten, nicht identischen Bericht über die fehlende Persistenz der ausgewählten Stimme im Standard Mode.
So soll die Stimmauswahl laut OpenAI funktionieren
OpenAI dokumentiert, dass bei der Erstellung einer Session eine Stimme über den Parameter audio.output.voice festgelegt wird. Der Parameter erwartet den API-Namen der Stimme, etwa 'quartz'. Diese Auswahl gilt für die gesamte Session. gpt-live-1 ist ein full-duplex-Sprachmodell, das gleichzeitig zuhören und sprechen kann. Die full-duplex-Architektur wurde mit der Einführung von GPT-Live im Juli 2026 vorgestellt und ist ein zentrales Merkmal des Modells. Nach Angaben von OpenAI ermöglicht sie natürlichere Gespräche, da das Modell nicht auf das Ende einer Nutzeräußerung warten muss, sondern bereits während des Sprechens zuhören kann. Die Dokumentation sieht damit eine feste, einmalig gewählte Stimme pro Session vor.
Widerspruch zwischen Dokumentation und Nutzererfahrung
Zwischen der Dokumentation und der Nutzererfahrung besteht ein Widerspruch: Während OpenAI eine feste Stimme pro Session vorsieht, berichtet der Nutzer von mehrfachen Wechseln der Sprecheridentität innerhalb eines einzigen Gesprächs. Die Ursache ist unklar. Der Nutzer selbst nennt als mögliche Erklärungen einen Modellfehler (Voice Drift), eine Wechselwirkung zwischen Audio und Kontext oder ein Problem in seiner Integration. Eine Bestätigung durch OpenAI steht aus. Der Bericht wirft die Frage auf, ob die dokumentierte Stimmauswahl in der Praxis zuverlässig durchgehalten wird.



