Live Brand Kit und Skills ab sofort in Copilot in PowerPoint
↘

Duplex-MPE: Benchmark für Full-Duplex-Mehrparteien-Dialoge

Neuer Benchmark bewertet, wann ein Assistent in Gesprächen mit mehreren Personen antworten, schweigen oder stoppen sollte.

· Veröffentlicht: 29.09.2026 ·1 Min Lesezeit
Duplex-MPE: Benchmark für Full-Duplex-Mehrparteien-DialogeMit KI erstellt
Inhalt
◆ Fakten auf einen Blick
  • Duplex-MPE ist ein Benchmark zur Bewertung von Full-Duplex-Sprachmodellen in Mehrparteien-Dialogen.
  • Das Benchmark enthält 2.000 Szenarien mit drei oder vier menschlichen Sprechern und einem Assistenten.
  • Jedes Szenario ist gepaart mit expliziter und impliziter Adressierung derselben Anfrage.
  • Modelle erhalten kontinuierliches Gesprächsaudio ohne Transkripte oder vorgegebene Turn-Grenzen.
  • Vier Scores messen: frische Antwortinitiierung, Antwortgenauigkeit, Stille-Bewahrung und Stoppen, wenn ein Mensch eine Anfrage löst.
  • Fünf Open-Weight-Sprachsysteme wurden evaluiert: MiniCPM-o 4.5, Moshi, FLM-Audio, Voila und Freeze-Omni.

Duplex-MPE: Benchmark für Full-Duplex-Mehrparteien-Dialoge

Duplex-MPE ist ein neuer Benchmark zur Bewertung von Full-Duplex-Sprachmodellen in Mehrparteien-Dialogen. Er adressiert eine Lücke: Bestehende Benchmarks konzentrieren sich meist auf einen einzelnen Nutzer und starre Turn-Grenzen, während Duplex-MPE einen Assistenten betrachtet, der an einem gemeinsamen Gespräch von drei oder vier menschlichen Sprechern teilnimmt. Das Benchmark umfasst 2.000 Szenarien, in denen jeweils ein Assistent und mehrere menschliche Sprecher interagieren. Ziel ist zu bewerten, wann der Assistent antworten, schweigen oder aufhören sollte zu sprechen.

Vier Metriken für Antworten, Schweigen und Stoppen

Für die Evaluation erhalten die Modelle kontinuierliches Gesprächsaudio, ohne Transkripte oder vorgegebene Turn-Grenzen. Jedes Szenario ist gepaart mit expliziter und impliziter Adressierung derselben Anfrage: Eine Anfrage wird einmal direkt an den Assistenten gerichtet und einmal indirekt im Gespräch geäußert. Vier Scores messen die Leistung: die frische Antwortinitiierung, also ob das Modell angemessen neu antwortet; die Antwortgenauigkeit, also ob die Antwort inhaltlich korrekt ist; die Stille-Bewahrung, also ob das Modell schweigt, wenn es nicht angesprochen ist; und das Stoppen, wenn ein Mensch eine Anfrage bereits löst. So wird bewertet, ob das System nicht nur richtig antwortet, sondern auch den richtigen Zeitpunkt für Sprechen und Schweigen findet.

MiniCPM-o 4.5 führt, andere sprechen oft falsch

Fünf Open-Weight-Sprachsysteme wurden evaluiert: MiniCPM-o 4.5, Moshi, FLM-Audio, Voila und Freeze-Omni. MiniCPM-o 4.5 führt bei drei der vier bewerteten Fähigkeiten. Die anderen Systeme zeigen ein anderes Muster: Häufiges Sprechen geht bei ihnen oft mit ungenauen Antworten oder Fehlern beim Schweigen einher. Ein transkriptbasiertes Referenzmodell, Gemini 3.1 Pro, antwortet 64,3 Prozentpunkte häufiger auf explizite als auf implizite Anfragen. Gepaarte Tests zeigen für die Sprachsysteme keinen signifikanten Unterschied in der Antwortrate zwischen expliziter und impliziter Adressierung.

J
Jasmin Freitag
Redaktion · KI-Anwendungen & Tools

Jasmin Freitag beobachtet für KI Spotlight die praktische Seite der künstlichen Intelligenz: neue Anwendungen, generative Werkzeuge, kreative KI und den Einsatz von Tools im Alltag und in Unternehmen. Sie erklärt praxisnah, was ein Werkzeug wirklich taugt.

Ähnliche Artikel