VoxPolyMem erreicht 85,0 Punkte auf neuem Benchmark
Interaktionsbewusstes multimodales Speicher-Framework übertrifft stärkste Baseline um 23,6 Punkte
Mit KI erstelltInhalt
◆ Fakten auf einen Blick
- VoxPolyMem ist ein interaktionsbewusstes multimodales Speicher-Framework, das inkrementelle Sprecheridentifikation mit einer Speicherhierarchie aus Interaktionsspeicher, Faktenspeicher und Teilnehmerprofilen kombiniert.
- Retrieval wird als sequenzielle Entscheidungsfindung formuliert; ein Agent schreibt Anfragen um und wählt Retrieval-Werkzeuge und Speicherebenen auf Basis akkumulierter Evidenz aus, um Informationslücken zu schließen.
- Es wird Evidence-Gain GRPO (EG-GRPO) eingeführt, das rundweise Kreditzuweisung nutzt, um komplementäre Evidenzbeschaffung zu fördern.
- VoxPolyBench wird konstruiert, um Speicherentwicklung, personalisierte Antworten, Speicherabruf und -schlussfolgern sowie Interaktionsschlussfolgern und -zuordnung in mehrteiligen gesprochenen Konversationen zu evaluieren.
- VoxPolyMem erreicht auf VoxPolyBench einen Gesamtscore von 85,0 und übertrifft die stärkste evaluierte Baseline um 23,6 Punkte.
- Auf Mem-Gallery und H2HMem-Multi erreicht VoxPolyMem 89,6 bzw. 74,4 Punkte.
VoxPolyMem erreicht 85,0 Punkte auf neuem Benchmark
Forschende stellen mit VoxPolyMem ein interaktionsbewusstes multimodales Speicher-Framework für mehrteilige gesprochene Konversationen vor. Bisherige Arbeiten zu Langzeitgedächtnis konzentrieren sich überwiegend auf dyadische Text- oder Bild-Text-Konversationen; die Mehrparteien-Sprachsituation ist dagegen kaum erforscht. Genau dort entstehen zusätzliche Anforderungen: Gesprächsinhalte müssen bewahrt, Teilnehmer über Sitzungen hinweg identifiziert und festgehalten werden, wer mit wem spricht. VoxPolyMem adressiert diese Lücke, indem es eine inkrementelle Sprecheridentifikation mit einer Speicherhierarchie kombiniert. Auf dem eigens konstruierten Benchmark VoxPolyBench erreicht das Framework einen Gesamtscore von 85,0 Punkten und liegt damit 23,6 Punkte über der stärksten evaluierten Baseline.
Architektur: Speicherhierarchie und sequenzielle Entscheidungsfindung
Die Speicherhierarchie von VoxPolyMem umfasst drei Ebenen: Interaktionsspeicher, Faktenspeicher und Teilnehmerprofile. Diese Aufteilung ist darauf ausgerichtet, die zentralen Anforderungen mehrteiliger gesprochener Konversationen abzudecken – Inhalte zu bewahren, Teilnehmer wiederzuerkennen und festzuhalten, wer mit wem spricht. Die inkrementelle Sprecheridentifikation ordnet Äußerungen fortlaufend den jeweiligen Teilnehmern zu und aktualisiert so die entsprechenden Informationen. Der Abruf von Informationen ist als sequenzielle Entscheidungsfindung formuliert: Ein Agent formuliert Anfragen um und wählt auf Basis der bis dahin akkumulierten Evidenz passende Retrieval-Werkzeuge und Speicherebenen aus, um bestehende Informationslücken zu schließen. Ergänzend führen die Autoren Evidence-Gain GRPO (EG-GRPO) ein. Das Verfahren nutzt eine rundweise Kreditzuweisung, um den Erwerb komplementärer Evidenz zu fördern.
VoxPolyBench und weitere Ergebnisse
VoxPolyBench evaluiert vier Aspekte in mehrteiligen gesprochenen Konversationen: Speicherentwicklung, personalisiertes Antworten, Speicherabruf und -schlussfolgern sowie Interaktionsschlussfolgern und -zuordnung. Neben dem Gesamtscore von 85,0 Punkten auf VoxPolyBench erreicht VoxPolyMem auf den Benchmarks Mem-Gallery und H2HMem-Multi Werte von 89,6 beziehungsweise 74,4 Punkten. Auch dort übertrifft es die stärkste evaluierte Baseline.



