APM-Bench: Neuer Benchmark für persistente Erinnerung in Video-Assistants
Benchmark reformuliert reale Streaming-Interaktion als Multi-Session-Lebensverläufe und testet persistente Erinnerung über Unterbrechungen hinweg.
Mit KI erstelltInhalt
◆ Fakten auf einen Blick
- APM-Bench reformuliert reale Streaming-Interaktion als Multi-Session-Lebensverläufe.
- Der Benchmark enthält 549 Sessions, 104 Trajektorien und 2.719 Kandidaten, mit objektiven und offenen Fragen.
- Jede Session ist ein Video mit feingranularen Annotationen; Sessions innerhalb einer Trajektorie drehen sich um verwandte Aktivitäten.
- Modelle nutzen persistenten Speicher, um Fragen zu vergangenen Sessions zu beantworten und proaktive Antworten zu geben, während Echtzeit-Interaktion aufrechterhalten wird.
- Der Benchmark evaluiert allgemeine Videomodelle unter verschiedenen Speicherprotokollen und spezialisierten Streaming-Speichersystemen und testet, ob Modelle fehlende Evidenz erkennen.
APM-Bench: Neuer Benchmark für persistente Erinnerung in Video-Assistants
Ein neuer Benchmark namens APM-Bench soll bewerten, wie gut egocentrische Streaming-Video-Assistants Erinnerungen über unterbrochene Sitzungen hinweg speichern und nutzen. Wie aus dem zugehörigen Fachpapier hervorgeht, reformuliert APM-Bench reale Streaming-Interaktion als Multi-Session-Lebensverläufe. Bisherige Benchmarks und Methoden konzentrierten sich meist auf einzelne kontinuierliche Videos oder kurze Clips und übersehen, dass reale Interaktionen häufig unterbrochen werden. Für einen persönlichen Assistenten ist es jedoch entscheidend, frühere Erlebnisse zu behalten, um später kontextbezogene Antworten zu geben oder proaktive Unterstützung zu leisten, ohne dass der Nutzer alles erneut erklären muss. Genau diese Lücke schließt APM-Bench: Modelle müssen nun über mehrere Sitzungen hinweg Informationen speichern, selektiv behalten und zum richtigen Zeitpunkt abrufen – eine Anforderung, die bei Einzelvideo-Benchmarks nicht getestet wird. So wird erstmals die persistente Erinnerung als Kernfähigkeit für persönliche Assistenten evaluiert.
Aufbau: 549 Sessions, 104 Trajektorien, 2.719 Kandidaten
Der Datensatz umfasst 549 Sessions, 104 Trajektorien und 2.719 Kandidaten. Jede Session ist ein Video mit feingranularen Annotationen; Sessions innerhalb einer Trajektorie drehen sich um verwandte Aktivitäten. Die Fragen decken zwei Formate ab: objektive und offene Fragen. Diese Struktur ist für die Bewertung von persistentem Gedächtnis zentral: Mehrere Sessions pro Trajektorie simulieren reale Unterbrechungen, sodass getestet wird, ob Modelle Informationen aus früheren Sessions behalten und auf spätere anwenden können. Die feingranularen Annotationen erlauben eine präzise Prüfung, welche Details erinnert wurden, und die Mischung aus objektiven und offenen Fragen testet sowohl Faktenwissen als auch das Verständnis von Zusammenhängen über Sitzungen hinweg. Die 2.719 Kandidaten bilden zusammen mit den Fragen ein umfangreiches Evaluationsset. So wird die Fähigkeit zur persistenten Erinnerung unter realistischen Bedingungen gemessen.
Evaluationsansatz: Speicherprotokolle und Fehlen von Evidenz
Modelle nutzen persistenten Speicher, um Fragen zu vergangenen Sessions zu beantworten und proaktive Antworten zu geben, während Echtzeit-Interaktion aufrechterhalten wird. Der Benchmark evaluiert allgemeine Videomodelle unter verschiedenen Speicherprotokollen und spezialisierten Streaming-Speichersystemen. Diese Protokolle sind entscheidend, weil persistenter Speicher speicherbar sein, selektiv Informationen behalten, zum richtigen Zeitpunkt eingefügt werden und effizient bleiben muss – nur so lässt sich der Kompromiss zwischen Nutzen, Latenz und Speicherbedarf meistern. Zudem testet der Benchmark, ob Modelle fehlende Evidenz erkennen, da endlicher Speicher dazu führen kann, dass benötigte Evidenz nicht verfügbar ist.



