CorpusMap: Navigationsschicht organisiert Korpora um Entitäten
Ein Paper führt eine offline aufgebaute Entitätsgraph-Schicht ein, die LLM-Agenten das Verknüpfen von Beweisen über Dokumente erleichtern soll.
Mit KI erstellt◆ Fakten auf einen Blick
- Das Paper stellt CorpusMap vor, eine Navigationsschicht, die den Korpus um wiederkehrende Entitäten organisiert.
- CorpusMap repräsentiert jede wiederkehrende Entität als Entity Page, die Informationen über sie aggregiert und auf jedes Dokument verlinkt, das sie erwähnt.
- Die Links werden offline durch Auflösen von Erwähnungen derselben Entität über Dokumente hinweg erstellt und sind über Abfragen hinweg geteilt, statt bei jeder Inferenz neu entdeckt zu werden.
- Das Paper erwähnt die Verwendung von 7 verschiedenen Modellen mit 3 Benchmarks (Abstract abgeschnitten, daher unvollständig).
- Motivation: LLM-Agenten suchen iterativ im gesamten Korpus, aber eine flache Dateisammlung gibt keine Hinweise auf Beziehungen zwischen Dokumenten; der Agent muss Beziehungen für jede Abfrage neu entdecken, verpasst oft komplementäre Beweise und verbraucht zusätzliche Tokens.
CorpusMap: Entitätsseiten als Navigationsschicht für Korpora
Das Paper 'Follow the Entities: A Corpus Map for Agentic Search' führt mit CorpusMap eine Navigationsschicht ein, die einen Dokumentkorpus um wiederkehrende Entitäten organisiert. Diese Entitäten sind aus den Dokumenten selbst identifizierbar. Statt Dokumente als flache Sammlung zu behandeln, repräsentiert CorpusMap jede wiederkehrende Entität als eigene Entity Page. Diese Seite aggregiert Informationen über die Entität und verlinkt auf jedes Dokument, das sie erwähnt; sie bündelt also nicht nur Verweise, sondern auch inhaltliche Informationen. Auf diese Weise entsteht ein Graph zwischen Entitäten und Dokumenten, den ein Agent durchqueren kann, um ansonsten unverbundene Beweise zusammenzuführen. Die Links werden offline erstellt, indem Erwähnungen derselben Entität über Dokumente hinweg aufgelöst werden. Dadurch sind sie über Abfragen hinweg geteilt und müssen nicht bei jeder Inferenz neu entdeckt werden. Das Paper zielt darauf ab, agentische LLM-Suche beim Verknüpfen von Beweisen über mehrere Dokumente zu unterstützen, etwa wenn die Genehmigung eines Projekts in einem Dokument, seine Anforderungen in einem anderen und der aktuelle Status in einem dritten festgehalten sind.
Warum flache Dateisammlungen für LLM-Agenten nicht reichen
Die Motivation des Papers liegt in der Arbeitsweise von LLM-Agenten: Sie suchen iterativ im gesamten Korpus, statt nur eine feste Menge top-gerankter Dokumente zu lesen. Wenn der Korpus jedoch nur als flache Dateisammlung vorliegt, gibt ein relevantes Dokument keinen Hinweis darauf, wie es mit anderen zusammenhängt. Der Agent muss diese Beziehungen für jede Abfrage neu entdecken – obwohl sie im Korpus latent vorhanden sind –, verpasst dabei oft komplementäre Beweise und verbraucht gleichzeitig erhebliche zusätzliche Tokens. Das Paper nennt die Verwendung von 7 verschiedenen Modellen mit 3 Benchmarks; der Abstract ist an dieser Stelle abgeschnitten, daher bleiben die Details unvollständig.



