OneSearch-VL: Neuer multimodaler Deep-Research-Agent mit VGEG vorgestellt
Ein Forschungsteam präsentiert einen einheitlichen Agenten für Bild- und Video-Recherche, der auf einem Visually Grounded Evidence Graph basiert und deutliche Verbesserungen gegenüber dem Basismodell erzielt.
Mit KI erstelltInhalt
◆ Fakten auf einen Blick
- OneSearch-VL ist ein multimodaler Deep-Research-Agent für Einzelbild, Mehrbild und Video, der auf einem Visually Grounded Evidence Graph (VGEG) basiert.
- Der VGEG kodiert Abhängigkeiten zwischen lokalisierten visuellen Ankern, Entitätsrelationen, quellengestützten Fakten und antwortproduzierenden Operationen als gemeinsame Aufgabenreferenz für Datenkonstruktion, Prozessüberwachung und Evaluation.
- Die VGEG-basierte Data Engine konstruiert und verifiziert Multi-Image- und Video-Fragen und filtert Experten-Trajektorien.
- Für Training werden OneSearch-VL-SFT-110K (Supervised Fine-Tuning) und OneSearch-VL-RL-10K (Reinforcement Learning) verwendet.
- Aus VGEG-Annotationen wird der Evidence-aware Visual-Grounded Rubric Reward (EVGR) abgeleitet, um Evidenz-Nachverfolgbarkeit und visuelle Verankerung während des RL zu überwachen.
- Für die Evaluation werden OneSearch-MI-Bench und OneSearch-Video-Bench konstruiert, die Fragen nach den in VGEG kodierten Forschungsoperationen organisieren.
OneSearch-VL: Neuer multimodaler Deep-Research-Agent mit VGEG
Ein Forschungsteam hat mit OneSearch-VL einen neuen multimodalen Deep-Research-Agenten vorgestellt, der Aufgaben mit Einzelbildern, mehreren Bildern und Videos bearbeitet. Kern des Systems ist ein Visually Grounded Evidence Graph (VGEG), der visuelle Verankerung, externe Retrieval-Operationen und die Zusammenstellung von Fakten in einem einheitlichen Workflow verbindet. Der Agent soll Abhängigkeiten zwischen lokalisierten visuellen Ankern, Entitätsrelationen, quellengestützten Fakten und antwortproduzierenden Operationen erhalten. In Experimenten verbessert sich OneSearch-VL-8B gegenüber dem Basismodell Qwen3-VL-8B mit Tool-Zugriff deutlich. Die Autoren berichten von substanziellen Zugewinnen auf mehreren Benchmarks. Der VGEG kodiert diese Abhängigkeiten explizit als gemeinsame Aufgabenreferenz, wodurch der Agent konsistente Schlussfolgerungen über visuelle und externe Evidenz hinweg ziehen kann. Der daraus abgeleitete Reward-Mechanismus belohnt zusätzlich die Nachverfolgbarkeit von Evidenz und die visuelle Verankerung, was zu präziseren Antworten führt.
VGEG-Architektur und Trainingsdaten
Der VGEG ist als Graphstruktur aufgebaut, in der lokalisierte visuelle Anker – etwa Bildregionen oder Objekt-Bounding-Boxen – mit realen Entitäten verknüpft werden. Entitätsrelationen werden als mehrstufige relationale Pfade aufgezeichnet, quellengestützte Fakten als Knoten oder Attribute gespeichert, und die Operationen, die diese Fakten zu einer Antwort zusammensetzen, werden explizit als Teil des Graphen spezifiziert. Dadurch entsteht eine gemeinsame Aufgabenreferenz, die für Datenkonstruktion, Prozessüberwachung und Evaluation auf Operationsebene genutzt wird. Die auf dem VGEG basierende Data Engine konstruiert und verifiziert Multi-Image- und Video-Fragen und filtert Experten-Trajektorien. Für das Training werden zwei Datensätze verwendet: OneSearch-VL-SFT-110K für überwachtes Feintuning und OneSearch-VL-RL-10K für Reinforcement Learning. Aus den VGEG-Annotationen wird der Evidence-aware Visual-Grounded Rubric Reward (EVGR) abgeleitet. Dieser Reward kombiniert mehrere Signale: Genauigkeit der Antwort, Qualität der Query, Evidenz-Traceability (trace) und visuelle Verankerung (ground). Die trace- und ground-Komponenten werden direkt aus den VGEG-Annotationen berechnet und bewerten, ob die vom Agenten verwendeten Evidenzquellen mit den im Graphen kodierten Fakten übereinstimmen und ob die visuellen Anker korrekt lokalisiert sind. Dadurch wird der Agent während des Reinforcement Learning explizit dazu angehalten, seine Antworten auf belegbare visuelle und externe Quellen zu stützen.
Benchmarks und Ergebnisse
Für die Evaluation haben die Autoren zwei neue Benchmarks konstruiert: OneSearch-MI-Bench für Multi-Image-Aufgaben und OneSearch-Video-Bench für Video-Aufgaben. Die Fragen sind nach den im VGEG kodierten Forschungsoperationen organisiert. OneSearch-VL-8B verbessert sich gegenüber Qwen3-VL-8B mit Tool-Zugriff um 20,2 Prozentpunkte auf OneSearch-MI-Bench und um 17,6 Prozentpunkte auf OneSearch-Video-Bench. Auf dem VideoDR-Benchmark erreicht der Agent 57,0 Punkte, die Baseline liegt bei 30,0. Über sieben Bild-Benchmarks gemittelt erzielt OneSearch-VL-8B 58,3 Punkte gegenüber 42,0 der Baseline. Der vollständige RL-Reward, der Genauigkeit, Query, Trace und Ground kombiniert, erreicht im Durchschnitt 61,1 Punkte und liegt damit 3,8 Punkte über einem Reward, der nur Antwort und Query berücksichtigt. Diese Verbesserungen sind erheblich: Auf OneSearch-MI-Bench entspricht der Zuwachs einer relativen Steigerung von über 57 Prozent, und auf VideoDR wird die Leistung nahezu verdoppelt. Das deutet darauf hin, dass der VGEG-basierte Ansatz insbesondere bei komplexen, evidenzbasierten Rechercheaufgaben mit mehreren visuellen Quellen deutliche Vorteile bietet und neue Anwendungsbereiche wie die automatisierte Video-Fragenbeantwortung erschließt.
Verfügbarkeit und Einordnung
Das Projekt-Repository ist auf GitHub unter https://github.com/appletea233/OneSearch-VL verfügbar. OneSearch-VL-8B ist auf dem multimodalen Modell Qwen3-VL-8B initialisiert.



