Live Missbrauch von 100%-Rabatt-Promotion für ChatGPT Plus über Apple Pay in Vietnam

OSReward: Neues Forschungsprojekt prüft VLM-Bewerter für Agenten-Trajektorien

Das Forschungsprojekt OSReward wird vorgestellt, um die Zuverlässigkeit von Vision-Language-Modellen (VLMs) als Bewerter für die Trajektorien von Computer-Using Agents (CUAs) systematisch zu untersuchen.

Veröffentlicht: 09.08.2026 ·2 Min Lesezeit
OSReward: Neues Forschungsprojekt prüft VLM-Bewerter für Agenten-TrajektorienMit KI erstellt
◆ Fakten auf einen Blick
  • OSReward ist ein neues Forschungsprojekt, das die Zuverlässigkeit von VLMs als Bewerter für CUA-Trajektorien untersucht.
  • Computer-using agents (CUAs) zeichnen Aktionen, Zustände und Überlegungen in Trajektorien auf.
  • Die Verifikation, ob eine Aufgabenanweisung erfüllt wurde, ist zentral für CUA-Evaluation, Datenkuratierung und bestärkendes Lernen.
  • Weder menschengeschriebene Verifizierer noch menschliche Annotatoren können diese Verifikation im großen Maßstab leisten, weshalb zunehmend VLMs als Bewerter eingesetzt werden.

OSReward nimmt VLM-Bewerter für Agenten-Trajektorien unter die Lupe

Mit OSReward stellt ein Forschungsteam ein neues Projekt vor, das eine bislang ungeprüfte Grundannahme der Agenten-Forschung hinterfragt: Wie zuverlässig sind Vision-Language-Models (VLMs), wenn sie als automatische Bewerter für die Trajektorien von Computer-Using Agents (CUAs) eingesetzt werden? CUAs sind KI-Agenten, die in digitalen Umgebungen selbstständig Aufgaben ausführen. Während der Ausführung zeichnen sie eine Trajektorie auf, die ihre Aktionen, die beobachteten Systemzustände und die internen Überlegungen dokumentiert. Die Überprüfung, ob die Aufgabenanweisung tatsächlich erfüllt wurde, ist zentral für die Evaluation von CUAs, die Kuratierung von Trainingsdaten und das bestärkende Lernen. Da weder menschliche Prüfer noch handgeschriebene Verifizierer diese Verifikation in großem Maßstab leisten können, greift die Community zunehmend auf VLMs als „Richter“ zurück. Allerdings wurde die Frage nach der Verlässlichkeit dieser VLM-Bewerter bisher nicht systematisch untersucht. OSReward soll diese Lücke schließen und erstmals eine methodische Studie zur Zuverlässigkeit von VLMs bei der Bewertung von CUA-Trajektorien liefern. Das Projekt zielt darauf ab, die Eignung von VLMs als Bewertungsinstanz grundlegend zu prüfen und damit eine belastbare Basis für den weiteren Einsatz in Forschung und Entwicklung zu schaffen. Details zum methodischen Vorgehen oder zu ersten Ergebnissen wurden mit der Ankündigung noch nicht veröffentlicht.

Warum skalierbare Bewertung für Computer-Using Agents entscheidend ist

Die automatisierte Verifikation von Agenten-Trajektorien ist eine Voraussetzung für den Fortschritt bei Computer-Using Agents. CUAs operieren in digitalen Umgebungen und müssen vielschrittige Anweisungen umsetzen. Jede Trajektorie dokumentiert dabei nicht nur die ausgeführten Aktionen, sondern auch die beobachteten Zustände und die Schlussfolgerungen des Agenten. Ob die Aufgabenstellung am Ende korrekt gelöst wurde, lässt sich nur durch eine Prüfung dieser gesamten Kette feststellen. Diese Verifikation ist für drei zentrale Bereiche unverzichtbar: In der Evaluation wird die Leistungsfähigkeit von CUAs gemessen; bei der Datenkuratierung werden hochwertige Trajektorien für das Training ausgewählt; und im bestärkenden Lernen dienen die Verifikationsurteile als Belohnungssignale. Menschliche Annotatoren und handgeschriebene Verifizierer können diese Prüfung jedoch nicht in dem erforderlichen Umfang leisten – die Menge der anfallenden Trajektorien übersteigt die Kapazitäten manueller Bewertung bei Weitem. Deshalb sind VLMs als skalierbare Alternative in den Fokus gerückt. Allerdings ist ihre Bewertungsgenauigkeit nicht garantiert. Genau hier setzt OSReward an: Das Projekt will systematisch klären, unter welchen Bedingungen VLM-Bewerter tatsächlich verlässliche Urteile liefern und wo ihre Grenzen liegen. Damit könnte es die Grundlage für robustere Evaluationspipelines und effizienteres bestärkendes Lernen von CUAs schaffen.

Ähnliche Artikel