RecreationWorld: Neues Framework testet hybride Computer-Use-Agenten über fünf Plattformen
RecreationBench zeigt: GPT-6 Astra erreicht 58,1 % gesamt, besteht aber nur 2,8 % der vollen programmatischen Tests.
Mit KI erstelltInhalt
◆ Fakten auf einen Blick
- RecreationWorld ist ein Five-Platform-Framework, das um „Recreation“ gebaut ist: Ein Agent erhält eine laufende Referenzanwendung, muss deren Verhalten erschließen und eine funktionstreue Implementierung ohne vorgeschriebenen Workflow bauen.
- RecreationWorld stellt reproduzierbare Umgebungen auf Ubuntu, macOS, Windows, Android und Web sowie ein einheitliches Harness mit nativer GUI-Steuerung und Coding-Tools bereit.
- Die laufende Referenz dient als Orakel für versteckte Verhaltenstests und liefert ausführungsbasierte Belohnungen.
- Die Trajektoriengenerierung wird mit hochwertigen Open-Source-Anwendungen skaliert.
- Modelle, die auf diesen Trajektorien trainiert wurden, verbessern sich in fünf Out-of-Distribution-Coding- und Hybrid-Computer-Use-Benchmarks und verifizieren ihre gerenderten Ausgaben häufiger.
- Für die Held-out-Evaluation wird RecreationBench mit 250 diversen Aufgaben über Domänen und Plattformen eingeführt.
RecreationWorld: Framework für hybride Agenten über fünf Plattformen
RecreationWorld ist ein Framework für hybride Computer-Use-Agenten, das auf dem Prinzip der Recreation aufbaut: Ein Agent erhält eine laufende Referenzanwendung, muss deren Verhalten erschließen und eine funktionstreue Implementierung ohne vorgeschriebenen Workflow erstellen. Das Framework stellt reproduzierbare Umgebungen auf Ubuntu, macOS, Windows, Android und Web bereit. Ein einheitliches Harness bündelt native GUI-Steuerung und Coding-Tools, sodass Agenten selbst entscheiden können, wann sie eine Oberfläche erkunden, Software implementieren und ihre gerenderten Artefakte visuell prüfen. Die laufende Referenz dient als Orakel für versteckte Verhaltenstests und liefert ausführungsbasierte Belohnungen. Für das Training werden Trajektorien mit hochwertigen Open-Source-Anwendungen skaliert. Durch diese Skalierung wird die Vielfalt der Trainingsdaten erhöht, was laut den Belegen zu Verbesserungen in fünf Out-of-Distribution-Coding- und Hybrid-Computer-Use-Benchmarks führt. Zudem verifizieren die Modelle ihre gerenderten Ausgaben häufiger.
RecreationBench: 250 Aufgaben als Held-out-Evaluation
Für die Held-out-Evaluation führen die Autoren RecreationBench ein. Der Benchmark umfasst 250 diverse Aufgaben über verschiedene Domänen und Plattformen hinweg. Referenzgeerdete programmatische und visuelle Assertions decken aktionsbedingte Ergebnisse in mehreren Interaktionstiefen ab. Programmatische Assertions werden als automatisierte Tests definiert, die funktionale Aspekte wie Rückgabewerte oder Zustandsänderungen anhand der Referenzimplementierung prüfen. Visuelle Assertions vergleichen gerenderte Ausgaben mit Referenz-Screenshots. Die verschiedenen Interaktionstiefen umfassen das Reproduzieren statischer Interface-Strukturen, das Ausführen interaktiver Aktionen und das Erzeugen berechneter Ausgaben. Jede Assertion wird an der Referenzimplementierung validiert, bevor sie in die automatische Bewertung eingeht. Dadurch soll sichergestellt werden, dass nicht nur statische Oberflächenstrukturen, sondern auch Interaktionen und berechnete Ausgaben geprüft werden.
Erste Ergebnisse: GPT-6 Astra erreicht 58,1 %, aber nur 2,8 % volle programmatische Tests
Auf RecreationBench erreicht GPT-6 Astra insgesamt 58,1 Prozent. Alle programmatischen Tests besteht das Modell jedoch nur bei 2,8 Prozent der Aufgaben. Diese Diskrepanz zeigt die Schwierigkeit der versteckten Verhaltenstests: Ein Agent kann visuelle Prüfungen bestehen, während er an nahezu allen funktionalen Kontrollen scheitert. Die versteckten Verhaltenstests sind besonders anspruchsvoll, weil sie funktionale Interaktionen und berechnete Ausgaben prüfen, die nicht aus der reinen Oberfläche ersichtlich sind – ein Agent kann die sichtbare Struktur korrekt nachbilden, ohne die dahinterliegende Logik zu verstehen. Laut dem Preprint sind Agenten zuverlässiger darin, statische Interface-Strukturen zu reproduzieren, als Interaktionen und berechnete Ausgaben korrekt umzusetzen; generierte Anwendungen fallen zudem tendenziell kleiner und monolithischer aus als ihre Referenzen.



