WideSWE: Coding-Agenten scheitern an repository-übergreifenden Aufgaben
Neuer Benchmark zeigt: Aktuelle Agenten lösen nur 10,83 bis 42,50 Prozent der Cross-Repo-Aufgaben vollständig.
Mit KI erstellt◆ Fakten auf einen Blick
- WideSWE ist ein Benchmark zur Bewertung von Coding-Agenten bei repository-übergreifenden Aufgaben.
- Die Aufgaben stammen aus 103 Software-Ökosystemen; insgesamt 120 reale Aufgaben, je 60 Bugfixes und 60 Features.
- Prompts werden aus zugehörigen Issues und Pull Requests abgeleitet.
- Hidden Tests werden systematisch überprüft und angepasst, um unterschiedliche korrekte Implementierungen zu unterstützen und Regressionen zu prüfen.
- Über sieben Agent-Konfigurationen liegt die vollständige Aufgabenerfüllung zwischen 10,83 % und 42,50 %; die Konfiguration Codex CLI mit GPT-5.6-sol erreicht die höchste Rate.
- Die Trajektorien zeigen, dass Agenten notwendige Änderungen nicht erkennen, erkannte Änderungen unvollendet lassen oder Repositories ändern, ohne die Anforderung vollständig zu erfüllen.
WideSWE: Neuer Benchmark für Cross-Repo-Aufgaben
Das neue Benchmark WideSWE bewertet Coding-Agenten bei Aufgaben, die Änderungen über mehrere Repositories hinweg erfordern. Bisherige Benchmarks prüften die Aufgabenerfüllung überwiegend innerhalb einer einzelnen Codebasis; in Software-Ökosystemen verlangen viele Features und Bugfixes jedoch koordinierte Änderungen in mehreren Repositories. Da reale Softwareprojekte oft aus mehreren zusammenhängenden Repositories bestehen, ist diese Fähigkeit entscheidend. WideSWE schließt diese Lücke: Die Aufgaben wurden durch das Mining und die Prüfung von Änderungen in 103 Software-Ökosystemen gewonnen. Insgesamt umfasst der Datensatz 120 reale Aufgaben, gleichmäßig verteilt auf 60 Bugfixes und 60 Features. Die Prompts werden aus zugehörigen Issues und Pull Requests abgeleitet. Die versteckten Tests werden systematisch überprüft und angepasst, um unterschiedliche korrekte Implementierungen zu unterstützen und zugleich geforderte Verhaltensweisen sowie Regressionstests zu erhalten. Damit misst WideSWE nicht nur, ob ein Agent einen einzelnen Patch erzeugt, sondern ob er die nötigen Änderungen über Repository-Grenzen hinweg erkennt und umsetzt. Die Bewertung erfolgt anhand der vollständigen Aufgabenerfüllung, nicht nur anhand einzelner Teiländerungen.
Aktuelle Agenten lösen nur einen Bruchteil der Aufgaben
Die Ergebnisse fallen ernüchternd aus. Über sieben Agent-Konfigurationen liegt die vollständige Aufgabenerfüllung zwischen 10,83 und 42,50 Prozent. Den höchsten Wert erreicht die Konfiguration aus Codex CLI und GPT-5.6-sol. Die Analyse der Trajektorien zeigt drei typische Fehlermuster: Agenten erkennen notwendige Änderungen nicht, lassen erkannte Änderungen unvollendet oder modifizieren die erforderlichen Repositories, ohne die Anforderung vollständig zu erfüllen. Um zu prüfen, ob die Bearbeitung eines Repositories nach dem anderen diese Schwierigkeiten verringert, wurde die unabhängige Ausführung mit der gemeinsamen Ausführung unter identischen Prompts verglichen. Die unabhängige Ausführung holt vor allem unterlassene Arbeit nach, ist aber weniger effektiv, wenn bereits versuchte, jedoch erfolglose Implementierungen korrigiert werden müssen. Die gemeinsame Ausführung kann Informationen aus verwandten Repositories nutzen. Die Spannweite von 10,83 bis 42,50 Prozent zeigt, dass selbst die beste Konfiguration mehr als die Hälfte der Aufgaben nicht vollständig löst. Damit bleibt repository-übergreifende Koordination eine offene Herausforderung für Coding-Agenten.



