Live Google zeigt Gemini-Einsatz in Edy's Grocer
↘

WideSWE: Coding-Agenten scheitern an repository-übergreifenden Aufgaben

Neuer Benchmark zeigt: Aktuelle Agenten lösen nur 10,83 bis 42,50 Prozent der Cross-Repo-Aufgaben vollständig.

· Veröffentlicht: 29.09.2026 ·2 Min Lesezeit
WideSWE: Coding-Agenten scheitern an repository-übergreifenden AufgabenMit KI erstellt
◆ Fakten auf einen Blick
  • WideSWE ist ein Benchmark zur Bewertung von Coding-Agenten bei repository-übergreifenden Aufgaben.
  • Die Aufgaben stammen aus 103 Software-Ökosystemen; insgesamt 120 reale Aufgaben, je 60 Bugfixes und 60 Features.
  • Prompts werden aus zugehörigen Issues und Pull Requests abgeleitet.
  • Hidden Tests werden systematisch überprüft und angepasst, um unterschiedliche korrekte Implementierungen zu unterstützen und Regressionen zu prüfen.
  • Über sieben Agent-Konfigurationen liegt die vollständige Aufgabenerfüllung zwischen 10,83 % und 42,50 %; die Konfiguration Codex CLI mit GPT-5.6-sol erreicht die höchste Rate.
  • Die Trajektorien zeigen, dass Agenten notwendige Änderungen nicht erkennen, erkannte Änderungen unvollendet lassen oder Repositories ändern, ohne die Anforderung vollständig zu erfüllen.

WideSWE: Neuer Benchmark für Cross-Repo-Aufgaben

Das neue Benchmark WideSWE bewertet Coding-Agenten bei Aufgaben, die Änderungen über mehrere Repositories hinweg erfordern. Bisherige Benchmarks prüften die Aufgabenerfüllung überwiegend innerhalb einer einzelnen Codebasis; in Software-Ökosystemen verlangen viele Features und Bugfixes jedoch koordinierte Änderungen in mehreren Repositories. Da reale Softwareprojekte oft aus mehreren zusammenhängenden Repositories bestehen, ist diese Fähigkeit entscheidend. WideSWE schließt diese Lücke: Die Aufgaben wurden durch das Mining und die Prüfung von Änderungen in 103 Software-Ökosystemen gewonnen. Insgesamt umfasst der Datensatz 120 reale Aufgaben, gleichmäßig verteilt auf 60 Bugfixes und 60 Features. Die Prompts werden aus zugehörigen Issues und Pull Requests abgeleitet. Die versteckten Tests werden systematisch überprüft und angepasst, um unterschiedliche korrekte Implementierungen zu unterstützen und zugleich geforderte Verhaltensweisen sowie Regressionstests zu erhalten. Damit misst WideSWE nicht nur, ob ein Agent einen einzelnen Patch erzeugt, sondern ob er die nötigen Änderungen über Repository-Grenzen hinweg erkennt und umsetzt. Die Bewertung erfolgt anhand der vollständigen Aufgabenerfüllung, nicht nur anhand einzelner Teiländerungen.

Aktuelle Agenten lösen nur einen Bruchteil der Aufgaben

Die Ergebnisse fallen ernüchternd aus. Über sieben Agent-Konfigurationen liegt die vollständige Aufgabenerfüllung zwischen 10,83 und 42,50 Prozent. Den höchsten Wert erreicht die Konfiguration aus Codex CLI und GPT-5.6-sol. Die Analyse der Trajektorien zeigt drei typische Fehlermuster: Agenten erkennen notwendige Änderungen nicht, lassen erkannte Änderungen unvollendet oder modifizieren die erforderlichen Repositories, ohne die Anforderung vollständig zu erfüllen. Um zu prüfen, ob die Bearbeitung eines Repositories nach dem anderen diese Schwierigkeiten verringert, wurde die unabhängige Ausführung mit der gemeinsamen Ausführung unter identischen Prompts verglichen. Die unabhängige Ausführung holt vor allem unterlassene Arbeit nach, ist aber weniger effektiv, wenn bereits versuchte, jedoch erfolglose Implementierungen korrigiert werden müssen. Die gemeinsame Ausführung kann Informationen aus verwandten Repositories nutzen. Die Spannweite von 10,83 bis 42,50 Prozent zeigt, dass selbst die beste Konfiguration mehr als die Hälfte der Aufgaben nicht vollständig löst. Damit bleibt repository-übergreifende Koordination eine offene Herausforderung für Coding-Agenten.

J
Jasmin Freitag
Redaktion · KI-Anwendungen & Tools

Jasmin Freitag beobachtet für KI Spotlight die praktische Seite der künstlichen Intelligenz: neue Anwendungen, generative Werkzeuge, kreative KI und den Einsatz von Tools im Alltag und in Unternehmen. Sie erklärt praxisnah, was ein Werkzeug wirklich taugt.

Ähnliche Artikel