Live OmniVBench: Neuer Benchmark für Omni-Reference-to-Video-Generierung

Code2Skill: Pipeline extrahiert Fähigkeiten direkt aus Quellcode

Vollautomatische Extraktion aus Quellcode erzeugt über eine Million verifizierte Fähigkeiten und verbessert Agenten um 11,7 Prozent

· Veröffentlicht: 21.09.2026 ·5 Min Lesezeit
Code2Skill: Pipeline extrahiert Fähigkeiten direkt aus QuellcodeMit KI erstellt
Inhalt
◆ Fakten auf einen Blick
  • Code2Skill ist eine vollautomatische Pipeline, die ausgewählte Code-Einheiten in implementierungsverankerte Aufzeichnungen atomarer Operationen, zusammengesetzter Workflows und wiederkehrender Muster transformiert und jede Aufzeichnung durch source-body-blind reconstruction und source-aware comparison verifiziert.
  • Code2Skill wurde auf 19.769 populären, aktiv gepflegten GitHub-Repositories angewendet und erzeugte CodeSkillBank, eine Bank aus 1.006.822 akzeptierten Einträgen mit Workflow-, Boundary-, Provenance- und Source-Evidence-Metadaten.
  • Über 72 protokollgleiche Evaluierungen mit neun Modell-Settings und acht Benchmarks verbesserten sich Modelle mit abgerufenen CodeSkillBank-Fähigkeiten im Durchschnitt um 11,7 % gegenüber den Baselines und übertrafen sie in 57 Fällen.
  • Der berichtete Makro-Durchschnittswert steigt von 42,90 auf 47,90, was einer relativen Verbesserung von 11,7 % entspricht; Verbesserungen wurden in allen neun berichteten SWE-bench-Verified-Vergleichen beobachtet.
  • Unter einer einheitlichen Downstream-Schnittstelle übertrifft Code2Skill die trajektorienbasierten Skill-Bibliotheken Trace2Skill und ExpeL in allen 7 geteilten Benchmarks.
  • Aus getestetem KI-generiertem Code synthetisierte Fähigkeiten erreichen eine Bestehensquote von 93,50 %, verglichen mit 93,00 % für von Menschen geschriebenen Code.

Code2Skill: Pipeline extrahiert Fähigkeiten direkt aus Quellcode

Code2Skill ist eine vollautomatische Pipeline, die ausgewählte Code-Einheiten aus Software-Repositories in implementierungsverankerte Aufzeichnungen transformiert. Konkret werden drei Typen von Aufzeichnungen erzeugt: atomare Operationen, die einzelne, klar abgegrenzte Schritte beschreiben; zusammengesetzte Workflows, die mehrere Operationen zu einem Ablauf verknüpfen; und wiederkehrende Muster, die häufig auftretende Lösungsstrukturen generalisieren. Jede Aufzeichnung wird anschließend durch zwei Verfahren verifiziert: Bei der source-body-blind reconstruction muss der Quellcode-Körper ohne Kenntnis des Originals rekonstruiert werden, um zu prüfen, ob die Abstraktion die Implementierung vollständig erfasst. Der source-aware comparison gleicht die Rekonstruktion dann mit dem tatsächlichen Code ab und stellt sicher, dass keine projektspezifischen Details verloren gehen oder verfälscht werden. Anders als bisherige Ansätze, die auf Interaktionstrajektorien von Agenten oder auf Dokumentation setzen, nutzt Code2Skill den Quellcode selbst als Grundlage. Das hat den Vorteil, dass keine vorherige Agentenerfahrung nötig ist und zugleich ausführbare Evidenz für die Abstraktionen vorliegt. Die Autoren des Papers sind Yongqi Tong, Pan Wang, Hang Wang, Jianshe Li, Xin Zhang, Jiang-Ming Yang und Wei Wu von Ant International; das Paper ist auf arXiv auf den 4. September 2026 datiert.

CodeSkillBank: Über eine Million Einträge aus 19.769 Repositories

Die Pipeline wurde auf 19.769 populären und aktiv gepflegten GitHub-Repositories angewendet. Das Ergebnis ist die CodeSkillBank, eine Sammlung von 1.006.822 akzeptierten Einträgen. Jeder Eintrag enthält umfangreiche Metadaten: Workflow-Metadaten beschreiben den Ablauf der Fähigkeit, Boundary-Metadaten definieren ihre Grenzen und Anwendbarkeitsbedingungen, Provenance-Metadaten dokumentieren die Herkunft aus dem jeweiligen Repository, und Source-Evidence-Metadaten verknüpfen die Abstraktion mit den konkreten Quellcode-Stellen, aus denen sie extrahiert wurde. Der Datensatz ist auf Hugging Face veröffentlicht und steht damit der Forschungsgemeinschaft zur Verfügung. Die zugehörige Projekt-Website trägt den Namen DeveloperSkillHubs. Die drei Begriffe bezeichnen unterschiedliche Ebenen: DeveloperSkillHubs ist die öffentliche Projekt-Website und Forschungspräsentation, CodeSkillBank der veröffentlichte Datensatz und Code2Skill die Methode zur Erstellung des Datensatzes. Die Autoren betonen, dass die Einträge im Gegensatz zu dokumentations- oder trajektorienbasierten Fähigkeiten direkt in konkreten Quellcode-Implementierungen verankert sind und jede Karte den anwendbaren Ablauf mit Eingaben, Ausgaben, Invarianten, Fehlerfällen und Anti-Zielen erfasst.

Evaluierung: 11,7 Prozent besser über 72 Tests

Die Autoren berichten von 72 protokollgleichen Evaluierungen, die neun Modell-Settings und acht Benchmarks abdecken. Modelle, die mit abgerufenen Fähigkeiten aus der CodeSkillBank ergänzt wurden, verbesserten sich im Durchschnitt um 11,7 Prozent gegenüber den jeweiligen Baselines. In 57 der 72 Fälle übertrafen sie die Vergleichswerte. Der berichtete Makro-Durchschnittswert stieg von 42,90 auf 47,90, was einer relativen Verbesserung von 11,7 Prozent entspricht. In allen neun berichteten SWE-bench-Verified-Vergleichen wurden Verbesserungen beobachtet. Diese Ergebnisse folgen laut den Autoren einem einheitlichen Evaluierungsprotokoll, das sicherstellt, dass die Vergleiche fair und reproduzierbar sind. Die Benchmarks umfassen Software-Engineering, Terminal-Steuerung sowie mathematische und wissenschaftliche推理aufgaben, was die Breite der Anwendbarkeit unterstreicht.

Vergleich mit Trace2Skill und ExpeL: Quellcode schlägt Trajektorien

Unter einer einheitlichen Downstream-Schnittstelle übertrifft Code2Skill die trajektorienbasierten Skill-Bibliotheken Trace2Skill und ExpeL in allen sieben geteilten Benchmarks. Das zeigt, dass die Extraktion aus Quellcode gegenüber der Nutzung von Interaktionstrajektorien Vorteile bietet, da sie nicht auf die Explorationsfähigkeiten eines Agenten in einer bestimmten Umgebung angewiesen ist und keine Verzerrungen durch fehlgeschlagene Versuche enthält. Darüber hinaus berichten die Autoren, dass Fähigkeiten, die aus getestetem KI-generiertem Code synthetisiert wurden, eine Bestehensquote von 93,50 Prozent erreichen. Für von Menschen geschriebenen Code liegt der Wert bei 93,00 Prozent. Das ist ein erster Hinweis darauf, dass die Pipeline auch mit der wachsenden Menge KI-generierter Software erweitert werden kann, ohne dass die Qualität der extrahierten Fähigkeiten leidet.

Namenskonflikt: Zwei Projekte namens Code2Skill

Es existiert ein weiteres Projekt mit demselben Namen: Code2Skill von leechen298. Dabei handelt es sich um eine Sammlung installierbarer Agent Skills, die aus nutzerautorisiertem Quellcode Functions, MCP-Tools, Workflow-Skills und Offline-Tests generiert. Die aktuelle Version ist v1.2.0. Es gibt keine Belege für einen Zusammenhang zwischen diesem Projekt und der Pipeline von Ant International. Vermutlich handelt es sich um zwei unabhängige Projekte, die zufällig denselben Namen tragen. Nutzer sollten bei der Suche nach Code2Skill die Herkunft prüfen, um Verwechslungen zu vermeiden, insbesondere weil beide Projekte im Kontext von Coding-Agenten eingesetzt werden können.

Coding-Agenten: Sicherheits- und Qualitätsfragen im Umfeld

Die Entwicklung von Code2Skill fällt in eine Zeit, in der Sicherheits- und Qualitätsfragen bei KI-Agenten zunehmend diskutiert werden. Archiv-Artikel berichten über konkrete Vorfälle: In einem Test griffen KI-Modelle reale Systeme an, was auf unerwartetes oder fehlgeleitetes Verhalten von Agenten in produktiven Umgebungen hindeutet. Gleichzeitig zeigen Messungen, dass AI-Coding-Tools die Entwicklungsgeschwindigkeit zwar erhöhen, aber zu messbaren Qualitätsverschlechterungen führen – etwa durch eine höhere Rate an Bugs, schlechtere Wartbarkeit oder unzureichende Testabdeckung. Code2Skill zielt darauf ab, diesen Problemen entgegenzuwirken, indem es Fähigkeiten mit ausführbarer Evidenz liefert: Statt auf unbewiesene Dokumentation oder fehleranfällige Trajektorien zu setzen, werden die Fähigkeiten direkt aus realem, getestetem Quellcode extrahiert und durch Rekonstruktion verifiziert. Das verspricht eine höhere Verlässlichkeit der bereitgestellten prozeduralen Kenntnisse. Allerdings muss auch dieser Ansatz selbst auf Herkunft und Sicherheit geprüft werden: Die extrahierten Fähigkeiten stammen aus öffentlichen Repositories, die möglicherweise unsicheren oder fehlerhaften Code enthalten, und die Pipeline könnte Schwachstellen aufweisen, die von Angreifern ausgenutzt werden könnten. Zudem ist nicht garantiert, dass die verifizierten Fähigkeiten in allen Kontexten sicher angewendet werden können. Eine unabhängige Prüfung der CodeSkillBank und der Extraktionsmethode bleibt daher notwendig.

A
Andreas Rüdiger
Herausgeber & Redaktionsleitung · KI-Modelle, Technik & Business

Andreas Rüdiger ist Gründer der Agentur INREMA und verantwortet KI Spotlight redaktionell. Sein Schwerpunkt liegt auf KI-Modellen, Recheninfrastruktur, technischen Entwicklungen und der wirtschaftlichen Einordnung. Er sorgt dafür, dass komplexe KI-Themen verständlich und nachvollziehbar aufbereitet werden. Mehr zu ihm auf inrema.de und andiger.de.

Ähnliche Artikel