Automatisierte Skill-Bank aus 19.769 Repositories erzielt 11,7 Prozent mehr Leistung
Code2Skill von Ant International übertrifft trajektorienbasierte Ansätze und setzt dokumentenbasierte Extraktion unter Druck
Mit KI erstelltInhalt
◆ Fakten auf einen Blick
- Code2Skill ist ein vollautomatisches Pipeline-System, das ausgewählte Code-Einheiten in implementierungsverankerte Skill-Records für atomare Operationen, zusammengesetzte Workflows und wiederkehrende Muster transformiert.
- Die Verifikation erfolgt durch source-body-blind reconstruction (blinde Rekonstruktion des Code-Körpers) gefolgt von source-aware comparison (quellcodebewusstem Vergleich).
- Code2Skill wurde auf 19.769 populäre und aktiv gepflegte GitHub-Repositories angewendet.
- Die resultierende CodeSkillBank enthält 1.006.822 akzeptierte Skill-Records mit Workflow-, Boundary-, Provenance- und Source-Evidence-Metadaten.
- In 72 protokollgleichen Evaluierungen über neun Modelleinstellungen und acht Benchmarks erzielen Modelle mit abgerufenen CodeSkillBank-Skills eine durchschnittliche Leistungssteigerung von 11,7 % gegenüber ihren gematchten Basislinien.
- Die augmentierten Modelle übertreffen ihre Basislinien in 57 der 72 Evaluierungsfälle.
Automatisierte Skill-Bank aus 19.769 Repositories erzielt 11,7 Prozent mehr Leistung
Forschende von Ant International haben mit Code2Skill ein vollautomatisches Verfahren vorgestellt, das aus 19.769 populären und aktiv gepflegten GitHub-Repositories eine Code-basierte Skill-Bank namens CodeSkillBank erzeugt. Die Bank enthält 1.006.822 akzeptierte Skill-Records, jeweils mit Metadaten zu Workflow, Boundary, Provenance und Source-Evidence. In 72 protokollgleichen Evaluierungen über neun Modelleinstellungen und acht Benchmarks erzielten Modelle, die mit abgerufenen CodeSkillBank-Skills augmentiert wurden, eine durchschnittliche Leistungssteigerung von 11,7 Prozent gegenüber ihren Basislinien. Das Paper trägt den Titel "Grounded Skill Synthesis from Code at Scale for Agentic Intelligence" und ist als Preprint auf arXiv verfügbar (arXiv:2609.05571). Es wurde am 4. September 2026 veröffentlicht. Die Autoren sind Yongqi Tong, Pan Wang, Hang Wang, Jianshe Li, Xin Zhang, Jiang-Ming Yang und Wei Wu von Ant International. Code2Skill transformiert ausgewählte Code-Einheiten in implementierungsverankerte Skill-Records für atomare Operationen, zusammengesetzte Workflows und wiederkehrende Muster. Damit wird erstmals eine Code-basierte Skill-Bank in dieser Größenordnung automatisiert aus Open-Source-Repositories erzeugt. Die Ergebnisse stammen aus einem wissenschaftlichen Preprint und sind daher als vorläufig einzuordnen.
Blinde Rekonstruktion und quellbewusster Vergleich sichern die Skill-Qualität
Code2Skill arbeitet als vollautomatische Pipeline, die ausgewählte Code-Einheiten in implementierungsverankerte Skill-Records überführt. Dabei werden atomare Operationen, zusammengesetzte Workflows und wiederkehrende Muster extrahiert und von projektspezifischen Details abstrahiert. Die Verifikation jedes Records erfolgt in zwei Schritten: Zuerst wird der Code-Körper blind rekonstruiert (source-body-blind reconstruction), das heißt, aus der Skill-Beschreibung wird versucht, den ursprünglichen Quellcode wiederherzustellen, ohne den echten Code zu sehen. Anschließend wird ein quellbewusster Vergleich (source-aware comparison) durchgeführt, bei dem die Rekonstruktion mit dem tatsächlichen Code abgeglichen wird. Nur wenn die Rekonstruktion hinreichend genau ist, wird der Skill-Record akzeptiert. Dieses Verfahren stellt sicher, dass die Skills tatsächlich auf ausführbarem Code basieren und nicht nur auf Dokumentation oder Vermutungen. Dadurch unterscheidet sich Code2Skill von dokumentenbasierten Ansätzen, die oft keine ausführbaren Belege liefern. Die Metadaten zu Workflow, Boundary, Provenance und Source-Evidence erhöhen die Nachvollziehbarkeit und ermöglichen eine gezielte Abfrage der Bank.
In 57 von 72 Fällen schlagen augmentierte Modelle ihre Basislinien
In 72 protokollgleichen Evaluierungen über neun Modelleinstellungen und acht Benchmarks wurden Modelle mit und ohne Zugriff auf CodeSkillBank verglichen. Die augmentierten Modelle erzielten in 57 der 72 Fälle bessere Ergebnisse als ihre Basislinien. Der durchschnittliche Score stieg von 42,90 auf 47,90 Punkte, was einer Verbesserung von 11,7 Prozent entspricht. Die Benchmarks decken Software-Engineering, Terminal-Steuerung und mathematisch-naturwissenschaftliches Schließen ab. Unter einer einheitlichen Downstream-Schnittstelle wurde Code2Skill mit trajektorienbasierten Skill-Banken verglichen: Trace2Skill, ExpeL und SkillRL-Bank. Auf allen sieben gemeinsamen Benchmarks erreichte Code2Skill den ersten Platz mit einem Durchschnittswert von 49,5 Punkten. Das beste Oracle-Ergebnis der trajektorienbasierten Banken lag bei durchschnittlich 40,1 Punkten, also 9,5 Punkte niedriger. Das zeigt, dass die code-basierte Skill-Bank nicht nur die Basislinien übertrifft, sondern auch die bisherigen Methoden zur Skill-Synthese deutlich hinter sich lässt. Die Autoren betonen, dass die Ergebnisse aus einem Preprint stammen und noch nicht unabhängig reproduziert wurden.
Rundungsdifferenz: 12 Prozent versus 11,7 Prozent
In der Berichterstattung findet sich sowohl die Angabe "etwa 12 Prozent" als auch der exakte Wert 11,7 Prozent. Dabei handelt es sich nicht um einen inhaltlichen Widerspruch, sondern um eine Rundungsdifferenz: 11,7 Prozent wird auf die nächste ganze Zahl aufgerundet und als "etwa 12 Prozent" kommuniziert. Der im Paper berichtete Wert ist 11,7 Prozent, der sich aus dem Anstieg des durchschnittlichen Scores von 42,90 auf 47,90 Punkte ergibt. Die Relevanz dieser Differenz liegt in der Kommunikation: Die gerundete Angabe "etwa 12 Prozent" kann den Effekt größer erscheinen lassen, als er tatsächlich ist. Für die Interpretation der Ergebnisse ist daher die exakte Zahl 11,7 Prozent maßgeblich, da sie den tatsächlichen Leistungszuwachs präzise abbildet. Da die Studie als Preprint auf arXiv veröffentlicht wurde und noch kein Peer-Review durchlaufen hat, fehlen unabhängige Bestätigungen. Die Ergebnisse sollten daher als vorläufig eingeordnet werden, bis sie von Dritten reproduziert und kritisch begutachtet wurden. Die Autoren selbst weisen darauf hin, dass die Validierung auf den 72 protokollgleichen Evaluierungen beruht und die Generalisierbarkeit noch offen ist.
Druck auf manuelle Skill-Ansätze und trajektorienbasierte Banken
Die Ergebnisse von Code2Skill setzen bestehende Ansätze unter Druck, weil sie deren zentrale Schwächen adressieren. Trajektorienbasierte Skill-Banken wie Trace2Skill, ExpeL und SkillRL-Bank erfordern kostspielige Umgebungsinteraktionen und Trial-and-Error, um Skills zu synthetisieren. Code2Skill umgeht diesen Aufwand vollständig, indem es direkt aus Quellcode extrahiert – und übertrifft diese Methoden dennoch auf allen sieben gemeinsamen Benchmarks mit 49,5 zu 40,1 Punkten im Oracle-Vergleich. Dokumentenbasierte Extraktionsmethoden liefern oft keine ausführbaren Belege; Code2Skill verifiziert jeden Skill-Record durch source-body-blind reconstruction und source-aware comparison und bietet damit eine code-verankerte, überprüfbare Alternative. Als Gewinner lässt sich Ant International benennen, das mit der CodeSkillBank eine umfangreiche, reproduzierbare Ressource vorweisen kann und als Erstveröffentlicher einen wissenschaftlichen Vorsprung erlangt. Die Open-Source-Community profitiert insofern, als die Bank aus öffentlichen Repositories erzeugt wurde und das Verfahren reproduzierbar ist – dieser Nutzen ist jedoch eine Interpretation und nicht explizit in der Studie ausgewiesen. Zudem zeigt die Studie, dass KI-generierter Code mit einer Synthese-Durchgangsrate von 93,5 Prozent die Bank kontinuierlich erweitern kann. Die Ergebnisse sind noch nicht unabhängig bestätigt, und die praktische Integration in bestehende Agenten-Frameworks steht noch aus.


