Live Machine-Learning-Modell klassifiziert Resilienz von US-Gesundheitskräften mit 75,6 Prozent Genauigkeit

Designer-RSI: Framework steuert Designsoftware mit über 230 Werkzeugen und lernt aus Nutzerverkehr

Ein Paper beschreibt ein System, das ein eingefrorenes Frontier-Modell mit einem externen prozeduralen Gedächtnis kombiniert und die Erfolgsquote auf GenEval2 auf 99,3 Prozent steigert.

· Veröffentlicht: 22.09.2026 ·2 Min Lesezeit
Designer-RSI: Framework steuert Designsoftware mit über 230 Werkzeugen und lernt aus NutzerverkehrMit KI erstellt
Inhalt
◆ Fakten auf einen Blick
  • Designer-RSI ist ein Framework zur kontinuierlichen Anpassung, bei dem ein eingefrorenes Frontier-Modell professionelle Designsoftware über mehr als 230 Werkzeuge bedient.
  • Das Framework nutzt ein externes prozedurales Gedächtnis aus natürlichsprachlichen Skills, das wiederverwendbare Designprozeduren aus Erfahrung sammelt und verfeinert.
  • Das Gedächtnis verbreitert sich, indem es Prozeduren für wiederkehrende, noch nicht abgedeckte Teilaufgaben erwirbt, und vertieft sich, indem es bestehende Prozeduren anhand eigener erfolgreicher und fehlgeschlagener Ausführungen überarbeitet; ein matched replay gate lässt nur Änderungen zu, die Fehler beheben, ohne beobachtete Erfolge zu verschlechtern.
  • Über fünf Runden mit 1.406 echten Nutzer-Briefings und 1.869 automatisch bewerteten Trajektorien, ohne Gewichtsupdates und ohne menschliche Labels, wächst die Bank von 76 dokumentationsbasierten Skills auf 139.
  • Die GenEval2-Ausführungserfolgsquote auf Claude-Sonnet-4 steigt von 72,7 % auf 99,3 % (+11,99 Punkte in der Generierungsqualität).
  • Gegenüber dem No-Skill-Agenten erreicht Designer-RSI 61,8 % bzw. 67,6 % Win-Rates über vier spezialisierte Design-Benchmarks auf Claude-Sonnet-4 und Claude-Opus-4.6.

Framework steuert Designsoftware mit über 230 Werkzeugen

Ein Paper stellt Designer-RSI vor, ein Framework zur kontinuierlichen Anpassung, bei dem ein eingefrorenes Frontier-Modell professionelle Designsoftware über mehr als 230 Werkzeuge bedient. Das Modell selbst wird dabei nicht verändert; stattdessen nutzt das System ein externes prozedurales Gedächtnis aus natürlichsprachlichen Skills. Dieses Gedächtnis sammelt wiederverwendbare Designprozeduren aus Erfahrung und verfeinert sie fortlaufend. Professionelles Grafikdesign gilt als langwierige agentische Aufgabe, bei der strukturierte, editierbare Artefakte aus vielen voneinander abhängigen Aktionen entstehen, ohne dass ein verlässliches programmatisches Orakel für die Bewertung existiert. Designer-RSI adressiert dies, indem es Prozeduren als Skills ablegt, die das eingefrorene Modell bei der Steuerung der Werkzeuge unterstützen.

Gedächtnis verbreitert und vertieft sich ohne Gewichtsupdates

Das Gedächtnis wächst auf zwei Wegen: Es verbreitert sich, indem es Prozeduren für wiederkehrende, noch nicht abgedeckte Teilaufgaben erwirbt, und vertieft sich, indem es bestehende Prozeduren anhand eigener erfolgreicher und fehlgeschlagener Ausführungen überarbeitet. Ein sogenanntes matched replay gate lässt dabei nur Änderungen zu, die Fehler beheben, ohne zuvor beobachtete Erfolge zu verschlechtern. Über fünf Runden mit 1.406 echten Nutzer-Briefings und 1.869 automatisch bewerteten Trajektorien – ohne Gewichtsupdates und ohne menschliche Labels – wächst die Skill-Bank von 76 dokumentationsbasierten Skills auf 139. Die automatische Bewertung der Trajektorien ersetzt menschliche Labels vollständig. Das Framework lernt also ausschließlich aus dem Nutzerverkehr, nicht aus manuell annotierten Daten.

GenEval2-Erfolgsquote steigt auf 99,3 Prozent

Die GenEval2-Ausführungserfolgsquote auf Claude-Sonnet-4 steigt von 72,7 Prozent auf 99,3 Prozent, was einem Zuwachs von 11,99 Punkten in der Generierungsqualität entspricht. Gegenüber dem No-Skill-Agenten erreicht Designer-RSI 61,8 Prozent beziehungsweise 67,6 Prozent Win-Rates über vier spezialisierte Design-Benchmarks auf Claude-Sonnet-4 und Claude-Opus-4.6. Auf 200 zurückgehaltenen Briefings aus dem User-Traffic-Benchmark erreicht alleiniges Widening oder Deepening eine Win-Rate von 49,4 Prozent beziehungsweise 48,6 Prozent gegenüber dem No-Skill-Agenten. Die Ergebnisse zeigen, dass die Kombination aus Verbreiterung und Vertiefung des Gedächtnisses die Leistung des eingefrorenen Modells deutlich steigert.

A
Andreas Rüdiger
Herausgeber & Redaktionsleitung · KI-Modelle, Technik & Business

Andreas Rüdiger ist Gründer der Agentur INREMA und verantwortet KI Spotlight redaktionell. Sein Schwerpunkt liegt auf KI-Modellen, Recheninfrastruktur, technischen Entwicklungen und der wirtschaftlichen Einordnung. Er sorgt dafür, dass komplexe KI-Themen verständlich und nachvollziehbar aufbereitet werden. Mehr zu ihm auf inrema.de und andiger.de.

Ähnliche Artikel