Live Raven: Open-Source-Multi-Agenten-System konstruiert Workflows für Spieleentwicklung
↘

Raven: Open-Source-Multi-Agenten-System konstruiert Workflows für Spieleentwicklung

Autonome Workflow-Konstruktion, Benchmark-Ergebnisse und Pre-Alpha-Praxis mit Raven und RSIGame

· Veröffentlicht: 01.10.2026 ·2 Min Lesezeit
Raven: Open-Source-Multi-Agenten-System konstruiert Workflows für SpieleentwicklungMit KI erstellt
Inhalt
◆ Fakten auf einen Blick
  • Raven ist ein Open-Source-Multi-Agenten-Ökosystem, das modulare Harnesse für spezifische Modelle und Domänen automatisch konstruiert und evolviert.
  • Raven besitzt einen Host Agent, der Ziele zerlegt, Teilaufgaben an spezialisierte Agenten zuweist, Ausführungsabhängigkeiten koordiniert und Ergebnisse integriert.
  • Raven nutzt ein Host-Archiv und EverOS, um Erfahrung über Aufgaben hinweg zu bewahren; Skill Forge macht diese Erfahrung als wiederverwendbare Prozeduren verfügbar.
  • Raven befindet sich im Pre-Alpha-Stadium; Schnittstellen und Konfiguration können sich schnell ändern.
  • Raven enthält integrierte Agenten: Raven-Research, Raven-Code, Raven-Design und Raven-Oncall für Forschung, Programmierung, visuelles Design und unbeaufsichtigte Workflow-Automatisierung.
  • Raven kann autonom komplette Projekte durchführen: In etwa 4 Tagen und 42 Runden aus Planung, Entwicklung und Verifikation erstellte es einen spielbaren First-Person-Shooter in Godot 4 mit Arena-Bosskampf, inklusive Poster, Präsentation und Website.

Autonome Workflow-Konstruktion: Ravens Host und Skill Forge

Raven ist ein Open-Source-Multi-Agenten-Ökosystem, das modulare Harnesse für spezifische Modelle und Domänen automatisch konstruiert und evolviert. Der Host Agent zerlegt Ziele in Teilaufgaben: Beispielsweise wird das Ziel „Erstelle einen First-Person-Shooter“ in Recherche zu Spielmechaniken, Code-Implementierung der Steuerung, Design von Level und Bosskampf sowie automatisierte Tests aufgeteilt. Diese Teilaufgaben weist er den integrierten Agenten Raven-Research, Raven-Code, Raven-Design und Raven-Oncall zu, koordiniert Ausführungsabhängigkeiten und integriert die Ergebnisse. Das Host-Archiv und EverOS speichern Erfahrung über Aufgaben hinweg – etwa erfolgreiche Pläne, aufgetretene Fehler und deren Lösungen – und tragen Kontext und Gedächtnis über Sitzungen hinweg. Skill Forge erkennt Muster in den archivierten Ablauf-Logs, überführt diese in wiederverwendbare Skript-Templates und bindet sie anschließend als parametrische Prozeduren in den Agenten-Pool ein, sodass sie bei ähnlichen Aufgaben wiederverwendet werden können. Die Architektur unterstützt iterative Verbesserung des eigenen Harness: Änderungen an Planung und Handeln werden vorgeschlagen, bewertet und bei bestandener Validierung übernommen. Laut Herstellerangabe übertrifft Raven nach eigenen Angaben State-of-the-Art-Agentensysteme signifikant und verschiebt die Grenze komponierbarer agentischer Intelligenz.

Benchmark-Ergebnisse: Qwen3.8-27B schlägt GPT-5.5-One-Shot

RSIGame organisiert die Spieleentwicklung in zwei komplementäre Schleifen: Ein lokaler Explore-Diagnose-Improve-Loop exploriert das ausführbare Spiel, diagnostiziert und priorisiert Probleme und führt evidenzbasierte Revisionen durch. Ein globaler Loop verfolgt die Gesamtqualität, bewahrt den besten Checkpoint und erkennt Sättigung oder Regression, um Überanpassung an einzelne Testfälle zu vermeiden. Erfolgreiche Entwicklungserfahrung wird durch Training in den Generator internalisiert. Die Benchmarks umfassen 140 GameCraft-Bench-Aufgaben, die auf zwei Spiel-Engines (Godot und Phaser) mit fünf verschiedenen Generatoren getestet werden. Die Werte 61,38 auf Godot und 58,53 auf Phaser werden in der Quelle als Ergebnisse angegeben; die Quelle erläutert nicht, wie diese Werte berechnet werden oder welche Qualitätsaspekte sie messen. Die Quelle gibt an, dass die Generierungs-Token von Qwen reduziert werden. Durch Erfahrungsinternalisierung erreicht Qwen3.8-27B diese Werte und übertrifft damit die One-Shot-Ergebnisse von GPT-5.5, während die Generierungs-Token von Qwen sinken. Ob es sich dabei um echte rekursive Selbstverbesserung handelt, ist offen: Eine separate Analyse des Forschungsstands sieht echte Rekursion, bei der das System seine eigenen Bewertungsstandards erhöht, noch nicht erreicht; RSIGame könnte eine Ausnahme darstellen.

Pre-Alpha-Praxis: Ein FPS in vier Tagen

Raven befindet sich im Pre-Alpha-Stadium; Schnittstellen und Konfiguration können sich schnell ändern. Integriert sind die Agenten Raven-Research, Raven-Code, Raven-Design und Raven-Oncall für Forschung, Programmierung, visuelles Design und unbeaufsichtigte Workflow-Automatisierung. Ein konkretes Praxisbeispiel: Ausgehend von einem menschlichen Briefing arbeitete Raven etwa vier Tage autonom und absolvierte 42 Runden. Eine Runde umfasst einen vollständigen Zyklus aus Planung (Zieldefinition und Aufgabenzuweisung), Entwicklung (Code-Generierung und Integration) und Verifikation (Testen und Fehlerbehebung). Raven entscheidet dabei autonom, welche Agenten welche Teilaufgaben übernehmen, führt Tests durch und iteriert basierend auf den Ergebnissen. Die 42 Runden bedeuten, dass dieser Zyklus 42-mal durchlaufen wurde, um schrittweise einen spielbaren First-Person-Shooter in Godot 4 mit Arena-Bosskampf zu erstellen. Zum vollständigen Ergebnis gehören außerdem Poster, Präsentation und Website, alle von Raven produziert.

A
Andreas Rüdiger
Herausgeber & Redaktionsleitung · KI-Modelle, Technik & Business

Andreas Rüdiger ist Gründer der Agentur INREMA und verantwortet KI Spotlight redaktionell. Sein Schwerpunkt liegt auf KI-Modellen, Recheninfrastruktur, technischen Entwicklungen und der wirtschaftlichen Einordnung. Er sorgt dafür, dass komplexe KI-Themen verständlich und nachvollziehbar aufbereitet werden. Mehr zu ihm auf inrema.de und andiger.de.

Ähnliche Artikel