OpenART: Skalierbare Red-Team-Arena für KI-Agenten in dynamischen Umgebungen
Eine neue Testumgebung evaluiert die Sicherheit von KI-Agenten über lange Zeithorizonte in sich entwickelnden, zustandsbehafteten Szenarien.
Mit KI erstellt◆ Fakten auf einen Blick
- OpenART ist eine skalierbare Red-Team-Arena.
- Die Arena nutzt offene, sich entwickelnde, zustandsbehaftete Umgebungen.
- OpenART evaluiert die Sicherheit von KI-Agenten über lange Zeithorizonte.
- OpenART verwendet die EMHA-Angriffsstrategie.
- Erste Ergebnisse zeigen, dass die Fehlerrate der Agenten mit zunehmender Aufgabenkomplexität steigt.
- KI-Agenten operieren in persistenten Umgebungen, in denen frühe Zustandsänderungen spätere Entscheidungen beeinflussen können.
OpenART: Testarena für KI-Agenten in dynamischen Umgebungen
OpenART ist eine skalierbare Red-Team-Arena, die speziell dafür entwickelt wurde, die Sicherheit von KI-Agenten über lange Zeithorizonte zu evaluieren. Dazu setzt sie auf offene, sich entwickelnde und zustandsbehaftete Umgebungen. In diesen Umgebungen agieren die Agenten persistent: Frühe Zustandsänderungen, die durch Aktionen der Agenten ausgelöst werden, können Entscheidungen weit in der Zukunft beeinflussen. Anders als bei herkömmlichen Interaktionen mit Sprachmodellen wird das Verhalten der Agenten hier über einen gemeinsam genutzten Zustand vermittelt, der über lange Arbeitsabläufe hinweg wiederholt modifiziert und wiederverwendet wird. Diese Architektur erlaubt es, die Auswirkungen von Entscheidungen über viele Schritte hinweg zu verfolgen und so die langfristige Verlässlichkeit der Agenten zu prüfen.
EMHA-Angriffsstrategie und erste Ergebnisse
In ersten Evaluierungen mit OpenART kam die EMHA-Angriffsstrategie zum Einsatz. Die Ergebnisse zeigen einen deutlichen Zusammenhang: Mit zunehmender Aufgabenkomplexität steigt die Fehlerrate der getesteten KI-Agenten. Die offene, zustandsbehaftete Testumgebung macht somit sichtbar, wie sich die Leistung der Agenten unter anspruchsvolleren Bedingungen verschlechtert – ein Effekt, der in einfacheren, isolierten Testszenarien nicht in gleicher Weise beobachtbar ist.



