Red Teaming
Red-Teaming ist das gezielte Angreifen eines KI-Systems, um Schwachstellen und gefährliche Antworten zu finden, bevor echte Nutzer darauf stoßen.
Kurz gesagt: Beim Red-Teaming versuchen Fachleute (oder eigene KI-Systeme) absichtlich, ein Modell zu Fehlverhalten zu bringen — um es vorher abzusichern.
Wie läuft Red-Teaming ab?
Getestet wird, ob sich Schutzmechanismen umgehen lassen (etwa durch Jailbreaks oder Prompt Injection) und ob das Modell zu gefährlichen, falschen oder manipulativen Ausgaben zu bewegen ist.
Warum ist das wichtig?
Es deckt Risiken vor der Veröffentlichung auf und gehört bei großen KI-Modellen inzwischen zum Standard der Sicherheitsprüfung.