Live MIT-Essay: KI erreicht Goldmedaillen-Niveau und liefert Lösungsansatz für Millennium-Problem
↘

CISPA-Studie: Wasserzeichen in KI-Bildern überleben Modelltraining

CISPA-Forscher haben untersucht, ob Wasserzeichen in KI-generierten Bildern das Training neuer Modelle überleben, und festgestellt, dass zumindest eine Methode über mehrere Trainingsgenerationen hinweg detektierbar bleibt, was die Erkennung synthetischer Trainingsdaten ermöglicht.

· Veröffentlicht: 10.10.2026 ·2 Min Lesezeit
CISPA-Studie: Wasserzeichen in KI-Bildern überleben ModelltrainingMit KI erstellt
◆ Fakten auf einen Blick
  • CISPA-Forscher um Michel Meintz haben eine Studie zu Wasserzeichen in KI-generierten Bildern durchgeführt.
  • Die Studie verwendete einen Zwei-Schritte-Ansatz: Zuerst wurden mit einem Modell wasserzeichenmarkierte Bilder erzeugt, dann wurde ein zweites Modell mit diesen Bildern trainiert, und anschließend wurde geprüft, ob das Wasserzeichen in den Ausgaben des zweiten Modells noch detektierbar ist.
  • Es wurden vier Wasserzeichenmethoden untersucht, darunter TrustMark, StableSignature und TreeRing.
  • Eine der untersuchten Wasserzeichenmethoden bleibt über mehrere Trainingsgenerationen hinweg hoch detektierbar, selbst wenn nur 1% der Trainingsdaten wasserzeichenmarkiert sind; andere Methoden degradieren stark und haben eine endliche Lebensdauer.
  • Wasserzeichen betten unmerkliche Signale in KI-generierte Bilder ein, die die Erkennung generierter Inhalte ermöglichen.
  • Das Training auf eigenen synthetischen Daten kann zu Model Collapse führen.

Wasserzeichen überleben Modelltraining

Forscher des CISPA Helmholtz-Zentrums für Informationssicherheit um Michel Meintz haben untersucht, ob Wasserzeichen in KI-generierten Bildern das Training neuer Modelle überleben. Hintergrund ist, dass KI-generierte Bilder heute allgegenwärtig sind und über das Internet verbreitet werden, wodurch das Risiko steigt, dass sie zum Training neuer Bildgenerierungsmodelle verwendet werden. „Wenn Unternehmen auf ihren eigenen synthetischen Daten trainieren, kann das zu Model Collapse führen“, erklärt Meintz. Wasserzeichen betten unmerkliche Signale in KI-generierte Bilder ein, die die Erkennung generierter Inhalte ermöglichen. Bislang war jedoch unklar, ob Wasserzeichen auch nach dem Training eines neuen generativen Modells noch nachweisbar sind. Die Forscher wählten einen Zwei-Schritte-Ansatz: Zuerst erzeugten sie mit einem Modell wasserzeichenmarkierte Bilder, dann trainierten sie ein zweites Modell mit diesen Bildern und prüften anschließend, ob das Wasserzeichen in den Ausgaben des zweiten Modells noch detektierbar ist. Entscheidend für die Robustheit war der Einsatz eines Dataset-Inference-Verfahrens: Es aggregiert schwache Signale einzelner Bilder über statistische Hypothesentests und ermöglicht so eine zuverlässige Erkennung selbst dann, wenn die Wasserzeichenspuren subtil sind. Dadurch bleibt eine der untersuchten Wasserzeichenmethoden über mehrere Trainingsgenerationen hinweg hoch detektierbar, selbst wenn nur ein Prozent der Trainingsdaten wasserzeichenmarkiert sind.

Methodenvergleich und Widerspruch

Für die Untersuchung nutzten die Forscher einen Zwei-Schritte-Ansatz: Zuerst erzeugten sie mit einem Modell wasserzeichenmarkierte Bilder, trainierten damit ein zweites Modell und prüften anschließend die Detektierbarkeit in dessen Ausgaben. Sie untersuchten vier Wasserzeichenmethoden, darunter TrustMark, StableSignature und TreeRing sowie eine vierte, in den Belegen nicht näher benannte Methode. Die vorliegenden Quellen enthalten keine Beschreibungen der Funktionsweise dieser Methoden oder ihrer Unterschiede. Während eine Methode über mehrere Trainingsgenerationen hinweg hoch detektierbar bleibt, degradieren andere Methoden stark und haben eine endliche Lebensdauer. Der Grund für diesen Wirksamkeitsverlust liegt darin, dass ihre Wasserzeichen entweder bei der Kodierung in den latenten Raum gelöscht werden oder im Noising-Denoising-Prozess während des Trainings im latenten Raum verloren gehen. Die Ergebnisse wurden auf dem ACM Workshop on Information Hiding and Multimedia Security vorgestellt. Die Autoren betonen die Notwendigkeit robusterer Wasserzeichenmethoden, die einem Retraining standhalten. Allerdings gibt es widersprüchliche Befunde: Eine andere Studie, die auf Arxiv veröffentlicht wurde, kommt zu dem Schluss, dass bestehende Wasserzeichenmethoden für Diffusionsmodelle nicht radioaktiv sind. Demnach werden Wasserzeichen entweder bei der Kodierung in den latenten Raum gelöscht oder gehen im Noising-Denoising-Prozess verloren.

A
Andreas Rüdiger
Herausgeber & Redaktionsleitung · KI-Modelle, Technik & Business

Andreas Rüdiger ist Gründer der Agentur INREMA und verantwortet KI Spotlight redaktionell. Sein Schwerpunkt liegt auf KI-Modellen, Recheninfrastruktur, technischen Entwicklungen und der wirtschaftlichen Einordnung. Er sorgt dafür, dass komplexe KI-Themen verständlich und nachvollziehbar aufbereitet werden. Mehr zu ihm auf inrema.de und andiger.de.

Quellen

  1. cispa.de ↗

Ähnliche Artikel