Live DeepMind-Sicherheitsforscher wechselt zu unabhängiger Evaluierungsorganisation METR

Datamimic veröffentlicht Open-Source-Community-Edition für deterministische Testdaten

Python-native Engine für reproduzierbare Testdaten und PII-sichere Pseudonymisierung

· Veröffentlicht: 16.09.2026 ·1 Min Lesezeit
Datamimic veröffentlicht Open-Source-Community-Edition für deterministische TestdatenMit KI erstellt
◆ Fakten auf einen Blick
  • Die Community Edition (CE) ist MIT-lizenziert, Python-nativ, MCP-ready und eigenständig nutzbar für deterministische synthetische Datengenerierung und PII-bewusste Pseudonymisierung.
  • Die Enterprise Platform ergänzt governed workflows, PII scanning, role-based access, audit logging, scheduling und multi-system execution.
  • Die CE ist die Open-Source-Deterministic-Data-Engine im Kern der Enterprise Platform.
  • Die CE kann vollständig synthetische, deterministische Datensätze modellgetrieben ohne Quelldaten erzeugen und Staging/QA-Exporte deterministisch (seeded) oder privacy-maximized (non-seeded) pseudonymisieren.
  • DATAMIMIC generiert deterministische, reproduzierbare, CI/CD-fähige Testdaten inklusive gültiger ISO-20022- und SWIFT-Nachrichten, ohne dass Produktionsdaten die Umgebung verlassen; Anbindung per REST/OpenAPI; referentielle Integrität über Tabellen, Collections und verschachtelte Payloads.
  • Gleiche Engine-Version, gleiches Modell und gleicher Seed ergeben byte-identische Ausgabe auf jeder Maschine, auch Monate später.

Open-Source-Engine für deterministische Testdaten jetzt als Python-Bibliothek verfügbar

Die Datamimic Community Edition (CE) ist als MIT-lizenzierte, Python-native Bibliothek und CLI verfügbar. Die Engine erzeugt deterministische synthetische Datensätze modellgetrieben ohne Quelldaten. Der Seed-Mechanismus initialisiert den Pseudozufallsgenerator; gleiche Engine-Version, Modell und Seed liefern byte-identische Ausgaben. Für Entwickler bedeutet das reproduzierbare Testläufe und einfacheres Debugging in CI/CD-Pipelines. Für PII-bewusste Pseudonymisierung gibt es deterministische und privacy-maximierte Modi. Der Hash-Converter berechnet aus Wert, Feldpfad und Seed einen stabilen Token; gleiche Eingaben ergeben denselben Token, unterschiedliche Feldpfade getrennte Token-Räume. Dies gewährleistet konsistente Pseudonymisierung über Systeme hinweg und wahrt referenzielle Integrität.

Enterprise Edition ergänzt Governance und Audit für regulierte Branchen

Die Enterprise Platform ergänzt die CE um PII-Scanning, das Datenquellen nach personenbezogenen Feldern durchsucht und so hilft, sensible Daten vor dem Test zu identifizieren – ein zentraler Schritt für GDPR-Compliance. Rollenbasierte Zugriffe steuern Benutzeraktionen und verhindern unbefugten Zugriff auf sensible Testdaten. Audit-Logging protokolliert jeden Lauf und Zugriff und liefert Nachweise für Prüfungen nach DORA oder BCBS 239. Scheduling verteilt geplante Tasks an Worker und ermöglicht automatisierte, wiederholbare Testdaten-Erzeugung in CI/CD-Pipelines. Die Plattform ist für den On-Prem-Betrieb in regulierten Branchen konzipiert und läuft vollständig offline.

J
Jasmin Freitag
Redaktion · KI-Anwendungen & Tools

Jasmin Freitag beobachtet für KI Spotlight die praktische Seite der künstlichen Intelligenz: neue Anwendungen, generative Werkzeuge, kreative KI und den Einsatz von Tools im Alltag und in Unternehmen. Sie erklärt praxisnah, was ein Werkzeug wirklich taugt.

Quellen

  1. github.com ↗

Ähnliche Artikel