Live Nvidia-CEO prognostiziert Verdopplung des Chip-Absatzes

Debatte: Text-Diffs vs. Fingerprints für KI-generierte SQL-Abfragen

Warum token-basierte Vergleiche harmlose Umformatierung tolerieren, naive Zeilendiffs aber nicht.

· Veröffentlicht: 18.09.2026 ·1 Min Lesezeit
Debatte: Text-Diffs vs. Fingerprints für KI-generierte SQL-AbfragenMit KI erstellt
◆ Fakten auf einen Blick
  • pt-fingerprint von Percona konvertiert Queries in Fingerprints, indem es Literale entfernt, Whitespace normalisiert und ähnliche Queries gruppiert.
  • Apache Pinot bietet einen Endpoint /query/sql/queryFingerprint, der einen normalisierten Fingerprint und stabilen Hash für eine DQL-Query generiert.
  • Das Open-Source-Projekt sql-fingerprint reduziert SQL-Queries auf Fingerprints, indem Kommentare entfernt, Whitespace normalisiert, Identifier- und Wertelisten zu '...' reduziert und Quoting entfernt wird.
  • Das Ruby-Gem sql_fingerprint abstrahiert SQL-Queries und berechnet einen Fingerprint, basierend auf der Percona-Toolkit-Implementierung; Beispiel: 'SELECT * FROM users WHERE id=1' ergibt den Hash dd1d44f7cffa757aad5152a27b811d6735ef6661.
  • sqlformat.io bietet ein Online-Tool, das zwei SQL-Queries vergleicht und Unterschiede hervorhebt, wobei es einen Token-basierten Vergleich (longest-common-subsequence) verwendet, der harmlose Umformatierung toleriert und echte Logikänderungen erkennt.
  • basedash.com bietet einen SQL-Diff-Checker, der zwei Versionen einer Query vergleicht und hinzugefügte, entfernte und unveränderte Zeilen in einer Unified-Diff-Ansicht markiert, basierend auf einem zeilenbasierten Diff-Algorithmus.

Bei der Prüfung von KI-generierten SQL-Abfragen auf Regressionen stehen zwei Ansätze gegenüber: wörtliche Textvergleiche (z. B. sqlformat.io, basedash.com, aidiffchecker.com) und die Abstraktion zu Query-Fingerprints (z. B. pt-fingerprint, Pinot queryFingerprint, sql-fingerprint). Der Widerspruch: Naive Text-Diffs scheitern an harmloser Umformatierung, weil sie Zeichen oder Zeilen vergleichen – schon ein Zeilenumbruch oder zusätzliche Leerzeichen erzeugen viele Differenzen, obwohl die Logik identisch ist. Token-basierte Diffs wie sqlformat.io zerlegen SQL dagegen in Schlüsselwörter, Bezeichner und Literale, normalisieren Whitespace und erkennen so echte Änderungen an Prädikaten oder Joins, ohne sich von kosmetischen Unterschieden stören zu lassen.

A
Andreas Rüdiger
Herausgeber & Redaktionsleitung · KI-Modelle, Technik & Business

Andreas Rüdiger ist Gründer der Agentur INREMA und verantwortet KI Spotlight redaktionell. Sein Schwerpunkt liegt auf KI-Modellen, Recheninfrastruktur, technischen Entwicklungen und der wirtschaftlichen Einordnung. Er sorgt dafür, dass komplexe KI-Themen verständlich und nachvollziehbar aufbereitet werden. Mehr zu ihm auf inrema.de und andiger.de.

Quellen

  1. github.com ↗

Ähnliche Artikel