HyperQ: Quanten-Branches verbessern eingefrorenes Diffusion-Sprachmodell
Token-konditionierte Quantenschaltkreise steigern Benchmark-Scores bei reduziertem Trainingsaufwand
Mit KI erstelltInhalt
◆ Fakten auf einen Blick
- HyperQ fügt einem eingefrorenen Masked-Diffusion-Language-Model token-bedingte Quanten-Residual-Branches hinzu.
- Eine Quanten-Residual-Branch ist ein Modul in jedem Transformer-Block, das den Hidden State eines Tokens liest, die Koordinaten des Schaltkreises des Tokens ausgibt, ihn ausführt und die gemessenen Werte über eine Residualverbindung zurückführt.
- Das Backbone bleibt eingefroren; nur die hinzugefügten Branches werden trainiert.
- Innerhalb jeder Branch emittiert ein leichtgewichtiges Circuit-Hypernetwork token-spezifische Rotationswinkel, Kopplungsstärken und Messachsen in einer gemeinsamen dünn besetzten Schaltkreisstruktur.
- Die benötigten Erwartungswerte haben einen exakten klassischen Ausdruck, dessen Evaluierungskosten linear mit der Qubit-Zahl wachsen; dadurch können Schaltkreise von 16 bis 64 Qubits innerhalb eines 1,1-Milliarden-Parameter-Backbones trainiert werden.
- Über nachgelagerte Benchmarks steigt der durchschnittliche Score mit zunehmender Schaltkreisbreite von 47,65 auf 54,30.
Quanten-Branches ergänzen eingefrorenes Diffusion-LLM
HyperQ erweitert ein eingefrorenes Masked-Diffusion-Language-Model um token-bedingte Quanten-Residual-Branches. Eine solche Branch ist ein Modul in jedem Transformer-Block: Sie liest den Hidden State eines Tokens, gibt die Koordinaten des zugehörigen Schaltkreises aus, führt ihn aus und führt die gemessenen Werte über eine Residualverbindung zurück. Das Backbone bleibt dabei unverändert; trainiert werden ausschließlich die zusätzlichen Branches. Dieser Ansatz erlaubt eine ressourcenschonende Anpassung, da nur ein Bruchteil der Parameter aktualisiert wird und das vortrainierte Sprachwissen unangetastet bleibt. Die token-spezifischen Quantenberechnungen ergänzen die klassischen Schichten, ohne das gesamte Modell neu trainieren zu müssen.
Token-spezifische Schaltkreise mit linear skalierender Auswertung
Innerhalb jeder Branch emittiert ein leichtgewichtiges Circuit-Hypernetwork token-spezifische Rotationswinkel, Kopplungsstärken und Messachsen in einer gemeinsamen dünn besetzten Schaltkreisstruktur. Die benötigten Erwartungswerte besitzen einen exakten klassischen Ausdruck, dessen Evaluierungskosten linear mit der Qubit-Zahl wachsen. Dies liegt an der dünn besetzten Struktur, die eine direkte klassische Berechnung der Observablen ermöglicht, ohne den Quantenzustand vollständig simulieren zu müssen. Dadurch lassen sich Schaltkreise von 16 bis 64 Qubits innerhalb eines 1,1 Milliarden Parameter umfassenden Backbones trainieren.
Benchmark: 64 Qubits schlagen klassische LoRA
Über nachgelagerte Benchmarks steigt der durchschnittliche Score mit zunehmender Schaltkreisbreite von 47,65 auf 54,30. Bei 64 Qubits übertrifft HyperQ das eingefrorene Backbone um 4,71 Punkte und das Low-Rank-adaptierte Gegenstück um 3,67 Punkte. Die breiteren Schaltkreise bieten mehr Kapazität für token-spezifische Anpassungen, was zu höheren Scores führt. HyperQ wird auf lediglich 20.000 Prompt-Response-Paaren feinabgestimmt, während die klassischen Baselines 200.000 Paare verwenden. Die geringere Datenmenge reicht aus, weil nur die Quanten-Branches trainiert werden und das eingefrorene Backbone Overfitting reduziert – so erzielt HyperQ trotz zehnfach weniger Trainingsdaten bessere Ergebnisse.



