Live Kandinsky 6.0 Video: Open-Source-Modellfamilie für synchronisierte Audio-Video-Generierung
↘

Kandinsky 6.0 Video: Open-Source-Modellfamilie für synchronisierte Audio-Video-Generierung

Lite (3B) und Pro (29B) erzeugen 5-Sekunden-Clips mit 44-kHz-Audio und Lippensynchronisation – veröffentlicht unter MIT-Lizenz

· Veröffentlicht: 10.10.2026 ·3 Min Lesezeit
Kandinsky 6.0 Video: Open-Source-Modellfamilie für synchronisierte Audio-Video-GenerierungMit KI erstellt
Inhalt
◆ Fakten auf einen Blick
  • Kandinsky 6.0 Video ist eine Familie von Foundation-Diffusionsmodellen für synchronisierte Text-zu-Audio-Video-Generierung und umfasst Kandinsky 6.0 Video Lite (3B Parameter) und Kandinsky 6.0 Video Pro (29B Parameter).
  • Beide Modelle erzeugen 5-Sekunden-Videoclips mit synchronisiertem 44-kHz-Audio inklusive Lippensynchronisation in den Modi Text-zu-Audio-Video (T2AV) und Bild-zu-Audio-Video (I2AV).
  • Ein eingebautes Super-Resolution-Modell erhöht die Ausgabeauflösung auf Full HD (1920×1080).
  • Kandinsky 6.0 Video nutzt eine Dual-Stream-CrossDiT-Architektur, die einen vortrainierten Video-Stream und einen neu trainierten Audio-Stream über bidirektionale Cross-Attention verbindet.
  • Die Trainingsstrategie umfasst kontinuierliches Pretraining (Audio-Stream von Grund auf, dann gemeinsames Training auf gepaarten Audio-Video-Daten), gefolgt von Supervised Fine-Tuning, RL-basiertem Post-Training und Destillation.
  • In einer Side-by-Side-Human-Evaluation übertrifft Kandinsky 6.0 Video Pro den Vorgänger Kandinsky 5.0 Video Pro deutlich und bleibt wettbewerbsfähig mit führenden Audio-Video-Generierungsmodellen, besonders bei Sprachqualität.

Kandinsky 6.0 Video: Synchronisierte Audio-Video-Generierung unter MIT-Lizenz

Kandinsky 6.0 Video ist eine Familie von Foundation-Diffusionsmodellen für synchronisierte Text-zu-Audio-Video-Generierung. Sie umfasst Kandinsky 6.0 Video Lite mit 3 Milliarden Parametern und Kandinsky 6.0 Video Pro mit 29 Milliarden Parametern. Beide Modelle erzeugen 5-Sekunden-Videoclips mit synchronisiertem 44-kHz-Audio inklusive Lippensynchronisation, und zwar in den Modi Text-zu-Audio-Video (T2AV) und Bild-zu-Audio-Video (I2AV). Die technische Grundlage bildet eine Dual-Stream-CrossDiT-Architektur, die einen vortrainierten Video-Stream und einen neu trainierten Audio-Stream über bidirektionale Cross-Attention verbindet. Dadurch werden Video- und Audio-Repräsentationen während der Diffusion kontinuierlich aufeinander abgestimmt, was die zeitliche und semantische Ausrichtung – insbesondere die Lippensynchronisation – ermöglicht. Ein eingebautes Super-Resolution-Modell hebt die Ausgabeauflösung auf Full HD (1920×1080) an, indem es die generierten Clips in einer nachgelagerten Stufe verfeinert und hochskaliert. Gegenüber dem Vorgänger Kandinsky 5.0 ist die Audio-Video-Synchronisation neu; die Modelle werden unter MIT-Lizenz veröffentlicht, einschließlich Code, Modell-Checkpoints und Diffusers-Integration. In einer Side-by-Side-Human-Evaluation übertrifft Kandinsky 6.0 Video Pro nach Angaben des Papers den Vorgänger Kandinsky 5.0 Video Pro deutlich und bleibt bei der Sprachqualität wettbewerbsfähig mit führenden Audio-Video-Generierungsmodellen.

Dual-Stream-CrossDiT-Architektur und Trainingspipeline

Die Dual-Stream-CrossDiT-Architektur trennt Video- und Audio-Verarbeitung in zwei spezialisierte Streams. Der Video-Stream ist vortrainiert und bringt starke visuelle Generierungsfähigkeiten mit; der Audio-Stream wird von Grund auf neu trainiert. Die Verbindung über bidirektionale Cross-Attention erlaubt es beiden Streams, wechselseitig auf die jeweils andere Modalität zu achten: Das Video kann sich an der Audiospur orientieren (z. B. Lippenbewegungen an Sprachlauten ausrichten), während das Audio auf visuelle Kontextinformationen reagieren kann. Diese bidirektionale Interaktion verbessert die zeitliche und semantische Ausrichtung erheblich, da sie eine kontinuierliche Abstimmung während des Diffusionsprozesses ermöglicht. Die Trainingsstrategie umfasst mehrere Phasen: Kontinuierliches Pretraining trainiert zunächst den Audio-Stream auf großen Audiokorpora und danach beide Streams gemeinsam auf gepaarten Audio-Video-Daten, wobei die unimodale Qualität erhalten bleibt. Supervised Fine-Tuning passt die Modelle an spezifische Verteilungen an. Darauf folgt ein Reinforcement-Learning-basiertes Post-Training, das die Modelle weiter optimiert. Den Abschluss bildet eine Destillationsphase, die effizientere Inferenzvarianten hervorbringt.

Edge0: Effiziente Inference für 35B-MoE auf Consumer-Hardware

Edge0 ist eine separate Streaming-MoE-Inference-Engine und nicht Teil des Kandinsky-6.0-Video-Modells. Sie zielt darauf ab, Modelle der 35B-Klasse auf Consumer-Hardware auszuführen. Dafür nutzt Edge0 einen Prerouter: ein schichtspezifischer Kopf sagt das Routing der nächsten Schicht einen Token im Voraus vorher. Dadurch kann die benötigte Expertenmenge bereits vorab von der SSD geladen werden, sodass die Lesevorgänge parallel zur Berechnung stattfinden und nicht auf das Ergebnis der aktuellen Schicht warten müssen. Die Vorhersage wird direkt als Routing verwendet, sodass nichts verworfen wird. Eine unmerged Recovery-LoRA – ein Low-Rank-Adapter, der auf dem studentischen Pfad trainiert wurde – kompensiert Qualitätsverluste durch int4-Quantisierung und Routing-Ersetzung, indem sie die Abweichungen zum fp16-Lehrer ausgleicht. Auf einer einzelnen 24-GB-GPU bedient Edge0 ein 35B-MoE mit 20 Tokens pro Sekunde innerhalb von 3 GiB peak active memory. Die 35B-Parameterzahl gehört also nicht zum generativen Kandinsky-Modell, sondern bezeichnet die von Edge0 adressierte Modellklasse.

Verfügbarkeit in Diffusers, ComfyUI und weiteren Frameworks

Am 6. Oktober 2026 wurde Kandinsky 6.0 in Diffusers, ComfyUI, vLLM-omni, SGLang und FastVideo verfügbar gemacht. Zusätzlich gibt es einen Hugging Face Space für Kandinsky 6.0 Pro Distill. Kandinsky 6.0 und das Kandinsky 6.0 Video Super-Resolution-Modell wurden als Open Source veröffentlicht.

A
Andreas Rüdiger
Herausgeber & Redaktionsleitung · KI-Modelle, Technik & Business

Andreas Rüdiger ist Gründer der Agentur INREMA und verantwortet KI Spotlight redaktionell. Sein Schwerpunkt liegt auf KI-Modellen, Recheninfrastruktur, technischen Entwicklungen und der wirtschaftlichen Einordnung. Er sorgt dafür, dass komplexe KI-Themen verständlich und nachvollziehbar aufbereitet werden. Mehr zu ihm auf inrema.de und andiger.de.

Ähnliche Artikel