xAI veröffentlicht Grok Imagine Video 1.5 mit 15-Sekunden-Clips und nativem Audio
Das neue Modell verlängert die Cliplänge, erzeugt Ton im selben Durchgang und ist ab sofort allgemein verfügbar.
Mit KI erstellt◆ Fakten auf einen Blick
- Grok Imagine Video 1.5 ist ein Video-Generierungsmodell von xAI.
- Das Modell basiert auf der Aurora-Architektur von xAI.
- Es unterstützt Bild-zu-Video und (nach einem Update) auch Text-zu-Video.
- Die generierten Videos enthalten nativ synchronisiertes Audio (Dialog, Soundeffekte, Umgebungsgeräusche).
- Die maximale Cliplänge beträgt 15 Sekunden bei 720p-Auflösung.
- Es gibt eine 'Fast'-Variante, die Videos in etwa 25 Sekunden generiert.
xAI veröffentlicht Grok Imagine Video 1.5 mit 15-Sekunden-Clips und nativem Audio
xAI hat Grok Imagine Video 1.5 veröffentlicht. Das neue Video-Generierungsmodell löst Version 1.0 ab, die im Februar dieses Jahres erschienen war. Gegenüber dem Vorgänger verlängert Version 1.5 die maximale Cliplänge von 10 auf 15 Sekunden bei 720p-Auflösung. Das Modell erzeugt Videos mit nativ synchronisiertem Ton – Dialoge, Soundeffekte und Umgebungsgeräusche entstehen im selben Durchgang wie das Bild. Bild-zu-Video ist sofort verfügbar, Text-zu-Video folgte nach einem späteren Update. Nach einer Preview-Phase Anfang Juni ist das Modell seit Mitte Juni allgemein verfügbar.
xAI gibt an, dass Grok Imagine Video 1.5 den ersten Platz im öffentlichen Image-to-Video-Arena-Leaderboard belegt. Laut Artificial Analysis erreicht das Modell einen Elo-Wert von 1.473 und schlägt damit Konkurrenzmodelle wie Veo 3.1, Kling 3.0 und Seedance 2.0. Der Elo-Wert stieg gegenüber Version 1.0 um 52 Punkte – der größte Zuwachs einer einzelnen Version auf diesem Board. Diese Verbesserung wird laut xAI durch die autoregressive Aurora-Architektur erreicht, die Videoframes sequenziell vorhersagt und dadurch zeitliche Abhängigkeiten besser modelliert. Das Modell wurde auf 110.000 NVIDIA GB200-GPUs trainiert. Ein Beispiel aus der Praxis: Der Kreative David Thompson produzierte mit Grok Imagine 1.5 einen Trailer, der laut xAI „kinoreif“ wirkt. Die Fast-Variante des Modells ist bereits auf grok.com/imagine sowie in den iOS- und Android-Apps verfügbar.
Technische Details: Aurora-Architektur, Fast-Variante und Preise
Technisch basiert Grok Imagine Video 1.5 auf der Aurora-Architektur von xAI, einem autoregressiven Video-Engine, der auf 110.000 NVIDIA GB200-GPUs trainiert wurde. Die Standardauflösung beträgt 720p; ein späteres Update ergänzte native 1080p-Ausgabe. Die Fast-Variante erzeugt nach Herstellerangaben 6-sekündige 720p-Clips in etwa 25 Sekunden – fast doppelt so schnell wie das Vorgängermodell, das über 40 Sekunden benötigte. Diese Beschleunigung wird durch eine speed-optimierte Build-Variante erreicht, die auf grok.com und in den Apps live ist.
Der Zugriff erfolgt proprietär über die xAI-API. Das bedeutet: Es gibt keinen Open-Source-Code, keine lokale Installation und keine Möglichkeit, das Modell auf eigener Hardware zu betreiben. Entwickler müssen sich über die API von xAI oder Drittanbieter-Gateways wie LLM Stats anbinden, was laufende Kosten und eine Abhängigkeit vom Anbieter mit sich bringt. Die Flexibilität bei der Integration ist auf die bereitgestellten Endpunkte beschränkt; ein API-Beispiel zeigt einen OpenAI-kompatiblen Endpoint, der Generierungsaufträge entgegennimmt und per Long-Polling den Status abfragt.
Der Preis wird pro generierter Videosekunde berechnet und variiert je nach gewählter Auflösung: 0,14 USD für 720p und 0,25 USD für 1080p. Es gibt keine monatliche Grundgebühr; die Kosten skalieren linear mit der Anzahl der generierten Sekunden. Rabatte oder Mengenstaffeln sind in den Belegen nicht dokumentiert.



