Live Bailey: Regulierung nicht der richtige Startpunkt bei KI
↘

FlashForward nutzt In-Flight-KV-Cache für schnellere Video-Diffusion

Forschende stellen eine Methode vor, die den während der Denoising-Schritte entstehenden Cache direkt wiederverwendet und so zusätzliche Vorwärtsdurchläufe einspart.

· Veröffentlicht: 30.09.2026 ·2 Min Lesezeit
FlashForward nutzt In-Flight-KV-Cache für schnellere Video-DiffusionMit KI erstellt
◆ Fakten auf einen Blick
  • FlashForward ist ein Ansatz für autoregressive Video-Diffusion, der den In-Flight-KV-Cache des aktuellen Chunks direkt wiederverwendet, um zusätzliche Cache-Update-Forwards zu vermeiden.
  • Nach Abschluss einer Denoising-Stufe eines Chunks ist dessen stufenspezifischer Cache für den nächsten Chunk verfügbar; durch Zuweisung einer GPU pro Stufe können verschiedene Chunks gleichzeitig verschiedene Stufen belegen.
  • FlashForward erzeugt spärliche zusätzliche saubere Anker-Latents, bevor die entsprechende Region generiert wird, um die Generierungstrajektorien durch zweiseitige Konditionierung zu stabilisieren.
  • Die zwei Speicher arbeiten auf unterschiedlichen Zeitskalen: Der spärliche saubere Anker-KV liefert grobe, langreichweitige zweiseitige strukturelle Führung, der dichte stufengematchte Verlauf bewahrt feine, jüngere Entwicklung.
  • Die frühe Verfügbarkeit des stufengematchten Verlaufs hat laut Abstract Qualitätskosten: Der resultierende stufengematchte Verlauf ist verrauscht und verursacht Appearance- und Motion-Drift zwischen Chunks.
  • Die Abstracts erwähnen eine Ausführung mit bis zu vier GPUs; die konkrete Beschleunigungszahl ist in den vorliegenden Belegen nicht vollständig enthalten, da der Text bei „runs 1.1“ bzw. „runs – fa“ abbricht.

FlashForward nutzt In-Flight-KV-Cache für schnellere Video-Diffusion

Forschende stellen mit FlashForward eine Methode für autoregressive Video-Diffusion vor, die den während der Denoising-Schritte entstehenden In-Flight-KV-Cache direkt wiederverwendet. Bei der autoregressiven Video-Diffusion wird ein langes Video in zeitliche Abschnitte (Chunks) zerlegt und Stück für Stück generiert, wobei jeder Chunk eine kurze Abfolge von Denoising-Stufen durchläuft. Bisherige Verfahren rekonstruierten für bereits generierte Chunks einen sauberen oder weniger verrauschten Key-Value-Cache, indem sie zusätzliche Vorwärtsdurchläufe ausführten, die das Ausgangs-Latent nicht voranbewegten. FlashForward umgeht diese separaten Cache-Aktualisierungen: Jeder Denoising-Vorwärtsdurchlauf berechnet ohnehin den In-Flight-KV des aktuellen Chunks, und genau dieser wird direkt genutzt. Da jeder Denoising-Vorwärtsdurchlauf den In-Flight-KV-Cache des aktuellen Chunks ohnehin berechnet, entfallen bei FlashForward die separaten, rechenintensiven Vorwärtsdurchläufe, die bei früheren Verfahren nur zur Aktualisierung des Caches dienten, ohne das Ausgangs-Latent voranzubewegen. Dies reduziert die Anzahl der benötigten Modell-Forwards pro Chunk erheblich und senkt damit sowohl Rechenlast als auch Latenz. Nachdem ein Chunk eine Denoising-Stufe abgeschlossen hat, steht sein stufenspezifischer Cache bereits für den nächsten Chunk zur Verfügung. Wird jeder Stufe eine eigene GPU zugewiesen, können verschiedene Chunks gleichzeitig unterschiedliche Stufen belegen – laut Abstract bis zu vier GPUs. Dadurch wird die Erzeugung langer Videos beschleunigt.

Anker-Latents und stufengematchter Verlauf: Zwei Speicher gegen Qualitätsdrift

Diese frühe Verfügbarkeit des stufengematchten Verlaufs hat jedoch Qualitätskosten: Der stufengematchte Verlauf stammt aus einem frühen Denoising-Stadium des vorherigen Chunks und ist daher noch nicht vollständig entrauscht; er enthält Restrauschen, das zu Appearance- und Motion-Drift zwischen den Chunks führt. Um dem entgegenzuwirken, erzeugt FlashForward spärliche zusätzliche saubere Anker-Latents, bevor die entsprechende Region generiert wird. Diese Anker sind weniger verrauscht, weil sie separat berechnet werden, und stabilisieren die Generierungstrajektorien durch zweiseitige Konditionierung – sie liefern sowohl von vorherigen als auch von nachfolgenden Chunks strukturelle Hinweise. Die beiden Speicher arbeiten auf unterschiedlichen Zeitskalen: Der spärliche saubere Anker-KV liefert grobe, langreichweitige strukturelle Führung in beide zeitliche Richtungen, während der dichte stufengematchte Verlauf die feine, jüngere Entwicklung bewahrt. So wird die Drift zwischen aufeinanderfolgenden Chunks abgefedert, ohne die Geschwindigkeitsvorteile der direkten Cache-Wiederverwendung aufzugeben.

A
Andreas Rüdiger
Herausgeber & Redaktionsleitung · KI-Modelle, Technik & Business

Andreas Rüdiger ist Gründer der Agentur INREMA und verantwortet KI Spotlight redaktionell. Sein Schwerpunkt liegt auf KI-Modellen, Recheninfrastruktur, technischen Entwicklungen und der wirtschaftlichen Einordnung. Er sorgt dafür, dass komplexe KI-Themen verständlich und nachvollziehbar aufbereitet werden. Mehr zu ihm auf inrema.de und andiger.de.

Ähnliche Artikel