Live Torvalds rät KI-Kritikern: Forken oder gehen

Medienberichte: Black Forest Labs stellt Flux 3 vor

Multimodales Modell soll Bild, Video, Audio und Robotik-Aktionen aus einem Prompt generieren – offizielle Bestätigung steht noch aus.

Veröffentlicht: 23.07.2026 ·1 Min Lesezeit
Medienberichte: Black Forest Labs stellt Flux 3 vorMit KI erstellt

Medienberichte: Flux 3 vereint Bild, Video, Audio und Robotik

Laut Fachmedien hat Black Forest Labs mit Flux 3 ein multimodales Foundation-Modell vorgestellt, das Bilder, 20-sekündige Videos mit nativem Audio und Roboter-Vision aus einem einzigen Prompt generieren kann. Ermöglicht wird dies den Berichten zufolge durch eine gemeinsam trainierte Architektur: Statt separater Modelle für Bild, Video und Audio, die nur über eine Schnittstelle verbunden sind, verarbeitet ein einheitliches neuronales Netzwerk alle Modalitäten und leitet cross-modale Zusammenhänge direkt aus dem Prompt ab. Zudem wurde Flux-mimic präsentiert – ein Video-Action-Modell, das aus Videodaten Aktionen erkennt und in Robotersteuerungen umsetzt. Dadurch können Roboter durch Beobachtung von Videosequenzen Aufgaben erlernen; laut Berichten wird dieser Ansatz bereits bei Audi getestet.

Keine offizielle Bestätigung

Die Informationen stammen aus Medienberichten; eine offizielle Bestätigung von Black Forest Labs liegt nicht vor. Nach Einschätzung der Redaktion handelt es sich um unbestätigte Angaben. Technische Details und die tatsächliche Verfügbarkeit von Flux 3 bleiben daher unklar. Das Unternehmen war bislang vor allem für Bildgenerierung bekannt, eine offizielle Ankündigung zu einem derart umfassenden Modell steht noch aus.

Ähnliche Artikel