Multimodal Flow: Kontinuierliches Flow-Matching für Sprache und Vision veröffentlicht
Multimodal Flow ist ein vollständig kontinuierliches generatives Modell, das Sprache und Vision in gemeinsamen Einbettungsräumen vereint. Es nutzt einen gemeinsamen chunk-kausalen Flow-Backbone und Flow Matching, um Text und Bilder als geordnete kontinuierliche Hyperchunks zu modellieren und so Quan
Mit KI erstellt◆ Fakten auf einen Blick
- Multimodal Flow ist ein vollständig kontinuierliches generatives Modell für Sprache und Vision.
- Das Modell integriert multimodale kontinuierliche Repräsentationen mit einem gemeinsamen chunk-kausalen Flow-Backbone.
- Textblöcke und Bilder werden als geordnete kontinuierliche Hyperchunks organisiert, wobei die Token-Reihenfolge im Text und die räumliche Struktur im Bild erhalten bleiben.
- Der Backbone lernt ein einziges Vektorfeld über diese Hyperchunks mittels Flow Matching.
- Gemeinsame Aufmerksamkeit (Joint Attention) ermöglicht cross-modale Interaktion, während modalitätsspezifische Feed-Forward-Netzwerke jede Modalität verarbeiten.
- Während des Trainings sagt das Modell mehrere Ziel-Chunks parallel vorher, bei der Inferenz werden Hyperchunks sequenziell generiert.
Kontinuierliches Flow-Matching für Sprache und Vision
Multimodal Flow ist ein vollständig kontinuierliches generatives Modell für Sprache und Vision. Anders als viele multimodale Modelle, die Sprache und quantisierte Bilder als diskrete Tokens behandeln oder diskrete Sprachvorhersage mit kontinuierlicher Bildgenerierung kombinieren, verzichtet der Ansatz auf einen visuellen Quantisierungsengpass. Textblöcke und Bilder werden als geordnete kontinuierliche Hyperchunks organisiert; dabei bleiben die Token-Reihenfolge im Text und die räumliche Struktur im Bild erhalten. Ein gemeinsamer chunk-kausaler Flow-Backbone lernt über diese Hyperchunks ein einziges Vektorfeld mittels Flow Matching. Joint Attention berechnet die Aufmerksamkeitsmatrix über alle Hyperchunks hinweg, sodass Text- und Bildanteile einander beeinflussen können; dabei werden die kontinuierlichen Repräsentationen beider Modalitäten in einem gemeinsamen Aufmerksamkeitsraum verarbeitet. Anschließend verarbeiten modalitätsspezifische Feed-Forward-Netzwerke die Text- und Bild-Hyperchunks getrennt, um die unterschiedlichen Eigenschaften der kontinuierlichen Repräsentationen zu berücksichtigen. Während des Trainings sagt das Modell mehrere Ziel-Chunks parallel vorher, bei der Inferenz werden die Hyperchunks sequenziell erzeugt. Dadurch entsteht ein gemeinsamer generativer Prozess für beide Modalitäten, ohne modalitätsabhängige Ziele oder Sampling-Verfahren. Die Autoren von der Huazhong University of Science and Technology, der Beijing Jiaotong University und Horizon Robotics stellen mit MF-1 eine Instanz vor, die auf multimodalen Daten vortrainiert wurde.
Offene Inferenzgewichte unter MIT-Lizenz
Für MF-1 sind die Modellgewichte in BF16 verfügbar. Die Veröffentlichung umfasst ausschließlich Inferenzgewichte und Konfiguration; Trainings- und Optimierer-Zustände sind nicht enthalten. Mit nur 150B Pretraining-Tokens erreicht MF-1 nach Angaben der Autoren einen Durchschnittswert von 82,8 über die Benchmarks GenEval und DPG-B. Der Open-Source-Code stellt eine Kommandozeilenschnittstelle `mf infer` bereit. Für Textfortsetzung wird `mf infer --checkpoint ./MF/pretrain text --prompt "..."` verwendet, für Bildverständnis `mf infer --checkpoint ./MF/sft caption --image /pfad/zum/bild.jpg --prompt "..."` und für Text-zu-Bild-Generierung `mf infer --checkpoint ./MF/sft image --prompt "..." --output ausgabe.png`. Für Bildverständnis und Bildgenerierung werden zusätzlich kompatible Scale-RAE-Decoder-Assets benötigt; der Pfad wird über die Umgebungsvariable MF_ASSETS_ROOT gesetzt. Text-Inferenz nutzt das Modellpaket direkt. Die Veröffentlichung steht unter MIT-Lizenz, was eine breite Nutzung erlaubt. Die Lizenzen externer Encoder-, Tokenizer- und Decoder-Assets sind gesondert zu prüfen.



