Live Brave hostet Anthropic-Modelle jetzt direkt
↘

Encoder-freie MLLMs holen bei 10^22 FLOPs auf

Neue Skalierungsgesetze zeigen: Ohne visuellen Encoder verschiebt sich die optimale Modellgröße – und der Vorteil des visuellen Priors schwindet mit wachsendem Compute.

· Veröffentlicht: 29.09.2026 ·2 Min Lesezeit
Encoder-freie MLLMs holen bei 10^22 FLOPs aufMit KI erstellt
Inhalt
◆ Fakten auf einen Blick
  • Das Dokument ist als Abstract auf Hugging Face verfügbar und beschreibt ein Forschungspapier zu Skalierungsgesetzen encoder-freier multimodaler Pretraining-Modelle.
  • Die Entfernung des visuellen Encoders verschiebt die compute-optimale Allokation für das multimodale Ziel hin zu größeren Modellen, während die für Text nahezu unverändert bleibt.
  • Encoder-freie und encoder-basierte Architekturen zeigen nahezu überlappende Loss-Compute-Frontiers beim Textziel, divergieren aber beim multimodalen Ziel: encoder-freie Modelle sind bei kleinen Skalen unterlegen, werden aber vorhergesagt, bei etwa 10^22 FLOPs aufzuholen.
  • Ohne visuellen Encoder lernt das Sprachmodell, dessen Rolle durch vision-spezifische Anpassung zu übernehmen: bidirektionale Interaktionen zwischen visuellen Tokens werden mit wachsendem Trainingscompute zunehmend vorteilhaft, visuelle Verarbeitung verschiebt sich in frühere Schichten, und das Experten-Routing für visuelle Tokens wird konzentrierter.
  • Die Autoren schlussfolgern, dass der Vorteil des visuellen Priors eines vortrainierten Encoders mit der Skalierung abnimmt und encoder-freie Architekturen dadurch als Alternative positioniert werden.
  • BREEN ist eine dateneffiziente encoder-freie multimodale Architektur, die eine learnable query und image experts nutzt und mit nur 13 Millionen Text-Bild-Paaren eine vergleichbare Leistung wie frühere encoder-freie State-of-the-Art-Modelle wie Mono-InternVL erreicht – etwa ein Prozent der sonst benötigten Datenmenge.

Crossover bei 10^22 FLOPs vorhergesagt

Ein neues Forschungspapier charakterisiert erstmals systematisch die Skalierungsgesetze encoder-freier gegenüber encoder-basierten multimodalen Large Language Models (MLLMs). Die meisten modernen MLLMs stützen sich auf einen vortrainierten visuellen Encoder, der als visueller Prior dient; encoder-freie Modelle lernen visuelle Repräsentationen dagegen direkt aus Rohpixeln. Der Vergleich zeigt: Beim Textziel liegen die Loss-Compute-Frontiers beider Architekturen nahezu übereinander. Beim multimodalen Ziel divergieren sie jedoch: Encoder-freie Modelle sind bei kleinen Skalen unterlegen, werden aber vorhergesagt, bei etwa 10^22 FLOPs aufzuholen. Diese Aufholprognose ergibt sich aus den im Paper untersuchten Skalierungseffekten: Mit zunehmendem Trainingscompute verändert sich die interne Verarbeitung visueller Informationen im Sprachmodell so, dass der anfängliche Nachteil gegenüber encoder-basierten Systemen schrittweise kompensiert wird. Nach Angaben der Autoren liegt dieser Crossover-Punkt innerhalb praktischer Pretraining-Budgets.

Compute-optimale Allokation verschiebt sich für multimodales Ziel

Als ersten Hauptbefund berichtet das Papier, dass die Entfernung des visuellen Encoders die compute-optimale Allokation für das multimodale Ziel hin zu größeren Modellen verschiebt. Für das reine Textziel bleibt die optimale Allokation dagegen nahezu unverändert. Die zugrundeliegende Logik: Ohne den visuellen Encoder muss das Sprachmodell selbst die visuelle Repräsentationsbildung übernehmen. Diese zusätzliche Aufgabe verändert die Rollenverteilung zwischen Vision- und Sprachkomponenten – die visuelle Verarbeitung wird in das Sprachmodell integriert, wodurch bei gegebenem Trainingsbudget ein größeres Modell erforderlich wird, um den multimodalen Verlust zu minimieren. Beim Textziel entfällt diese Zusatzlast, sodass die optimale Allokation dort nahezu unverändert bleibt.

Sprachmodell übernimmt visuelle Verarbeitung ohne Encoder

Der dritte Hauptbefund beschreibt, wie das Sprachmodell die Rolle des fehlenden visuellen Encoders übernimmt. Mit wachsendem Trainingscompute werden bidirektionale Interaktionen zwischen visuellen Tokens zunehmend vorteilhaft; die visuelle Verarbeitung verschiebt sich in frühere Schichten des Modells, und das Experten-Routing für visuelle Tokens wird konzentrierter. Diese vision-spezifische Anpassung zeigt, dass das Sprachmodell nicht nur Text, sondern auch visuelle Merkmale intern strukturiert – es bildet eigene Mechanismen aus, um die Funktionen des entfernten Encoders zu ersetzen. Die Autoren schlussfolgern, dass der Vorteil des visuellen Priors eines vortrainierten Encoders mit der Skalierung abnimmt. Encoder-freie Architekturen werden dadurch als Alternative positioniert.

A
Andreas Rüdiger
Herausgeber & Redaktionsleitung · KI-Modelle, Technik & Business

Andreas Rüdiger ist Gründer der Agentur INREMA und verantwortet KI Spotlight redaktionell. Sein Schwerpunkt liegt auf KI-Modellen, Recheninfrastruktur, technischen Entwicklungen und der wirtschaftlichen Einordnung. Er sorgt dafür, dass komplexe KI-Themen verständlich und nachvollziehbar aufbereitet werden. Mehr zu ihm auf inrema.de und andiger.de.

Ähnliche Artikel