Live SageMaker AI führt Multi-Turn Reinforcement Learning für agentische Modellanpassung ein
↘

E-MoE nutzt Expert-Routing für nicht-faktorisierte Diffusions-Sprachmodelle

Ein neuer Mixture-of-Experts-Ansatz modelliert den Rückwärtsprozess als Mischung faktorisierter Verteilungen und verbessert die Generierung bei wenigen Schritten.

· Veröffentlicht: 02.10.2026 ·2 Min Lesezeit
E-MoE nutzt Expert-Routing für nicht-faktorisierte Diffusions-SprachmodelleMit KI erstellt
Inhalt
◆ Fakten auf einen Blick
  • E-MoE wird als Enhanced Mixture-of-Experts für nicht-faktorisierte Diffusions-Sprachmodelle vorgeschlagen.
  • Der Rückwärtsprozess wird als Mischung faktorisierter Verteilungen über eine diskrete gemeinsame latente Variable aufgebaut, die durch die Expert-Routing-Entscheidungen eines MoE-Backbones gegeben ist.
  • E-MoE erhöht die aktiven Parameter gegenüber der faktorisierten Baseline nicht.
  • E-MoE wurde auf synthetischen multi-modalen Benchmarks, binarisiertem MNIST und LM1B evaluiert.
  • Laut Abstract verbessert E-MoE die Few-Step-Generierung gegenüber faktorisierten Baselines.
  • Maskierte Diffusions-Sprachmodelle generieren mehrere Tokens parallel; ihr Rückwärtsprozess ist typischerweise über Positionen faktorisiert, was die Qualität im Few-Step-Regime begrenzt.

Neuer Ansatz E-MoE für nicht-faktorisierte Diffusions-Sprachmodelle

Forschende schlagen mit E-MoE einen neuen Ansatz für nicht-faktorisierte Diffusions-Sprachmodelle vor. Maskierte Diffusionsmodelle generieren mehrere Tokens parallel, doch ihr Rückwärtsprozess ist üblicherweise über die Positionen faktorisiert. Das bedeutet, dass jedes Token unabhängig von den anderen vorhergesagt wird, was die Qualität bei wenigen Generierungsschritten einschränkt. E-MoE, kurz für Enhanced Mixture-of-Experts, modelliert den Rückwärtsprozess stattdessen als Mischung faktorisierter Verteilungen. Dafür wird eine diskrete gemeinsame latente Variable verwendet, die aus den Expert-Routing-Entscheidungen eines Mixture-of-Experts-Backbones stammt. Diese Routing-Entscheidungen bestimmen, welcher Experte für ein Token zuständig ist, und dienen als gemeinsame Information über alle Positionen hinweg. So entsteht eine koordinierte, nicht-faktorisierte Generierung, ohne dass zusätzliche aktive Parameter nötig sind.

Weniger Schritte, gleiche aktive Parameter

Der Vorteil von E-MoE liegt darin, dass die aktiven Parameter gegenüber der faktorisierten Baseline nicht erhöht werden. Bei einem Mixture-of-Experts-Modell sind zwar viele Experten vorhanden, aber pro Schritt wird nur ein Teil davon aktiviert. E-MoE nutzt diese Routing-Entscheidungen als latente Variable, ohne zusätzliche Berechnungen oder Parameter einzuführen. Das zugrunde liegende Problem der faktorisierten Rückwärtsprozesse ist die fehlende Koordination zwischen den parallel generierten Tokens: Jede Position wird unabhängig vorhergesagt, wodurch Korrelationen verloren gehen und die Qualität bei wenigen Schritten leidet. Laut dem Abstract des Papers verbessert E-MoE die Few-Step-Generierung gegenüber faktorisierten Baselines. Damit adressiert der Ansatz genau das Regime, in dem Diffusionsmodelle ihren Geschwindigkeitsvorteil gegenüber autoregressiven Verfahren ausspielen sollen.

Tests auf synthetischen Benchmarks, MNIST und LM1B

Die Autoren evaluieren E-MoE auf synthetischen multi-modalen Benchmarks, auf binarisiertem MNIST und auf dem Sprachdatensatz LM1B. In allen diesen Tests zeigt sich eine verbesserte Few-Step-Generierung im Vergleich zu faktorisierten Baselines. Die Ergebnisse belegen, dass die nicht-faktorisierte Modellierung über die gemeinsame latente Variable aus den Expert-Routing-Entscheidungen die Qualität bei wenigen Denoising-Schritten steigert. Besonders bei sehr kleinen Schrittanzahlen, wo die parallele Token-Generierung ohne Koordination an ihre Grenzen stößt, profitiert das Modell von der gemeinsamen Information. Die Arbeit liefert damit einen konkreten Architekturvorschlag, wie sich Mixture-of-Experts-Backbones für Diffusions-Sprachmodelle nutzen lassen, ohne die Rechenlast zu erhöhen.

A
Andreas Rüdiger
Herausgeber & Redaktionsleitung · KI-Modelle, Technik & Business

Andreas Rüdiger ist Gründer der Agentur INREMA und verantwortet KI Spotlight redaktionell. Sein Schwerpunkt liegt auf KI-Modellen, Recheninfrastruktur, technischen Entwicklungen und der wirtschaftlichen Einordnung. Er sorgt dafür, dass komplexe KI-Themen verständlich und nachvollziehbar aufbereitet werden. Mehr zu ihm auf inrema.de und andiger.de.

Ähnliche Artikel