Live PackLab: Neues Framework für robotisches Bin-Packing mit Simulation, MLLM und Benchmark

Stanford-Team stellt MAttr vor und führt MIB an

Matryoshka Attribution ordnet interne Modellkomponenten nach Wichtigkeit und erreicht den Spitzenplatz im Mechanistic Interpretability Benchmark.

· Veröffentlicht: 24.09.2026 ·1 Min Lesezeit
Stanford-Team stellt MAttr vor und führt MIB anMit KI erstellt
◆ Fakten auf einen Blick
  • Ein von Stanford angeführtes Team hat Matryoshka Attribution (MAttr) eingeführt, eine Methode zur Rangordnung interner Komponenten, die für ein Modellverhalten verantwortlich sind.
  • MAttr erreichte den höchsten Score auf dem Node-Track des Mechanistic Interpretability Benchmark (MIB) und lag etwa um das 2,9-Fache über dem zweitplatzierten Ergebnis.
  • MAttr formuliert Attribution als Optimierungsproblem über verschachtelte Komponentenmengen und ist auf Attention Heads, MLP-Blöcke, Neuronen, Sparse-Autoencoder-Features und Parameter-Updates zwischen Checkpoints anwendbar.
  • MAttr verwendet eine differenzierbare Sigmoid-Top-k-Maske mit randomisierter Sparsity; Straight-through- oder Gumbel-Tricks sind nicht erforderlich.
  • Ein einzelner Trainingslauf erzeugt eine Rangordnung, die auf vielen Sparsity-Stufen aufgeteilt werden kann.
  • Code für schaltkreis- und parameterbezogene Attribution wurde veröffentlicht.

Ein von Stanford angeführtes Team hat die Matryoshka-Attribution-Methode (MAttr) vorgestellt. Sie ordnet interne Modellkomponenten nach ihrer Wichtigkeit für ein bestimmtes Verhalten. Auf dem Mechanistic Interpretability Benchmark (MIB) erreichte MAttr den höchsten Score und lag damit etwa um das 2,9-Fache über dem zweitplatzierten Ergebnis. Die Quelle spricht vom „Node-Track“; der Benchmark selbst definiert zwei Tracks – Circuit Localization und Causal Variable Localization –, ein Node-Track wird dort nicht genannt. Die Zuordnung bleibt daher unklar. MAttr nutzt eine differenzierbare Sigmoid-Top-k-Maske mit randomisierter Sparsity; ein einzelner Trainingslauf erzeugt eine Rangordnung für mehrere Sparsity-Stufen. Anwendbar ist die Methode auf Attention Heads, MLP-Blöcke, Neuronen, Sparse-Autoencoder-Features und Parameter-Updates. Code wurde veröffentlicht.

A
Andreas Rüdiger
Herausgeber & Redaktionsleitung · KI-Modelle, Technik & Business

Andreas Rüdiger ist Gründer der Agentur INREMA und verantwortet KI Spotlight redaktionell. Sein Schwerpunkt liegt auf KI-Modellen, Recheninfrastruktur, technischen Entwicklungen und der wirtschaftlichen Einordnung. Er sorgt dafür, dass komplexe KI-Themen verständlich und nachvollziehbar aufbereitet werden. Mehr zu ihm auf inrema.de und andiger.de.

Ähnliche Artikel