Raschka: Astras kurze Spuren sind kein verstecktes Reasoning, sondern looped Transformers
Looped Transformers verarbeiten Zwischenrepräsentationen mehrfach – kürzere sichtbare Spuren sind ein Zeichen höherer Rechenkapazität, nicht von Verheimlichung.
Mit KI erstellt◆ Fakten auf einen Blick
- Sebastian Raschka hat am 9. September 2026 einen Beitrag zu looped Transformers und Astra veröffentlicht.
- Ein looped Transformer wendet dieselben Transformer-Blöcke mehrfach an; das Verfahren wird auch recurrent depth oder looped depth sharing genannt.
- Bei einem looped Transformer werden die Hidden States eines Durchlaufs zum Input des nächsten; die effektive Zahl der Blockanwendungen ist L × T, wobei T > 1.
- Nanbeige4.2-3B ist ein Beispiel: Ein 22-Layer-Stack wird zweimal wiederverwendet, was effektiv 44 Layer ergibt, ohne die Gewichte zu duplizieren; der Rechenaufwand verdoppelt sich nahezu, während Speicher/RAM etwa gleich bleiben.
- Laut Nanbeige-Report ergaben zwei Durchläufe den besten Trade-off und etwa 75 % der Token-Effizienz einer Standardarchitektur; mehr Durchläufe brachten kaum Gewinn, machten das Training aber deutlich langsamer und teurer.
- Die Grundidee geht auf die Universal Transformers (2018) zurück; spätere Arbeiten wie Ouro (ByteDance), Mixture-of-Recursions und Recurrent Depth folgen derselben Idee der Tiefen-Gewichtsteilung.
Sebastian Raschka hat in einem Beitrag vom 9. September die kursierende Deutung zu GPT-6 Astra korrigiert. Die kurzen sichtbaren Reasoning-Spuren seien kein verstecktes Chain-of-Thought, sondern eine Folge von looped Transformers und höherer Modellkapazität. Ein looped Transformer wendet dieselben Transformer-Blöcke mehrfach an; dabei werden nicht dieselben Texte verarbeitet, sondern Zwischenrepräsentationen, deren Hidden States zum Input des nächsten Durchlaufs werden. Die effektive Zahl der Blockanwendungen ist L × T, wobei T > 1. Raschka widerspricht damit The Information, die aus der Architektur eine Verdeckung der Reasoning-Kette abgeleitet hatte. Astra nutze weniger sichtbare Token als GPT-5.6 Sol, weil das Modell leistungsfähiger und besser trainiert sei: Durch die wiederholte Anwendung derselben Blöcke wird pro sichtbarem Token mehr interne Berechnung möglich, sodass komplexe Gedankengänge kompakter ausgedrückt werden können – intern werde mehr gerechnet, nicht verheimlicht.



