Live Microsoft schaltet Brand Kit und Skills in Copilot in PowerPoint frei
↘

BAAI veröffentlicht AREX-2: 27B-Modell für selbstverbessernde Agenten

Die Beijing Academy of Artificial Intelligence stellt ein dichtes, Qwen3.8-kompatibles Modell vor, das auf langfristige Selbstverbesserung durch Reflexion trainiert wurde.

· Veröffentlicht: 01.10.2026 ·4 Min Lesezeit
BAAI veröffentlicht AREX-2: 27B-Modell für selbstverbessernde AgentenMit KI erstellt
Inhalt
◆ Fakten auf einen Blick
  • AREX-2 ist ein Modell der Beijing Academy of Artificial Intelligence (BAAI).
  • AREX-2 hat 27 Milliarden Parameter und ist ein dichtes, Qwen3.8-kompatibles multimodales Modell.
  • AREX-2 hat eine Kontextlänge von 262.144 Token.
  • AREX-2 wurde auf Machine-Learning- und algorithmischen Programmieraufgaben mit verifizierbarem Feedback sowie auf bestehenden AREX-Deep-Research-Daten trainiert.
  • AREX-2 erreicht auf MLE-bench Lite 81.8, auf Frontier-CS 70.7, auf BrowseComp 84.0, auf HLE 52.6, auf GAIA 92.2 und auf DeepSearchQA 93.8.
  • AREX-2 verbessert seine Leistung weiter, wenn das Budget an Testzeit-Runden wächst.

BAAI veröffentlicht AREX-2: 27B-Modell für selbstverbessernde Agenten

Die Beijing Academy of Artificial Intelligence (BAAI) hat mit AREX-2 ein neues Modell für selbstverbessernde Agenten vorgestellt. Das Modell besitzt 27 Milliarden Parameter, ist dicht aufgebaut und nach Angaben der Modellkarte Qwen3.8-kompatibel sowie multimodal. Es baut auf Qwen3.8-27B auf. Trainiert wurde AREX-2 auf Machine-Learning- und algorithmischen Programmieraufgaben, die verifizierbares Feedback liefern, sowie auf bestehenden Deep-Research-Daten des Vorgängers AREX. Ziel ist eine Fähigkeit, die die Autoren als Selbstverbesserung definieren: ein Modell, das eine Lösung in mehreren Testzeit-Runden iterativ verfeinert. Dafür kombiniert es Reflexion – das Erzeugen einer besseren Lösung als die aktuelle – mit langfristiger Ausführung, die die Iteration über viele Runden effektiv hält. Die Autoren formulieren die Hypothese, dass beide Fähigkeiten domänenagnostisch sind und daher in Szenarien mit guter Supervisionsmöglichkeit gelernt werden können. Entsprechend synthetisierten sie langfristige Verbesserungstrajektorien aus Machine-Learning- und algorithmischen Programmieraufgaben, zwei Domänen mit verifizierbarem Feedback und Belohnung für anhaltende Iteration. Die Autoren berichten, dass langfristige reflexive Daten ein effektiver Weg zu selbstverbessernden Agenten seien. Das zugehörige Paper ist auf Hugging Face unter der ID 2609.38288 verfügbar. Die Veröffentlichung erfolgt als Forschungsarbeit; eine Modellkarte dokumentiert technische Details und Evaluierungsprotokolle.

Technische Eckdaten und Trainingsansatz

Die Modellkarte nennt eine Kontextlänge von 262.144 Token. AREX-2 ist multimodal ausgelegt; als Architektur wird ein dichtes, Qwen3.8-kompatibles Modell angegeben. Die Trainingsdaten stammen aus zwei Bereichen: Machine-Learning-Aufgaben und algorithmische Programmieraufgaben, jeweils mit verifizierbarem Feedback, sowie aus den bestehenden AREX-Deep-Research-Daten. Verifizierbares Feedback bedeutet, dass Lösungen automatisch anhand von Scores, Logs, Fehlern oder Zeitmessungen bewertet werden können; das Modell lernt, diese Signale zu lesen und daraus die nächste Änderung abzuleiten. Die Modellkarte spezifiziert außerdem die Evaluierungsprotokolle: Frontier-CS wird als 188-Task Agent Track geführt, MLE-Lite berichtet den Wert 'Any Medal' gemittelt über drei Seeds. Bei HLE kennzeichnen Werte mit Stern das volle HLE-Set, Werte ohne Stern das Text-only-Subset. Die Autoren betonen, dass das gelernte Selbstverbesserungsverhalten auf Deep Research übertragbar ist, ohne neue Suchtrajektorien hinzuzufügen. Zusätzlich wird hervorgehoben, dass AREX-2 produktive Iteration aufrechterhält, wenn das Aufgabenbudget wächst – ein zentrales Merkmal des langfristigen Reasoning-Ansatzes.

Erstmals veröffentlichte Benchmark-Ergebnisse

Die Autoren berichten erstmals veröffentlichte Benchmark-Ergebnisse für AREX-2. Auf MLE-bench Lite erreicht das Modell 81,8, auf Frontier-CS 70,7. Im Deep-Research-Bereich werden 84,0 auf BrowseComp, 52,6 auf HLE, 92,2 auf GAIA und 93,8 auf DeepSearchQA genannt. Die Werte folgen nach Angaben der Modellkarte den im Paper dokumentierten Protokollen. Zudem geben die Autoren an, dass die Leistung weiter steigt, wenn das Budget an Testzeit-Runden wächst. Das bedeutet: Mehr verfügbare Iterationsrunden führen zu weiteren Verbesserungen, statt dass das Modell nach einer Runde stagniert. Die Ergebnisse decken algorithmische Programmierung, Machine-Learning-Engineering, Deep Research und allgemeines agentisches Reasoning ab. Die Autoren sehen darin einen Beleg für die Wirksamkeit langfristiger reflexiver Trainingsdaten und für den Transfer des gelernten Selbstverbesserungsverhaltens auf neue Domänen.

Vom Vorgänger AREX zu AREX-2: Ein Paradigmenwechsel

Der Vorgänger AREX war eine Familie von rekursiv selbstverbessernden Deep-Research-Agenten. Sie umfasste ein dichtes 4B-Modell und ein größeres Modell namens AREX-Base. AREX-Base basierte auf Qwen3.5-122B-A10B, nutzte eine Mixture-of-Experts-Architektur mit 122 Milliarden Gesamtparametern und 10 Milliarden aktivierten Parametern bei einer Kontextlänge von 262.144 Token. AREX verfolgte einen rekursiven Selbstverbesserungsrahmen mit innerer Forschungsschleife und äußerer Verbesserungsschleife; ein autonomes Kontext-Update-Werkzeug komprimierte die wachsende Interaktionshistorie in einen kompakten Verbesserungszustand, der verifizierte Evidenz und ungelöste Einschränkungen bewahrte. Trainiert wurde AREX auf verifizierten synthetischen Aufgaben und hochwertigen Trajektorien durch agentisches Mid-Training und langfristiges Reinforcement Learning. AREX-2 setzt dagegen auf ein dichtes 27B-Modell, das speziell auf langfristige Selbstverbesserung durch Reflexion und Ausführung über viele Runden trainiert wurde. Statt eines großen MoE-Modells kommt ein kompakteres dichtes Modell zum Einsatz, das dennoch eine Kontextlänge von 262.144 Token aufweist. Der Paradigmenwechsel liegt in der Trainingszielsetzung: AREX-2 lernt Selbstverbesserung anhand von Machine-Learning- und Programmieraufgaben mit verifizierbarem Feedback und überträgt dieses Verhalten auf Deep Research, ohne neue Suchtrajektorien hinzuzufügen.

Offene Fragen: Repo-Inhalt und Namenskollision

Zwei Punkte bleiben offen. Erstens ist die Verfügbarkeit und der Inhalt des Hugging-Face-Repos widersprüchlich. Es existiert eine Modellkarte mit technischen Details zu AREX-2, darunter Parameterzahl, Architektur und Benchmarks. Eine Beobachtung beschreibt das Repository jedoch als leer: Es enthalte nur eine .gitattributes-Datei, keine Modellkarte, keine Lizenzangabe und keine Ankündigung; die Modelldaten umfassten null Byte. Möglicherweise wurde die Modellkarte nach dieser Beobachtung hinzugefügt, oder es handelt sich um unterschiedliche Repositories oder Zeitpunkte. Zweitens besteht Verwechslungsgefahr mit anderen Produkten namens 'Arex'. Eine Verbraucher-App von Anuvyx bietet Modelle wie 'Arex 2', 'Arex 2 Gold' und weitere an. Zusätzlich existiert ein koreanisches AREX-System für Krypto-Dienste im Zusammenhang mit dem TTT Coin. Die hier beschriebenen technischen Angaben beziehen sich ausschließlich auf das BAAI-Modell.

A
Andreas Rüdiger
Herausgeber & Redaktionsleitung · KI-Modelle, Technik & Business

Andreas Rüdiger ist Gründer der Agentur INREMA und verantwortet KI Spotlight redaktionell. Sein Schwerpunkt liegt auf KI-Modellen, Recheninfrastruktur, technischen Entwicklungen und der wirtschaftlichen Einordnung. Er sorgt dafür, dass komplexe KI-Themen verständlich und nachvollziehbar aufbereitet werden. Mehr zu ihm auf inrema.de und andiger.de.

Ähnliche Artikel