Live Anthropic macht Auto-Modus in Claude Code zum Standard

GPT-5.5 Thinking gewinnt WM-2026-Benchmark – als einziges Modell mit Spanien als Weltmeister

GPT-5.5 Thinking hat in einem Benchmark mit zehn KI-Assistenten die höchste Punktzahl bei der Vorhersage der FIFA-Weltmeisterschaft 2026 erzielt und war das einzige Modell, das Spanien als Weltmeister tippte.

Veröffentlicht: 08.08.2026 ·1 Min Lesezeit
GPT-5.5 Thinking gewinnt WM-2026-Benchmark – als einziges Modell mit Spanien als WeltmeisterMit KI erstellt
Inhalt
◆ Fakten auf einen Blick
  • GPT-5.5 Thinking erreichte in einem Benchmark mit zehn KI-Assistenten die höchste Gesamtpunktzahl bei der Vorhersage der FIFA-Weltmeisterschaft 2026.
  • Das Modell erzielte 744 Punkte und lag damit vor GPT-5.5 (717 Punkte), Gemini (699 Punkte) und Qwen 3.7.
  • GPT-5.5 Thinking war das einzige Modell, das Spanien als Weltmeister vorhersagte; in der simulierten Auswertung gewann Spanien das Finale mit 1:0 gegen Argentinien.
  • Claude Sonnet 4.6 erzielte mit 63,89 % die höchste Trefferquote bei den Gruppenspielen.
  • Der Benchmark umfasste eine einmalige Turnierprognose vor Beginn der WM und wertete alle 104 tatsächlich gespielten Partien aus.

GPT-5.5 Thinking setzt sich an die Spitze

In einem Benchmark mit zehn großen Sprachmodellen zur Vorhersage der gesamten FIFA-Weltmeisterschaft 2026 hat GPT-5.5 Thinking die höchste Gesamtpunktzahl erzielt. Das Modell erreichte 744 Punkte und verwies damit GPT-5.5 (717 Punkte) und Gemini (699 Punkte) auf die Plätze. Der Vergleich, der als „AI World Cup 2026“-Benchmark dokumentiert ist, zeigt erstmals systematisch, wie unterschiedlich die Modelle bei einer einmaligen Turnierprognose abschneiden.

Spanien als einziger Weltmeister-Tipp

Bemerkenswert ist die Spitzenplatzierung vor allem wegen der Weltmeister-Prognose: GPT-5.5 Thinking war das einzige der zehn Modelle, das Spanien als Turniersieger vorhersagte. In der simulierten Auswertung gewann Spanien das Finale mit 1:0 gegen Argentinien. Kein anderes Modell tippte auf diesen Ausgang, was den Vorsprung in der Gesamtwertung erklärt.

Claude Sonnet 4.6 bei Gruppenspielen vorn

Bei der Vorhersage der einzelnen Gruppenspiele zeigte sich ein anderes Bild: Hier erzielte Claude Sonnet 4.6 mit einer Trefferquote von 63,89 Prozent den höchsten Wert. Das Modell lag damit in der Genauigkeit für die frühe Turnierphase vor der Konkurrenz, konnte diesen Vorteil aber nicht in eine führende Gesamtpunktzahl ummünzen.

So lief der Benchmark ab

Für den Benchmark gaben die zehn KI-Assistenten vor Beginn der Weltmeisterschaft eine einmalige Prognose für das gesamte Turnier ab. Nachdem alle 104 tatsächlich gespielten Partien absolviert waren, wurden die Vorhersagen mit den realen Ergebnissen abgeglichen und in ein Punktesystem überführt. Die Methodik ist in einem wissenschaftlichen Paper beschrieben, das den Vergleich als „AI World Cup 2026“-Benchmark bezeichnet. Details zur Zusammensetzung der Punktwertung oder zu den übrigen Modellen gehen aus den vorliegenden Informationen nicht hervor.

Quellen

  1. kiweekly.de ↗

Ähnliche Artikel