Live ChatGPT verweigert Tool-Calls für app-only MCP-Tools

Benchmark-Kontamination

Testdaten sind versehentlich ins Training geraten.

Aktualisiert: 11.07.2026

Von Benchmark-Kontamination spricht man, wenn Aufgaben eines Tests bereits in den Trainingsdaten eines Modells enthalten waren. Das Modell erscheint dann besser, als es ist, weil es die Antworten teils auswendig gelernt hat. Sie ist ein ernstes Problem bei der fairen Bewertung von KI.