Live ChatGPT verweigert Tool-Calls für app-only MCP-Tools

Benchmark-Sammlung

Bündel von Tests für eine breite Bewertung.

Aktualisiert: 12.07.2026

Eine Benchmark-Sammlung fasst mehrere Tests zusammen, um ein Modell über verschiedene Fähigkeiten hinweg zu bewerten, statt sich auf eine einzelne Kennzahl zu verlassen. Sie gibt ein umfassenderes Bild, kann aber ebenfalls in die Irre führen, wenn Modelle gezielt auf die enthaltenen Aufgaben optimiert werden.