Live ChatGPT verweigert Tool-Calls für app-only MCP-Tools

RULER

Long-Context-Benchmark mit mehreren synthetischen Abruf-, Tracking- und Aggregationsaufgaben.

Aktualisiert: 18.08.2026

Long-Context-Benchmark mit mehreren synthetischen Abruf-, Tracking- und Aggregationsaufgaben.

Ausführlich im Dossier: Wie große Sprachmodelle wirklich funktionieren