Live ChatGPT verweigert Tool-Calls für app-only MCP-Tools
KI-Lexikon Benchmark

HumanEval

Benchmark für die Programmierfähigkeit von Modellen.

Aktualisiert: 18.08.2026

HumanEval ist ein Testdatensatz, der misst, wie gut ein Sprachmodell Programmieraufgaben löst, indem der erzeugte Code automatisch gegen vorgegebene Tests geprüft wird. Er ist zu einem Standardmaß für die Coding-Fähigkeiten von KI-Modellen geworden.