Live ChatGPT verweigert Tool-Calls für app-only MCP-Tools

KV-Cache

Zwischenspeicher, der die Textausgabe beschleunigt.

Aktualisiert: 11.07.2026

Der KV-Cache speichert bei der Textgenerierung bereits berechnete Zwischenergebnisse der Attention, damit das Modell sie nicht bei jedem neuen Token erneut berechnen muss. Das beschleunigt die Ausgabe erheblich, benötigt aber zusätzlichen Speicher, der mit der Länge des Textes wächst.