OpenAI verbessert Prompt-Caching für GPT-6: Bis zu 90 Prozent Rabatt und neue Steuerung
Die GPT-6-Familie bringt ein überarbeitetes Caching-System mit höheren Hit-Raten, neuen Diagnose-Tools und expliziten Breakpoints. Die Preise für Astra, Sol und Luna im Überblick.
Mit KI erstelltInhalt
◆ Fakten auf einen Blick
- OpenAI hat ein verbessertes Prompt-Caching-System für GPT-6 eingeführt.
- Das System liefert höhere Cache-Hit-Raten standardmäßig.
- Rabatte für geteilte Präfixe werden innerhalb eines 30-Minuten-Fensters gewährt.
- Bis zu 90% Rabatt auf gecachte Eingabetoken sind möglich.
- Neue Tools: Prompt Caching Dashboard und Prompt Cache Diagnostics Tool wurden eingeführt.
- Prompt Caching ist standardmäßig für unterstützte OpenAI-Modelle aktiviert.
OpenAI führt verbessertes Prompt-Caching für GPT-6 ein
OpenAI hat im Zuge der Einführung der GPT-6-Modellfamilie ein überarbeitetes Prompt-Caching-System vorgestellt. Laut der Ankündigung des Unternehmens liefert das System standardmäßig höhere Cache-Hit-Raten als zuvor. Rabatte für geteilte Präfixe werden innerhalb eines 30-Minuten-Fensters gewährt, wenn dieselben Eingabetoken erneut verwendet werden. Auf gecachte Eingabetoken sind dabei Nachlässe von bis zu 90 Prozent möglich.
Neu sind zudem zwei Werkzeuge zur Überwachung und Fehlersuche: Das Prompt Caching Dashboard zeigt an, welcher Anteil der Eingaben einer Anwendung aus dem Cache bedient wird, und erlaubt die Verfolgung von Hit-Raten über die Zeit. Eine Eingabezusammensetzungsgrafik vergleicht gecachte und ungecachte Token, sodass Entwickler Einbrüche bei den Cache-Hits erkennen und bewerten können, wie sich Änderungen an ihrer Anwendung auf die Caching-Performance auswirken. Ein separates Diagnose-Tool hilft Entwicklern, unerwartete Cache-Misses zu analysieren, indem es eine Anfrage mit einer früheren Antwort vergleicht und Änderungen an Modell, Werkzeugen, Einstellungen oder Eingaben identifiziert, die eine Wiederverwendung verhindert haben. Die geschätzte Anzahl betroffener Token wird dabei angezeigt.
Prompt Caching ist laut der offiziellen Dokumentation für alle unterstützten OpenAI-Modelle standardmäßig aktiviert. Das gilt auch für Aufrufe über die Agents API, die dasselbe Verhalten wie die Responses API aufweisen. Die Preise für gecachte Eingaben und Cache-Writes variieren je Modell und sind in der API-Preisübersicht hinterlegt. OpenAI betont, dass das Caching die Rechenlast reduziert, Eingabetoken billiger macht und die Antwortzeiten verkürzt, da die Vorverarbeitung des Präfixes entfällt. Für persistente Agenten, die stundenlang an komplexen Aufgaben arbeiten und dabei wiederholt dieselben Anweisungen, Tool-Definitionen und Kontexte mitführen, ist das Caching ein zentraler Baustein.
Preisstruktur der GPT-6-Modelle: Astra, Sol und Luna im Vergleich
Die GPT-6-Familie umfasst drei Modelle mit deutlich unterschiedlichen Preisniveaus. Das Flaggschiff GPT-6 Astra, das am 3. September 2026 veröffentlicht wurde, kostet 10 US-Dollar pro Million Eingabetoken und 50 US-Dollar pro Million Ausgabetoken. Für gecachte Eingabetoken werden 1 US-Dollar berechnet, für Cache-Writes 12,50 US-Dollar pro Million Token. Diese Angaben stammen aus Fachberichten, die sich auf die Preisliste und Dokumentation von OpenAI stützen. Der gecachte Eingabepreis von 1 US-Dollar entspricht exakt einem Rabatt von 90 Prozent gegenüber dem regulären Eingabepreis.
Die beiden kleineren Modelle GPT-6 Sol und GPT-6 Luna wurden am 22. September 2026 eingeführt. Sol kostet 2 US-Dollar pro Million Eingabetoken und 10 US-Dollar pro Million Ausgabetoken. Luna ist mit 0,10 US-Dollar pro Million Eingabetoken und 0,50 US-Dollar pro Million Ausgabetoken das günstigste Modell der Familie. Beide Preise liegen damit 50 Prozent unter den bisherigen Promotionspreisen der entsprechenden GPT-5.6-Modelle. OpenAI begründet die Reduktion mit Verbesserungen bei Caching und Inferenz, deren Einsparungen direkt an die Kunden weitergegeben würden. Sam Altman schrieb auf X, die Modelle seien „half the price per token, and even less per task“.
Für Sol und Luna sind in den vorliegenden Quellen keine separaten Preise für gecachte Eingabetoken oder Cache-Writes ausgewiesen. Die offizielle Ankündigung spricht zwar von einem Rabatt von 90 Prozent auf gecachte Eingabetoken für die gesamte GPT-6-Familie, nennt aber keine absoluten Zahlen für die beiden kleineren Modelle. Daher können diese konkreten Werte hier nicht aufgelistet werden. Bei Astra entspricht der gecachte Eingabepreis von 1 US-Dollar genau diesem Abschlag gegenüber dem regulären Eingabepreis von 10 US-Dollar. Ob für Sol und Luna ähnliche proportionale Rabatte gelten, geht aus den Belegen nicht hervor. Ebenso fehlen Angaben zu Cache-Write-Gebühren für Sol und Luna; für Astra beträgt der Cache-Write-Preis 12,50 US-Dollar pro Million Token und liegt damit über dem regulären Eingabepreis von 10 US-Dollar.
Beide neuen Modelle verfügen laut API-Dokumentation über ein Kontextfenster von 1.050.000 Token und eine maximale Ausgabelänge von 128.000 Token. Sol wird als Modell für komplexe Coding- und Agentic-Workflows beschrieben, Luna als effizientestes Modell für fokussierte, hochvolumige Aufgaben wie Dokumentenzusammenfassung oder kurze Antworten. Astra bleibt laut OpenAI das beste Modell für anspruchsvollste Projekte. Die Modelle sind ab dem 22. September in ChatGPT Work und Codex für Plus-, Pro-, Business-, Enterprise- und Edu-Konten verfügbar; Free- und Go-Nutzer erhalten Luna in der Desktop-App.
Explizite Breakpoints: Entwickler behalten Kontrolle über Cache-Präfixe
Entwickler können bei GPT-6 explizite Breakpoints setzen, um festzulegen, wo ein gecachter Präfix endet. Das geht aus der Ankündigung von OpenAI hervor, die im Zusammenhang mit der Einführung von Sol und Luna veröffentlicht wurde. Bisher bestimmte das System automatisch, welcher Teil der Eingabe als gemeinsamer Präfix wiederverwendet werden konnte. Mit den Breakpoints erhält der Entwickler die Kontrolle darüber, wie viel eines Prompts gecacht wird.
Der praktische Nutzen entsteht dadurch, dass ein Breakpoint dem System eine eindeutige Grenze vorgibt: Alles vor dem Breakpoint wird als fester, wiederverwendbarer Präfix behandelt, alles danach als variabler Teil. Wenn ein Entwickler weiß, dass bestimmte Abschnitte seiner Anfragen – etwa Systemanweisungen, Tool-Definitionen oder umfangreiche Kontextblöcke – über viele Aufrufe hinweg unverändert bleiben, kann er den Breakpoint genau hinter diesen Abschnitt setzen. Dadurch wird der Cache-Hit wahrscheinlicher, weil das System nicht raten muss, welcher Teil der Eingabe als Präfix in Frage kommt, sondern eine klare Vorgabe erhält. Gleichzeitig verhindert der Breakpoint, dass variable Abschnitte, die sich bei jedem Aufruf ändern, fälschlich in den Präfix aufgenommen werden. Solche variablen Teile würden sonst bei jeder Änderung einen neuen Cache-Write auslösen, weil der bisherige Präfix nicht mehr passt. Durch die explizite Trennung lassen sich also sowohl die Trefferquote erhöhen als auch unnötige Schreibvorgänge vermeiden. In der Ankündigung wird zudem erwähnt, dass Entwickler auch den Reasoning-Aufwand ändern können, was zusätzliche Flexibilität bei der Steuerung von Kosten und Leistung bietet.
Allerdings sind Cache-Writes nicht kostenlos. Für GPT-6 Astra werden laut Fachberichten 12,50 US-Dollar pro Million Token für das Schreiben in den Cache fällig. Wer viele unterschiedliche Präfixe erzeugt oder Breakpoints häufig verschiebt, kann daher zusätzliche Kosten verursachen. Ob für Sol und Luna vergleichbare Gebühren anfallen, ist aus den vorliegenden Quellen nicht ersichtlich. Die explizite Steuerung durch Breakpoints kann helfen, diese Kosten zu minimieren, indem nur tatsächlich wiederverwendete Abschnitte gecacht werden.
Cache-Gültigkeitsdauer: 30 Minuten oder 5 Minuten? Ein Widerspruch
In der offiziellen Ankündigung zum verbesserten Prompt-Caching für GPT-6 nennt OpenAI ein 30-Minuten-Fenster, innerhalb dessen Rabatte für geteilte Präfixe gewährt werden. Das bedeutet: Wird derselbe Präfix innerhalb einer halben Stunde erneut verwendet, gilt der vergünstigte Preis für gecachte Eingabetoken. Diese Angabe stammt direkt vom Hersteller und bezieht sich auf das neue System der GPT-6-Familie.
Dem steht eine Aussage in einem Reddit-Beitrag gegenüber, der von einer 5-Minuten-TTL (Time-to-Live) für den Cache spricht. Der Beitrag stammt aus dem Subreddit r/LLMDevs und datiert vom 29. August 2026 – also vor der Einführung von GPT-6 Astra am 3. September. Der Nutzer beschreibt, dass viele Entwickler kleine Keepalive-Skripte einsetzen, um den Cache am Leben zu halten, und stellt fest, dass das eigentliche Problem nicht die Ablaufzeit von fünf Minuten sei, sondern dass diese Skripte nicht wirklich effektiv sind.
Der Widerspruch lässt sich auf verschiedene Weise erklären. Zum einen könnte sich der Reddit-Nutzer auf eine ältere Implementierung des Cachings beziehen, die vor der GPT-6-Familie galt. Zum anderen ist denkbar, dass es unterschiedliche Cache-Ebenen gibt – etwa einen Prefix-Cache mit längerer Gültigkeit und einen Session-Cache mit kürzerer TTL. Die vorliegenden Belege reichen nicht aus, um zu klären, welche Erklärung zutrifft. Fest steht nur, dass die offizielle Angabe für das neue System 30 Minuten lautet, während die Community-Quelle eine kürzere Zeitspanne nennt. Da der Reddit-Beitrag zeitlich vor der GPT-6-Veröffentlichung liegt, ist es plausibel, dass er sich auf das vorherige Caching-System bezieht. Eine abschließende Bewertung ist auf Basis der vorhandenen Informationen nicht möglich.
Auswirkungen: Wer profitiert, wer verliert, und der Druck auf die Konkurrenz
Von dem verbesserten Prompt-Caching profitieren vor allem Entwickler, deren Anwendungen wiederholt dieselben Präfixe verwenden – etwa bei langlaufenden Agenten, die über viele API-Aufrufe hinweg denselben Kontext, dieselben Anweisungen und Tool-Definitionen mitführen. Für sie sinken die Kosten durch den Rabatt von bis zu 90 Prozent auf gecachte Eingabetoken erheblich, und die Antwortzeiten verkürzen sich, weil die Vorverarbeitung des Präfixes entfällt. Die neuen Überwachungswerkzeuge helfen zudem, Cache-Misses zu erkennen und die Wiederverwendungsrate zu optimieren. OpenAI weist darauf hin, dass GPT-6 persistente Agenten unterstützt, die stundenlang an komplexen Aufgaben arbeiten, und dass das Caching dabei eine zentrale Rolle spielt.
Nachteilig könnte das System für Nutzer sein, deren Kontext sich häufig ändert. Wer bei jedem Aufruf einen neuen oder stark veränderten Präfix sendet, erzeugt Cache-Writes, die – zumindest bei GPT-6 Astra – mit 12,50 US-Dollar pro Million Token zu Buche schlagen. Das ist mehr als der reguläre Eingabepreis von 10 US-Dollar pro Million Token. In Szenarien mit vielen kurzen, kontextwechselnden Anfragen können diese Schreibkosten die Einsparungen durch gecachte Reads übersteigen. Ein Reddit-Nutzer wies bereits auf diese versteckte Preiskomplexität hin und betonte, dass lange Agenten-Schleifen mit häufigem Kontext-Rewriting teurer werden können.
Für Wettbewerber erhöht sich der Druck durch zwei miteinander verbundene Mechanismen. Erstens senkt OpenAI mit Sol und Luna die Listenpreise für den Einstieg in die GPT-6-Familie um 50 Prozent gegenüber den GPT-5.6-Promotionspreisen, wodurch die Hürde für Entwickler sinkt, auf die neuen Modelle zu wechseln. Zweitens reduziert das verbesserte Caching die effektiven Kosten für wiederholte Anfragen zusätzlich: Wer denselben Präfix innerhalb von 30 Minuten erneut sendet, zahlt nur 10 Prozent des regulären Eingabepreises. Diese Kombination aus niedrigeren Grundpreisen und hohen Cache-Rabatten macht OpenAI für Anwendungen mit agentenbasierten Workloads besonders attraktiv, weil dort typischerweise lange Konversationen mit stabilem Kontext anfallen. Anbieter, die ähnliche Dienste anbieten, müssen daher vergleichbare Preisnachlässe und Caching-Vorteile bieten, um für Entwickler wirtschaftlich konkurrenzfähig zu bleiben. Ob und wie sie darauf reagieren, ist aus den vorliegenden Belegen nicht ersichtlich.



