Live MHRA legt 44 Empfehlungen für KI-Regulierung im Gesundheitswesen vor

Cloudflare erweitert AI Gateway Custom Costs um Cache-Token-Raten

Neue optionale Felder für Cache-Read- und Cache-Write-Token ermöglichen präzise Abrechnung ausgehandelter Preise über Anbieter hinweg.

· Veröffentlicht: 10.09.2026 ·1 Min Lesezeit
Cloudflare erweitert AI Gateway Custom Costs um Cache-Token-RatenMit KI erstellt
◆ Fakten auf einen Blick
  • AI Gateway custom costs unterstützen jetzt cache-read und cache-write Token-Raten.
  • Die neuen Raten können über die Header-Felder per_cache_read_token und per_cache_write_token im cf-aig-custom-cost Header gesetzt werden.
  • Cache-Token-Pricing aktiviert sich, wenn mindestens eine der beiden Cache-Raten angegeben wird.
  • Wird nur eine Cache-Rate angegeben, wird die andere standardmäßig auf den Wert von per_token_in gesetzt.
  • Wenn beide Cache-Raten weggelassen werden, behält AI Gateway die bestehende Berechnung auf Basis von Eingabe- und Ausgabe-Token bei.
  • Anbieter können Cache-Tokens innerhalb der Input-Tokens melden oder separat ausweisen. AI Gateway berücksichtigt diese Unterschiede automatisch und verhindert Doppelzählung.

Cloudflare erweitert Custom Costs um Cache-Token-Raten

Cloudflare hat die Custom Costs im AI Gateway erweitert. Bislang konnten im `cf-aig-custom-cost`-Header die Felder `per_token_in` und `per_token_out` gesetzt werden. Neu hinzugekommen sind die optionalen Felder `per_cache_read_token` und `per_cache_write_token`. Damit können Nutzer ausgehandelte Cache-Preise über verschiedene KI-Anbieter hinweg korrekt abbilden. Hintergrund ist, dass Anbieter Cache-Tokens unterschiedlich melden: Manche rechnen sie in die Input-Tokens ein, andere weisen sie separat aus. Die neuen Felder sollen Doppelzählungen vermeiden. Die Werte werden als JSON-Objekt im Header übergeben, etwa mit `per_token_in`, `per_token_out` sowie den neuen Cache-Feldern. Die neuen Felder werden im Abschnitt „Custom Costs“ der Cloudflare-Entwicklerdokumentation beschrieben.

So funktionieren die neuen Cache-Preisfelder

Das Cache-Token-Pricing wird aktiv, sobald mindestens eine der beiden Cache-Raten angegeben ist. Wird nur eine Rate gesetzt, übernimmt die andere standardmäßig den Wert von `per_token_in`. Fehlen beide Cache-Raten, behält AI Gateway die bisherige Berechnung auf Basis von Eingabe- und Ausgabe-Token bei. Anbieter können Cache-Tokens innerhalb der Input-Tokens melden oder separat ausweisen. AI Gateway berücksichtigt diese Unterschiede automatisch: Sind Cache-Tokens in den Input-Tokens enthalten, zieht das System sie vor der Anwendung von `per_token_in` ab; werden sie separat gemeldet, kommen ihre Kosten zusätzlich zu den Eingabekosten hinzu. So wird eine Doppelzählung verhindert. Custom Costs lassen sich auf Request-Ebene setzen und überschreiben dann die Standard- oder öffentlichen Modellkosten. Es gibt keine Begrenzung der Dezimalstellen, um präzise Berechnungen zu ermöglichen. AI Gateway ist auf allen Cloudflare-Plänen verfügbar; die Kernfunktionen sind kostenlos.

J
Jasmin Freitag
Redaktion · KI-Anwendungen & Tools

Jasmin Freitag beobachtet für KI Spotlight die praktische Seite der künstlichen Intelligenz: neue Anwendungen, generative Werkzeuge, kreative KI und den Einsatz von Tools im Alltag und in Unternehmen. Sie erklärt praxisnah, was ein Werkzeug wirklich taugt.

Ähnliche Artikel