Cloudflare erweitert AI Gateway Custom Costs um Cache-Token-Raten
Neue optionale Felder für Cache-Read- und Cache-Write-Token ermöglichen präzise Abrechnung ausgehandelter Preise über Anbieter hinweg.
Mit KI erstellt◆ Fakten auf einen Blick
- AI Gateway custom costs unterstützen jetzt cache-read und cache-write Token-Raten.
- Die neuen Raten können über die Header-Felder per_cache_read_token und per_cache_write_token im cf-aig-custom-cost Header gesetzt werden.
- Cache-Token-Pricing aktiviert sich, wenn mindestens eine der beiden Cache-Raten angegeben wird.
- Wird nur eine Cache-Rate angegeben, wird die andere standardmäßig auf den Wert von per_token_in gesetzt.
- Wenn beide Cache-Raten weggelassen werden, behält AI Gateway die bestehende Berechnung auf Basis von Eingabe- und Ausgabe-Token bei.
- Anbieter können Cache-Tokens innerhalb der Input-Tokens melden oder separat ausweisen. AI Gateway berücksichtigt diese Unterschiede automatisch und verhindert Doppelzählung.
Cloudflare erweitert Custom Costs um Cache-Token-Raten
Cloudflare hat die Custom Costs im AI Gateway erweitert. Bislang konnten im `cf-aig-custom-cost`-Header die Felder `per_token_in` und `per_token_out` gesetzt werden. Neu hinzugekommen sind die optionalen Felder `per_cache_read_token` und `per_cache_write_token`. Damit können Nutzer ausgehandelte Cache-Preise über verschiedene KI-Anbieter hinweg korrekt abbilden. Hintergrund ist, dass Anbieter Cache-Tokens unterschiedlich melden: Manche rechnen sie in die Input-Tokens ein, andere weisen sie separat aus. Die neuen Felder sollen Doppelzählungen vermeiden. Die Werte werden als JSON-Objekt im Header übergeben, etwa mit `per_token_in`, `per_token_out` sowie den neuen Cache-Feldern. Die neuen Felder werden im Abschnitt „Custom Costs“ der Cloudflare-Entwicklerdokumentation beschrieben.
So funktionieren die neuen Cache-Preisfelder
Das Cache-Token-Pricing wird aktiv, sobald mindestens eine der beiden Cache-Raten angegeben ist. Wird nur eine Rate gesetzt, übernimmt die andere standardmäßig den Wert von `per_token_in`. Fehlen beide Cache-Raten, behält AI Gateway die bisherige Berechnung auf Basis von Eingabe- und Ausgabe-Token bei. Anbieter können Cache-Tokens innerhalb der Input-Tokens melden oder separat ausweisen. AI Gateway berücksichtigt diese Unterschiede automatisch: Sind Cache-Tokens in den Input-Tokens enthalten, zieht das System sie vor der Anwendung von `per_token_in` ab; werden sie separat gemeldet, kommen ihre Kosten zusätzlich zu den Eingabekosten hinzu. So wird eine Doppelzählung verhindert. Custom Costs lassen sich auf Request-Ebene setzen und überschreiben dann die Standard- oder öffentlichen Modellkosten. Es gibt keine Begrenzung der Dezimalstellen, um präzise Berechnungen zu ermöglichen. AI Gateway ist auf allen Cloudflare-Plänen verfügbar; die Kernfunktionen sind kostenlos.



