Token-Einsparungen durch Memory-Layer: Je nach Zählmethode 91 bis 93,9 Prozent
Ein mit Belcore verbundener Autor veröffentlicht einen Messpost, der zeigt, dass die Token-Einsparungen durch die Belcore-Memory-Layer je nach Zählmethode unterschiedlich ausfallen: von 93,9% bei Kontext-Token bis etwa 91% bei abgerechneten Input-Token in einer handverlesenen Teilmenge. Der Beitrag
Mit KI erstelltInhalt
◆ Fakten auf einen Blick
- Der Messpost stammt von einem Autor, der angibt, mit Belcore verbunden zu sein.
- Der Benchmark verwendete den Datensatz LongMemEval_S mit 500 Fragen und etwa 109k Token vorheriger Konversation pro Frage (ca. 500 Runden).
- Das Antwortmodell war gpt-5, mit festem Seed und eingefrorenem Harness.
- Der Tokenizer für Kontextzählungen war o200k_base.
- Die Läufe fanden im August 2026 statt.
- Bei voller, ungeschnittener Transkription betrugen die Token pro Aufruf 109.079.
Messpost zeigt Token-Einsparungen je nach Zählmethode
Ein mit Belcore verbundener Autor hat erstmals konkrete Benchmark-Zahlen zu Token-Einsparungen durch die Memory-Layer des Unternehmens veröffentlicht. Je nach Zählmethode fallen die Einsparungen unterschiedlich aus: Bei den Kontext-Token beträgt die Reduktion 93,9 Prozent, bei den abgerechneten Input-Token in einer handverlesenen Teilmenge etwa 91 Prozent. Der Beitrag betont, dass die Wahl der Zählmethode die wahrgenommene Einsparung stark beeinflusst. Der Autor legt offen, mit Belcore verbunden zu sein, und bezeichnet den Beitrag ausdrücklich als Messpost.
Benchmark-Setup und konkrete Zahlen
Der Benchmark verwendete den Datensatz LongMemEval_S mit 500 Fragen und rund 109k Token vorheriger Konversation pro Frage. Als Antwortmodell diente gpt-5 mit festem Seed und eingefrorenem Harness. Für die Kontextzählungen kam der Tokenizer o200k_base zum Einsatz. Die Läufe fanden im August 2026 statt. Bei voller, ungeschnittener Transkription betrugen die Token pro Aufruf 109.079. Bei zusammengestelltem Memory-Kontext waren es 6.671 Token. In der 27-Fragen-Teilmenge, bei der der abgerechnete Input inklusive Prompt und Frage gezählt wurde, lagen die Token pro Aufruf bei 9.908. Daraus ergeben sich die genannten Einsparungen von 93,9 Prozent bei den Kontext-Token und etwa 91 Prozent beim abgerechneten Input.
Einschränkungen und offene Fragen
Der Autor weist auf mehrere Einschränkungen hin. Die Teilmenge für die abgerechnete Input-Messung war handverlesen und daher nur als indikativ zu betrachten. Der Beitrag macht keine Aussage zur Antwortqualität; Genauigkeit sei eine separate Metrik und werde nicht zitiert. Die Kosten pro erfolgreicher Aufgabe, einschließlich Wiederholungen und Korrekturen, wurden noch nicht gemessen. LongMemEval_S ist ein öffentlicher Benchmark und kein Produktionsverkehr. Zudem erwähnt der Autor, dass ein Ergebnis nicht hielt – der Text ist an dieser Stelle abgeschnitten, Details fehlen. Unklar ist auch die Identität von Belcore: Der Messpost beschreibt das Unternehmen als „a memory and context layer for LLM apps“, während ein LinkedIn-Profil ein belgisches Pre-Startup namens Belcore Datalith mit Fokus auf Cybersicherheits-Assurance für SMEs und Verteidigungslieferketten zeigt. Ob es sich um dasselbe Unternehmen handelt, ist offen.



