Live Richterin erklärt Pentagon-Strafen gegen Anthropic für illegal

LFM2.5-DSpark beschleunigt LLM-Inferenz um bis zu Faktor 3,18

Herstellerangaben zu Durchsatzsteigerungen, Latenzreduktion bei Funktionsaufrufen und Integration in llama.cpp und SGLang

· Veröffentlicht: 21.08.2026 ·1 Min Lesezeit
LFM2.5-DSpark beschleunigt LLM-Inferenz um bis zu Faktor 3,18Mit KI erstellt
◆ Fakten auf einen Blick
  • LFM2.5-DSpark bietet bis zu 3,18-fache Durchsatzsteigerung auf einer GPU.
  • LFM2.5-DSpark bietet bis zu 2,87-fache Durchsatzsteigerung auf dem Gerät.
  • LFM2.5-DSpark reduziert die Latenz bei Funktionsaufrufen um durchschnittlich 57% für LFM2.5-2.6B.
  • LFM2.5-DSpark unterstützt llama.cpp und SGLang ab dem ersten Tag; die LFM-kompatible DSpark-Integration ist Open Source und upstream verfügbar.

Bis zu 3,18-facher Durchsatz auf GPUs und 2,87-fach auf Geräten

LFM2.5-DSpark ist eine vom Hersteller vorgestellte Optimierung für die Inferenz großer Sprachmodelle. Laut Herstellerangabe erreicht sie auf einer einzelnen GPU eine bis zu 3,18-fache Steigerung des Durchsatzes im Vergleich zur herkömmlichen Inferenz. Auf Endgeräten wird eine Steigerung um den Faktor 2,87 angegeben. Die Optimierung setzt an der Dekodierphase an, die bei der LLM-Inferenz traditionell durch den Speicherdurchsatz begrenzt ist: Der Großteil der Latenz entsteht beim Streamen der Gewichte aus dem DRAM in den SRAM, nicht durch rechenintensive Operationen. DSpark nutzt spekulatives Dekodieren, bei dem ein leichtgewichtiges Entwurfsmodell mehrere Kandidaten-Token erzeugt und das Zielmodell diese anschließend in einem Schritt verifiziert, statt jedes Token einzeln zu dekodieren. Die genannten Durchsatzwerte sind Herstellerangaben und wurden nicht unabhängig verifiziert.

57% weniger Latenz bei Funktionsaufrufen und Integration in llama.cpp und SGLang

Für das Modell LFM2.5-2.6B gibt der Hersteller an, dass DSpark die Latenz bei Funktionsaufrufen im Durchschnitt um 57 Prozent senkt. Diese Reduktion wird durch den Einsatz von spekulativem Dekodieren ermöglicht, bei dem ein leichtgewichtiges Entwurfsmodell Kandidaten-Token erzeugt und das Zielmodell diese verifiziert, wodurch die speichergebundene Dekodierphase beschleunigt wird. Das zielt auf agentische Inferenz auf Geräten ab, bei der Modelle wiederholt externe Funktionen aufrufen und niedrige Antwortzeiten entscheidend sind. Die Integration ist ab dem ersten Tag für llama.cpp und SGLang verfügbar. Die LFM-kompatible DSpark-Implementierung ist Open Source und bereits im Haupt-Repository der jeweiligen Projekte enthalten, sodass Entwickler die Optimierung ohne zusätzliche Installationsschritte nutzen können. Auch diese Angaben stammen vom Hersteller und wurden nicht unabhängig überprüft.

J
Jasmin Freitag
Redaktion · KI-Anwendungen & Tools

Jasmin Freitag beobachtet für KI Spotlight die praktische Seite der künstlichen Intelligenz: neue Anwendungen, generative Werkzeuge, kreative KI und den Einsatz von Tools im Alltag und in Unternehmen. Sie erklärt praxisnah, was ein Werkzeug wirklich taugt.

Ähnliche Artikel