Live LangSmith führt smithtune ein: Fine-Tuning direkt aus Agenten-Trajektorien

Liquid AI veröffentlicht LFM2.5-VL-DSpark mit bis zu 3,13x schnellerer Decodierung

Das Beschleunigungsframework für Vision-Language-Modelle integriert sich nahtlos in llama.cpp, MLX-VLM und SGLang.

· Veröffentlicht: 24.09.2026 ·1 Min Lesezeit
Liquid AI veröffentlicht LFM2.5-VL-DSpark mit bis zu 3,13x schnellerer DecodierungMit KI erstellt
◆ Fakten auf einen Blick
  • LFM2.5-VL-DSpark ist ein Beschleunigungsframework für Vision-Language-Modelle.
  • Die Decode-Geschwindigkeit wird um bis zu 3,13x auf Geräten und 2,66x auf einer H100 erhöht.
  • End-to-End-Beschleunigungen betragen bis zu 2,62x auf Geräten und 2,27x auf H100.
  • Der Drafter fügt 280M Parameter hinzu, was 8,9% des 3B-Zielmodells entspricht.
  • Es gibt Day-one-Support für llama.cpp, MLX-VLM und SGLang.
  • Der Vision-Drafter verwendet dieselbe Architektur wie die Text-LFM2.5-DSpark-Drafter: Er erfasst Hidden States an festgelegten getappten Layern und konditioniert darauf, um einen Block von k Kandidaten-Token zu entwerfen.

Liquid AI veröffentlicht LFM2.5-VL-DSpark mit bis zu 3,13x schnellerer Decodierung

Liquid AI hat ein Beschleunigungsframework für Vision-Language-Modelle namens LFM2.5-VL-DSpark veröffentlicht. Es basiert auf spekulativer Dekodierung und erhöht die Inferenzgeschwindigkeit deutlich: Die Decode-Geschwindigkeit steigt nach Angaben des Unternehmens um bis zu 3,13x auf Geräten und um 2,66x auf einer Nvidia H100. End-to-End betragen die Beschleunigungen bis zu 2,62x auf Geräten und 2,27x auf der H100. Der Drafter fügt dem Zielmodell lediglich 280 Millionen Parameter hinzu – ein Zuwachs von 8,9 Prozent gegenüber dem 3B-Modell. Das Framework wird mit Day-one-Support für die Inferenz-Frameworks llama.cpp, MLX-VLM und SGLang ausgeliefert. Damit lässt sich die Beschleunigung direkt in bestehende Deployment-Pipelines integrieren, ohne dass Anpassungen am Zielmodell nötig sind. Die Ausgaben bleiben dabei unverändert, da spekulative Dekodierung nur Token emittiert, die das Zielmodell verifiziert hat.

Technische Details: 280M-Parameter-Drafter mit 4 Layern und Blockgröße 9

Der Vision-Drafter übernimmt die Architektur der Text-DSpark-Drafter: Er erfasst die Hidden States des Zielmodells an festgelegten getappten Layern und konditioniert darauf, um einen Block von k Kandidaten-Token zu entwerfen. Bild-Patches und Text-Token werden vor diesen Layern in eine gemeinsame Repräsentation projiziert, sodass der Drafter unabhängig von der Eingabemodalität auf Vektoren gleicher Dimensionalität arbeitet. Der Inferenzalgorithmus bleibt gegenüber den Textmodellen unverändert. Basierend auf Ablationen über 3, 4 und 5 Layer wurde ein vereinfachter Attention-only-Drafter mit 4 Layern und einer Blockgröße von 9 gewählt. Trainiert wurde mit einer Mischung aus Vision-Language-SFT-Daten, gewichtet nach erwarteten Workloads, über 10 Epochen. Die Akzeptanzrate verbesserte sich mit zusätzlichen Trainings-Tokens, bis abnehmende Erträge eintraten. Zur Inferenzzeit empfiehlt Liquid AI je nach Hardware eine Blockgröße von 8 oder 9.

A
Andreas Rüdiger
Herausgeber & Redaktionsleitung · KI-Modelle, Technik & Business

Andreas Rüdiger ist Gründer der Agentur INREMA und verantwortet KI Spotlight redaktionell. Sein Schwerpunkt liegt auf KI-Modellen, Recheninfrastruktur, technischen Entwicklungen und der wirtschaftlichen Einordnung. Er sorgt dafür, dass komplexe KI-Themen verständlich und nachvollziehbar aufbereitet werden. Mehr zu ihm auf inrema.de und andiger.de.

Ähnliche Artikel