Liquid AI veröffentlicht zwei offene Entscheidungsmodelle
d1-3B und d1-omni-600M sind als Open-Weight-Modelle auf Hugging Face verfügbar – d1-3B ist das erste offene 3B-Modell der d1-Familie, d1-omni-600M ein experimentelles Modell mit Audio-Unterstützung.
Mit KI erstelltInhalt
◆ Fakten auf einen Blick
- Liquid AI hat am 7. Oktober zwei Open-Weight-Modelle der d1-Familie veröffentlicht: d1-3B und d1-omni-600M.
- d1-3B ist ein 3B-Parameter-Entscheidungsmodell, basierend auf LFM2.5-VL-3B, und akzeptiert Text und Bilder.
- d1-omni-600M ist ein experimentelles Modell, basierend auf LFM2.5-Encoder-350M, und akzeptiert entweder Text+Bild oder Text+Audio.
- Entscheidungsmodelle der d1-Familie erzeugen keine Token, sondern antworten in einem einzigen Vorwärtsdurchlauf.
- d1-3B erreicht 48,57 auf dem Decision Index v0.2.1 (public split).
- d1-3B erreicht einen Mittelwert von 82,9 über sieben öffentliche Datensätze.
Liquid AI veröffentlicht zwei offene Entscheidungsmodelle
Liquid AI hat am 7. Oktober zwei Open-Weight-Modelle seiner d1-Familie auf Hugging Face veröffentlicht: d1-3B und das experimentelle d1-omni-600M. d1-3B ist das erste offene Modell der Familie mit 3 Milliarden Parametern und akzeptiert Text und Bilder. d1-omni-600M ist ein experimentelles Modell, das entweder Text plus Bild oder Text plus Audio verarbeitet. Nur d1-omni-600M unterstützt Audio; d1-3B ist auf Text und Bild beschränkt. d1-3B basiert auf dem Vision-Language-Modell LFM2.5-VL-3B, d1-omni-600M auf dem bidirektionalen Encoder LFM2.5-Encoder-350M. Beide Modelle sind für Edge-Geräte optimiert und antworten in einem einzigen Vorwärtsdurchlauf statt Token zu generieren. Die Veröffentlichung erfolgte zwei Tage nach der Ankündigung einer API-gehosteten d1-Version. Entwickler können die Modelle lokal ausführen, Demos finden sich im Open d1 Arcade.
Technik: Ein Durchlauf statt Token-Generierung
Entscheidungsmodelle der d1-Familie erzeugen keine Token, sondern antworten in einem einzigen Vorwärtsdurchlauf. Die Antworten werden direkt aus den Logits am Antwort-Slot abgelesen; es wird nichts dekodiert, wodurch Schemaverletzungen ausgeschlossen sind. d1-3B akzeptiert Text und Bilder als Eingabe, d1-omni-600M entweder Text plus Bild oder Text plus Audio. d1-3B hat 3,12 Milliarden Parameter, einen Vision-Encoder SigLIP2 NaFlex 400M, eine Kontextlänge von 32.768 Tokens und einen Wortschatz von 128.000. Liquid AI gibt für d1-3B einen Wert von 48,57 auf dem Decision Index v0.2.1 an, für d1-omni-600M 15,95. Über sieben öffentliche Datensätze, die Leseverständnis, Toxizitätserkennung, Intent-Klassifikation, medizinische QA und sprachübergreifendes Verständnis umfassen, erreicht d1-3B einen Mittelwert von 82,9, d1-omni-600M 78,4. Für d1-3B nennt Liquid AI Latenzen von 8 ms auf einer NVIDIA RTX 4090, 16 ms auf Jetson AGX Thor, 26 ms auf Jetson AGX Orin und 50 ms auf Jetson Orin Nano. Das Modell beantwortet Ja/Nein-Fragen, Auswahl aus benannten Optionen oder Bewertungen und schreibt keinen Text. d1-3B erreicht auf elf öffentlichen Bildbenchmarks einen Wert von 74,1. Nach Angaben von Liquid AI ist d1-3B das beste Entscheidungsmodell unter 10 Milliarden Parametern auf diesem Index. d1-omni-600M erreicht mit einem Viertel der Parameter von Decider 2B einen höheren Mittelwert (78,4 gegenüber 77,1).
Bezug über Hugging Face und Quantisierungsoptionen
Beide Modelle sind auf Hugging Face verfügbar, Demos finden sich im Open d1 Arcade. Der Download ist über die Webseite, die Hugging-Face-CLI oder curl möglich. Die Lizenz ist als 'other' mit license_name 'lfm1.0' angegeben. Für d1-3B gibt es eine INT8-quantisierte Version d1-3B-w8a8 für NVIDIA Jetson und GPUs ab Ampere; sie benötigt 3,8 GB statt 6,2 GB für den bf16-Checkpoint und lädt ohne Kalibrierung zur Laufzeit. Zusätzlich existiert eine MLX-native 8-bit-Konvertierung für Apple Silicon mit 3,72 GB. Die Quantisierung betrifft die Sprachmodell-Gewichte; Vision-Tower und Layer-Norms bleiben in BF16. Für andere Geräte empfiehlt Liquid AI die Basisversion d1-3B. Die offenen Gewichte erlauben die lokale Ausführung auf eigener Hardware.



