LFM2.5 blir upp till 3,2 gånger snabbare – DSpark accelererar lokal AI på Mac och GPU
Liquid AI har släppt DSpark draft-modeller för LFM2.5 som använder speculative decoding för att öka genereringshastigheten utan att ändra huvudmodellens
Liquid AI har släppt DSpark draft-modeller för LFM2.5 som använder speculative decoding för att öka genereringshastigheten utan att ändra huvudmodellens output vid greedy decoding.
I företagets tester når tekniken upp till 3,18 gånger högre throughput på GPU och upp till 2,87 gånger högre hastighet på lokal hårdvara. För LFM2.5-2.6B minskade function-calling-latensen med i genomsnitt 57 procent.
Stöd finns från start i llama.cpp och SGLang.

En liten modell gissar tokens i förväg
DSpark använder en betydligt mindre draft-modell som föreslår flera kommande tokens. Huvudmodellen verifierar sedan flera förslag i samma beräkningssteg.
Om ett förslag inte matchar huvudmodellens fördelning används huvudmodellens egen token. Vid greedy decoding blir tokenföljden därför enligt Liquid AI identisk med vanlig generering.
Draft-modellerna för LFM2.5-1.2B-Instruct, LFM2.5-2.6B och LFM2.5-8B-A1B ligger på ungefär 296–328 miljoner parametrar.
Över 160 tokens per sekund på M4 Max
Liquid AI testade llama.cpp och Metal på en MacBook Pro med M4 Max och FP16-GGUF.
För LFM2.5-2.6B gick HumanEval från 61 till 161 tokens per sekund. MATH500 gick från 61 till 137, GSM8K från 60 till 143 och MT-Bench från 62 till 123 tokens per sekund.
Genomsnittet i de redovisade testerna ökade från cirka 61 till 139 tokens per sekund, omkring 2,27 gånger.
Resultaten gäller den specifika M4 Max-konfigurationen och kan inte direkt överföras till andra Mac-modeller.
Även H100 får stor acceleration
GPU-testerna kördes med SGLang på en Nvidia H100 80 GB i BF16.
För LFM2.5-2.6B steg genomsnittet från 323 till 864 tokens per sekund i de redovisade testerna, cirka 2,67 gånger högre throughput.
Relevant för lokala AI-agenter
En agent kan behöva generera många korta verktygsanrop. Därför är minskad function-calling-latens viktig även när en vanlig chatt redan känns snabb.
Liquid AI uppger 57 procent lägre genomsnittlig latens för LFM2.5-2.6B i flera multi-tool-scenarier.
Att integrationen finns i llama.cpp gör tekniken särskilt relevant för lokal AI. Liquid AI har även publicerat GGUF-varianter av DSpark-modellerna på Hugging Face.
Källor
- Liquid AI/Hugging Face, Up to 3.2x Faster Inference with LFM2.5-DSpark, 20 augusti 2026: https://huggingface.co/blog/LiquidAI/lfm25-dspark
- Hugging Face, LFM2.5-8B-A1B-DSpark: https://huggingface.co/LiquidAI/LFM2.5-8B-A1B-DSpark