Praktisk AI-förbättring

DSpark kan göra LFM2.5 upp till omkring tre gånger snabbare utan att byta modell

DSpark-draftmodeller för LFM2.5 gör speculative decoding praktiskt tillgängligt i SGLang och kan ge stora hastighetsvinster utan att byta huvudmodell.

Liten draftmodell som accelererar en större språkmodell

Nya DSpark-draftmodeller för Liquid AI:s LFM2.5-familj gör speculative decoding tillgängligt för flera LFM2.5-varianter i SGLang. Det betyder att samma huvudmodell kan producera svar snabbare genom att låta en mycket mindre draftmodell föreslå flera tokens som huvudmodellen sedan verifierar.

Det här är exakt den typ av teknisk förbättring som lätt ser obetydlig ut men som kan märkas direkt av användaren: samma modell, samma kvalitetsmål, mindre väntetid.

Illustration av en liten draftmodell som föreslår tokens åt en större språkmodell

Illustration: Speculative decoding låter en liten modell föreslå flera tokens som huvudmodellen verifierar.

Vad är DSpark?

DSpark är en speculative-decoding-metod som kombinerar snabb parallell draft-generering med adaptiv verifiering.

I stället för att huvudmodellen själv producerar varje token sekventiellt låter systemet en mindre draftmodell föreslå ett block med tokens. Huvudmodellen kontrollerar sedan förslagen i större grupper.

Om förslagen accepteras kan flera tokens produceras med färre dyra körningar av huvudmodellen.

Vad har blivit praktiskt tillgängligt?

På Hugging Face finns DSpark-draftmodeller för bland annat LFM2.5-1.2B-Instruct och LFM2.5-8B-A1B. Modellkorten visar färdiga SGLang-kommandon för att starta huvudmodell och DSpark-draft tillsammans.

python -m sglang.launch_server   --model-path LiquidAI/LFM2.5-8B-A1B   --speculative-algorithm DSPARK   --speculative-draft-model-path tugot17/LFM2.5-8B-A1B-DSpark-2L   --speculative-draft-attention-backend flashinfer

Det kräver en SGLang-version med stöd för DSpark och LFM2.

Hur mycket snabbare kan det bli?

I DeepSeeks DSpark-paper rapporteras 60–85 procent högre per-user generation speed jämfört med deras tidigare produktionsbaseline vid matchad throughput.

För LFM2.5 rapporteras i communitymaterial hastighetsvinster på upp till omkring 3,2× i vissa konfigurationer.

Den siffran ska inte behandlas som en garanti för varje dator eller workload. Prestandan påverkas av modellstorlek, draftmodell, GPU, batchstorlek, accept rate, contextlängd och serving-backend.

Varför är detta viktigt för lokal AI?

Lokal AI begränsas ofta av minnesbandbredd snarare än rå beräkningskraft. Varje gång den stora modellen måste läsa stora mängder vikter från minnet kostar det tid.

Om flera tokens kan verifieras per tung modellkörning används hårdvaran effektivare.

Det gör speculative decoding särskilt intressant för lokala assistenter, coding agents, privata chatbots, lokala API-servrar och realtidsflöden.

Diagram över vanlig autoregressiv decoding jämfört med speculative decoding

Illustration: Speculative decoding försöker få ut flera accepterade tokens per dyr körning av huvudmodellen.

Källor

  • Hugging Face paper page, DSpark: https://huggingface.co/papers/2607.05147
  • LFM2.5-8B-A1B DSpark model card: https://huggingface.co/tugot17/LFM2.5-8B-A1B-DSpark-2L
  • LFM2.5-1.2B-Instruct DSpark model card: https://huggingface.co/tugot17/LFM2.5-1.2B-Instruct-DSpark-5L
  • Communitydiskussion: https://www.reddit.com/r/LocalLLaMA/comments/1vtrecb/up_to_32x_faster_inference_with_lfm25dspark/

Läs mer om ämnet

LFM2.5 DSpark speculative decoding lokal AI SGLang

Källor