Nya 4-bitars LFM2.5-modeller behåller omkring 97 procent av BF16-prestandan
Liquid AI släpper 4-bitars LFM2.5-modeller tränade med Quantization-Aware Distillation – omkring 97 procent av BF16-prestandan med lägre minnesanvändning.
Liquid AI har släppt nya 4-bitarsversioner av flera LFM2.5-modeller som tränats med Quantization-Aware Distillation, QAD. Målet är att behålla den låga minnesanvändningen och höga hastigheten hos Q4_0-modeller samtidigt som mer av kvaliteten från modeller med högre precision bevaras.
I Liquid AI:s egna tester behåller de nya modellerna omkring 96,5–97,4 procent av respektive BF16-modells genomsnittliga benchmarkresultat.
Modellerna finns som GGUF-filer och kan köras med llama.cpp och andra kompatibla lokala AI-runtime.
Fyra LFM2.5-modeller har fått nya QAD-versioner
Liquid AI har släppt QAD Q4_0-checkpoints för:
- LFM2.5-230M
- LFM2.5-350M
- LFM2.5-1.2B-Instruct
- LFM2.5-2.6B
Filerna finns på Hugging Face och är byggda för lokal och edge-baserad inference.
Det gör modellerna relevanta för små datorer, laptops, telefoner och andra enheter där RAM och minnesbandbredd är begränsade.
Vanlig quantization tappar information
När en modell går från BF16 eller FP16 till 4-bitars vikter minskar minnesbehovet kraftigt.
Det gör modellen snabbare och enklare att köra lokalt, men lägre precision innebär normalt också att en del information går förlorad.
Traditionell post-training quantization gör konverteringen efter att modellen redan har tränats.
QAD angriper problemet tidigare.
En modell med högre precision används som lärare och hjälper den quantized modellen att lära sig beteendet redan under träningsprocessen.
Målet är att den lilla modellen ska anpassa sig till begränsningarna i 4-bitarsformatet i stället för att bara komprimeras i efterhand.
Omkring 97 procent av BF16-resultatet
Liquid AI testade modellerna på en samling benchmark för bland annat reasoning, instruction following, tool use och agentiska funktioner.
De rapporterade nivåerna jämfört med BF16 var:
- LFM2.5-230M: 97,1 procent
- LFM2.5-350M: 96,5 procent
- LFM2.5-1.2B-Instruct: 97,4 procent
- LFM2.5-2.6B: 96,6 procent
Siffrorna kommer från Liquid AI:s egna tester och ska därför inte tolkas som oberoende verifierade resultat.
Högre fart vid jämförbar kvalitet
Liquid AI jämförde också QAD Q4_0 med andra GGUF-varianter.
För modellerna på 230M och 350M parametrar uppger företaget att QAD Q4_0 når ungefär samma kvalitet som Q5_K_M inom testvariationen, men med 4–33 procent högre decode throughput.
För 1.2B- och 2.6B-modellerna uppges QAD Q4_0 nå ungefär samma kvalitet som Q4_K_M med 3–14 procent högre throughput.
Testerna kördes på flera typer av hårdvara, bland annat MacBook Pro, NucBox EVO-X2, Samsung Galaxy S26 Ultra och Raspberry Pi 5.
Intressant för lokal AI på små datorer
För lokal AI är modellstorleken ofta minst lika viktig som rå beräkningskraft.
En mindre quantized modell använder mindre minne, vilket lämnar mer utrymme för längre context, KV-cache, andra appar, flera parallella modeller samt agentverktyg och lokala tjänster.
På maskiner med begränsat unified memory eller RAM kan en bättre 4-bitarsmodell därför vara mer användbar än en större modell som bara precis får plats.
Modellerna körs med llama.cpp
De nya QAD-modellerna distribueras som GGUF.
Liquid AI visar exempel med llama.cpp, vilket gör att modellerna kan användas i ett stort antal lokala verktyg som bygger på GGUF-ekosystemet.
llama-cli -hf LiquidAI/LFM2.5-350M \
--hf-file LFM2.5-350M-QAD-Q4_0.gguf \
-p "What is C. elegans?"
Samma filer kan också användas av andra runtime som stöder GGUF Q4_0.
Communityn pekar på att fler tester behövs
Diskussioner i LocalLLaMA visar samtidigt att alla inte är övertygade om att QAD Q4_0 är det bästa valet för varje modell och användningsområde.
Bland annat diskuteras hur olika quantization-metoder, importance matrices och alternativa Q4- eller Q5-format påverkar verklig kvalitet.
Det gör oberoende tester viktiga, särskilt för den större 2.6B-modellen.
Liquid AI:s resultat visar ändå att quantization inte längre bara handlar om att minska en färdig modell. Allt mer av optimeringen kan byggas in redan under träningen.
Källor
- Liquid AI, LFM2.5 Q4_0: Quantization-Aware Distillation for Edge Deployment, 19 augusti 2026: https://www.liquid.ai/blog/qad
- Hugging Face, LFM2.5 Q4_0 Checkpoints from Quantization-Aware Distillation, 19 augusti 2026: https://huggingface.co/blog/LiquidAI/qad
- LocalLLaMA, communitydiskussion om LFM2.5 QAD: https://www.reddit.com/r/LocalLLaMA/comments/1vss944/lfm_25_qad/