Efter att ha testat 20+ lokala LLM:er – dessa fyra behåller han för olika jobb
Efter över 20 testade lokala LLM:er behåller XDA-skribenten fyra modeller – en för kodning, en för vardagen, en för resonemang, en för kreativt skrivande.
XDA Developers-skribenten Yash Patel har under drygt ett år testat fler än 20 lokala språkmodeller. Efter alla tester har han skalat ner till fyra modeller – var och en med ett tydligt jobb i arbetsflödet.
Patel kör modellerna på en dator med 32 GB RAM, ett Nvidia RTX 5070-grafikkort, 1 TB SSD och en Intel Core Ultra 9-processor. Som runtime använder han KoboldCpp, ett öppet verktyg för att ladda och köra lokala modeller. Eftersom allt körs på egen hårdvara lämnar varken prompts eller filer maskinen.
Qwen 3.6 27B – kodningen
Den tyngsta modellen i uppsättningen är Qwen 3.6 27B. Patel kör en Q5_K_S-kvantiserad version på omkring 18 GB. Den används för att skapa kod, felsöka, refaktorera och förstå befintliga kodbaser.
Modellen är inte den snabbaste han har, men enligt Patel är väntan värd det när resultatet blir renare och mer användbar kod. Det är modellen han laddar när kvalitet väger tyngre än hastighet.
Gemma 4 12B – vardagsarbetshästen
Gemma 4 12B är den modell Patel vänder sig till i vardagen. Q4_0-versionen tar omkring 7–8 GB och laddas betydligt snabbare än de större modellerna.
Den används för snabba frågor, sammanfattningar, begreppsförklaringar, brainstorming och mindre koduppgifter. Eftersom den är liten lämnar den också mer resurser över till annat medan den körs.
GPT OSS 20B – djupare resonemang
När frågan har flera lager använder Patel GPT OSS 20B, en Q6_K-version på omkring 11–12 GB. Modellen används för att bryta ner komplexa frågor, jämföra alternativ, arbeta igenom problem och kontrollera om en idé håller.
Avvägningen är hastigheten – den tar längre tid på sig än de mindre modellerna, särskilt med stora prompts. Men när resonemanget behöver vara djupare är Patel villig att vänta.
Llama 3.3 8B – det kreativa skrivandet
Den sista modellen är en Llama 3.3 8B-variant på omkring 7 GB (Q6_K). Den används för berättelser, karaktärsidéer, brainstorming och att experimentera med olika skrivstilar.
Enligt Patel hanterar den öppna prompts väl och håller skrivandet i rörelse utan att svaren blir för strukturerade. Storleken gör den snabb att ladda och responsiv under längre kreativa sessioner.
Två av modellerna är community-varianter med långa kvantiserade filnamn, vilket är vanligt i GGUF-ekosystemet. Llama-modellen är exempelvis en omarbetad version med extra resonemangs- och skrivinriktning, inte en ren instruktionsmodell.
Fyra modeller i stället för en som ska klara allt
Patels slutsats är att lokal AI fungerar bäst när man slutar kräva att en enda modell ska göra allt. Att hålla några modeller för olika jobb ger flexibilitet utan att komplicera uppsättningen.
Den största fördelen med lokal AI, som han ser det, är valfriheten: man väljer själv modeller, hårdvara och hur de används. Siffrorna i texten är författarens egna erfarenheter, inte oberoende benchmarkresultat.