Kör små språkmodeller lokalt för integritet och kostnadskontroll
En liten språkmodell på egen hårdvara ger kontroll över data och kostnad. Här är när det lönar sig, hur du väljer modell och hur du kommer igång med
Att köra en språkmodell i molnet är enkelt, men det skickar din data till en tredje part och kostnaden växer med användningen. En liten språkmodell på din egen hårdvara ger dig kontroll över båda. Här är när det är rätt val och hur du kommer igång.
När lokalt är rätt val
En lokal modell passar när data inte får lämna verksamheten — journaler, kunduppgifter, intern kod — eller när du vill ha en fast kostnad i stället för per-token-fakturor. Små modeller räcker långt för klassificering, sammanfattning och enkel chatt, men de ersätter inte en stor molnmodell för svåra resonemangsuppgifter. Har du en avgränsad uppgift med tydliga in- och utdata är chansen stor att en lokal modell räcker.
Välj modell efter uppgift
Storleken avgör vad som går att köra. En modell på 3 miljarder parametrar körs lätt på en vanlig bärbar dator och duger för klassificering och korta svar. Vill du ha längre sammanhang och bättre resonemang behöver du 7–14 miljarder parametrar, vilket kräver en grafikprocessor eller mer minne. Börja i liten skala, mät kvaliteten på din egen uppgift och gå upp i storlek bara om det behövs.
Kom igång på tre steg
Först installerar du Ollama och hämtar en modell:
brew install ollama
ollama pull llama3.1:8b
Sedan startar du modellen och provar den:
ollama run llama3.1:8b
Till sist kopplar du modellen till din app via Ollamas lokala API på port 11434. Skicka en förfrågan och se att du får ett svar tillbaka utan att något lämnar datorn.
Felsökning
Om modellen är för långsam, byt till en mindre variant eller kvantisera modellen. Får du ont om minne, stäng ned andra program eller kör en 4-bitars kvantiserad version. Om svaren är för svaga för uppgiften har du valt en för liten modell — testa en modell i 13–14 miljarder parametrar i stället.
Källa: Kdnuggets