Guide
Så får du ut max prestanda ur Ollama på din Mac – MLX-guiden
Få ut högsta prestanda ur lokala AI-modeller på din Mac. Steg-för-steg-guide för Ollama MLX med multi-token prediction.
Ollama har uppdaterat sin MLX-motor för Apple Silicon med stöd för multi-token prediction – en teknik som ger både snabbare svar och högre kvalitet från lokala AI-modeller. Här är guiden som tar dig från standardinstallation till optimerad körning.
Guiden är för dig som redan använder Ollama på en Mac med M1-, M2- eller M3-chip och vill få ut mer prestanda utan att byta hårdvara.
Efter guiden kommer du att köra Gemma 4 med MLX aktiverat och multi-token prediction påslaget – och se mätbar skillnad i både hastighet och svarskvalitet.
Vad du behöver innan du börjar
- En Mac med Apple Silicon (M1, M2, M3 eller M4)
- macOS 14 eller senare
- Ollama installerat (minst version 0.6.0)
- Minst 16 GB RAM rekommenderas för Gemma 4
Steg 1: Kontrollera din Ollama-version
Öppna Terminalen och kör:
ollama --version
Du bör se version 0.6.0 eller högre. Om du har en äldre version, ladda ner den senaste från ollama.com.
Kontrollera: versionsnumret ska börja på 0.6 eller högre. Om inte, uppdatera innan du går vidare.
Steg 2: Ladda ner Gemma 4 med MLX-stöd
MLX-stödet är inbyggt i Ollama sedan version 0.6.0, men du måste dra rätt version av modellen. Kör:
ollama pull gemma4:31b
Det här laddar ner Gemma 4 i 31B-utförande. Modellen är stor – räkna med 5–15 minuter beroende på din internetanslutning.
Kontrollera: När nedladdningen är klar, kör ollama list för att se att gemma4:31b finns i din modellista.
Steg 3: Aktivera MLX och multi-token prediction
Skapa eller redigera en Modelfile för att aktivera optimeringarna:
ollama show gemma4:31b --modelfile > Modelfile.gemma4
Öppna Modelfile.gemma4 i valfri texteditor och lägg till dessa rader under PARAMETER-sektionen:
PARAMETER num_predict 4
PARAMETER num_ctx 8192
Spara filen och skapa din optimerade modell:
ollama create gemma4-mlx -f Modelfile.gemma4
Kontrollera: Kör ollama list igen. Du ska nu se gemma4-mlx i listan.
Steg 4: Kör modellen och verifiera MLX
Starta en interaktiv session:
ollama run gemma4-mlx
Skriv en enkel prompt, till exempel "Förklara skillnaden mellan MLX och CUDA på två meningar på svenska."
Kontrollera: Svaret ska komma snabbare än med standardmodellen. Du kan verifiera att MLX används genom att öppna Aktivitetskontroll (Activity Monitor), gå till fliken CPU/GPU, och se att Ollama-processen använder GPU:n under inferens.
Steg 5: Jämför prestanda före och efter
Kör samma prompt mot både standardmodellen och din MLX-optimerade version för att se skillnaden. I Terminalen:
echo "Skriv en kort dikt om Stockholm på svenska." | ollama run gemma4:31b --verbose 2>&1 | grep "eval"
Kör sedan samma kommando mot din MLX-version:
echo "Skriv en kort dikt om Stockholm på svenska." | ollama run gemma4-mlx --verbose 2>&1 | grep "eval"
--verbose-flaggan visar tokens per sekund. Med MLX och multi-token prediction ska du se en tydlig ökning.
Vanliga problem och lösningar
"MLX not available" eller modellen körs långsamt: Kontrollera att du faktiskt kör på Apple Silicon. Intel-Macar stöder inte MLX. Kör uname -m i Terminalen – den ska svara arm64.
Modellen laddas inte – slut på minne: Gemma 4 31B kräver cirka 20 GB ledigt RAM. Stäng andra minnestunga program, eller använd en mindre modell som gemma4:9b.
Ollama startar inte efter uppdatering: Kör ollama serve i en separat terminalflik och kontrollera felmeddelandena där.
Nästa steg
När du har MLX igång kan du testa andra modeller som stöds: Llama 4, Mistral och Qwen har alla visat prestandavinster med MLX på Apple Silicon. Experimentera med num_predict-värdet – högre värden ger fler tokens per steg men kan påverka kvaliteten.
Källa: Ollama Blog