Guide

Så får du ut max prestanda ur Ollama på din Mac – MLX-guiden

Få ut högsta prestanda ur lokala AI-modeller på din Mac. Steg-för-steg-guide för Ollama MLX med multi-token prediction.

Källbild till artikeln: Så får du ut max prestanda ur Ollama på din Mac – MLX-guiden

Ollama har uppdaterat sin MLX-motor för Apple Silicon med stöd för multi-token prediction – en teknik som ger både snabbare svar och högre kvalitet från lokala AI-modeller. Här är guiden som tar dig från standardinstallation till optimerad körning.

Guiden är för dig som redan använder Ollama på en Mac med M1-, M2- eller M3-chip och vill få ut mer prestanda utan att byta hårdvara.

Efter guiden kommer du att köra Gemma 4 med MLX aktiverat och multi-token prediction påslaget – och se mätbar skillnad i både hastighet och svarskvalitet.

Vad du behöver innan du börjar

  • En Mac med Apple Silicon (M1, M2, M3 eller M4)
  • macOS 14 eller senare
  • Ollama installerat (minst version 0.6.0)
  • Minst 16 GB RAM rekommenderas för Gemma 4

Steg 1: Kontrollera din Ollama-version

Öppna Terminalen och kör:

ollama --version

Du bör se version 0.6.0 eller högre. Om du har en äldre version, ladda ner den senaste från ollama.com.

Kontrollera: versionsnumret ska börja på 0.6 eller högre. Om inte, uppdatera innan du går vidare.

Steg 2: Ladda ner Gemma 4 med MLX-stöd

MLX-stödet är inbyggt i Ollama sedan version 0.6.0, men du måste dra rätt version av modellen. Kör:

ollama pull gemma4:31b

Det här laddar ner Gemma 4 i 31B-utförande. Modellen är stor – räkna med 5–15 minuter beroende på din internetanslutning.

Kontrollera: När nedladdningen är klar, kör ollama list för att se att gemma4:31b finns i din modellista.

Steg 3: Aktivera MLX och multi-token prediction

Skapa eller redigera en Modelfile för att aktivera optimeringarna:

ollama show gemma4:31b --modelfile > Modelfile.gemma4

Öppna Modelfile.gemma4 i valfri texteditor och lägg till dessa rader under PARAMETER-sektionen:

PARAMETER num_predict 4
PARAMETER num_ctx 8192

Spara filen och skapa din optimerade modell:

ollama create gemma4-mlx -f Modelfile.gemma4

Kontrollera: Kör ollama list igen. Du ska nu se gemma4-mlx i listan.

Steg 4: Kör modellen och verifiera MLX

Starta en interaktiv session:

ollama run gemma4-mlx

Skriv en enkel prompt, till exempel "Förklara skillnaden mellan MLX och CUDA på två meningar på svenska."

Kontrollera: Svaret ska komma snabbare än med standardmodellen. Du kan verifiera att MLX används genom att öppna Aktivitetskontroll (Activity Monitor), gå till fliken CPU/GPU, och se att Ollama-processen använder GPU:n under inferens.

Steg 5: Jämför prestanda före och efter

Kör samma prompt mot både standardmodellen och din MLX-optimerade version för att se skillnaden. I Terminalen:

echo "Skriv en kort dikt om Stockholm på svenska." | ollama run gemma4:31b --verbose 2>&1 | grep "eval"

Kör sedan samma kommando mot din MLX-version:

echo "Skriv en kort dikt om Stockholm på svenska." | ollama run gemma4-mlx --verbose 2>&1 | grep "eval"

--verbose-flaggan visar tokens per sekund. Med MLX och multi-token prediction ska du se en tydlig ökning.

Vanliga problem och lösningar

"MLX not available" eller modellen körs långsamt: Kontrollera att du faktiskt kör på Apple Silicon. Intel-Macar stöder inte MLX. Kör uname -m i Terminalen – den ska svara arm64.

Modellen laddas inte – slut på minne: Gemma 4 31B kräver cirka 20 GB ledigt RAM. Stäng andra minnestunga program, eller använd en mindre modell som gemma4:9b.

Ollama startar inte efter uppdatering: Kör ollama serve i en separat terminalflik och kontrollera felmeddelandena där.

Nästa steg

När du har MLX igång kan du testa andra modeller som stöds: Llama 4, Mistral och Qwen har alla visat prestandavinster med MLX på Apple Silicon. Experimentera med num_predict-värdet – högre värden ger fler tokens per steg men kan påverka kvaliteten.


Källa: Ollama Blog

Relaterade guider

Ollama MLX Apple Silicon Gemma 4 guide Mac

Källor