Så kör du Meta-modellen Muse Glimmer lokalt för vibecoding
Meta-modellen Muse Glimmer går att köra lokalt med llama.cpp och DFlash. Här är stegen, hårdvaran du behöver och hur du verifierar att allt fungerar.
Meta Superintelligence Labs har släppt Muse Glimmer, en modell byggd för agentiskt kodande. Den går att köra lokalt, och kombinationen av llama.cpp och DFlash (spekulativ avkodning) gör att den rullar på en vanlig RTX 3090 i stället för att kräva en server.
Vad du behöver
Ett grafikkort med minst 24 GB minne – en RTX 3090 eller RTX 4090 är den nivå som krävs. Modellen körs via llama.cpp, och DFlash snabbar upp avkodningen genom att gissa flera tokens åt gången. Pi används som agentramverk.
Steg 1: hämta llama.cpp
Klona och bygg projektet:
git clone https://github.com/ggml-org/llama.cpp
cd llama.cpp
cmake -B build -DGGML_CUDA=ON
cmake --build build --config Release -j
Flaggan `-DGGML_CUDA=ON` bygger med stöd för Nvidia-grafikkort. Har du AMD eller kör bara på CPU hoppar du över den raden.
Steg 2: ladda ner modellen
Hämta Muse Glimmer-vikterna från Metas eller Hugging Faces modellsida och konvertera till GGUF-format om de inte redan är det. Lägg filen i en egen mapp.
Steg 3: starta servern
./build/bin/llama-server -m /sokvag/till/muse-glimmer.gguf --ctx-size 16384
DFlash aktiveras som en draftmodell i llama.cpp:s serverinställningar och kräver en mindre modell som gissar tokens. Utan den körs modellen, men långsammare.
Steg 4: koppla in Pi och verifiera
Starta Pi och peka den mot llama.cpp-servern. Prova med en liten uppgift – be den skapa en funktion och köra den. Ser du rimlig kod och ett svar inom några sekunder är allt igång. Är svaret avklippt eller hackigt är det context-fönstret som är för litet.
Lokal körning betyder att koden stannar på din maskin. Kostnaden är hårdvara och tid för konfigurering – och att modellen inte når samma nivå som de största molnmodellerna på svåra uppgifter.
Felsökning
Svarar inte servern alls beror det oftast på att grafikkortsdrivaren inte hittas eller att GGUF-filen ligger på fel sökväg. Kontrollera att `-m` pekar på rätt fil och att builden faktiskt byggdes med CUDA-stöd.
Kör modellen men långsamt beror det i regel på att DFlash inte är aktiverad. Utan draftmodell sker varje token i vanlig takt, vilket märks direkt på längre svar. Koppla in draftmodellen och jämför tokens per sekund före och efter.
Blir svaren avklippta är context-fönstret för litet. Höj `--ctx-size` och starta om servern. Att modellen ibland föreslår kod som inte kompilerar är inte ett tecken på att något är trasigt – det är en gräns hos en mindre lokal modell och skäl att alltid granska utdata.
Källorna
- [KDnuggets
- Run Muse Glimmer for Local Vibe Coding with llama.cpp, DFlash, and Pi](https://www.kdnuggets.com/run-muse-glimmer-for-local-vibe-coding-with-llama-cpp-dflash-and-pi)
- [Ollama Blog
- Muse Glimmer](https://ollama.com/blog/muse-glimmer)