FreeToken kör en 753B-modell på en enda workstation-GPU – ny motor pressar ner kraven för lokal AI
Ett nytt open-source-system kallat FreeToken visar hur mycket större Mixture-of-Experts-modeller kan köras på lokal hårdvara genom att behandla GPU, CPU
Ett nytt open-source-system kallat FreeToken visar hur mycket större Mixture-of-Experts-modeller kan köras på lokal hårdvara genom att behandla GPU, CPU, RAM och minnesöverföringar som en gemensam inferensplattform.
Forskarna rapporterar att FreeToken kan köra GLM-5.2 med 753 miljarder parametrar på en enda workstation-GPU. Systemet stöder fler än 20 MoE-modeller och sträcker sig från 35B-modeller på laptops med 8 GB GPU-minne till modeller i hundratals miljarder parametrar på kraftigare stationära datorer.

GPU-minnet används som en del av ett större system
FreeToken bygger inte på att hela modellen måste få plats i VRAM. Motorn anpassar kontinuerligt var beräkningar och modellstate ska ligga utifrån datorns resurser och bandbredd.
Systemet samordnar modellayout och laddning, expert residency, CPU/GPU-exekvering, återanvändning av agentstate och runtime-minneshantering.
Det skiljer sig från enklare offload-strategier där en fast del av modellen placeras på CPU eller GPU.
753B på en RTX PRO 6000
I forskarnas redovisade konfiguration körs GLM-5.2, en 753B MoE-modell, på en enda RTX PRO 6000 Blackwell med 96 GB VRAM.
Forskarna rapporterar cirka 14,9 tokens per sekund.
En separat reproduktion publicerad kort efter forskningsarbetet använde samma GPU-klass och checkpoint och bekräftade att modellen gick att köra på en enda workstation-GPU. Resultaten bör fortfarande betraktas som tidiga eftersom FreeToken är nytt och forskningsartikeln är en preprint.
Från laptop till workstation
Forskarna beskriver även en 284B-modell på en gamingdator och en 35B MoE-modell på en laptop med 8 GB GPU-minne.
Det fungerar eftersom MoE-modeller bara aktiverar en del av experterna för varje token. FreeToken försöker cacha och flytta de delar som faktiskt behövs i stället för att behandla alla parametrar som lika aktiva.
En central idé är bandwidth-adaptive execution. Olika datorer har olika balans mellan VRAM, RAM, CPU och PCIe-bandbredd. Motorn försöker därför anpassa exekveringen efter den faktiska maskinen.
Lokal AI flyttar upp ytterligare en modellklass
Utvecklingen kring llama.cpp, MLX, SSD-offload och expertstreaming har redan gjort större modeller möjliga på lokal hårdvara.
FreeToken går längre genom att designa hela inferensstacken runt heterogena resurser.
Det betyder inte att en 753B-modell blir praktisk på en vanlig laptop. Den största demonstrationen kräver fortfarande en mycket kraftfull workstation. Men resultaten visar att modellens totala parameterantal inte längre behöver motsvara mängden VRAM som krävs för att köra den.
Källor
- arXiv, FreeToken: Efficient Edge-Native MoE Serving with Bandwidth-Adaptive Execution, 17 augusti 2026: https://arxiv.org/abs/2608.16157
- Hugging Face Papers: https://huggingface.co/papers/2608.16157
- PureTensor AI, reproduktion, 22 augusti 2026: https://puretensor.ai/blog/four-days-later-753b-on-one-gpu