Qwen3.8-Flash-Next visar vägen mot nästa generation AI-agenter
Qwen3.8-Flash-Next kombinerar miljonkontext, sparse attention och MoE för snabbare AI-agenter.
Qwen3.8-Flash-Next är en öppen preview-modell från Alibaba som kombinerar mycket lång kontext med en Mixture-of-Experts-arkitektur. Modellen beskrivs av Qwen som en förhandsvisning av riktningen mot Qwen4.
Modellen har totalt 176 miljarder parametrar, varav omkring 6 miljarder aktiveras per token. Den består av 125 miljarder vanliga modellparametrar och 51 miljarder N-gram-embeddings. Det gör att den kan ha stor total kapacitet utan att hela modellen behöver bearbetas för varje token.
Det inbyggda kontextfönstret är 262 144 token. Med YaRN kan det enligt underlaget utökas till omkring en miljon token. För en coding agent innebär det att mer av ett stort kodprojekt, långa loggar eller en samling dokument kan hållas tillgängligt samtidigt.
Arkitekturen kombinerar Gated DeltaNet med Qwen Sparse Attention. Gated DeltaNet komprimerar historisk information till ett återkommande tillstånd, vilket kan bromsa tillväxten i KV-cachen. Qwen Sparse Attention väljer i stället ut relevanta delar av en lång sekvens.
I leverantörens tester uppges attention-kärnan ge upp till 7,6 gånger snabbare prefill och 4,9 gånger snabbare decoding än full attention vid en miljon tokens. Sådana siffror är benchmarkresultat, inte en garanti för samma hastighet i andra miljöer.
Nvidia har dessutom rapporterat över 16 000 tokens per sekund och GPU på GB300 NVL72 med TensorRT-LLM. Det är rackskalshårdvara och ska inte jämföras direkt med en vanlig stationär dator. Modellen kan också köras i mindre konfigurationer, men hårdvarukraven är fortfarande höga.
Qwen3.8-Flash-Next är därför mest intressant som en signal om vart agentmodeller är på väg: längre arbetsminne, mer selektiv attention och snabbare inferens utan att varje token måste använda hela modellens kapacitet.
Källa: Qwen Kompletterande källa: Nvidia Technical Blog