AI-infrastruktur och Big Tech

Nvidia Groq 3 LPX går i full produktion – når 3 400 tokens per sekund med 100K kontext

Nvidia har satt Groq 3 LPX i full produktion. Den nya inferensacceleratorn är byggd för Vera Rubin-plattformen och fokuserar på den del av AI-agenters

Illustration för artikeln: Nvidia Groq 3 LPX går i full produktion – når 3 400 tokens per sekund med 100K kontext

Nvidia har satt Groq 3 LPX i full produktion. Den nya inferensacceleratorn är byggd för Vera Rubin-plattformen och fokuserar på den del av AI-agenters arbete som användaren märker direkt: hur snabbt modellen kan generera nästa token.

I Artificial Analysis test med Gemma 4 31B och 100 000 tokens indata nådde systemet omkring 3 400 output-tokens per sekund. Nvidia uppger att det var ungefär fyra gånger snabbare än närmaste alternativa plattform i jämförelsen.

Illustration av Groq 3 LPX och hög inferenshastighet i datacentermiljö.

Illustration: AI-genererad huvudbild för artikeln.

5 000 tokens kan genereras på omkring 1,5 sekunder

Nvidias tekniska redovisning anger ett medianresultat på 3 431 output-tokens per sekund vid 100K kontext.

Som jämförelse tar 5 000 genererade tokens omkring 50 sekunder vid 100 tokens per sekund. Vid den uppmätta LPX-hastigheten blir själva decode-fasen omkring 1,5 sekunder.

Teknisk visualisering av lång kontext och hög token-throughput för Groq 3 LPX.

Illustration: En teknisk översikt över Groq 3 LPX med fokus på throughput och lång kontext.

Vid 10K kontext mättes 3 382 tokens per sekund, vilket tyder på att systemets generationstakt påverkas relativt lite mellan de två testade kontextlängderna.

Coding-benchmark passerade 4 700 tokens per sekund

Nvidia körde även det öppna SPEED-Bench för coding.

Där nådde samma Gemma 4-konfiguration 4 767 output-tokens per sekund i median, och mer än 20 procent av uppgifterna passerade 5 500 tokens per sekund.

Artificial Analysis-testet är tredjepartsmätt medan SPEED-Bench-resultatet redovisas av Nvidia självt.

Byggd för agentisk inferens

Coding agents och andra autonoma system kan göra hundratals eller tusentals inferenssteg, läsa lång kontext, anropa verktyg och fortsätta resonera efter varje resultat.

Små decode-fördröjningar multipliceras därför genom hela arbetsflödet. LPX är designad för att öka tokenproduktionen i just sådana interaktiva, kontexttunga arbetslaster.

Nebius blir tidig molnaktör

Nvidia anger att Nebius blir den första AI-molnaktören att adoptera Groq 3 LPX.

Hårdvaran är enligt Nvidia i full produktion och ska börja dyka upp i kommersiell inferensinfrastruktur.

Källor

  • NVIDIA Newsroom, 24 augusti 2026: https://nvidianews.nvidia.com/news/nvidia-groq-3-lpx-now-in-full-production-with-world-class-speed-for-agentic-ai
  • NVIDIA Technical Blog, 24 augusti 2026: https://developer.nvidia.com/blog/how-nvidia-groq-3-lpx-unlocks-ultrafast-interactivity-at-long-context-on-nvidia-vera-rubin/

Läs mer om ämnet

AI AI-nyheter AIPost

Källor