AI-infrastruktur och Big Tech

AWS visar RAG-metod som kapar kontexten 10 gånger – 36 procent lägre kostnad i test

Amazon Web Services har publicerat en praktisk metod för att minska kostnaden i Retrieval-Augmented Generation, RAG.

Illustration för artikeln: AWS visar RAG-metod som kapar kontexten 10 gånger – 36 procent lägre kostnad i test

Amazon Web Services har publicerat en praktisk metod för att minska kostnaden i Retrieval-Augmented Generation, RAG. I stället för att skicka alla hämtade dokumentbitar direkt till den dyrare huvudmodellen används först en mindre modell som plockar ut de textspann som faktiskt är relevanta för frågan.

I AWS test minskade kombinationen av reranking och query-aware compression kontexten till omkring en tiondel, samtidigt som den totala kostnaden sjönk med 36 procent.

Illustration av query-aware komprimering i ett RAG-flöde.

Illustration: AI-genererad huvudbild för artikeln.

En billig modell städar kontexten först

Ett traditionellt RAG-flöde hämtar ofta 5–20 textchunks för att maximera chansen att rätt information finns med.

AWS lägger därför in ett komprimeringssteg mellan retrieval och slutmodellen. En mindre modell får användarfrågan och de hämtade chunkarna och returnerar bara relevanta textspann.

Huvudmodellen får sedan den komprimerade kontexten.

10,1 gånger färre tokens till huvudmodellen

Enbart compression gav 8,6 gånger färre tokens till huvudmodellen och 33 procents kostnadsbesparing.

När reranking kombinerades med compression blev det 10,1 gånger färre tokens och 36 procents kostnadsbesparing.

Schema som visar hur många dokumentbitar komprimeras till ett fokuserat kontextfönster.

Illustration: Ett RAG-flöde där många textbitar komprimeras innan de skickas till huvudmodellen.

Den sammansatta kvalitetsmätningen låg samtidigt på 97,6 procent av baseline.

Latensen ökar något

Compression-flödet ökade latensen med 19 procent i AWS test. Med reranking plus compression var ökningen 12 procent.

Resultaten gäller AWS testkorpus och modellval och måste mätas på den egna datan innan samma besparingar antas.

Kan kombineras med caching och model routing

AWS framhåller att metoden kan läggas ovanpå andra Bedrock-funktioner som prompt caching, Intelligent Prompt Routing och Rerank API.

Det gör query-aware compression särskilt intressant eftersom besparingarna kan staplas.

Relevant även utanför AWS

Principen – använd en billig modell för att filtrera kontext innan en dyrare modell får den – kan byggas med andra modellplattformar och lokala modeller.

För större RAG-system är det en konkret påminnelse om att kostnadsoptimering inte bara handlar om billigare API-priser. Att skicka färre irrelevanta tokens kan ge en stor del av vinsten.

Källor

  • AWS Machine Learning Blog, 21 augusti 2026: https://aws.amazon.com/blogs/machine-learning/reduce-rag-costs-on-amazon-bedrock-with-query-aware-compression/

Läs mer om ämnet

AI AI-nyheter AIPost

Källor