IBM-test: rätt AI-minne ger 16 procentenheter bättre agentresultat med bara 5 procent fler tokens
Mer minne gör inte automatiskt en AI-agent bättre. Ny forskning från IBM Research visar att mängden och typen av minne behöver anpassas efter modellen.
Mer minne gör inte automatiskt en AI-agent bättre. Ny forskning från IBM Research visar att mängden och typen av minne behöver anpassas efter modellen.
I tester med åtta modeller gav selektivt agentminne gpt-oss-120b 16,1 procentenheter högre task completion samtidigt som tokenanvändningen bara ökade med omkring 5 procent.

Agenten lär sig utan nya modellvikter
IBM:s system ALTK-Evolve analyserar tidigare lyckade och misslyckade arbetsförlopp och destillerar dem till återanvändbara riktlinjer: strategier som fungerat, misstag som bör undvikas och edge cases.
Riktlinjerna återförs sedan vid framtida uppgifter. Inga modellvikter uppdateras.
Selektivt minne hjälpte gpt-oss-120b
Forskarna testade på AppWorld med 585 flerstegsuppgifter i nio simulerade appar.
För gpt-oss-120b låg Task Goal Completion utan minne på 39,9 procent. Med kuraterad retrieval ökade resultatet till 56,0 procent, en förbättring på 16,1 procentenheter.
Tokenanvändningen steg samtidigt från cirka 110 000 till 116 000 tokens per uppgift, ungefär 5 procent.
DeepSeek tjänade på hela minnet
För DeepSeek-V3.2 ökade Task Goal Completion från 79,8 till 89,3 procent när modellen fick hela sin riktlinjeuppsättning.
På Scenario Goal Completion steg resultatet från 64,3 till 80,4 procent. Tokenanvändningen ökade från cirka 148 000 till 263 000 tokens per uppgift.
IBM pekar på prompt caching som ett sätt att minska kostnaden när samma statiska riktlinjer återanvänds.
Claude och GPT förbättrades också
Claude Opus 4.6 ökade från 90,5 till 94,6 procent i Task Goal Completion med den bästa minneskonfigurationen. GPT-5.5 ökade från 92,3 till 95,2 procent.
GLM-5 visade däremot ingen mätbar förbättring i den redovisade konfigurationen.
Resultaten pekar på att svagare modeller kan behöva ett kompakt urval av relevanta minnen, medan starkare modeller med mer kapacitet kan dra nytta av en större riktlinjeuppsättning.
Billigare långvariga agenter
Att ständigt skicka hela historiken till en modell blir dyrt och fyller kontextfönstret.
Om tidigare erfarenheter i stället kan destilleras och rätt lärdomar hämtas för aktuell uppgift kan både kostnad och kvalitet förbättras.
IBM betonar att resultaten hittills är validerade på AppWorld och behöver testas bredare.
Källor
- IBM Research/Hugging Face, How Much Memory Does Your Agent Actually Need?, 18 augusti 2026: https://huggingface.co/blog/ibm-research/altk-evolve-hmm
- IBM Research/Hugging Face, Thinking of ACE? We Can Do It with Fewer Tokens, 11 augusti 2026: https://huggingface.co/blog/ibm-research/altk-evolve-sldd