AI-nyheter

Faraday är bara 27B men slår större AI-agenter på att återskapa forskningsresultat

Det brittiska AI-labbet Inherent har utvecklat Faraday, en AI-agent med 27 miljarder parametrar som tränats för att självständigt återskapa resultat från

Faraday är bara 27B men slår större AI-agenter på att återskapa forskningsresultat

Det brittiska AI-labbet Inherent har utvecklat Faraday, en AI-agent med 27 miljarder parametrar som tränats för att självständigt återskapa resultat från vetenskapliga papers.

I Inherents nya benchmark Replica producerade Faraday mer trogna reproduktioner än Claude Opus 4.8 och GPT-5.5 i de testade uppgifterna. Systemet använder samtidigt en större coding agent som verktyg, vilket gör arkitekturen annorlunda än en vanlig direkt jämförelse mellan språkmodeller.

Illustration av en AI-agent som analyserar stegvisa uppgifter och forskningsproblem

310 uppgifter från 100 forskningspapers

För att träna och testa Faraday byggde forskarna Replica.

Den första versionen innehåller 310 uppgifter från 100 papers inom maskininlärning och AI för vetenskap, bland annat NLP, materialvetenskap, väderprognoser och strukturell biologi.

Agentens uppgift är att återskapa en figur från ett paper utan att få se originalfiguren. Den får läsa resten av forskningsarbetet och använda en begränsad mängd tid och compute för att rekonstruera experimentet.

Tränad med långvarig reinforcement learning

Faraday har tränats med long-horizon reinforcement learning.

Vetenskaplig reproduktion saknar ett enkelt facit som kodtester. Forskarna utvecklade därför en automatiskt genererad rubric-baserad bedömare och jämförde dess bedömningar med mänskliga experter.

Träningen använder bland annat flera bedömningssamplingar och credit assignment på turn-nivå för att minska brus i rewardsignalen.

Använder GPT-5.5 Codex som verktyg

Faraday använder GPT-5.5 Codex som ett verktyg, ungefär som en forskare kan använda en coding agent.

Inherent beskriver Faradays roll som att välja experiment, bedöma resultat och styra arbetet.

Det gör resultatet intressant ur ett agentsystemperspektiv: en mindre specialiserad modell kan fungera som besluts- och kontrollager ovanpå en större generell modell.

Resultaten kommer från Inherents egen benchmark

Inherent rapporterar att Faraday producerade bättre reproduktioner än Claude Opus 4.8 och GPT-5.5 över kategorierna i Replica.

Claude kördes i Claude Code-harnessen och GPT-5.5 i Codex med hög reasoning-nivå.

Resultaten kommer från Inherents egen benchmark och forskningsgrupp och ska därför inte behandlas som en oberoende generell ranking av modellerna.

Faraday är fortfarande ett forskningssystem. Resultaten visar inte att agenten självständigt kan bedriva generell vetenskaplig forskning.

Källor

  • Inherent, Training AI Scientists to Replicate Research, 14 augusti 2026: https://inherentlabs.ai/research/training-to-replicate
  • arXiv, Training AI Scientists to Replicate Research, 13 augusti 2026: https://arxiv.org/abs/2608.13331

Läs mer om ämnet

AI AI-nyheter

Källor