AI-säkerhet och forskning

Så fungerar Claudes nya textvattenmärke

Anthropic vattenmärker text som Claude genererar. Här är hur tekniken fungerar, vad den kan och vad den inte kan bevisa.

Bild till: Så fungerar Claudes nya textvattenmärke

Anthropic kommer att vattenmärka texten som framtida Claude-modeller genererar. Tekniken bygger på Google DeepMinds SynthID-Text och införs för att möta EU:s AI-förordning.

Hur ett osynligt mönster skapas

En stor språkmodell skriver ett ord i taget. För varje nästa ord väljer den bland flera tänkbara kandidater, och när flera ord är ungefär lika bra avgörs valet i praktiken av en slumptalsgenerator. Vattenmärkning ändrar bara källan till den slumpen. I stället för en godtycklig generator använder modellen en nyckel plus de närmast föregående orden för att välja nästa ord. För läsaren syns ingen skillnad, men den som har nyckeln kan i efterhand räkna ut sannolikheten att texten skapats av Claude.

Vad vattenmärket inte kan bevisa

Metoden svarar bara på en fråga: hur troligt är det att texten delvis skrivits av Claude. Den bekräftar inte att en text är människoskriven, och den kan inte peka ut andra AI-modeller. På korta texter och faktapassager finns färre ordval att påverka, så där blir märkningen glesare – efter "2 + 2 =" finns bara ett korrekt nästa ord. Lätt redigering tar inte bort märkningen helt, men en total omskrivning gör det. Anthropic uppger att märkningen inte påverkar kvalitet, hastighet eller pris, och att den inte går att spåra till en enskild användare.

Bilder får en annan sorts märkning

När Claude skapar en fil av stödd typ läggs i stället en C2PA-märkning i filens metadata: en kryptografiskt signerad anteckning om att filen gjorts eller bearbetats med Claude. Det är en öppen standard som även kameror och bildredigerare använder, och den säger bara att Claude var inblandad – inte vem som bad om filen.

En användbar analogi är ett monopolspel där tärningen ersätts av en siffersekvens ur talet pi. Spelet blir lika slumpmässigt, men den som känner pi kan i efterhand se att just den sekvensen använts. Märkningen gäller också översättningar, eftersom Claude där väljer varje ord själv, och äldre modeller får märkningen successivt under de kommande månaderna. Metoden skiljer sig från AI-detektorer som Pangram, som inte har Anthropics nyckel och i stället letar efter språkliga mönster.

Anledningen till förändringen är EU:s AI-förordning. Anthropic har tillsammans med runt 190 andra aktörer skrivit under EU:s uppförandekod om transparens för AI-genererat innehåll. Märkningen rullas ut globalt eftersom det ännu inte finns ett hållbart sätt att begränsa den till en region, och en detektions-API ska enligt företaget komma inom kort.

Källa: Anthropic

Läs mer om ämnet

Claude Anthropic textvattenmärke AI-transparens

Källor