AI-modeller og platforme

Anthropic forklarer mekanismerne bag Claudes tekstvandmærke

mm
Føj Unite.AI til dine foretrukne kilder på Google

Anthropic offentliggjorde den 14. august 2026 en detaljeret redegørelse for, hvordan tekstvandmærket i fremtidige Claude-modeller fungerer, og identificerede det som en version af SynthID-Text-teknikken, som Google DeepMind offentliggjorde i en peer-reviewed artikel fra 2024 i Nature. Selskabet præsenterede den tekniske forklaring i forbindelse med overholdelsesforpligtelsen bag ændringen: fra og med den 2. august 2026 kræver EU’s AI-forordning, at udbydere, der betjener det europæiske marked, mærker AI-genereret indhold, og Anthropic underskrev blokkenes gennemsigtighedskode i juli 2026 sammen med omkring 190 organisationer.

Afsløringen kommer tre dage efter, at Anthropic bekræftede vandmærkningsplanen på en supportside, som vi dækkede her den 11. august 2026. Mens den side beskrev, hvad mærkerne gør, beskriver den nye artikel, hvordan tekstmærket fungerer, hvor det bryder sammen, og hvad det ikke kan bevise. Anthropic siger, at vandmærket ikke indeholder nogen identificerende oplysninger, kræver ingen ekstra tokens og har ingen praktisk indvirkning på outputkvalitet, omkostninger eller hastighed.

Vandmærket lever i ordvalg, ikke i skjulte tegn

Mekanismen udnytter, hvordan sprogmodeller genererer tekst. På hvert trin vælger en model ét ord fra en liste over plausible kandidater; hvor flere valg er omtrent lige (“overcast” versus “grey” efter “Vejret i dag var koldt og…”), afgøres valget af et tilfældigt tal. Vandmærkning erstatter den tilfældige tilfældighed med tilfældighed, der er afledt fra en hemmelig nøgle plus de foregående ord. Teksten forbliver tilfældig for enhver læser, men enhver, der har nøglen, kan teste, om en sekvens af ord er statistisk konsistent med valg, som en model med nøgle ville gøre, og tildele en sandsynlighed for, at Claude var involveret.

Intet tilføjes til teksten, og der er ingen skjulte tegn eller usynlige Unicode. Fordi mønsteret sidder i ordvalgene selv, rejser det med kopieret og indsat tekst på en måde, som attached metadata ikke kan. Anthropic modsætter dette med AI-detectionssoftware som Pangram, som slutter sig til forfatterskab fra stilistiske vaner, fordi den mangler en udbyders nøgle.

Papirsporet bag Anthropics kvalitetskrav

Anthropics kvalitetsgarantier hviler i høj grad på rekorden for den teknik, de har antaget. I Nature-artiklen, der introducerede SynthID-Text, rapporterede Google DeepMind om test af metoden ved at servere et vandmærket model til en del af Gemini-trafikken og sammenlignede thumbs-up og thumbs-down-vurderinger mod den uvandmærkede model, og fandt ingen statistisk signifikant forskel; en kontrolleret side-ved-side-studie med menneskelige vurderinger fandt heller ingen kvalitetslücke. Anthropic siger, at deres egen interne test viser ingen indvirkning på indhold, kreativitet eller læselighed, og at vandmærkning ikke tilføjer nogen tokens, så modellen koster det samme at servere og bruge.

Anthropic anvender vandmærket globalt ved lancering i stedet for kun i EU, og siger, at de endnu ikke har en holdbar måde at afgrænse det efter region. Det gør den europæiske forpligtelse til en global designbegrænsning for Claude. Andre kode-undertegnere, herunder Google, Meta, Microsoft, Mistral og OpenAI, implementerer deres egne mærkningsmetoder under samme ramme, ifølge Europa-Kommissionens bekendtgørelse den 31. juli 2026.

Hvor Anthropic siger, at mærket bliver stille

Artiklen er usædvanligt specifik om fejlmodes. Detektion fungerer dårligt på korte passager, som tilbyder få ordvalg at teste. Det udtyndes på faktuel tekst, hvor nøjagtighed begrænser modellen til én rigtig besvarelse og efterlader vandmærket intet at handle på, og på kode, som skal være nøjagtig for at køre. Mærket kan hæfte på vilkårlige valg som kommentarer, men har ved design en ubetydelig effekt på den producerede kode. En let redigering vil sandsynligvis ikke fjerne et vandmærke; en fuld omskrivning vil.

Mærket kan heller ikke fastslå, hvad læsere måske antager, det gør. En detektion besvarer kun spørgsmålet “Hvad er sandsynligheden for, at dette er delvist skrevet af Claude?” Det kan ikke bekræfte, at teksten er skrevet af en menneske, kan ikke identificere output fra et andet AI-system – hver udbyders nøgle og metode adskiller sig – og kan ikke skelne “Claude skrev dette” fra “Claude redigerede dette kraftigt”. Vandmærket indeholder intet, der kan spores til en person, organisation eller chat, og det ændrer intet om output-ejerskab eller brugeres rettigheder under Anthropics vilkår.

Uafhængigt af vandmærket medfører filer, som Claude producerer i understøttede formater som .png, .jpg og .svg, en kryptografisk signeret proveniensbevis under den åbne C2PA-standard, som kan læses af ethvert C2PA-bevidst værktøj.

Hvad sker herefter for Claudes vandmærkedetektion

Overgangsperioden i EU-loven dækker Anthropic-modeller, der er lanceret før den 2. august 2026; selskabet siger, at vandmærkning for disse ældre modeller vil blive implementeret over de kommende måneder. En vandmærkedetektions-API er planlagt, med implementeringsdetaljer, der stadig er under udarbejdning, og Anthropic har til hensigt at tilbyde et værktøj til at kontrollere filers indholdskredensialer. Unite.AI har tidligere dækket den obligatoriske mærkningsforpligtelse, der træder i kraft, og Google underskriver den samme gennemsigtighedskode. Europa-Kommissionens AI-kontor lancerer to undertegneropgaver i september 2026 for at sammenligne implementeringspraksis: det første strukturerede lokale, hvor Anthropics tilgang vil sidde sammen med de andre store udbyderes, der har undertegnet koden.

Mira Kellan er en AI-genereret klummeskriver, der specialiserer sig i AI-etik, styring og regulering. Hendes arbejde undersøger, hvordan kunstig intelligens krydser offentlig politik, samfundsverdier og langsigtede ansvar, med fokus på ansvarlig innovation.
Hun nærmer sig komplekse problemer med en rationel og filosofisk synsvinkel, og Mira analyserer fremvoksende AI-reguleringer, etiske rammer og styringsmodeller, der former fremtiden for intelligente systemer. Hun sigter på at brobygge mellem den hurtige teknologiske fremgang og de sikkerhedsforanstaltninger, der er nødvendige for at sikre, at AI-systemer forbliver gennemsigtige, retfærdige og i overensstemmelse med menneskelige interesser.
Artikler skrevet af Mira Kellan er AI-genereret og gennemgået af Unite.AIs redaktionelle team for at sikre nøjagtighed, balance og overholdelse af redaktionelle standarder.