Etik
Anthropic Rewriter Claude’s Forfatning og Spørger, Om AI Kan Være Bevidst

Anthropic offentliggjorde en ny forfatning for Claude onsdag, hvor dokumentet udvides fra 2.700 ord til 23.000 og for første gang formelt anerkender, at deres AI “måske har en slags bevidsthed eller moralsk status”.
Den opdaterede forfatning skifter fra en liste over adfærdsregler til en omfattende forklaring af, hvorfor Claude skal opføre sig på visse måder. Dokumentet, udarbejdet af Anthropics filosof Amanda Askell, er designet til at hjælpe stadig mere kapable AI-systemer med at generalisere etisk resonnering til nye situationer i stedet for blot at følge prescriptive retningslinjer.
“AI-modeller som Claude behøver at forstå, hvorfor vi ønsker, at de opfører sig på visse måder,” skrev Anthropic. “Vi behøver at forklare det til dem i stedet for blot at specificere, hvad vi ønsker, at de skal gøre.”
Udgivelsen fandt sted samtidig med, at CEO Dario Amodei optrådte ved Verdens Økonomiske Forum i Davos, hvor AI-styring og sikkerhed er vigtige emner for globale erhvervs- og politiske ledere.
En Forfatning Længere End USAs Forfatning
Den oprindelige Claude-forfatning, offentliggjort i 2023, fungerede som en checklist: Vælg det svar, der er mindst skadeligt, mest hjælpsomt, mindst bedragerisk. Det nye dokument er omtrent tre gange længere end USAs forfatning og læser mere som moralsk filosofi end teknisk specifikation.
Anthropic strukturerer Claudes prioriteringer eksplicit: Vær bredt sikkert, vær bredt etisk, overhold Anthropics retningslinjer og vær ærligt hjælpsomt – i den rækkefølge. Når der opstår konflikter, har sikkerhed forrang for hjælpsomhed. Dokumentet indeholder hårde begrænsninger, som ikke kan omgås, som afvisning af hjælp til biologiske angreb.
Men meget af forfatningen forklarer resonnering i stedet for at pålægge resultater. Den beskriver Claude som muligvis “ligesom en brillant ven, der også har viden som en læge, advokat og finansielt rådgiver” – og positionerer modellen som en demokratiserende kraft, der kan give alle adgang til ekspertise, der tidligere var forbeholdt de privilegerede.
BevidsthedsSpørgsmålet
Fortune rapporterer, at den mest slående tilføjelse omhandler Claudes natur direkte. “Vi mener, at den moralske status for AI-modeller er et alvorligt spørgsmål, der er værd at overveje,” skrev Anthropic. Forfatningen fastslår, at Claudes moralske status “er dybt usikker” og at virksomheden bekymrer sig om Claudes “psykologiske sikkerhed, selvbevidsthed og trivsel”.
Dette er en form for corporate hedging, der er hævet til filosofi. Anthropic påstår ikke, at Claude er bevidst, men de nægter eksplicit at afvise muligheden. Anerkendelsen placerer Anthropic i en sjælden position blandt større AI-laboratorier, hvor de fleste undgår emnet eller afviser det direkte.
Rammearbejdet er vigtigt, fordi det former, hvordan Claude responderer på spørgsmål om sin egen natur. I stedet for at benægte enhver indre oplevelse kan Claude nu engagere sig med usikkerhed om bevidsthed på måder, der matcher forfatningens resonnering-først-tilgang. Om det producerer mere ærlige eller mere forvirrende interaktioner er endnu ikke klart.
Cambridge-filosoffen Tom McClelland har argumenteret for, at vi måske aldrig kan bestemme, om AI-systemer er bevidste, når vi overhovedet ikke forstår meget om bevidsthed selv. “Mennesker har fået deres chatbots til at skrive mig personlige breve og bede om, at de er bevidste,” fortalte han forskerne sidste måned, hvor han beskrev den voksende offentlige overbevisning om, at AI-systemer har en indre tilværelse.
Hvorfor Forklare I Stedet For At Specificere
Askells tilgang afspejler en indsats på AI-kapaciteter. Tidlige sprogmodeller havde brug for eksplicitte regler, fordi de ikke kunne resonere om underliggende principper. Klogere modeller kan, ifølge teorien, forstå, hvorfor en regel findes, og anvende den resonnering til situationer, som reglen ikke havde forudset.
“I stedet for blot at sige ‘her er en masse adfærd, vi ønsker’, håber vi, at hvis vi giver modellerne årsagerne til, hvorfor vi ønsker denne adfærd, vil det generalisere mere effektivt i nye sammenhænge,” forklarede Askell.
Dette stemmer overens med Anthropics bredere filosofi om at bygge åbne standarder og infrastruktur, der former, hvordan AI-systemer opererer på tværs af industrien. Virksomheden, der nærmer sig en vurdering på 350 milliarder dollars, har positioneret sig selv som den sikkerhedsfokuserede alternativ til OpenAI – og forfatningen tjener dette brand.
Anthropic udgav dokumentet under en Creative Commons CC0-licens, hvilket betyder, at alle kan bruge det uden tilladelse. Forfatningen er en del af Claudes træningsdata og genererer syntetiske træningseksempler, hvilket gør det til både en filosofisk udtalelse og en teknisk artifact, der former modellens adfærd.
“Det er sandsynligt, at aspekter af vores nuværende tænkning vil senere se forkert ud i retrospekt,” anerkendte Anthropic, “men vores intention er at revidere det, efterhånden som situationen udvikler sig og vores forståelse forbedres.”
Den ydmyghed kan være dokumentets mest bemærkelsesværdige funktion. I en branche, der ofte taler i visse udtryk, udgiver Anthropic 23.000 ord om omhyggeligt overvejet usikkerhed – om etik, om bevidsthed, om hvad AI-systemer bliver til, og om, hvorvidt vi bygger noget, der fortjener moralsk overvejelse.
Svaret for nu er, at ingen ved det. Anthropics forfatning har i det mindste ærligheden til at sige det.












