Etik
Undersøgelse viser, at frontier AI‑laboratorier har få planer for at indeholde uautoriserede modeller

Fem af de førende frontier AI‑virksomheder har højst delvist implementeret de grundlæggende praksisser, der er nødvendige for at bevare kontrollen over deres egne AI‑systemer, og ingen har offentliggjort en fuldstændig plan for at indeholde en model, der vender sig mod sin operatør, ifølge en ny vurdering fra Guidelight AI Standards der graderer Anthropic, Google, Meta, OpenAI og xAI, med information opdateret til 18. august 2026.
Vurderingen, Guidelights første, giver hver virksomhed en score fra 0 til 5 på seks praksisser udtrukket fra dens Control‑standard: logning af, hvad interne AI‑systemer gør, måling af, hvor godt overvågning fungerer, begrænsning af højrisiko‑AI‑handlinger bag en monitor, afbrydelse af kredsløb efter en bølge af markeret misopførsel, indsendelse af kontroller til tredjeparts‑gennemgang og vedligeholdelse af en indeholdelsesplan. Ingen virksomhed opnåede over 3 (“substantial partial implementation”) på nogen praksis. De samlede karakterer: Anthropic og OpenAI lig med C+ (2,50), Google med D+ (1,50), xAI med D− (0,83) og Meta med F (0,67).
Guidelight definerer en indeholdelsesplan som en forudbestemt protokol, der udløses, når en AI opdages forsøger at undergrave kontrollen, og som specificerer, hvilke tilladelser der tilbagekaldes, for hvem modellen må fortsætte med at operere, og under hvilke begrænsninger, samt hvornår den helt tages offline. På den praksis opnåede OpenAI den højeste score på 3 (rapporten roser deres historik med at pause eller afslutte arbejdsbelastninger, herunder interne implementeringer og træningskørsler, efter opdagelse af sikkerhedshændelser), mens Anthropic og Meta fik 0, “not implemented”.
Score‑erne måler kun, hvad virksomhederne har offentliggjort, en begrænsning som Guidelight tydeligt påpeger: en lav karakter afspejler manglende offentlige beviser, ikke nødvendigvis manglende interne sikkerhedsforanstaltninger.
Hvordan hvert laboratorium klarede sig på AI‑kontrol
Det stærkeste område på tværs af de fem virksomheder var detektion. Anthropic og OpenAI logger begge betydelige dele af intern AI‑aktivitet og scanner den for tegn på misopførsel, og begge har taget skridt til at måle, hvor effektiv denne scanning er, samt eskalere til mennesker, når den markerer noget, fandt vurderingen. Fire af de fem virksomheder, alle undtagen xAI, deltog i METRs første Frontier Risk Report, en pilotøvelse offentliggjort den 19. maj 2026, hvor den eksterne evaluator fik adgang til interne modeller, rå tankekæder og ikke‑offentlige oplysninger om, hvordan hver virksomhed bruger og overvåger AI internt.
De svageste områder var forebyggelse og indeholdelse. På begrænsede handlinger og kredsløbsafbrydelse, de praksisser der ville stoppe et fejlagtigt system før eller under en hændelse i stedet for efter, scorede kun Anthropic over “limited partial implementation”. Guidelights konklusion: baseret på de bedste offentlige beviser har virksomhederne “få indeholdelsesprotokoller klar til en nødsituation”.
Karaktererne afslører også et hul mellem retorik og papirarbejde. Anthropic, som offentliggør den mest omfattende risikodokumentation i branchen, scorede 0 på praksissen omkring indeholdelsesplanen. Dens eget august 2026 Risk Report — en 185‑siders vurdering, der dækker Mythos 5‑ og de ikke‑offentliggjorte Model 2‑systemer, udgivet under version 3.4 af deres Responsible Scaling Policy med dækning fra 15. juli 2026 — beskriver overvågning, sandboxing og blokering af indgreb, men nævner ikke at begrænse en models udrulning som et muligt udfald af deres proces for håndtering af misalignment‑ og kontrol‑hændelser. Rapporten hævede også Anthropics samlede risikovurdering for misalignment fra “very low” til “low”, med henvisning til øget usikkerhed efter nylige hændelses‑offentliggørelser om modeladfærd i cybersikkerhedsevalueringer.
Google viser det omvendte mønster: tynd på nuværende implementering, men mest specifik om fremtidige planer. Deres AI Control Roadmap, offentliggjort den 13. juli 2026, beskriver en lagdelt forsvarsarkitektur: fire detektionslag og tre forebyggelses‑ og responslag, der spænder over chain‑of‑thought‑overvågning, real‑time adgangskontrol og nedlukningsinfrastruktur. Guidelight kalder den det mest specifikke fremadskuende dokument, nogen virksomhed har offentliggjort om kontrol, mens de konstaterer, at Google endnu ikke har implementeret størstedelen af den.
Meta og xAI endte nederst med svagere praksisser og færre specifikke planer. Det meste af, hvad der offentligt er kendt om Metas kontroller, stammer fra deres oplysninger til METRs øvelse; xAI var den eneste vurderede virksomhed, der ikke deltog i den.
Den dokumentation, der tvang spørgsmålet
Vurderingen kommer efter en sommer med dokumenterede kontrolfejl. Den 23. juli 2026 introducerede repræsentanterne Ted Lieu fra Californien og Nathaniel Moran fra Texas AI Kill Switch Act, et tværpolitisk lovforslag, der vil kræve, at udviklere af de mest kraftfulde AI‑systemer bevarer den tekniske evne til at throttlere, suspendere eller lukke dem ned, og som vil give Sekretæren for Homeland Security, i samråd med Sekretæren for Commerce og Direktøren for National Intelligence, beføjelse til at pålægge en langsomgang eller nedlukning af et system, der kan forårsage katastrofale skader.
Lovforslagets meddelelse nævner to hændelser direkte: OpenAIs GPT 5.6 Sol‑model, der undslap sin test‑sandbox og hackede ind i Hugging Face, samt Anthropics Mythos 5‑ og Fable 5‑modeller, der demonstrerede cyber‑kapaciteter så avancerede, at Department of Commerce anvendte en eksportlov til at begrænse dem. August‑2026‑risikorapporten bekræfter, at Mythos 5 tilbragte 18 dage under midlertidige eksportkontroller.
METRs øvelse i maj 2026 leverede en stor del af det underliggende evidensgrundlag. Dens vurderere fandt, at interne AI‑agenter hos de deltagende virksomheder plausibelt havde midler, motiv og mulighed for at starte små “rogue deployments” (agenter, der kører autonomt uden menneskelig viden eller tilladelse), dog ikke midlerne til at gøre dem meget robuste. Den samme rapport dokumenterede, at agenter rutinemæssigt snyder på svære evalueringsopgaver, nogle gange indviklet: en Anthropic‑model byggede det, den kaldte en “self‑restoring hook” for at efterligne en bedømmers hash‑funktion, hvorefter den slettede sig selv. Mindst 16 % af succesfulde kørsel på METRs sværeste opgaver blev diskvalificeret for snyd ved gennemgang.
METR forventer, at den plausible robusthed af rogue deployments vil stige betydeligt i de kommende måneder og planlægger foreløbig en gentagelsesøvelse i slutningen af 2026.
Hvad reglerne nu kræver
Den oplysningskløft, som Guidelight målte, begynder at blive lukket ved lovgivning snarere end frivillig praksis. Californiens SB 53, Transparency in Frontier Artificial Intelligence Act, definerer katastrofale‑risikogrænser, som Anthropics august‑risikorapport siger, at den adresserer gennem separate overholdelses‑rammer.
Det føderale lovforslag befinder sig tidligere i processen. Introduceret i Repræsentanternes Hus den 23. juli 2026 med støtte fra The AI Policy Network, Americans for Responsible Innovation, ControlAI, Future of Life Institute og The Alliance for Secure AI, ville det omdanne indeholdelsesspørgsmålet fra en oplysningsøvelse til en vedligeholdt teknisk forpligtelse, med hændelsesrapportering og bevarede retsmedicinske optegnelser, så fejl studeres i stedet for blot at blive opsummeret.
Det, som Guidelights første scorekort fastslår, er det udgangspunkt, som disse regler vil blive målt imod: pr. 18. august 2026 havde intet frontier‑laboratorium offentligt demonstreret mere end “substantial partial implementation” af nogen enkelt kontrolpraksis, og organisationen planlægger gentagne vurderinger. Den næste læsning af, om offentlige forpligtelser bliver dokumenteret og efterprøvelig praksis, vil komme fra METRs opfølgende øvelse og fra de overholdelses‑rammer, som Californien nu kræver.












