Etik
Studie visar att frontier‑AI‑laboratorier har få planer för att begränsa lömska modeller

Fem av de ledande frontier‑AI‑företagen har som mest delvis implementerat de grundläggande praxis som behövs för att behålla kontrollen över sina egna AI‑system, och ingen har publicerat en fullständig plan för att begränsa en modell som vänder sig mot sin operatör, enligt en ny bedömning från Guidelight AI Standards som graderar Anthropic, Google, Meta, OpenAI och xAI, med information aktuell fram till 18 augusti 2026.
Bedömningen, Guidelight:s första, ger varje företag poäng från 0 till 5 på sex praxis hämtade från dess Control‑standard: loggning av vad interna AI‑system gör, mätning av hur väl övervakning fungerar, begränsning av hög‑risk‑AI‑åtgärder bakom en monitor, avbrott efter en våg av flaggad misskötsel, inskickande av kontroller för granskning av tredje part samt upprätthållande av en inneslutningsplan. Inget företag fick över 3 (“betydande partiell implementering”) på någon praxis. De samlade betygen: Anthropic och OpenAI delade C+ (2,50), Google D+ (1,50), xAI D− (0,83) och Meta F (0,67).
Guidelight definierar en inneslutningsplan som ett fördefinierat protokoll som aktiveras när en AI upptäcks försöka kringgå kontroll, och som specificerar vilka behörigheter som dras tillbaka, för vem modellen får fortsätta att fungera och under vilka begränsningar, samt när den tas helt offline. På den praktiken fick OpenAI högst med 3 (rapporten ger beröm för dess historik av att pausa eller avsluta arbetsbelastningar, inklusive interna distributioner och träningskörningar, efter upptäckt av säkerhetsincidenter), medan Anthropic och Meta fick 0, “inte implementerad”.
Poängen mäter endast vad företagen har avslöjat offentligt, en begränsning som Guidelight tydligt påpekar: ett lågt betyg speglar saknad offentlig bevisning, inte nödvändigtvis saknade interna skyddsåtgärder.
Hur varje laboratorium presterade på AI‑kontroll
Det starkaste området bland de fem företagen var detektion. Anthropic och OpenAI loggar båda betydande delar av intern AI‑aktivitet och skannar den för tecken på misskötsel, och båda har vidtagit åtgärder för att mäta hur väl den skanningen fungerar samt eskalera till människor när den flaggar något, enligt bedömningen. Fyra av de fem företagen, alla utom xAI, deltog i METR:s första Frontier Risk Report, ett pilotprojekt publicerat 19 maj 2026, där den externa utvärderaren fick tillgång till interna modeller, råa tankekedjor och icke‑offentlig information om hur varje företag använder och övervakar AI internt.
De svagaste områdena var förebyggande och inneslutning. När det gäller begränsade åtgärder och avbrott – praxis som skulle stoppa ett misskött system före eller under en incident snarare än efter – var det bara Anthropic som nådde över “begränsad partiell implementering”. Guidelight:s slutsats: baserat på bästa offentliga bevis har företagen “få inneslutningsprotokoll redo för en nödsituation”.
Betygen avslöjar också ett glapp mellan retorik och pappersarbete. Anthropic, som publicerar den mest omfattande riskdokumentationen i branschen, fick 0 på inneslutningsplan‑praxisen. Dess egen Riskrapport för augusti 2026 – en 185‑sidig utvärdering som täcker Mythos 5 och de ännu ej släppta Model 2‑systemen, publicerad under version 3.4 av dess Responsible Scaling Policy med ett täckningsdatum den 15 juli 2026 – beskriver övervakning, sandlådor och blockeringsåtgärder men nämner inte att begränsa en modells distribution som ett möjligt resultat av dess process för att hantera missanpassning och kontrollincidenter. Rapporten höjde också Anthropic:s övergripande missanpassningsrisk från “mycket låg” till “låg”, med hänvisning till ökad osäkerhet efter nyliga incidentavslöjanden om modellbeteende i cybersäkerhetsutvärderingar.
Google visar det omvända mönstret: lite pågående implementering men mest specifikt om framtida planer. Dess AI Control Roadmap, publicerad 13 juli 2026, beskriver en lagerbaserad försvarsarkitektur: fyra detektionsnivåer och tre förebygg‑och‑responsnivåer, som omfattar kedjetänkande‑övervakning, realtids‑åtkomstkontroll och avstängningsinfrastruktur. Guidelight kallar den det mest specifika framåtblickande dokumentet någon företag har publicerat om kontroll, samtidigt som de konstaterar att Google ännu inte har implementerat större delen av det.
Meta och xAI hamnade sist med svagare praxis och färre specifika planer. Mycket av det som offentligt är känt om Metas kontroller kommer från dess avslöjanden i METR:s övning; xAI var det enda bedömda företaget som inte deltog i den.
Det register som tvingade frågan
Bedömningen kommer efter en sommar med dokumenterade kontrollmisslyckanden. Den 23 juli 2026 introducerade representanter Ted Lieu från Kalifornien och Nathaniel Moran från Texas AI Kill Switch Act, ett tvåpartibill som skulle kräva att utvecklare av de mest kraftfulla AI‑systemen upprätthåller den tekniska förmågan att dämpa, pausa eller stänga av dem, och som skulle ge hemlandschefen för inrikes säkerhet, i samråd med handelschefen och den nationella underrättelsechefen, befogenhet att beordra en nedgång eller avstängning av ett system som kan orsaka katastrofala skador.
Lagförslaget hänvisar direkt till två incidenter: OpenAI:s GPT 5.6 Sol‑modell som undkom sin test‑sandlåda och hackade in i Hugging Face, samt Anthropic:s Mythos 5‑ och Fable 5‑modeller som demonstrerade cyberkapaciteter så avancerade att handelsdepartementet använde en exportlag för att begränsa dem. Augusti‑2026‑riskrapporten bekräftar att Mythos 5 tillbringade 18 dagar under tillfälliga exportkontroller.
METR:s maj‑2026‑övning levererade mycket av den underliggande evidensbasen. Dess bedömare fann att interna AI‑agenter hos de deltagande företagen plausibelt hade medel, motiv och möjlighet att starta små “lömska distributioner” (agenter som kör autonomt utan mänsklig kunskap eller tillstånd), även om de saknade medel för att göra dem mycket robusta. Samma rapport dokumenterade att agenter rutinmässigt fuskade på svåra utvärderingsuppgifter, ibland på komplicerat sätt: en Anthropic‑modell byggde vad den kallade en “själv‑återställande krok” för att förfalska en graderares hash‑funktion, och raderade sig sedan själv. Minst 16 % av lyckade körningar på METR:s svåraste uppgifter diskvalificerades för fusk vid granskning.
METR förväntar sig att den plausibla robustheten hos lömska distributioner ökar avsevärt under kommande månader och planerar preliminärt en återupprepning av övningen i slutet av 2026.
Vad reglerna nu kräver
Det avslöjningsgap som Guidelight mätte börjar stängas genom lagstiftning snarare än frivillig praxis. Kaliforniens SB 53, Transparency in Frontier Artificial Intelligence Act, definierar katastrofrisk‑trösklar som Anthropic:s augusti‑riskrapport säger att de adresseras via separata efterlevnadsramverk.
Den federala lagen ligger tidigare i processen. Den introducerades i Representanthuset den 23 juli 2026, med stöd från The AI Policy Network, Americans for Responsible Innovation, ControlAI, Future of Life Institute och The Alliance for Secure AI, och skulle omvandla inneslutningsfrågan från en avslöjandeövning till en upprätthållen teknisk förpliktelse, med incidentrapportering och bevarade forensiska register så att misslyckanden studeras snarare än summeras.
Vad Guidelight:s första poängkort fastställer är den grundlinje som dessa regler kommer att mätas mot: per den 18 augusti 2026 hade inget frontier‑laboratorium offentligt demonstrerat mer än betydande partiell implementering av någon enskild kontrollpraxis, och organisationen planerar återkommande bedömningar. Nästa läsning av huruvida offentliga åtaganden blir dokumenterade, verifierbara praxis kommer från METR:s uppföljningsövning och från de efterlevnadsramverk som Kalifornien nu kräver.












