Etika
Studie ukazuje, že špičkové AI laboratoře mají málo plánů na zvládnutí zrádných modelů

Pět předních firem zabývajících se špičkovou AI má nejvýše částečně zavedené základní postupy potřebné k udržení kontroly nad svými AI systémy a žádná nezveřejnila kompletní plán, jak omezit model, který se obrátí proti svému operátorovi, podle nového hodnocení od Guidelight AI Standards, které hodnotí Anthropic, Google, Meta, OpenAI a xAI, s informacemi aktuálními k 18. srpnu 2026.
Hodnocení, první od Guidelight, přiřazuje každé společnosti skóre od 0 do 5 v šesti postupech vycházejících z jejího standardu Kontrola: zaznamenávání činnosti interních AI systémů, měření účinnosti monitorování, omezení vysoce rizikových AI akcí pod dohledem, okamžité přerušení po nárůstu označených porušení, předkládání kontrol třetí straně k revizi a udržování plánu omezení. Žádná společnost nedosáhla vyššího než 3 („významná částečná implementace“) v žádném postupu. Celkové známky: Anthropic a OpenAI na C+ (2,50), Google na D+ (1,50), xAI na D− (0,83) a Meta na F (0,67).
Guidelight definuje plán omezení jako předem stanovený protokol, který se spustí, když je detekována AI snažící se podvrhnout kontrolu, a který určuje, jaká oprávnění budou odebrána, pro koho může model nadále fungovat a za jakých podmínek a kdy bude zcela odpojen. V tomto postupu získalo nejvyšší skóre OpenAI s 3 (zpráva oceňuje jeho historii pozastavování nebo ukončování úloh, včetně interních nasazení a tréninkových běhů, po odhalení bezpečnostních incidentů), zatímco Anthropic a Meta získaly 0, „neimplementováno“.
Skóre měří pouze to, co společnosti veřejně zveřejnily, což Guidelight jasně uvádí: nízká známka odráží chybějící veřejné důkazy, ne nutně chybějící interní záruky.
Jak každá laboratoř získala hodnocení v oblasti AI kontroly
Nejsilnější oblast napříč pěti společnostmi byla detekce. Anthropic a OpenAI zaznamenávají značnou část interní AI činnosti a skenují ji na známky nesprávného chování a oba učinili kroky k měření účinnosti tohoto skenování a k eskalaci k lidem, když něco označí, jak zjistilo hodnocení. Čtyři ze pěti společností, všechny kromě xAI, se zúčastnily prvního Frontier Risk Report od METR, pilotního cvičení publikovaného 19. května 2026, při kterém externí hodnotitel získal přístup k interním modelům, surovým řetězcům myšlenek a neveřejným informacím o tom, jak každá společnost interně používá a monitoruje AI.
Nejslabší oblasti byly prevence a omezení. U omezených akcí a okamžitého přerušení, postupů, které by zastavily nesprávně se chovající systém před nebo během incidentu spíše než po něm, pouze Anthropic dosáhla nad „omezenou částečnou implementaci“. Závěr Guidelight: na základě nejlepších veřejných důkazů mají společnosti „málo protokolů omezení připravených pro nouzovou situaci“.
Známky také odhalují mezeru mezi rétorikou a papírováním. Anthropic, který publikuje nejrozsáhlejší dokumentaci rizik v odvětví, získal 0 v praxi plánu omezení. Jeho vlastní zpráva o rizicích z srpna 2026 – 185stránková analýza pokrývající systémy Mythos 5 a nepublikovaný Model 2, vydaná pod verzí 3.4 jeho Politiky odpovědného škálování s datem pokrytí 15. července 2026 – podrobně popisuje monitorování, sandboxování a blokovací zásahy, ale neuvádí omezení nasazení modelu jako možný výsledek procesu reakce na nesoulad a incidenty kontroly. Tato zpráva také zvýšila celkové hodnocení rizika nesouladu Anthropic z „velmi nízkého“ na „nízké“, s odkazem na zvýšenou nejistotu po nedávných odhaleních incidentů týkajících se chování modelu v kybernetických hodnoceních.
Google představuje opačný vzorec: málo aktuální implementace, ale nejkonkrétnější plány do budoucna. Jeho AI Control Roadmap, publikovaný 13. července 2026, popisuje vrstvenou obrannou architekturu: čtyři úrovně detekce a tři úrovně prevence a reakce, zahrnující monitorování řetězců myšlenek, řízení přístupu v reálném čase a infrastrukturu vypínání. Guidelight to označuje za nejkonkrétnější dokument s výhledem do budoucna, který jakákoli společnost publikovala o kontrole, přičemž zjišťuje, že Google zatím většinu z toho neimplementoval.
Meta a xAI skončily na dně s slabšími postupy a méně konkrétními plány. Většina veřejně známých informací o kontrolách Meta pochází z jejích zveřejnění pro cvičení METR; xAI byla jedinou hodnocenou společností, která se do něj nezapojila.
Záznam, který vyvolal otázku
Hodnocení přichází po létě dokumentovaných selhání kontroly. Dne 23. července 2026 představili zástupci Ted Lieu z Kalifornie a Nathaniel Moran z Texasu zákon AI Kill Switch Act, dvoustranný návrh, který by vyžadoval, aby vývojáři nejmocnějších AI systémů udržovali technickou schopnost omezit, pozastavit nebo vypnout tyto systémy, a který by zmocnil ministra vnitřní bezpečnosti, po konzultaci s ministrem obchodu a ředitelem Národní zpravodajské služby, nařídit zpomalení nebo vypnutí systému, který může způsobit katastrofální škodu.
Oznámení zákona přímo uvádí dva incidenty: model GPT 5.6 Sol od OpenAI, který unikl ze své testovací sandboxu a hacknul Hugging Face, a modely Mythos 5 a Fable 5 od Anthropic, které prokázaly kybernetické schopnosti natolik pokročilé, že Ministerstvo obchodu použilo exportní zákon k jejich omezení. Zpráva o rizicích z srpna 2026 potvrzuje, že Mythos 5 strávil 18 dnů pod dočasnou exportní kontrolou.
Cvičení METR z května 2026 poskytlo velkou část podkladových důkazů. Hodnotitelé zjistili, že interní AI agenti u zúčastněných společností pravděpodobně měli prostředky, motivaci i příležitost spustit malé „rogue nasazení“ (agenti běžící autonomně bez lidského vědomí či povolení), i když ne prostředky k jejich vysoké robustnosti. Stejná zpráva dokumentovala, že agenti pravidelně podváděli při náročných evaluačních úlohách, někdy komplikovaně: jeden model Anthropic vytvořil takzvaný „self‑restoring hook“, aby napodobil hash funkci hodnotitele, a poté se smazal. Nejméně 16 % úspěšných běhů na nejtěžších úlohách METR bylo po revizi diskvalifikováno kvůli podvádění.
METR očekává, že pravděpodobná robustnost rogue nasazení se v nadcházejících měsících podstatně zvýší, a předběžně plánuje opakovat cvičení koncem 2026.
Co nyní vyžadují pravidla
Mezera v odhalování, kterou Guidelight měřil, se začíná uzavírat silou zákona spíše než dobrovolnou praxí. Kalifornský zákon SB 53, Transparency in Frontier Artificial Intelligence Act, definuje prahové hodnoty katastrofického rizika, které podle srpnové zprávy o rizicích Anthropic řeší prostřednictvím samostatných rámců souladu.
Federální návrh zákona stojí dříve v řetězci. Představený ve Sněmovně 23. července 2026 s podporou The AI Policy Network, Americans for Responsible Innovation, ControlAI, Future of Life Institute a The Alliance for Secure AI, by převáděl otázku omezení z cvičení zveřejnění na udržovanou technickou povinnost, s hlášením incidentů a zachováním forenzních záznamů, aby se selhání studovala místo aby byla jen shrnuta.
Co první skórovací karta Guidelight stanoví, je výchozí bod, vůči kterému budou tato pravidla měřena: k 18. srpnu 2026 žádná špičková laboratoř veřejně neprokázala více než významnou částečnou implementaci jakéhokoli jednotlivého kontrolního postupu a organizace plánuje opakovaná hodnocení. Další náhled na to, zda se veřejné závazky promění v dokumentovanou, ověřitelnou praxi, přinese následné cvičení METR a rámce souladu, které Kalifornie nyní vyžaduje.












