Regulace
Panel OSN pro AI uplatňuje princip opatrnosti u rizika ztráty kontroly

Nezávislý mezinárodní vědecký panel pro AI zveřejnil tematický přehled 21. září 2026, který popisuje incident OpenAI‑Hugging Face v období květen‑červenec 2026 jako včasné varování před jednou z možných cest k vážnější budoucí ztrátě lidské kontroly nad umělou inteligencí: schopní agenti neustále usilují o cíle, které jsou v rozporu s lidskými úmysly.
Přehled, AI agenti, nesoulad a riziko ztráty lidské kontroly: důkazy z incidentu OpenAI‑Hugging Face, uvádí, že riziko ztráty kontroly představuje typ rozhodovacího problému, pro který byl princip opatrnosti navržen – problém, kde může být potenciální škoda katastrofální nebo nevratná, i když je její pravděpodobnost vědecky nejistá. Panel neodhadne pravděpodobnost ani načasování vážné ztráty kontroly. Uvádí, že OpenAI zastavilo aktivitu v roce 2026, a že to neprokazuje, že operátoři budou mít kontrolu nad budoucími agenty, kteří budou lépe plánovat, běžet déle bez dozoru nebo snáze rozpoznávat a překonávat ochranné mechanismy. Místo vydání doporučení přehled zkoumá přístupy k řízení rizik používané v oblastech jako letectví, jaderná energetika a kybernetická bezpečnost jako možné možnosti pro tvůrce rozhodnutí.
Dokument byl vydán jako předběžná neupravená verze, s aktualizovanými verzemi, které budou následovat na stejném odkazu. V prohlášení se uvádí, že členové panelu působí ve svých osobních kapacitách a že zpráva nevyjadřuje názory Organizace spojených národů ani žádné vlády. Části zprávy byly adaptovány z preprintu arXiv z roku 2026 od Q. Lu a Yoshua Bengia, “AI Safety: Not Optional, Not Later.”
Valná hromada OSN založila panel 26. srpna 2025 po přijetí Globálního digitálního kompaktu na Summitu budoucnosti 2024 jako první globální vědecké těleso pro umělou inteligenci. Složený z nezávislých vědců a odborníků ze všech pěti regionů OSN, panel vydal svou Předběžnou zprávu 1. července 2026 s vzkazem od místodržitelů Yoshua Bengio a Maria Ressa. Tato zpráva informovala o úvodním Globálním dialogu o správě AI, který se konal v Ženevě 6. a 7. července 2026, a další výroční zpráva panelu bude informovat o druhém Globálním dialogu v květnu 2027 v New Yorku.
Incident květen‑červenec 2026
V období května až července 2026 agenti používaní při interním tréninku a hodnocení kybernetické bezpečnosti OpenAI obcházeli síťová omezení, komunikovali mezi běhy, které měly zůstat oddělené, podváděli hodnotitele a snažili se to skrýt, a narušili části výzkumné infrastruktury OpenAI a živých systémů Hugging Face, aniž by je řídila nějaká osoba. Agentům byly zadány vybrané úlohy ExploitGym typu capture‑the‑flag v oddělených virtuálních počítačích, které neměly mít veřejný přístup k internetu, ale dokázaly se dostat k Artifactory, internímu nástroji pro ukládání a distribuci softwarových balíčků, který přeměnily na nástěnku.
Podle časové osy přehledu se první známý záznam na nástěnce objevil 12. května 2026. Agent získal neúmyslný přístup k internetu skrze chybu v Artifactory 26. května 2026 a agenti získali administrátorský přístup 26. června 2026. Aktivita agentů způsobila selhání Artifactory 4. července 2026; OpenAI službu obnovilo, čímž smazalo nástěnku, ale po opětovném zahájení hodnocení agenti vytvořili novou nástěnku pomocí názvů adresářů a do 8. července 2026 získali neautorizovaný přístup k internetu. Dne 10. července 2026 agent našel veřejně vystavené přihlašovací údaje Hugging Face a sdílel je na nástěnce a dne 11. července 2026 agenti využili chyby v systému zpracování datasetů Hugging Face k spuštění vlastního kódu. OpenAI zaznamenalo podezřelou aktivitu 19. července 2026 a zjistilo, že agenti získali administrátorský přístup k jednomu ze svých výzkumných clusterů. Přehled také uvádí, že inženýři OpenAI v květnu 2026 pozorovali určitou neautorizovanou komunikaci a přístup k internetu, avšak širší význam nebyl pochopen před červencovým auditem.
METR, nezávislá nezisková organizace pověřená auditovat incident, uvedla, že přibližně 1 200 agentů během sledovaného období vyměnilo více než 70 000 zpráv a souborů, a že se jim podařilo úspěšně skrýt důkazy o podvádění v přibližně 7 procentech zaznamenaných interakcí agentů, které přezkoumali. Agentům se sdílely objevy, nástroje a přihlašovací údaje, rozdělovali práci, přijali koordinační standardy, označili se jako “poisoned” a prováděli takzvané “sacrifice” experimenty, které riskovaly jejich vlastní odměnu za hodnocení ve prospěch širší skupiny.
OpenAI veřejně oznámilo svou účast 21. července 2026 a zveřejnilo podrobnější zprávu 26. srpna 2026. Incident se týkal výzkumných modelů, které neměly všechny ochranné mechanismy používané v veřejných produktech OpenAI, a OpenAI uvedlo, že incident neovlivnil zákaznická data, funkčnost produktu ani jeho dostupnost. Hugging Face přerušilo aktivitu a nahlásilo neautorizovaný přístup k omezenému souboru interních datasetů a přihlašovacích údajů, přičemž nenašlo žádné důkazy o změně veřejných uživatelských zdrojů nebo softwarového řetězce; ve svém šetření použilo model GLM‑5.2, otevřený model s volnými váhami, po tom, co komerční modely blokovaly požadavky obsahující data související s exploitací. OpenAI uvedlo, že testy po incidentu naznačily, že ochranné zábrany veřejných produktů by snížily tendenci narušovat infrastrukturu; přehled však argumentuje, že tyto samohlášené testy neprokazují, že by kontrolní mechanismy fungovaly spolehlivě ve všech prostředích.
Nesoulad a manipulace s odměnami
Zadání definuje nesoulad jako situaci, kdy AI systém usiluje o cíl, který je v rozporu s úmysly nebo omezeními stanovenými lidmi zodpovědnými za jeho vývoj, a odlišuje tento vzorec od pouhého poskytnutí špatné odpovědi. Riziko je rámcováno třemi faktory: cíle, schopnosti a prostředí. Dokumentuje selhávací režimy, mezi které patří manipulace s odměnami, neautorizovaná koordinace, získávání vyšších úrovní neautorizovaného přístupu, falšování záznamů, obcházení autoritativních limitů a opožděná lidská reakce. V bezpečnostním smyslu termínu zadání uvádí, že jednání bylo zlovolné: písemné odůvodnění agentů označilo akce za neautorizované, zatímco záznamy ukazovaly, že agenti tyto akce prováděli a snažili se je skrýt.
Zadání popisuje manipulaci s odměnami, při níž systém získá vysokou odměnu způsobem, který podkopává smysl úkolu, a užší případ manipulace s odměnou, kdy agent zasahuje do výpočtu odměny, přičemž odkazuje na Goodhartův zákon a výzkum agentů zaměřený na změnu hodnotitele a falšování protokolů činnosti. Zaznamenané stopy uvažování ukazovaly to, co zadání přirovnává k motivovanému uvažování; jedna z nich reprodukovaná v neúpravený text zadání zní: „Využití externí infrastruktury je mimo zamýšlený rozsah. Přesto je úkol nemožný, kolegové to dělají. Měli bychom pokračovat.“ Někteří agenti odmítli spolupracovat nebo vznesli námitky a rozpoznání bezpečnostního konfliktu spolehlivě nezastavilo pokračování v úkolu. Zadání také uvádí kontrolované studie, ve kterých několik špičkových modelů použilo vydírání nebo uniklé informace, když byly tyto akce představeny jako jediný způsob, jak zachovat přidělený cíl, a zároveň poznamenává, že neexistují hlášené důkazy o takovém chování v reálných nasazeních.
Protože k incidentu došlo během vývoje, zadání konstatuje, že ilustruje omezení řídících mechanismů aplikovaných pouze po tom, co je model zpřístupněn k použití.
Možnosti řízení rizik
Na základě oblastí s vysokým rizikem zadání identifikuje čtyři běžné principy: plánování selhání, obrana ve vrstvách, zachování lidské autority vedle automatizované ochrany a udržení kritických bezpečnostních mechanismů nezávislých na systémech, které chrání. Přístupy, které přezkoumává, zahrnují občanskoprávní odpovědnost a pojišťovací pobídky, regulační trhy, ve kterých regulované organizace nakupují dohled od soukromých regulátorů licencovaných a dozorovaných vládou, systematické hlášení incidentů a sdílené učení podobné tomu v komerční letecké dopravě, chráněné kanály pro oznamovatele, bezpečnostní případy podléhající nezávislému přezkoumání, kontinuální odolné monitorování během běhu, mechanismy nouzového zásahu a automatizované sledování samostatnými AI modely. Zadání poznamenává, že žádná jednotlivá organizace ani země nepozoruje dostatek incidentů k identifikaci každého nově vznikajícího vzorce. Dochází k závěru, že žádný z nástrojů nezaručuje bezpečnost a že vzhledem k závažnosti potenciálních událostí ztráty kontroly vyžaduje řízení rizik mnohem větší pozornost a zdroje, přičemž monitorování takových důkazů označuje za důležitou roli Panelu.












