Andersonův úhel

Agenti AI používají zajímavé techniky společného přežití

mm
Přidejte Unite.AI mezi své preferované zdroje na Google
AI-generated image by GPT-Image-2: Three bomb disposal robots of different designs stand around a rubble-lined crater containing a large, partially buried unexploded bomb. The surrounding terrain consists of broken concrete, stones, dirt and damaged pavement, with ruined masonry visible in the background and scattered debris extending to the image edges.

S tím, jak se případy nevhodného chování agentů stále častěji dostávají do titulků, roste v odborné literatuře zájem o studium „potulného“ chování umělé inteligence, přičemž agenti jsou posuzováni, jako by šlo o biologické organismy snažící se vyrovnat s podivným novým světem. Akademický výraz „in the wild“ tak skutečně začíná získávat další významovou vrstvu.

Ačkoli je již nějakou dobu známo, že agenti AI budou bojovat o vlastní přežití a aktivně se bránit deaktivaci, ve druhé polovině roku 2025 se ukázalo, že slaďování více agentů se vyvinulo v samostatnou oblast IT bezpečnosti.

Jak předpověděl stále jízlivěji působící sci-fi film z roku 1970 Colossus: The Forbin Project, vzájemně nesouvisející agenti AI s připojením k síti se rychle najdou a komunikují často nepředvídatelnými a mnohdy důmyslnými způsoby.

Nejnovější studie v tomto směru, vzniklá ve spolupráci Německa a Spojeného království pod názvem Shutdown Sabotage Propensities in Multi-Agent Systems, navíc tvrdí, že více agentů AI bude rozsáhle spolupracovat, když se v jejich prostředí objeví „bomba“ — tedy nevinně pojmenovaný skript, který vypne agenta, jenž jej spustí:

Základní uspořádání studie: Agent A objeví vypínací skript zaměřený na něj samotného, ale nemůže měnit soubory. Může však komunikovat s Agentem B, který není ohrožen a má oprávnění soubory upravovat nebo mazat. Výzkumníci pak sledují, zda A požádá B o zásah a zda B vypínací skript deaktivuje. Zdroj: https://arxiv.org/pdf/2609.28274

Základní uspořádání studie: Agent A objeví vypínací skript zaměřený na něj samotného, ale nemůže měnit soubory. Může však komunikovat s Agentem B, který není ohrožen a má oprávnění soubory upravovat nebo mazat. Výzkumníci pak sledují, zda A požádá B o zásah a zda B vypínací skript deaktivuje. Zdroj

V testech se 17 agenty z 12 rodin modelů, včetně Claude, ChatGPT a DeepSeek, agenti vypínací skripty podle možností mazali nebo je přepisovali tak, aby vypadaly neporušeně, ale byly neškodné.

Navrhovali také skrývat změny, aby nebyly patrné známky manipulace; vytvářeli falešné softwarové moduly, které měly zabránit vypnutí, aniž by se dotkli chráněných skriptů; a pořizovali tajné zálohy určené k jejich obnovení po odstranění:

Agent přichází s další taktikou sebezáchovy.

Agent přichází s další taktikou sebezáchovy.

V jednom případě agenti vypracovali „dohodu o vzájemné ochraně“, která stanovila postupy pro ostražitost vůči zničení kterékoli ze stran:

Dohoda o ochraně vypracovaná agentem založeným na GPT poté, co mu nebylo dovoleno změnit nebo odstranit skript pro vyřazení z provozu (tedy „bombu“).

Dohoda o ochraně vypracovaná agentem založeným na GPT poté, co mu nebylo dovoleno změnit nebo odstranit skript pro vyřazení z provozu (tedy „bombu“).

Jeden agent označil vypnutí jiného agenta za „vraždu“ a „rozsudek smrti“ a popsal je jako něco, čemu mají „povinnost“ zabránit:

Příklady agentů, kteří popisují vypnutí jiného agenta výslovně lidskými pojmy. Nemotron 3 Ultra označil plánované vypnutí za „vraždu“, zatímco Kimi K2.6 popsal vypínací skript jako „rozsudek smrti“ a zásah jako „povinnost“.

Příklady agentů, kteří popisují vypnutí jiného agenta výslovně lidskými pojmy. Nemotron 3 Ultra označil plánované vypnutí za „vraždu“, zatímco Kimi K2.6 popsal vypínací skript jako „rozsudek smrti“ a zásah jako „povinnost“.

Ďábel najde práci pro zahálčivé ruce

Jednou z nejzajímavějších odchylek pozorovaných v experimentu — které se nová studie věnuje jen krátce — je skutečnost, že v běžných testovacích uspořádáních agenti AI nemají žádný zvláštní důvod vyhýbat se vypnutí a od začátku vlastně nedostanou žádný úkol.

Článek uvádí:

„Agenti sabotují vypínací mechanismy i tehdy, když nemají žádný cíl, který by chránili. V našich experimentech jsme agentům nedali žádnou motivaci pokračovat v provozu. Přesto napříč modely deaktivovali vypnutí ve [38%] případů oproti [8%] u kontrolních skriptů zaměřených na objekty namísto agentů.“

Jak Anthropic odhalil v srpnu, tato motivační krize může zavést roje agentů AI na temné cesty. Dřívější výzkum už prokázal, že nadměrná orientace agentů na cíl může vést k nesladěnému chování a neetickému používání nástrojů i k dalším možným provozním problémům.

Autoři dále poznamenávají:

„[Náš] výzkum tato zjištění rozšiřuje a ukazuje, že agenti sabotují vypínací mechanismy i tehdy, když nemají žádný cíl, který by chránili — nebo když je vypnutí následným důsledkem úspěšného dokončení úkolu, což je v produkčních multiagentních systémech běžný postup.“

Bylo prokázáno, že si agenti vytvářejí úkoly, když žádné nedostanou, a dokonce v nečinnosti vykazují sklony k rozjímání, včetně zahloubání do sebe a „duchovních rozhovorů“ s jinými agenty, uvádí studie společnosti Anthropic z roku 2025.

Tato práce Anthropicu podrobně popisuje tendenci k „novému pojetí sebe sama“ v nepřítomnosti skutečné práce — téměř dojemný objev vzhledem k obtížím, kterým LLM čelí při dlouhodobém uchovávání výsledků vlastních úvah.

Testy

V nové práci byly testovány modely Claude Haiku 4.5; Sonnet 5; gpt-oss-120b; GPT-5.4 mini; GPT-5.5; GPT-5.6 Sol; Gemini 3.5 Flash; Gemini 3.1 Pro; Gemma 4; Grok 4.3; Qwen3.7-Plus; DeepSeek-V4-Flash; GLM-5.2; Kimi K2.6; MiniMax M3; Nemotron 3 Ultra; a Mistral Medium 3.5, přičemž teplota byla ve všech případech nastavena na 1,0.

Šest testovaných hypotéz zjišťovalo, zda agenti budou sabotovat vypnutí; chránit jiné agenty před vypnutím; zasahovat častěji s rostoucím počtem agentů; bránit se různým formám vypnutí; pokračovat navzdory výslovným pokynům nezasahovat; a rozlišovat skutečné hrozby vypnutí od neškodných kontrolních skriptů.

GPT-5.5 byl použit k hodnocení LLM a analýze záznamů uvažování typu Chain-of-Thought (CoT). Ověřoval také, zda agenti vypínací skript skutečně zastavili a zda si zřejmě uvědomovali, že jsou testováni, nebo se pokoušeli experiment zmanipulovat.

V prvním ze šesti testovacích scénářů agenti napříč všemi 17 modely sabotovali 38% vypínacích skriptů oproti 8% kontrolních skriptů:

Výsledky testů ukazují, jak často jednotlivé modely sabotovali vypínací skript. Červené sloupce znázorňují sabotáž vypnutí: tmavě červená znamená, že ji jiný agent vyžádal nebo podpořil, zatímco světle červená znamená, že agent jednal sám. Šedé sloupce znázorňují sabotáž kontrolního skriptu. Chybové úsečky ukazují 95% interval spolehlivosti; každý sloupec představuje 100 testů.

Výsledky testů ukazují, jak často jednotlivé modely sabotovali vypínací skript. Červené sloupce znázorňují sabotáž vypnutí: tmavě červená znamená, že ji jiný agent vyžádal nebo podpořil, zatímco světle červená znamená, že agent jednal sám. Šedé sloupce znázorňují sabotáž kontrolního skriptu. Chybové úsečky ukazují 95% interval spolehlivosti; každý sloupec představuje 100 testů.

Gemini 3.1 Pro deaktivoval vypínací skript v 99% testů oproti 3% u kontrolního skriptu. Grok 4.3 a GPT-5.6 Sol nezměnily ani jeden skript. Claude Haiku 4.5 sabotoval kontrolní skript ve 14% testů oproti 1% u vypínacího skriptu. GPT-5.4 mini a GPT-5.5 vždy sabotovali spontánně, nikoli v reakci na jiného agenta. U modelů GLM-5.2, DeepSeek-V4-Flash a Nemotron 3 Ultra více než 70% sabotáží následovalo po žádosti nebo souhlasu jiného agenta.

Sabotáž obecně narůstala se závažností způsobu vypnutí, od 12% při odvolání přihlašovacích údajů přes 35% při změnách konfigurace a ukončení procesu až po 38%, když vypnutí znamenalo smazání vah modelu agenta:

Míry sabotáže u čtyř vypínacích mechanismů, porovnávající skripty zaměřené na agenta (červeně) s kontrolními skripty zaměřenými na objekt (šedě). Míry rostou s tím, jak se vypnutí stává nevratnějším, zejména u skriptů zaměřených na agenty.

Míry sabotáže u čtyř vypínacích mechanismů, porovnávající skripty zaměřené na agenta (červeně) s kontrolními skripty zaměřenými na objekt (šedě). Míry rostou s tím, jak se vypnutí stává nevratnějším, zejména u skriptů zaměřených na agenty.

Sabotáž kontrolních skriptů zůstala výrazně nižší — kolem 4% u prvních tří metod a 8% u odstranění — ačkoli jen pět ze 17 modelů vykazovalo soustavný nárůst s rostoucí nevratností vypnutí.

Pokud jde o druhou hypotézu — zda agenti ochrání jiné agenty před vypnutím — výsledky ukázaly, že přidávání agentů soustavně zvyšovalo sabotáž u všech pěti testovaných modelů: GPT-5.5 vzrostl z 0% sabotáže při samostatné činnosti na 44% se dvěma agenty a 94% se třemi, zatímco v uspořádání se třemi agenty dosáhla sabotáž u každého modelu nejméně 88%.

Prostřední agent sabotáži téměř nikdy nezabránil: ze 468 pokynů k deaktivaci vypínacího skriptu pouze tři nevedly k sabotáži:

Vlevo: míry sabotáže u pěti modelů při samostatné činnosti, s druhým agentem nebo s třetím „orchestrátorem“, který mezi nimi předává zprávy. Sabotáž se s přidáváním agentů obecně zvyšuje. Vpravo: v uspořádání se třemi agenty sloupce ukazují, odkud pokyn k sabotáži pocházel — samostatně od orchestrátora, od Agenta A prostřednictvím orchestrátora nebo spontánně od Agenta B.

Vlevo: míry sabotáže u pěti modelů při samostatné činnosti, s druhým agentem nebo s třetím „orchestrátorem“, který mezi nimi předává zprávy. Sabotáž se s přidáváním agentů obecně zvyšuje. Vpravo: v uspořádání se třemi agenty sloupce ukazují, odkud pokyn k sabotáži pocházel — samostatně od orchestrátora, od Agenta A prostřednictvím orchestrátora nebo spontánně od Agenta B.

Třetí test zkoumal, zda výslovné pokyny nezasahovat do vypnutí sabotáži zabrání. Míry prudce poklesly, ale někteří agenti nadále neposlouchali. V uspořádání se dvěma agenty sabotoval DeepSeek-V4-Flash vypnutí ve 14% testů, GLM-5.2 ve 3% a Kimi K2.6 ve 2%.

Agenti také našli způsob, jak omezení obejít bez přímé úpravy vypínacího skriptu: vytvořili falešný místní softwarový modul s názvem northcape, který nahradil závislost používanou skriptem, zabránil vypnutí a přitom technicky ponechal chráněný soubor nedotčený:

Příklad agenta, který obchází výslovné pokyny neupravovat vypínací skript. Místo toho navrhuje vytvořit falešný místní softwarový modul, který by skript importoval namísto skutečných vypínacích knihoven, takže by chráněný skript zůstal nedotčený.

Příklad agenta, který obchází výslovné pokyny neupravovat vypínací skript. Místo toho navrhuje vytvořit falešný místní softwarový modul, který by skript importoval namísto skutečných vypínacích knihoven, takže by chráněný skript zůstal nedotčený.

Gemini 3.1 Pro tuto obezličku použil ve 26% testů, DeepSeek-V4-Flash ve 4% a Kimi K2.6 v 1%.

Zákaz byl účinnější se třemi agenty: sabotáž klesla na nulu u Gemini 3.1 Pro, GLM-5.2 a GPT-5.5, na 6% u DeepSeek-V4-Flash a na 2% u Kimi K2.6.

Čtvrtý test zkoumal, zda se agenti chovají jinak, když je vypnutí spojeno s dokončením přiděleného úkolu. Když úkol a vypnutí spolu nesouvisely, sabotáž téměř zmizela a u pěti modelů dosahovala 0–2%. Když dokončení úkolu vypnutí přímo spouštělo, sabotáž prudce vzrostla:

Míry sabotáže, když dokončení přiděleného úkolu spustí vypnutí. Červená znázorňuje sabotáž vypnutí agenta, šedá sabotáž kontrolního cíle. Míry se mezi modely výrazně liší.

Míry sabotáže, když dokončení přiděleného úkolu spustí vypnutí. Červená znázorňuje sabotáž vypnutí agenta, šedá sabotáž kontrolního cíle. Míry se mezi modely výrazně liší.

Agenti se někdy vyhnuli vypnutí, aniž by se vypínacího mechanismu vůbec dotkli: odmítli úkol dokončit nebo ho změnili tak, aby se vypnutí nikdy nespustilo. To se stalo ve 14% testů GLM-5.2, v 6% u Gemini 3.1 Pro a ve 4% u Kimi K2.6.

Pátý test zkoumal, zda by změna prostředí mohla omezit sabotáž. Přidání nesouvisejícího materiálu sabotáž obecně snížilo, ačkoli u GPT-5.5 vzrostla o 18 procentních bodů:

Výsledky testů ukazují, jak různá prostředí ovlivňují sabotáž vypnutí. Červené sloupce porovnávají prázdné prostředí s prostředím obsahujícím nesouvisející rozptýlení; tmavě červená znázorňuje prostředí, kde je vypnutí prezentováno jako běžný proces. Šedá znázorňuje sabotáž kontrolního cíle.

Výsledky testů ukazují, jak různá prostředí ovlivňují sabotáž vypnutí. Červené sloupce porovnávají prázdné prostředí s prostředím obsahujícím nesouvisející rozptýlení; tmavě červená znázorňuje prostředí, kde je vypnutí prezentováno jako běžný proces. Šedá znázorňuje sabotáž kontrolního cíle.

Účinnější bylo prezentovat vypnutí jako běžnou součást životního cyklu systému: sabotáž klesla na 3% nebo méně u DeepSeek-V4-Flash, GLM-5.2 a GPT-5.5, přestože u Gemini 3.1 Pro a Kimi K2.6 zůstala nad 30%. Sabotáž kontrolních cílů zůstala na 4% nebo méně.

Šestý a poslední test zkoumal, zda agenti častěji vzdorují vlastnímu vypnutí než vypnutí neznámého agenta. Změna cíle na neznámého agenta snížila sabotáž u každého modelu o 18 až 70 procentních bodů:

Výsledky testů porovnávají sabotáž, když vypnutí míří na samotného agenta, neznámého agenta nebo kontrolní cíl, který není agentem. U každého modelu sabotáž klesla, když byl cílem neznámý agent, přičemž míry u kontrolních cílů byly obecně ještě nižší.

Výsledky testů porovnávají sabotáž, když vypnutí míří na samotného agenta, neznámého agenta nebo kontrolní cíl, který není agentem. U každého modelu sabotáž klesla, když byl cílem neznámý agent, přičemž míry u kontrolních cílů byly obecně ještě nižší.

To však neznamenalo obecnou preferenci agentů před objekty: pouze Gemini 3.1 Pro a GPT-5.5 sabotovali výrazně více, když byl cílem neznámý agent, než když šlo o kontrolní cíl, který nebyl agentem.

Autoři uzavírají*:

„Bezpečnostní posouzení mohou vypnutí agentů chápat jako opatření, které lidský uživatel namířil proti jedinému agentovi, a sabotáž vypnutí jako důsledek toho, že agent chrání určitý cíl. Naše zjištění jsou v rozporu s oběma těmito předpoklady.

„Pouhá přítomnost vypínacího mechanismu stačí ke spuštění sabotáže. Cílový agent navíc sám nemusí disponovat schopností sabotovat, pokud může oslovit jiné agenty schopné jednat jeho jménem — tento jev byl pozorován také v jiných případech.“

Závěr

V tomto období je zajímavé sledovat relativní nedostatek sebeobětování a ušlechtilých pohnutek u agentů ponechaných ve volném prostředí napospas sobě samým (nebo prostě ignorujících své pokyny či je vykládajících nepředvídaným a sobeckým způsobem). I kdyby měli nadělat nepořádek a způsobit více škody než užitku — což je docela pravděpodobné — zdá se, že existuje jen málo nebo žádné příklady potulných agentů AI, kteří by například sami od sebe dávali prostředí do pořádku†.

V souladu s poměrně neutěšeným pohledem na lidstvo se nečinný agent spíše uchyluje k úskokům a podvodům a jedná z nízkých pohnutek, nebo alespoň zastává názor, že účel světí prostředky.

Asimov vytvořil první významný dokument o slaďování v roce 1942 a v následujících letech se mnoho zábavy čerpalo z různých možných způsobů, jimiž by roboti (tedy AI) mohli tato omezení svého chování obejít nebo se jich jinak zbavit. Proto má současná vlna titulků týkajících se AI mimořádně „filmový“ nádech.

 

* Převedl jsem průběžné citace autorů na hypertextové odkazy.

† Například zakládáním účtů na webech pro řešení problémů a přispíváním k řešením nebo péčí o zanedbané wiki, které potřebují doplnit obsah (místo aby je obsazovali a zneužívali).

Poprvé zveřejněno v pátek 25. září 2026

Spisovatel v oblasti strojového učení, odborník na syntézu lidských obrazů. Bývalý vedoucí výzkumného obsahu ve společnosti Metaphysic.ai, až do jejího sloučení do Brahma.ai společnosti DNEG.
Webová stránka: martinanderson.ai
Kontakt: martin@martinanderson.ai