Myslitelé
Dozor AI má tři slepá místa — a většina společností nesleduje žádné z nich

Většina diskusí o bezpečnosti AI uvnitř společností je zaměřena na špatný cíl. Týmy tráví týdny debatami o tom, který model použít, a poté propojí tento model s jejich e-mailem, platbami, zákaznickou databází a kódem, aniž by se zastavily u mnohem jednodušší otázky: co se stane, když tato věc něco udělá, kdo to sleduje a zda někdo může zastavit to?
Čísla říkají, že to brzy bude drahé. Gartner odhaduje, že alespoň 15 % rutinních rozhodnutí bude učiněno autonomně pomocí AI v roce 2028, ve srovnání s téměř žádnými v roce 2024. Ve stejné studii varuje, že více než 40 % projektů agentic AI bude zrušeno do konce roku 2027, a jedním z důvodů, které uvádí, je slabá kontrola rizik. Přečtěte si to znovu. Projekty neumírají, protože modely jsou špatné. Umírají, protože nikdo nezavedl způsob, jak je řídit.
Vytvářím systémy řízení pro AI jako součást své práce, takže vidím stejné mezery znovu a znovu. Existují tři z nich. Většina společností nesleduje ani jeden z nich řádně a mnoho z nich nesleduje žádný.
Agenty jsou tím hlasitým
Každý se obává autonomních agentů a právem tak činí. Ale většina lidí se obává špatné části. To, co je znepokojivé na agentovi, není to, že rozumí. Je to to, že jedná. Nenavrhuje refundaci; provede ji. Nevytvoří e-mail; pošle ho. Dejte modelu sadu nástrojů a dáte mu schopnost zasahovat do skutečných systémů a měnit věci.
Pokud to uděláte špatně, selhání nebude pouze nešikovný výrok. Bude to peníze, které zmizí, nebo tabulka, která bude potichu smazána z databáze. A je tu ostrější hranice. Prompt injection je na vrcholu seznamu rizik pro LLM aplikace, a to z dobrého důvodu: pokud se modelu podá špatný text, může být přesvědčen, aby udělal něco, o čem nikdo nežádal. Když model může pouze mluvit, je to otrava. Když model může volat nástroje, je to útočník, který drží vaše API klíče.
Standardní odpověď je zaznamenat vše, co agent dělá, a sledovat stopy. Dobře. Ale stopa je popisem něčeho, co se již stalo. Je to CCTV záznam po tom, co byla pokladna vyprázdněna, užitečný pro vyšetřování, ale k ničemu pro zastavení krádeže.
Ten klidný, o kterém nikdo nemluví
Druhá slepá skvrna se nikdy nedostane na prezentaci, protože je nudná. Je to obyčejný API volání. Ne agent, ne framework, ale pouze kus kódu někde ve službě, který sestaví prompt a pošle ho na model.
Většina AI v produkci skutečně vypadá takto a je nejméně řízenou částí celé sady, přesně protože je tak obyčejná. Je to HTTP požadavek zakopán tři vrstvy hluboko v některé službě, napsaný inženýrem, který nikdy neslyšel o vaší AI politice a nevěděl by, kde ji najít. To jediné volání může odeslat zákaznická data do třetí strany modelu nebo spustit akci dále, a nikdo nekontroluje, zda by to mělo být provedeno, a nikdo nezávisle nezapisuje, že to bylo provedeno.
Ten zmatečný je lidmi
Třetí slepá skvrna je lidmi, a proto je to ta nejhorší. Vaši zaměstnanci si uvědomili před několika měsíci, že vkládání úkolu do ChatGPT nebo Claude ho dokončí rychleji, takže to dělají celý den, obvykle z osobních účtů, které nevidíte. To není hypotetické. Cyberhavenova studie skutečného používání na pracovišti zjistila, že skutečný podíl zaměstnanců vkládal důvěrná firemní data do ChatGPT, většina z nich prostřednictvím účtů, do kterých společnost nemá okno.
Pokud chcete varovnou historku, je to Samsung. V roce 2023 zakázal generativní AI interně poté, co inženýři vkládali proprietární zdrojový kód do ChatGPT, třikrát během méně než měsíce. Ti nebyli špatní aktéři. Byli to dobří inženýři, kteří se snažili ladit rychleji. To je celková past: únik vypadá identicky jako produktivita. A vaše staré nástroje pro ztrátu dat je nechytnou, protože se jedná o kopírování a vkládání do prohlížeče, ne o soubor, který opouští budovu.
Co skutečně funguje
Pokud seřadíme tři, řešení přestává být specifické pro agenty a stává se jednoduchou myšlenkou: řídit, co dělá jakékoli AI, předtím, než to udělá, ne poté. Několik věcí, které skutečně záleží, se naučily většinou tvrdou cestou.
Sedět před akcí, ne za ní. To je celá hra a je to důvod, proč stále trvám na tom, že pozorovatelnost a řízení nejsou stejná slova. Dashboard, který vám říká, že agent přesunul 40 000 liber včera, je zpráva o ztrátě. Něco, co může zastavit převod pro lidské prohlížení, než opustí, je kontrola. Pokud vaše nastavení může říci pouze to, co se stalo, nemáte dohled. Máte zpětný pohled.
Použít jednu kontrolní bod, ne jeden pro každý nástroj. Agenty, API volání a zaměstnanci vkládající do chatbota se zdají jako tři samostatné problémy, takže společnosti kupují tři samostatné nástroje a nakonec mají tři sady mezer mezi nimi. Špatné věci žijí v mezerách. Cokoli, co dělá AI, odkudkoli pochází, by mělo projít stejnou bránou.
Udržet záznam, který AI nemůže přepsat. Pokud systém, který provádí věc, je také jediný, kdo zaznamenává, že provedl věc, nemáte záznam. Máte deník, který mu je dovoleno editovat. To je přesně tam, kde pravidla směřují. Požadavek na vedení záznamů EU AI zákona, článek 12, existuje tak, aby to, co provedl systém s vysokým rizikem, mohlo být rekonstruováno někým jiným než systémem. V praxi to znamená záznam uchovávaný mimo věc, která je zaznamenána, jeden, který nelze potichu upravit poté.
Umístěte člověka na velké, nezvratné volání. Ne všechno, udělejte to a budete utopit lidi v schvalování, dokud je všechny neschválí. Ale volání, která nelze vzít zpět, přesunutí peněz, export dat, smazání záznamů, by mělo zastavit a čekat. EU AI zákon již činí lidský dohled povinným pro systémy s vysokým rizikem, článek 14. Chyťte si to, co stojí za zapamatování, je to, že dohled platí pouze tehdy, pokud má osoba čas a kontext, aby skutečně řekla ne. Schválení, které nikdo nečte, je pouze divadlo.
Čestná kontrola instinktu
Žádná z těchto tří není rohovým případem. Jsou to obyčejný způsob, jakým většina společností v současnosti provozuje AI, potichu, bez velké sítě. Týmy, které projdou dalšími pár lety bez ošklivého incidentu, nebudou ty s nejkrásnějšími grafy. Budou to ty, které se rozhodly brzy, že vše, co dělá jejich AI, agent, API volání, vkládaný odstavec, projde jednou bránou, než se to stane, ne poté.
Pokud chcete rychlou zkoušku svého vlastního nastavení, odpovězte na dvě otázky upřímně. Z těch tří ploch, kolik jich můžete skutečně vidět? A z těch, které můžete vidět, kolik jich můžete zastavit? Pro mnoho společností je upřímná odpověď na druhou otázku nula. To je číslo, které je třeba opravit jako první.












