Myslitelé

AI agenti mohou vykonávat práci. Ale dokáží je podniky provozovat?

mm
Přidejte Unite.AI mezi své preferované zdroje na Google

AI agenti se stávají pozoruhodně dobrými v plnění úkolů. Pokud agentovi dáte cíl, přístup k vhodným nástrojům, dostatek kontextu a dobře definovaný pracovní postup, může zkoumat informace, analyzovat dokumenty, rozhodovat, aktualizovat systémy a koordinovat se s dalšími agenty.

To je ta vzrušující část Agentické AI. Je to také část, kterou obvykle vidíme v ukázkách.

Podnikové operace vypadají jinak. Žádost o půjčku se během schvalování změní. Zákazník po dokončení ověření poskytne nové informace. Dva systémy nesouhlasí ohledně stejného účtu. Schválení, které bylo platné včera, už dnes nemusí být platné. Agent shrne případ, než jej předá dalšímu agentovi, a zdánlivě drobný detail v procesu zmizí.

Optimální cesta může představovat 80 % toho, co agent musí udělat. Podniky žijí v zbývajících 20 %.

Rámec 80/20 není průmyslovou statistikou. Je to způsob, jak popsat, kde se operační složitost obvykle skrývá. Náročná část podnikových operací často není normální případ, ale výjimky, předání úkolů, závislosti, měnící se kontext a rozhodnutí, kde organizace zůstává odpovědná za výsledek.

Jak AI přechází od odpovídání na otázky k provádění akcí, tato operační složitost se stává mnohem důležitější. Podniky budou muset přemýšlet nejen o tom, jak jsou agenti vytvářeni, ale také o tom, jak jsou provozováni.

To je místo, kde Agentic Operations začíná.

Od generování odpovědí k provádění akcí

První vlna podnikového generativního AI se zaměřovala převážně na informace. Modely shrnovaly dokumenty, generovaly zprávy, odpovídaly na otázky, prohledávaly podnikovou znalostní bázi a pomáhaly zaměstnancům rychleji plnit stávající úkoly.

Agenti zavádějí něco zásadně odlišného. Mohou provádět akce, které mění stav obchodního procesu. Agent může něco schválit nebo odmítnout, aktualizovat záznamový systém, odeslat komunikaci zákazníkovi, spustit další pracovní postup, zavolat jiného agenta nebo učinit rozhodnutí, které určuje, co se stane dál.

OpenAI popisuje agenty ve svém praktickém průvodci jako systémy, které samostatně plní úkoly jménem uživatelů, používají modely k řízení provádění pracovních postupů a nástroje k interakci s externími systémy. Provozní důsledek nesprávné odpovědi se výrazně liší od důsledku nesprávné akce.

Podniková otázka se tedy mění. Není již dostačující se ptát, zda model vygeneroval dobrou odpověď nebo zda agent úspěšně dokončil svěřený úkol. Podniky stále častěji potřebují vědět, zda měla akce vůbec proběhnout, s ohledem na obchodní kontext, zásady, pravomoci a vše, co se v procesu dříve odehrálo.

Obrázek 1: Generativní AI vytváří výstup. Agentická AI mění stav podniku.

Jakmile AI může měnit stav podniku a ovlivňovat následná rozhodnutí, spolehlivost již nelze měřit jen na úrovni modelu.

Agent může uspět, i když podnikový proces selže

Zvažte workflow schvalování půjček poháněný AI. Jeden agent extrahuje dokumenty žádosti, další ověřuje příjmy, další hodnotí úvěrové informace a pozdější agent shrne případ před tím, než agent pro schvalování učiní nebo doporučí rozhodnutí.

Každý agent má jasně definovanou odpovědnost a může ji vykonávat správně. Agent pro dokumenty může extrahovat správné informace. Agent pro ověření příjmů může úspěšně dokončit svůj úkol. Agent pro shrnutí může vytvořit přesné shrnutí dostupných informací. Agent pro schvalování může správně následovat své instrukce.

Konečné podnikové rozhodnutí může stále být špatné.

Představte si, že aktualizované informace o příjmech dorazí po počátečním ověření. Nový dokument je zpracován, ale jeho význam je snížen, když je případ shrnut pro další krok. Konečný agent pro schvalování obdrží rozumné shrnutí, jen ne kompletní obchodní kontext, který existoval během celého procesu.

Nic nutně nezhavarovalo. Žádné API neselhalo. Žádný jednotlivý agent nutně nehalucinoval. Každá součást může hlásit úspěšné provedení, zatímco podnikový proces dosáhne špatného výsledku.

Anthropic diskutuje o souvisejícím problému ve svých pokynech pro budování efektivních agentů, uvádí, že autonomní systémy mohou čelit kumulativním chybám, jakmile provedou více kroků. Problém se rozšiřuje za hranice přesnosti modelu, protože stav, kontext, rozhodnutí a předpoklady se přesouvají napříč pracovním postupem.

Toto vytváří důležitý rozdíl mezi spolehlivost agenta a spolehlivost podnikového procesu. Podnik nakonec neprožívá jednotlivého agenta. Prožívá výsledek vytvořený celým procesem.

Obrázek 2: Místní úspěch nezaručuje obchodní úspěch

Jedná se o jednu z důležitých změn zavedených Agentickým AI. Pracovní postup může selhat i když se všechny komponenty při samostatné kontrole jeví jako zdravé.

Schopnost není pravomoc

Většina současného zásobníku agentů se pochopitelně soustředí na schopnosti. Týmy chtějí vědět, zda agent dokáže uvažovat, vybrat správný nástroj, dokončit úkol, zotavit se z chyb a fungovat s přijatelnou přesností a latencí.

Podniky mají další požadavek: pravomoc.

Předpokládejme, že underwritingový agent je schopen schválit úvěr. To neznamená, že by měl schválit každý úvěr, který dokáže vyhodnotit. Jeho pravomoc může záviset na výši úvěru, rizikové kategorii, typu zákazníka, dostupných důkazech, úrovni důvěry, předchozích rozhodnutích nebo na tom, zda se žádost po předchozím přezkoumání změnila.

Vytváří to hranici mezi tím, co agent může udělat a tím, co agent smí udělat.

OpenAI doporučuje posoudit riziko spojené s nástroji agentů a přidat ochranná opatření nebo lidský zásah u citlivých a nevratných akcí. Microsoft přistupuje podobně ve svých pokynech pro agenturní řízení klíčových obchodních procesů, kde agenti mohou činit rutinní rozhodnutí v definovaných mezích, zatímco práva rozhodování určují, které akce mohou být prováděny samostatně a které vyžadují schválení člověkem.

Jak se schopnosti agentů zlepšují, tato rozdílnost se stává důležitější, nikoli méně. Schopnější agenti mohou provádět závažnější akce. Podniky proto potřebují jasnější způsoby, jak definovat a vynucovat hranice, v nichž jsou tyto akce povoleny.

Otázka se posouvá od Dokáže agent toto udělat? k Za jakých podmínek by měl být agent povolen toto udělat?

Obchodní politika se musí přiblížit provádění

Podniky již mají rozsáhlé mechanismy pro řízení procesů řízených lidmi. Používají SOP, schvalovací matice, politiky souladu, prahové hodnoty rizika, školení, oddělení povinností, audity a eskalační postupy. Většina těchto mechanismů byla navržena na jednoduchém předpokladu: osoba přečte pravidlo, pochopí situaci a pravidlo aplikuje při vykonávání práce.

Agenti tento předpoklad mění.

Zvažte politiku vyžadující sekundární schválení pro transakce nad určitou hranicí. Když úkol provádí člověk, politika může existovat v dokumentu podpořeném školením a kontrolami pracovního postupu. Když agent může rychle provést stovky či tisíce akcí, existence takového dokumentu sama o sobě nebrání akci, která politiku porušuje.

Mezi psanou politikou a obchodní akcí musí politika získat operativní podobu.

Toto neznamená, že každá politika musí být převedena na deterministický kód. Některé kontroly budou deterministické, některé budou vyžadovat sémantickou interpretaci, některé budou záviset na riziku nebo důvěře a jiné budou i nadále vyžadovat lidský úsudek. Hlavní architektonickou změnou je, že obchodní politika se začíná posouvat blíže k prováděcímu řetězci.

AWS toto uvádí konkrétně v kontextu Agentického AI ve finančních službách, včetně potřeby validace akcí agentů na základě politik a auditních stop u důsledných aktivit.

Historicky mohly organizace definovat mnoho požadavků na správu před provedením a později ověřovat soulad prostřednictvím auditů a revizí. Když autonomní systémy působí kontinuálně a rychlostí stroje, některé kontroly musí fungovat během samotného běhu procesu.

Lidský zásah je nezbytný, ale není provozním modelem

Nejčastější reakcí na nejistotu v AI pracovním postupu je zařadit člověka do smyčky. To dává smysl, zejména u důsledných rozhodnutí, ale stává se problematickým, když je lidské přezkoumání považováno za odpověď na každou výjimku.

Představte si agenturní operaci zpracovávající tisíce či miliony rozhodnutí. Pokud je každá neobvyklá situace, výsledek s nízkou důvěrou, nejasnost politiky nebo výjimka směrována k člověku, organizace neodstranila úzké hrdlo operací. Jednoduše ho přesunula do fronty na přezkoumání. V průběhu času to může vytvořit další problém: když jsou lidé požádáni o schválení příliš mnoha rutinních rozhodnutí, samotný lidský dohled může ztratit smysl.

Lidé zůstávají nezbytní, ale jejich role se musí změnit. Místo přezkoumávání každého rozhodnutí by se měli soustředit na situace, kde je skutečně vyžadován úsudek, kde byla dosažena pravomoc agenta, nebo kde systém narazí na podmínku, kterou by neměl řešit samostatně.

Škálovatelný provozní model tedy nemůže spoléhat pouze na hodnocení rizik a lidskou kontrolu. Než se akce agenta stane obchodní akcí, systém musí zvážit aktuální obchodní kontext, relevantní zásady, pravomoc agenta a to, co se již ve workflow stalo. Výsledek může být pokračovat, požádat o další důkazy, pozastavit akci nebo eskalovat rozhodnutí na člověka.

Obrázek 3: Lidská kontrola se stává jedním výsledkem řízení za běhu

Toto mění roli lidského dohledu. Lidé již nejsou ve výchozím nastavení vkládáni do každého nejistého kroku. Lidský zásah se stává jedním možným výsledkem, když obchodní kontext, zásada, pravomoc nebo důsledek akce vyžaduje posouzení.

Rozlišení je důležité pro podnikové měřítko. Některé akce by měly probíhat automaticky, protože jsou jednoznačně v rámci zásad a pravomocí. Některé by měly být pozastaveny, protože chybí požadované důkazy nebo se změnil obchodní stav. Jiné by měly být eskalovány, protože rozhodnutí překročilo hranici, kterou organizace úmyslně vyhradila pro lidi.

Cílem není odstranit lidi z řetězce. Je to umístit lidi do správných smyček, zatímco umožňuje rutinním rozhodnutím probíhat v jasně definovaných hranicích. Jak se agentní systémy rozšiřují, kvalita lidského dohledu může záviset méně na tom, kolik rozhodnutí lidé kontrolují, a více na tom, zda operační systém dokáže identifikovat rozhodnutí, kde je lidský úsudek skutečně podstatný.

Pozorovatelnost je nezbytná, ale vidět neznamená řídit

Odvětví učinilo značný pokrok v pozorovatelnosti AI. Týmy mohou kontrolovat výzvy, odpovědi modelu, stopy, volání nástrojů, latenci, využití tokenů a stále častěji celou trajektorii, kterou agent prošel před vytvořením výsledku.

Tato viditelnost je nezbytná. OpenAI pokyny pro bezpečnost agentů a hodnocení také zdůrazňuje techniky jako hodnocení a klasifikaci stop pro pochopení chování agenta.

Ale samotná viditelnost nevyřeší provozní problém.

Představte si, že zjistíte, že pojišťovací agent porušil schvalovací politiku 2,700krát minulý týden. To by představovalo vynikající pozorovatelnost a špatný provoz.

Pro důležité obchodní procesy budou podniky nakonec potřebovat schopnost nejen pochopit chování agenta, ale také reagovat během běhu procesu.

Obrázek 4: Provozní řídicí smyčka

Pozorovatelnost odpovídá co agent udělal. Agentní operace také potřebují odpovědět zda by měl agent pokračovat.

Toto rozlišení se stává zvláště důležitým, když je akce nákladná, významná, obtížně reverzibilní nebo schopná ovlivnit mnoho následných rozhodnutí.

Nejtěžší selhání se mohou stát mezi agenty

Existuje další výzva, která se ukazuje, jak podniky přecházejí k víceagentovým a delším pracovním postupům. Mnoho obchodních zásad není lokální pro jedinou akci.

Zvažte politiku, která omezuje celkovou finanční expozici napříč sekvencí rozhodnutí. Každá jednotlivá transakce může být pod povoleným limitem, zatímco kumulativní expozice jej překračuje. Pohled na každou akci samostatně by neukázal žádné porušení.

Stejný problém se může objevit u pravomocí. Agent může být oprávněn shromažďovat informace, ale ne učinit konečné rozhodnutí. Po několika předáních může následný agent získat informace bez zachování omezení pravomocí připojených k původnímu úkolu. Každý jednotlivý krok může vypadat rozumně, zatímco sekvence porušuje zamýšlený obchodní proces.

Kontext vytváří podobný problém. Informace, které byly důležité během první fáze workflow, mohou být po několika krocích shrnuty, transformovány nebo vynechány. Následující agent nemůže uvažovat o informacích, které již nemá, i když je jeho úvaha jinak správná.

Tyto selhání naznačují, že jednotka spolehlivosti musí být rozšířena.

Budeme i nadále hodnotit modely tím, že se zeptáme, zda jsou jejich odpovědi správné. Agenty budeme hodnotit tím, že se zeptáme, zda úkoly splnili správně. Na úrovni workflow se však otázka mění na to, zda informace, pravomoci a zásady přežily napříč sekvencí akcí. Na úrovni podniku se otázka mění na to, zda byl konečný výsledek jak správný, tak povolený.

To je také v souladu s širším pohledem na životní cyklus v NIST AI Risk Management Framework, který zdůrazňuje průběžné měření a řízení rizik AI místo toho, aby hodnocení považoval za jednorázovou činnost před nasazením.

Zde začíná agentní operace

AI governance, model evaluation, LLMOps, observability, security a responsible AI již řeší důležité části provozu AI systémů. Agentic Operations nenahrazuje tyto disciplíny. Zabývá se operační vrstvou, která se stává důležitou, když autonomní a semi-autonomní systémy začnou přímo zasahovat do obchodních procesů.

Agentic Operations je disciplína provozování autonomních a semi-autonomních AI systémů v reálných obchodních procesech, včetně toho, jak jsou během provádění řízeny pravomoci, kontext, rozhodnutí, výjimky, lidská intervence a odpovědnost.

Rozlišení je důležité, protože objekt, který se řídí, již není jen model. Je to probíhající obchodní proces, ve kterém může software samostatně činit rozhodnutí a vykonávat akce.

V praxi to vytváří jinou sadu provozních otázek. Co je agent oprávněn dělat? Jaký obchodní kontext musí přetrvávat během dlouhého pracovního postupu? Co se stane, když nové důkazy zneplatní dřívější rozhodnutí? Jak může organizace zjistit, kdy individuálně přijatelné akce kolektivně porušují politiku? Kdy by měl agent pokračovat, pozastavit, zastavit nebo eskalovat? Měsíce později, dokáže organizace rekonstruovat, proč bylo konkrétní rozhodnutí učiněno?

Existuje také otázka vlastnictví. Když agent vykoná svou technickou úlohu správně, ale obchodní výsledek je špatný, kdo nese odpovědnost za selhání? Delegování provádění na agenta neodkládá odpovědnost organizace, která jej provozuje.

Agent může vykonávat práci. Podnik stále vlastní výsledek.

Cílem je kontrolovaná autonomie

Budoucnost Agentic AI je někdy popisována jako vývoj směrem k úplné autonomii, kde lidé postupně mizí z obchodních pracovních toků. Pro většinu podniků je to pravděpodobně špatný cíl.

Užitečnější cíl je kontrolovaná autonomie.

Mnoho dnes AI‑asistovaných procesů následuje vzor, kdy agent navrhne akci a člověk učiní konečné rozhodnutí. Jak se důvěra zvyšuje, některé pracovní toky umožní agentům činit rozhodnutí v rámci definované pravomoci, zatímco okolní systém dohlíží na provádění a lidé řeší výjimky. Zralé, méně rizikové pracovní toky mohou nakonec umožnit agentům rozhodovat a jednat samostatně, zatímco následná rozhodnutí zůstávají monitorována a zaznamenávána.

Obr. 5 : Zvyšující se úroveň autonomie

Vhodná hranice se bude lišit podle procesu. Banka může povolit značnou autonomii při klasifikaci dokumentů, zatímco vyžaduje přísné kontroly u rozhodnutí o úvěrech. Pojišťovna může automatizovat rutinní nároky a zároveň eskalovat neobvyklé kombinace důkazů. Zdravotnická organizace může umožnit agentům shromažďovat a shrnovat informace, zatímco následná rozhodnutí ponechá na lidech.

Důležitá otázka tedy není jen, jak autonomní může agent být. Jde o to, kolik autonomie může organizace odpovědně provozovat.

To také mění roli kontrol. Kontroly nejsou nutně mechanismy pro snižování autonomie. Pokud jsou dobře provedeny, umožní organizaci rozšířit autonomii s větší důvěrou.

Provoz agentů může být obtížnější než jejich tvorba

Modely se budou i nadále zlepšovat. Používání nástrojů se zlepší. Rámce pro agenty se zlepší. Uvažování se zlepší a mnoho problémů, které se dnes jeví obtížně, se nakonec stane rutinními.

Lepší modely však neodstraňují obchodní politiky, měnící se kontext, výjimky, organizační hranice ani odpovědnost. V některých ohledech lepší agenti tyto otázky ještě zvýrazňují. Systém, který nemůže jednat autonomně, má omezenou operační pravomoc. Systém schopný provádět tisíce obchodních rozhodnutí vytváří naprosto odlišnou odpovědnost.

Proto další fáze podnikové AI nemusí být určena tím, která organizace nasadí nejvíce agentů. Může být určena tím, které organizace se naučí je provozovat.

Prvních 80 % ukazuje, že agent může fungovat. Zbývajících 20 % určuje, zda mu podnik může důvěřovat v obchodním kontextu.

Jak agenti získají větší schopnosti, může se klíčová podniková otázka posunout od co mohou naši agenti dělat k něčemu obtížnějšímu:

Na co jsme připraveni jim dovolit, za jakých podmínek a jak zjistíme, kdy se tyto podmínky změní?

Tam začíná Agentic Operations.

Rajesh Gupta je lídr v oblasti AI produktů a technologií, bývalý odborník v Apple a Qualcomm a druhý zakladatel. Strávil více než 15 let prací v oblasti strojového učení, podnikové AI a Agentic AI a v současnosti buduje RunCtrl AI, zaměřenou na řízení za běhu pro agentické obchodní operace.