Liderzy opinii

Agenci AI mogą wykonać pracę. Ale czy przedsiębiorstwa potrafią nimi zarządzać?

mm
Dodaj Unite.AI do preferowanych źródeł w Google

Agenci AI stają się niezwykle dobrzy w realizacji zadań. Daj agentowi cel, dostęp do odpowiednich narzędzi, wystarczający kontekst i dobrze zdefiniowany przepływ pracy, a będzie mógł badać informacje, analizować dokumenty, podejmować decyzje, aktualizować systemy i koordynować się z innymi agentami.

To jest ekscytująca część Agentic AI. To także część, którą zazwyczaj widzimy w demonstracjach.

Operacje przedsiębiorstw wyglądają inaczej. Wniosek kredytowy zmienia się w połowie procesu oceny. Klient podaje nowe informacje po zakończeniu weryfikacji. Dwa systemy nie zgadzają się co do tego samego konta. Zatwierdzenie, które było ważne wczoraj, może już nie być ważne dzisiaj. Agent podsumowuje sprawę przed przekazaniem jej innemu agentowi, a pozornie drobny szczegół znika w tym procesie.

Ścieżka pomyślna może stanowić 80 % tego, co agent musi zrobić. Przedsiębiorstwa funkcjonują w pozostałych 20 %.

Ramka 80/20 nie jest statystyką branżową. To sposób opisania, gdzie ukrywa się złożoność operacyjną. Trudna część operacji przedsiębiorstw często nie polega na typowym przypadku, lecz na wyjątkach, przekazaniach, zależnościach, zmieniającym się kontekście i decyzjach, za które organizacja pozostaje odpowiedzialna.

W miarę jak AI przechodzi od odpowiadania na pytania do podejmowania działań, ta złożoność operacyjna staje się znacznie ważniejsza. Przedsiębiorstwa będą musiały myśleć nie tylko o tym, jak budowane są agenty, ale także o tym, jak są one zarządzane.

To jest miejsce, w którym Agentic Operations zaczyna się.

Od generowania odpowiedzi do podejmowania działań

Pierwsza fala Generatywnej AI w przedsiębiorstwach dotyczyła głównie informacji. Modele podsumowywały dokumenty, generowały raporty, odpowiadały na pytania, przeszukiwały zasoby wiedzy przedsiębiorstwa i pomagały pracownikom szybciej realizować istniejące zadania.

Agenci wprowadzają coś zasadniczo innego. Mogą podejmować działania, które zmieniają stan procesu biznesowego. Agent może zatwierdzić lub odrzucić coś, zaktualizować system rejestracji, wysłać komunikację do klienta, uruchomić kolejny przepływ pracy, wywołać innego agenta lub podjąć decyzję, która określa, co stanie się dalej.

OpenAI opisuje agentów w swoim praktycznym przewodniku jako systemy, które samodzielnie realizują zadania w imieniu użytkowników, wykorzystując modele do zarządzania wykonywaniem przepływu pracy oraz narzędzia do interakcji z systemami zewnętrznymi. Operacyjne konsekwencje nieprawidłowej odpowiedzi są bardzo różne od konsekwencji nieprawidłowego działania.

Pytanie przedsiębiorstwa więc się zmienia. Nie wystarczy już pytać, czy model wygenerował dobrą odpowiedź lub czy agent pomyślnie wykonał przydzielone zadanie. Przedsiębiorstwa coraz częściej muszą wiedzieć, czy dana akcja w ogóle powinna się odbyć, biorąc pod uwagę kontekst biznesowy, polityki, uprawnienia oraz wszystko, co wydarzyło się wcześniej w procesie.

Rysunek 1: Generatywna AI generuje wynik. Agentic AI zmienia stan biznesowy.

Gdy AI może zmienić stan biznesowy i wpływać na kolejne decyzje, niezawodność nie może już być mierzona wyłącznie na poziomie modelu.

Agent może odnieść sukces, podczas gdy proces biznesowy zawodzi

Rozważmy przepływ pracy oceny kredytowej zasilany AI. Jeden agent wyodrębnia dokumenty wniosku, kolejny weryfikuje dochód, kolejny ocenia informacje kredytowe, a późniejszy agent podsumowuje sprawę przed tym, jak agent oceny kredytowej podejmie lub zaleci decyzję.

Każdy agent ma jasno określoną odpowiedzialność i każdy może wykonać tę odpowiedzialność prawidłowo. Agent dokumentów może wyodrębnić właściwe informacje. Agent weryfikacji dochodu może pomyślnie zakończyć swoje zadanie. Agent podsumowujący może stworzyć dokładne streszczenie dostępnych mu informacji. Agent oceny kredytowej może prawidłowo stosować się do swoich instrukcji.

Ostateczna decyzja biznesowa może nadal być błędna.

Wyobraź sobie, że zaktualizowane informacje o dochodach pojawiają się po wstępnej weryfikacji. Nowy dokument zostaje przetworzony, ale jego znaczenie zostaje pomniejszone, gdy sprawa jest podsumowywana przed kolejnym krokiem. Ostateczny agent oceny kredytowej otrzymuje przyzwoite podsumowanie, ale nie pełny kontekst biznesowy, który istniał w całym procesie.

Nic nie uległo awarii. Żadne API nie zawiodło. Żaden pojedynczy agent nie wpadł w halucynacje. Każdy komponent może zgłaszać pomyślne wykonanie, podczas gdy proces biznesowy prowadzi do błędnego wyniku.

Anthropic omawia powiązane wyzwanie w swoim przewodniku dotyczącym budowania skutecznych agentów, zauważając, że autonomiczne systemy mogą napotykać narastające błędy w miarę wykonywania kolejnych kroków. Problem staje się szerszy niż dokładność modelu, ponieważ stan, kontekst, decyzje i założenia przenoszą się przez cały przepływ pracy.

To tworzy ważne rozróżnienie między niezawodnością agenta a niezawodnością procesu biznesowego. Przedsiębiorstwo nie doświadcza ostatecznie pojedynczego agenta. Doświadcza wynik wytworzony przez cały proces.

Rysunek 2: Lokalny sukces nie gwarantuje sukcesu biznesowego

To jedna z ważnych zmian wprowadzonych przez Agentic AI. Przepływ pracy może się nie powieść, nawet gdy każdy element wydaje się zdrowy przy niezależnej inspekcji.

Zdolność nie jest władzą

Większość obecnego stosu agentów słusznie koncentruje się na zdolnościach. Zespoły chcą wiedzieć, czy agent potrafi rozumować, wybrać odpowiednie narzędzie, wykonać zadanie, odzyskać się po błędach i działać z akceptowalną dokładnością oraz opóźnieniem.

Przedsiębiorstwa mają dodatkowy wymóg: uprawnienia.

Załóżmy, że agent underwritingowy jest w stanie zatwierdzić pożyczkę. Nie oznacza to, że powinien zatwierdzać każdą pożyczkę, którą może ocenić. Jego uprawnienia mogą zależeć od wysokości pożyczki, kategorii ryzyka, typu klienta, dostępnych dowodów, poziomu pewności, wcześniejszych decyzji lub tego, czy wniosek uległ zmianie po wcześniejszej ocenie.

To tworzy granicę między tym, co agent może zrobić a tym, co agent jest uprawniony zrobić.

OpenAI zaleca ocenę ryzyka związanego z narzędziami agentów oraz wprowadzenie zabezpieczeń lub interwencji człowieka w przypadku działań wrażliwych i nieodwracalnych. Microsoft przyjmuje podobne podejście w swoich wytycznych dotyczących podstawowych procesów biznesowych obsługiwanych przez agentów, gdzie agenci mogą podejmować rutynowe decyzje w określonych granicach, podczas gdy prawa decyzyjne określają, które działania mogą być podejmowane samodzielnie, a które wymagają zatwierdzenia przez człowieka.

W miarę jak zdolności agentów się poprawiają, to rozróżnienie staje się ważniejsze, nie mniej. Bardziej zdolni agenci mogą podejmować bardziej konsekwentne działania. Przedsiębiorstwa potrzebują więc wyraźniejszych metod definiowania i egzekwowania granic, w których te działania są dozwolone.

Pytanie przechodzi od Czy agent może to zrobić? do Na jakich warunkach agent powinien mieć pozwolenie na zrobienie tego?

Polityka biznesowa musi zbliżyć się do realizacji

Przedsiębiorstwa już posiadają rozbudowane mechanizmy kontrolowania procesów obsługiwanych przez ludzi. Korzystają z SOP‑ów, macierzy zatwierdzeń, polityk zgodności, progów ryzyka, szkoleń, rozdzielenia obowiązków, audytów i procedur eskalacji. Większość tych mechanizmów została zaprojektowana wokół prostego założenia: osoba czyta regułę, rozumie sytuację i stosuje regułę podczas wykonywania pracy.

Agenci zmieniają to założenie.

Rozważmy politykę wymagającą drugiej akceptacji dla transakcji powyżej określonego progu. Gdy człowiek wykonuje zadanie, polityka może istnieć w dokumencie wspieranym przez szkolenia i kontrolę przepływu pracy. Gdy agent może szybko wykonać setki lub tysiące działań, samo istnienie tego dokumentu polityki nie zapobiega działaniu, które go narusza.

Gdzieś pomiędzy zapisaną polityką a działaniem biznesowym, polityka musi stać się operacyjna.

To nie oznacza, że każda polityka musi stać się deterministycznym kodem. Niektóre kontrole będą deterministyczne, niektóre będą wymagały interpretacji semantycznej, niektóre będą zależały od ryzyka lub pewności, a inne nadal będą wymagały ludzkiego osądu. Szersza zmiana architektoniczna polega na tym, że polityka biznesowa zaczyna zbliżać się do ścieżki wykonania.

AWS podkreśla to szczególnie w kontekście Agentic AI w usługach finansowych, w tym potrzebę walidacji działań agentów opartej na polityce oraz ścieżek audytu wokół działań o istotnych konsekwencjach.

Historycznie organizacje mogły definiować liczne wymagania zarządcze przed wykonaniem i później weryfikować zgodność poprzez audyty i przeglądy. Gdy autonomiczne systemy działają nieprzerwanie i z prędkością maszyny, niektóre kontrole muszą działać w trakcie trwania procesu.

Człowiek w pętli jest niezbędny, ale nie jest modelem operacyjnym

Najczęstszą reakcją na niepewność w przepływie pracy AI jest włączenie człowieka w pętlę. Ma to sens, szczególnie w przypadku decyzji o istotnych konsekwencjach, ale staje się problematyczne, gdy przegląd ludzki jest traktowany jako rozwiązanie każdej wyjątkowej sytuacji.

Wyobraźmy sobie operację agentową przetwarzającą tysiące lub miliony decyzji. Jeśli każda nietypowa sytuacja, wynik o niskiej pewności, niejasność polityki lub wyjątek jest kierowany do osoby, organizacja nie usunęła wąskiego gardła operacyjnego. Po prostu przeniosła je do kolejki przeglądów. Z czasem może to również stworzyć kolejny problem: gdy ludzie są proszeni o zatwierdzanie zbyt wielu rutynowych decyzji, nadzór ludzki sam w sobie może stać się mniej istotny.

Ludzie pozostają niezbędni, ale ich rola musi się zmienić. Zamiast przeglądać każdą decyzję, powinni koncentrować się na sytuacjach, w których rzeczywiście wymagana jest ocena, gdy uprawnienia agenta zostały wyczerpane lub gdy system napotyka warunek, którego nie powinien rozwiązywać samodzielnie.

Skalowalny model operacyjny nie może więc opierać się wyłącznie na ocenie ryzyka i przeglądzie ludzkim. Zanim działanie agenta stanie się działaniem biznesowym, system musi uwzględnić bieżący kontekst biznesowy, odpowiednie polityki, uprawnienia agenta oraz to, co już wydarzyło się w przepływie pracy. Wynikiem może być kontynuacja, żądanie dodatkowych dowodów, wstrzymanie działania lub eskalacja decyzji do człowieka.

Rysunek 3: Przegląd ludzki jako jeden z wyników kontroli w czasie rzeczywistym

Zmienia to rolę nadzoru ludzkiego. Człowiek nie jest już domyślnie wstawiany w każdy niepewny krok. Interwencja ludzka staje się jednym z możliwych wyników, gdy kontekst biznesowy, polityka, uprawnienia lub konsekwencje działania wymagają oceny.

Rozróżnienie to jest istotne przy skali przedsiębiorstwa. Niektóre działania powinny odbywać się automatycznie, ponieważ wyraźnie mieszczą się w polityce i uprawnieniach. Niektóre powinny zostać wstrzymane, ponieważ brak wymaganych dowodów lub stan biznesowy uległ zmianie. Inne powinny być eskalowane, ponieważ decyzja przekroczyła granicę, którą organizacja celowo zarezerwowała dla ludzi.

Celem nie jest usunięcie ludzi z pętli. Chodzi o umieszczenie ludzi w odpowiednich pętlach, przy jednoczesnym pozwoleniu na podejmowanie rutynowych decyzji w jasno określonych granicach. W miarę skalowania systemów agentowych jakość nadzoru ludzkiego może zależeć mniej od liczby decyzji przeglądanych przez ludzi, a bardziej od tego, czy system operacyjny potrafi zidentyfikować decyzje, w których ocena ludzka rzeczywiście ma znaczenie.

Obserwowalność jest niezbędna, ale widzenie nie jest kontrolą

Branża poczyniła znaczące postępy w obserwowalności AI. Zespoły mogą przeglądać podpowiedzi, odpowiedzi modeli, ślady, wywołania narzędzi, opóźnienia, zużycie tokenów oraz coraz częściej pełną trajektorię, jaką podążył agent przed wygenerowaniem wyniku.

Ta widoczność jest niezbędna. wytyczne OpenAI dotyczące bezpieczeństwa i oceny agentów podkreślają również techniki takie jak oceny i klasyfikacja śladów, aby zrozumieć zachowanie agenta.

Ale sama widoczność nie rozwiązuje problemu operacyjnego.

Wyobraź sobie odkrycie, że agent underwritingowy naruszył politykę zatwierdzania 2 700 razy w zeszłym tygodniu. Byłoby to doskonałe świadectwo obserwowalności i jednocześnie fatalna operacja.

Dla kluczowych procesów biznesowych przedsiębiorstwa ostatecznie potrzebują możliwości nie tylko zrozumienia zachowania agenta, ale także reagowania w trakcie trwania procesu.

Rysunek 4: Pętla kontroli operacyjnej

Obserwowalność odpowiada na pytanie co agent zrobił. Operacje agentowe muszą także odpowiedzieć na pytanie czy agent powinien kontynuować.

To rozróżnienie staje się szczególnie ważne, gdy działanie jest kosztowne, ma istotne konsekwencje, trudne do odwrócenia lub może wpływać na wiele decyzji dalszych.

Najtrudniejsze awarie mogą wystąpić pomiędzy agentami

Istnieje kolejny problem, który staje się widoczny, gdy przedsiębiorstwa przechodzą do wieloagentowych i dłużej trwających przepływów pracy. Wiele polityk biznesowych nie jest lokalnych dla pojedynczego działania.

Rozważ politykę, która ogranicza całkowitą ekspozycję finansową w serii decyzji. Każda pojedyncza transakcja może być poniżej dozwolonego progu, podczas gdy skumulowana ekspozycja go przekracza. Analiza każdego działania oddzielnie nie wykazałaby naruszenia.

Ten sam problem może pojawić się w kontekście uprawnień. Agent może mieć uprawnienie do zbierania informacji, ale nie do podejmowania ostatecznej decyzji. Po kilku przekazaniach, agent dalszy może otrzymać informacje bez zachowania ograniczeń uprawnień związanych z pierwotnym zadaniem. Każdy pojedynczy krok może wydawać się uzasadniony, podczas gdy cała sekwencja narusza zamierzony proces biznesowy.

Kontekst tworzy podobny problem. Informacje istotne na pierwszym etapie przepływu pracy mogą zostać podsumowane, przekształcone lub pominięte kilka kroków później. Agent dalszy nie może rozważać informacji, których już nie posiada, nawet jeśli jego rozumowanie jest poprawne.

Te awarie sugerują, że jednostka niezawodności musi zostać rozszerzona.

Będziemy nadal oceniać modele, pytając, czy ich odpowiedzi są poprawne. Będziemy oceniać agentów, pytając, czy wykonali swoje zadania prawidłowo. Jednak na poziomie przepływu pracy pytanie brzmi, czy informacje, uprawnienia i polityka przetrwały w całej sekwencji działań. Na poziomie biznesowym pytanie brzmi, czy ostateczny wynik był zarówno prawidłowy, jak i dopuszczalny.

Jest to również zgodne z szerszą perspektywą cyklu życia w Ramowym Systemie Zarządzania Ryzykiem AI NIST, który podkreśla ciągłe pomiary i zarządzanie ryzykiem AI, zamiast traktować ocenę jako jednorazową czynność przed wdrożeniem.

Tutaj zaczynają się Operacje Agentowe

Zarządzanie AI, ocena modeli, LLMOps, obserwowalność, bezpieczeństwo i odpowiedzialna AI już obejmują ważne elementy eksploatacji systemów AI. Operacje agentowe nie zastępują tych dyscyplin. Dotyczą one warstwy operacyjnej, która staje się istotna, gdy autonomiczne i półautonomiczne systemy zaczynają uczestniczyć bezpośrednio w procesach biznesowych.

Operacje agentowe to dyscyplina zarządzania autonomicznymi i półautonomicznymi systemami AI w rzeczywistych procesach biznesowych, obejmująca sposób, w jaki podczas wykonywania zarządzane są uprawnienia, kontekst, decyzje, wyjątki, interwencje ludzkie i odpowiedzialność.

Rozróżnienie ma znaczenie, ponieważ zarządzany obiekt nie jest już jedynie modelem. Jest to trwający proces biznesowy, w którym oprogramowanie może samodzielnie podejmować decyzje i wykonywać działania.

W praktyce generuje to inny zestaw pytań operacyjnych. Co agent jest uprawniony zrobić? Jaki kontekst biznesowy musi przetrwać w długotrwałym przepływie pracy? Co się stanie, gdy nowe dowody unieważnią wcześniejszą decyzję? Jak organizacja może wykryć, że indywidualnie dopuszczalne działania łącznie naruszają politykę? Kiedy agent powinien kontynuować, wstrzymać, zatrzymać lub eskalować? Miesiące później, czy organizacja może odtworzyć, dlaczego podjęto konkretną decyzję?

Istnieje również kwestia własności. Gdy agent prawidłowo wykonuje swoje zadanie techniczne, ale wynik biznesowy jest nieprawidłowy, kto ponosi odpowiedzialność za porażkę? Delegowanie wykonania agentowi nie deleguje odpowiedzialności organizacji go obsługującej.

Agenci mogą wykonywać pracę. Przedsiębiorstwo nadal ponosi odpowiedzialność za wynik.

Celem jest kontrolowana autonomia

Przyszłość AI agentowej jest czasami opisywana jako postęp w kierunku pełnej autonomii, w której ludzie stopniowo znikają z procesów biznesowych. Dla większości przedsiębiorstw jest to prawdopodobnie niewłaściwy cel.

Bardziej użytecznym celem jest kontrolowana autonomia.

Wiele dzisiejszych procesów wspomaganych przez AI podąża za schematem, w którym agent proponuje działanie, a człowiek podejmuje ostateczną decyzję. W miarę wzrostu pewności niektóre przepływy pracy pozwolą agentom podejmować decyzje w ramach określonych uprawnień, podczas gdy otaczający system nadzoruje wykonanie, a ludzie zajmują się wyjątkami. Dojrzałe, mniej ryzykowne przepływy mogą ostatecznie pozwolić agentom decydować i działać samodzielnie, przy czym decyzje o konsekwencjach będą monitorowane i rejestrowane.

Rys. 5: Wzrost poziomu autonomii

Odpowiednia granica będzie się różnić w zależności od procesu. Bank może zezwolić na znaczną autonomię w klasyfikacji dokumentów, jednocześnie wymagając ścisłej kontroli decyzji kredytowych. Ubezpieczyciel może automatyzować rutynowe roszczenia, eskalując nietypowe kombinacje dowodów. Organizacja opieki zdrowotnej może pozwolić agentom zbierać i podsumowywać informacje, zachowując decyzje o konsekwencjach w rękach ludzi.

Ważne pytanie nie dotyczy więc tylko tego, jak autonomiczny może stać się agent. Chodzi o to, jaką autonomię organizacja może odpowiedzialnie wdrożyć.

To także zmienia rolę kontroli. Kontrole nie muszą być koniecznie mechanizmami ograniczającymi autonomię. Przy właściwym zastosowaniu pozwalają organizacji zwiększyć autonomię z większą pewnością.

Obsługa agentów może okazać się trudniejsza niż ich tworzenie

Modele będą nadal się doskonalić. Użycie narzędzi się poprawi. Ramy agentów będą ulepszane. Rozumowanie się polepszy, a wiele dzisiaj trudnych problemów w końcu stanie się rutyną.

Lepsze modele jednak nie eliminują polityk biznesowych, zmieniającego się kontekstu, wyjątków, granic organizacyjnych ani odpowiedzialności. W pewnym sensie lepsi agenci podnoszą znaczenie tych kwestii. System, który nie może działać autonomicznie, ma ograniczone uprawnienia operacyjne. System zdolny do wykonywania tysięcy decyzji biznesowych tworzy zupełnie inną odpowiedzialność.

Dlatego kolejna faza AI w przedsiębiorstwach może nie zależeć od tego, która organizacja wdroży najwięcej agentów. Może zależeć od tego, które organizacje nauczą się je obsługiwać.

Pierwsze 80 procent pokazuje, że agent może działać. Pozostałe 20 procent decyduje, czy przedsiębiorstwo może mu zaufać w kontekście biznesowym.

W miarę jak agenci stają się bardziej zdolni, kluczowe pytanie przedsiębiorstwa może przesunąć się z co nasze agenty potrafią na coś trudniejszego:

Na co jesteśmy gotowi pozwolić im zrobić, na jakich warunkach i jak będziemy wiedzieć, kiedy te warunki się zmienią?

Tam właśnie zaczynają się Operacje agentowe.

Rajesh Gupta jest liderem produktów i technologii AI, byłym pracownikiem Apple i Qualcomm oraz drugokrotnym założycielem. Spędził ponad 15 lat, pracując w obszarze uczenia maszynowego, AI w przedsiębiorstwach i AI agentowej, a obecnie buduje RunCtrl AI, skoncentrowane na kontroli czasu wykonania dla agentowych operacji biznesowych.