Tankeledere

AI-agenter kan udføre arbejdet. Men kan virksomheder drive dem?

mm
Føj Unite.AI til dine foretrukne kilder på Google

AI‑agenter bliver bemærkelsesværdigt dygtige til at udføre opgaver. Giv en agent et mål, adgang til de rette værktøjer, tilstrækkelig kontekst og en veldefineret arbejdsgang, så kan den undersøge information, analysere dokumenter, træffe beslutninger, opdatere systemer og koordinere med andre agenter.

Det er den spændende del af agentbaseret AI. Det er også den del, vi typisk ser i demonstrationer.

Virksomhedsdrift ser anderledes ud. En låneansøgning ændrer sig midt i underwriting. En kunde leverer nye oplysninger, efter at verifikationen er afsluttet. To systemer er uenige om den samme konto. En godkendelse, der var gyldig i går, er måske ikke længere gyldig i dag. En agent opsummerer en sag, før den overdrages til en anden agent, og en tilsyneladende mindre detalje forsvinder i processen.

Den glade sti kan udgøre 80 % af, hvad en agent skal gøre. Virksomheder befinder sig i de resterende 20 %.

80/20‑rammen er ikke en branche‑statistik. Den er en måde at beskrive, hvor operationel kompleksitet typisk gemmer sig. Den vanskelige del af virksomhedsdrift er ofte ikke det normale tilfælde, men undtagelserne, overleveringer, afhængigheder, skiftende kontekst og beslutninger, hvor organisationen fortsat er ansvarlig for resultatet.

Efterhånden som AI bevæger sig fra at besvare spørgsmål til at udføre handlinger, bliver denne operationelle kompleksitet meget vigtigere. Virksomheder vil skulle tænke ud over, hvordan agenter bygges, og begynde at overveje, hvordan de drives.

Det er hvor Agentic Operations begynder.

Fra at generere svar til at udføre handlinger

Den første bølge af virksomheds‑generativ AI handlede i høj grad om information. Modeller opsummerede dokumenter, genererede rapporter, besvarede spørgsmål, søgte i virksomhedens viden og hjalp medarbejdere med at fuldføre eksisterende opgaver hurtigere.

Agenter introducerer noget grundlæggende anderledes. De kan udføre handlinger, der ændrer tilstanden i en forretningsproces. En agent kan godkende eller afvise noget, opdatere et registreringssystem, sende en kundekommunikation, udløse en anden arbejdsgang, kontakte en anden agent eller træffe en beslutning, der bestemmer, hvad der sker derefter.

OpenAI beskriver agenter i sin praktiske vejledning som systemer, der uafhængigt udfører opgaver på vegne af brugere, ved at bruge modeller til at styre arbejdsgangsudførelse og værktøjer til at interagere med eksterne systemer. Den operationelle konsekvens af et forkert svar er meget anderledes end konsekvensen af en forkert handling.

Spørgsmålet for virksomheder ændrer sig derfor. Det er ikke længere nok at spørge, om en model har genereret et godt svar, eller om en agent har fuldført sin tildelte opgave med succes. Virksomheder har i stigende grad brug for at vide, om en handling overhovedet burde have fundet sted, givet forretningskonteksten, politikker, myndighed og alt, hvad der skete tidligere i processen.

Figur 1: Generativ AI producerer et output. Agentbaseret AI ændrer forretningsstatus.

Når AI kan ændre forretningsstatus og påvirke efterfølgende beslutninger, kan pålidelighed ikke længere kun måles på modelniveau.

En agent kan lykkes, mens forretningsprocessen fejler

Overvej en AI-drevet låneunderwriting‑arbejdsgang. En agent udtrækker ansøgningsdokumenter, en anden verificerer indkomst, en tredje vurderer kreditoplysninger, og en senere agent opsummerer sagen, før en underwriting‑agent træffer eller anbefaler en beslutning.

Hver agent har et klart defineret ansvar, og hver kan udføre dette ansvar korrekt. Dokument‑agenten kan udtrække den rette information. Indkomst‑verifikationsagenten kan fuldføre sin opgave med succes. Opsummerings‑agenten kan skabe et præcist resumé af den tilgængelige information. Underwriting‑agenten kan følge sine instruktioner korrekt.

Den endelige forretningsbeslutning kan stadig være forkert.

Forestil dig, at opdateret indkomstinformation ankommer efter den første verifikation. Det nye dokument behandles, men dets betydning reduceres, når sagen opsummeres til næste trin. Den endelige underwriting‑agent modtager et rimeligt resumé, blot ikke den fulde forretningskontekst, der eksisterede gennem hele processen.

Intet nødvendigvis gik ned. Ingen API fejlede. Ingen individuel agent nødvendigvis hallucinerede. Alle komponenter kan rapportere en vellykket udførelse, mens forretningsprocessen ender med et forkert resultat.

Anthropic diskuterer en relateret udfordring i sin vejledning om at bygge effektive agenter, idet de påpeger, at autonome systemer kan støde på kumulerende fejl, efterhånden som de tager flere skridt. Problemet bliver bredere end modelnøjagtighed, fordi tilstand, kontekst, beslutninger og antagelser bevæger sig gennem arbejdsgangen.

Dette skaber en vigtig sondring mellem agentpålidelighed og forretningsprocespålidelighed. En virksomhed oplever i sidste ende ikke en individuel agent. Den oplever resultatet, som den komplette proces leverer.

Figur 2: Lokal succes garanterer ikke forretningssucces

Dette er en af de vigtige ændringer, som Agentic AI introducerer. En arbejdsproces kan fejle, selvom hver komponent ser sund ud, når den inspiceres uafhængigt.

Kapacitet er ikke autoritet

Størstedelen af den nuværende agent‑stak er forståeligt fokuseret på kapacitet. Teams vil vide, om en agent kan ræsonnere, vælge det rette værktøj, fuldføre en opgave, komme sig efter fejl og operere med acceptabel nøjagtighed og latenstid.

Virksomheder har et andet krav: autoritet.

Antag, at en underwriting‑agent er i stand til at godkende et lån. Det betyder ikke, at den skal godkende hvert lån, den kan vurdere. Dens autoritet kan afhænge af lånebeløbet, risikokategorien, kundetypen, tilgængelige beviser, tillidsniveauet, tidligere beslutninger eller om ansøgningen ændrede sig efter en tidligere gennemgang.

Dette skaber en grænse mellem hvad en agent kan gøre og hvad en agent har tilladelse til at gøre.

OpenAI anbefaler at vurdere risikoen forbundet med agentværktøjer og tilføje sikkerhedsforanstaltninger eller menneskelig indgriben omkring følsomme og irreversible handlinger. Microsoft anvender en lignende tilgang i deres vejledning for agent‑drevne kerneforretningsprocesser, hvor agenter kan træffe rutinebeslutninger inden for definerede grænser, mens beslutningsrettigheder bestemmer, hvilke handlinger der kan udføres uafhængigt, og hvilke der kræver menneskelig godkendelse.

Efterhånden som agentens kapacitet forbedres, bliver denne sondring vigtigere, ikke mindre. Mere kapable agenter kan udføre mere væsentlige handlinger. Virksomheder har derfor brug for klarere måder at definere og håndhæve de grænser, inden for hvilke disse handlinger er tilladt.

Spørgsmålet skifter fra Kan agenten gøre dette? til Under hvilke betingelser bør agenten tillades at gøre dette?

Forretningspolitik skal komme tættere på udførelsen

Virksomheder har allerede omfattende mekanismer til at kontrollere menneskestyrede processer. De bruger SOP’er, godkendelsesmatricer, compliance‑politikker, risikogrænser, træning, adskillelse af funktioner, revisioner og eskaleringsprocedurer. De fleste af disse mekanismer blev designet ud fra en simpel antagelse: en person læser reglen, forstår situationen og anvender reglen, mens vedkommende udfører arbejdet.

Agenter ændrer denne antagelse.

Overvej en politik, der kræver sekundær godkendelse for transaktioner over en vis grænse. Når et menneske udfører opgaven, kan politikken eksistere i et dokument understøttet af træning og workflow‑kontroller. Når en agent kan udføre hundreder eller tusinder af handlinger hurtigt, forhindrer selve politikdokumentet ikke en handling, der overtræder den.

Et sted mellem den skrevne politik og forretningshandlingen skal politikken blive operationel.

Dette betyder ikke, at hver politik skal blive til deterministisk kode. Nogle kontroller vil være deterministiske, nogle vil kræve semantisk fortolkning, nogle vil afhænge af risiko eller tillid, og andre vil fortsat kræve menneskelig dømmekraft. Den større arkitektoniske ændring er, at forretningspolitikken begynder at flytte sig tættere på udførelsesstien.

AWS påpeger dette specifikt i forbindelse med Agentic AI i finansielle tjenester, herunder behovet for politikbaseret validering af agenthandlinger og revisionsspor omkring væsentlige aktiviteter.

Historisk set kunne organisationer definere mange governance‑krav inden udførelse og senere verificere overholdelse gennem revisioner og gennemgange. Når autonome systemer handler kontinuerligt og med maskinhastighed, skal nogle kontroller fungere, mens processen kører.

Menneske i løkken er nødvendigt, men det er ikke driftsmodellen

Den mest almindelige reaktion på usikkerhed i en AI‑arbejdsproces er at sætte et menneske i løkken. Det giver mening, især for væsentlige beslutninger, men det bliver problematisk, når menneskelig gennemgang betragtes som svaret på hver eneste undtagelse.

Forestil dig en agentisk operation, der behandler tusinder eller millioner af beslutninger. Hvis hver usædvanlig situation, lavt tillidsresultat, politik‑uklarhed eller undtagelse sendes til en person, har organisationen ikke fjernet den operationelle flaskehals. Den har blot flyttet flaskehalsen til en gennemgangskø. Over tid kan dette også skabe et andet problem: når mennesker bliver bedt om at godkende for mange rutinebeslutninger, kan den menneskelige kontrol selv blive mindre meningsfuld.

Mennesker forbliver essentielle, men deres rolle skal ændres. I stedet for at gennemgå hver beslutning bør de fokusere på situationer, hvor dømmekraft faktisk er påkrævet, hvor en agents autoritet er nået, eller hvor systemet støder på en betingelse, det ikke bør løse uafhængigt.

En skalerbar driftsmodel kan derfor ikke kun baseres på risikoscorering og menneskelig gennemgang. Før en agenthandling bliver til en forretningshandling, skal systemet tage højde for den aktuelle forretningskontekst, relevante politikker, agentens autoritet og hvad der allerede er sket i arbejdsprocessen. Resultatet kan være at fortsætte, anmode om yderligere beviser, holde handlingen tilbage eller eskalere beslutningen til et menneske.

Figur 3: Menneskelig gennemgang bliver et resultat af runtime‑kontrol

Dette ændrer rollen for menneskelig tilsyn. Et menneske indsættes ikke længere som standard i hvert usikkert trin. Menneskelig indgriben bliver et muligt udfald, når forretningskonteksten, politikken, autoriteten eller konsekvensen af en handling kræver dømmekraft.

Forskellen er vigtig for virksomhedens skala. Nogle handlinger bør udføres automatisk, fordi de klart ligger inden for politik og autoritet. Nogle bør sættes på pause, fordi nødvendige beviser mangler eller forretningssituationen har ændret sig. Andre bør eskaleres, fordi beslutningen har krydset en grænse, som organisationen bevidst har reserveret til mennesker.

Målet er ikke at fjerne mennesker fra kredsløbet. Det er at placere mennesker i de rigtige kredsløb, samtidig med at rutinebeslutninger kan fortsætte inden for klart definerede grænser. Efterhånden som agentbaserede systemer skalerer, kan kvaliteten af menneskelig tilsyn afhænge mindre af, hvor mange beslutninger folk gennemgår, og mere af, hvorvidt driftsystemet kan identificere de beslutninger, hvor menneskelig dømmekraft faktisk betyder noget.

Observabilitet er nødvendig, men at se er ikke at kontrollere

Branchen har gjort betydelige fremskridt inden for AI‑observabilitet. Teams kan inspicere prompts, model‑respons, spor, værktøjskald, latenstid, token‑forbrug og i stigende grad hele forløbet, en agent fulgte, før den leverede et resultat.

Denne synlighed er afgørende. OpenAI‑vejledning om agentsikkerhed og evaluering understreger også teknikker som evalueringer og spor‑bedømmelse for at forstå agentadfærd.

Men synlighed alene løser ikke det operationelle problem.

Forestil dig at opdage, at en underwriting‑agent overtrådte en godkendelsespolitik 2.700 gange i sidste uge. Det ville repræsentere fremragende observabilitet og forfærdelig drift.

For væsentlige forretningsprocesser har virksomheder på et tidspunkt brug for evnen til ikke kun at forstå agentadfærd, men også at reagere, mens processen kører.

Figur 4: Den operationelle kontrolsløjfe

Observabilitet svarer på hvad agenten gjorde. Agent‑operationer skal også svare på om agenten skal fortsætte.

Den sondring bliver særlig vigtig, når en handling er dyr, væsentlig, svær at fortryde eller i stand til at påvirke mange efterfølgende beslutninger.

De sværeste fejl kan ske mellem agenter

Der er en anden udfordring, der bliver synlig, når virksomheder bevæger sig mod multi‑agent‑ og længerevarende arbejdsprocesser. Mange forretningspolitikker er ikke lokale for en enkelt handling.

Overvej en politik, der begrænser den samlede finansielle eksponering på tværs af en sekvens af beslutninger. Hver enkelt transaktion kan ligge under den tilladte grænse, mens den samlede eksponering overstiger den. At se på hver handling isoleret ville ikke vise nogen overtrædelse.

Det samme problem kan opstå med autoritet. En agent kan være autoriseret til at indsamle information, men ikke til at træffe en endelig beslutning. Efter flere overdragelser kan en efterfølgende agent modtage informationen uden at beholde de autoritetsbegrænsninger, der var knyttet til den oprindelige opgave. Hvert enkelt trin kan synes rimeligt, mens sekvensen overtræder den tiltænkte forretningsproces.

Kontekst skaber et lignende problem. Information, der var vigtig i den første fase af en arbejdsproces, kan blive opsummeret, transformeret eller udeladt flere trin senere. Den efterfølgende agent kan ikke ræsonnere om information, den ikke længere har, selvom dens ræsonnement ellers er korrekt.

Disse fejl antyder, at pålidelighedens enhed skal udvides.

Vi vil fortsætte med at evaluere modeller ved at spørge, om deres svar er korrekte. Vi vil evaluere agenter ved at spørge, om de har udført deres opgaver korrekt. Men på arbejdsprocesniveau bliver spørgsmålet, om information, autoritet og politik overlevede gennem sekvensen af handlinger. På forretningsniveau bliver spørgsmålet, om det endelige resultat både var korrekt og tilladt.

Dette er også i overensstemmelse med det bredere livscyklus‑perspektiv i NIST AI Risk Management Framework, som understreger løbende måling og styring af AI‑risiko i stedet for at betragte evaluering som en engangsaktivitet før implementering.

Dette er hvor agent‑operationer begynder

AI-styring, modelvurdering, LLMOps, observabilitet, sikkerhed og ansvarlig AI adresserer allerede vigtige dele af driften af AI‑systemer. Agentic Operations erstatter ikke disse discipliner. Det adresserer det operationelle lag, som bliver vigtigt, når autonome og semi‑autonome systemer begynder at deltage direkte i forretningsprocesser.

Agentic Operations er disciplinen for at drive autonome og semi‑autonome AI‑systemer inden for reelle forretningsprocesser, herunder hvordan autoritet, kontekst, beslutninger, undtagelser, menneskelig indgriben og ansvarlighed håndteres under udførelsen.

Forskellen er vigtig, fordi objektet, der håndteres, ikke længere kun er en model. Det er en løbende forretningsproces, hvor software kan træffe beslutninger og udføre handlinger uafhængigt.

Denne skaber i praksis et andet sæt operationelle spørgsmål. Hvad er en agent autoriseret til at gøre? Hvilken forretningskontekst skal overleve gennem en langvarig arbejdsproces? Hvad sker der, når nye beviser ugyldiggør en tidligere beslutning? Hvordan kan en organisation opdage, når individuelt acceptable handlinger samlet set overtræder en politik? Hvornår skal en agent fortsætte, pause, stoppe eller eskalere? Måneder senere kan organisationen rekonstruere, hvorfor en bestemt beslutning blev truffet.

Der er også et spørgsmål om ejerskab. Når en agent udfører sin tekniske opgave korrekt, men forretningsresultatet er forkert, hvem ejer så fejlen? At delegere udførelsen til en agent delegere ikke ansvaret for den organisation, der driver den.

Agenter kan udføre arbejdet. Virksomheden ejer stadig resultatet.

Målet er kontrolleret autonomi

Fremtiden for Agentic AI beskrives nogle gange som en udvikling mod fuldstændig autonomi, hvor mennesker gradvist forsvinder fra forretningsarbejdsprocesser. For de fleste virksomheder er det sandsynligvis det forkerte mål.

Det mere nyttige mål er kontrolleret autonomi.

Mange AI‑assisterede processer i dag følger et mønster, hvor en agent foreslår en handling, og en person træffer den endelige beslutning. Efterhånden som tilliden vokser, vil nogle arbejdsprocesser tillade agenter at træffe beslutninger inden for defineret autoritet, mens det omgivende system overvåger udførelsen, og mennesker håndterer undtagelser. Modne, lavrisiko‑arbejdsprocesser kan efterhånden tillade agenter at beslutte og handle uafhængigt, mens de væsentlige beslutninger forbliver overvåget og registreret.

Fig 5 : Stigende autonominiveau

Den passende grænse vil variere efter proces. En bank kan tillade betydelig autonomi i dokumentklassificering, mens der kræves strenge kontroller omkring kreditbeslutninger. En forsikringsvirksomhed kan automatisere rutinekrav, mens usædvanlige kombinationer af beviser eskaleres. En sundhedsorganisation kan tillade agenter at indsamle og opsummere information, mens væsentlige beslutninger forbeholdes mennesker.

Det vigtige spørgsmål er derfor ikke blot, hvor autonom en agent kan blive. Det er, hvor meget autonomi en organisation kan drive ansvarligt.

Dette ændrer også kontrollernes rolle. Kontroller er ikke nødvendigvis mekanismer til at reducere autonomi. Gøres de godt, giver de en organisation mulighed for at udvide autonomi med større tillid.

Drift af agenter kan blive sværere end at bygge dem

Modeller vil fortsætte med at blive bedre. Værktøjsbrug vil forbedres. Agent‑rammer vil blive forbedret. Resoneringskapacitet vil forbedres, og mange problemer, der i dag virker vanskelige, vil efterhånden blive rutine.

Bedre modeller eliminerer dog ikke forretningspolitikker, skiftende kontekst, undtagelser, organisatoriske grænser eller ansvarlighed. På nogle måder gør bedre agenter disse spørgsmål endnu vigtigere. Et system, der ikke kan handle autonomt, har begrænset operationel autoritet. Et system, der kan udføre tusindvis af forretningsbeslutninger, skaber et helt andet ansvar.

Det er derfor, den næste fase af enterprise‑AI måske ikke bestemmes af, hvilken organisation der implementerer flest agenter. Det kan bestemmes af, hvilke organisationer der lærer at drive dem.

De første 80 % viser, at agenten kan fungere. De resterende 20 % bestemmer, om virksomheden kan stole på den i forretningen.

Efterhånden som agenter bliver mere kapable, kan det afgørende virksomheds­spørgsmål skifte fra hvad kan vores agenter gøre til noget sværere:

Hvad er vi villige til at lade dem gøre, under hvilke betingelser, og hvordan vil vi vide, når disse betingelser ændrer sig?

Det er, hvor Agentic Operations begynder.

Rajesh Gupta er en AI-produkt- og teknologileder, tidligere Apple- og Qualcomm-medarbejder, og anden gang grundlægger. Han har i mere end 15 år arbejdet med maskinlæring, enterprise AI og Agentic AI, og bygger i øjeblikket RunCtrl AI, med fokus på runtime‑kontrol for agentbaserede forretningsoperationer.