Tankeledere
AI‑agenter kan gjøre arbeidet. Men kan bedrifter operere dem?

AI‑agenter blir bemerkelsesverdig flinke til å fullføre oppgaver. Gi en agent et mål, tilgang til de rette verktøyene, nok kontekst og en godt definert arbeidsflyt, så kan den undersøke informasjon, analysere dokumenter, ta beslutninger, oppdatere systemer og koordinere med andre agenter.
Det er den spennende delen av agentbasert AI. Det er også den delen vi vanligvis ser i demonstrasjoner.
Bedriftsoperasjoner ser annerledes ut. En lånesøknad endres midt i kredittvurderingen. En kunde gir ny informasjon etter at verifiseringen er fullført. To systemer er uenige om samme konto. En godkjenning som var gyldig i går, er kanskje ikke lenger gyldig i dag. En agent oppsummerer en sak før den overleveres til en annen agent, og en tilsynelatende liten detalj forsvinner i prosessen.
Den optimale banen kan utgjøre 80 % av det en agent må gjøre. Bedrifter opererer i de resterende 20 %.
80/20‑rammen er ikke en bransjestatistikk. Den er en måte å beskrive hvor operasjonell kompleksitet har en tendens til å skjule seg. Den vanskelige delen av bedriftsoperasjoner er ofte ikke det vanlige tilfellet, men unntakene, overleveringene, avhengighetene, den skiftende konteksten og beslutningene der organisasjonen fortsatt er ansvarlig for resultatet.
Etter hvert som AI går fra å besvare spørsmål til å utføre handlinger, blir denne operasjonelle kompleksiteten mye viktigere. Bedrifter må tenke utover hvordan agenter bygges og begynne å tenke på hvordan de driftes.
Det er der Agentic Operations begynner.
Fra å generere svar til å utføre handlinger
Den første bølgen av bedriftsgenerativ AI handlet i stor grad om informasjon. Modeller oppsummerte dokumenter, genererte rapporter, besvarte spørsmål, søkte i bedriftskunnskap, og hjalp ansatte med å fullføre eksisterende oppgaver raskere.
Agenter introduserer noe fundamentalt annerledes. De kan utføre handlinger som endrer tilstanden i en forretningsprosess. En agent kan godkjenne eller avvise noe, oppdatere et registersystem, sende en kundekommunikasjon, utløse en annen arbeidsflyt, kontakte en annen agent, eller ta en beslutning som bestemmer hva som skjer videre.
OpenAI beskriver agenter i sin praktiske veiledning som systemer som uavhengig utfører oppgaver på vegne av brukere, ved å bruke modeller for å styre arbeidsflytutførelse og verktøy for å samhandle med eksterne systemer. Den operative konsekvensen av et feil svar er svært forskjellig fra konsekvensen av en feil handling.
Spørsmålet for bedrifter endrer seg derfor. Det er ikke lenger nok å spørre om en modell genererte et godt svar eller om en agent fullførte sin tildelte oppgave med suksess. Bedrifter trenger i økende grad å vite om en handling i det hele tatt burde ha skjedd, gitt forretningskonteksten, retningslinjene, myndigheten og alt som skjedde tidligere i prosessen.
Figur 1: Generativ AI produserer et resultat. Agentbasert AI endrer forretningsstatus.

Når AI kan endre forretningsstatus og påvirke påfølgende beslutninger, kan pålitelighet ikke lenger måles kun på modellnivå.
En agent kan lykkes mens forretningsprosessen feiler
Tenk på en AI‑drevet lånekredittvurderings‑arbeidsflyt. En agent henter ut søknadsdokumenter, en annen verifiserer inntekt, en tredje vurderer kredittinformasjon, og en senere agent oppsummerer saken før en kredittvurderingsagent tar eller anbefaler en beslutning.
Hver agent har et tydelig definert ansvar, og hver kan utføre dette ansvaret korrekt. Dokument‑agenten kan hente ut riktig informasjon. Inntekts‑verifiserings‑agenten kan fullføre oppgaven sin med suksess. Oppsummerings‑agenten kan lage et nøyaktig sammendrag av den tilgjengelige informasjonen. Kredittvurderings‑agenten kan følge instruksjonene sine korrekt.
Den endelige forretningsbeslutningen kan fortsatt være feil.
Forestill deg at oppdatert inntektsinformasjon kommer inn etter den første verifiseringen. Det nye dokumentet blir behandlet, men betydningen reduseres når saken oppsummeres for neste steg. Den endelige kredittvurderings‑agenten får et rimelig sammendrag, men ikke den komplette forretningskonteksten som eksisterte gjennom hele prosessen.
Ingenting nødvendigvis krasjet. Ingen API feilet. Ingen individuell agent nødvendigvis hallusinerte. Hver komponent kan rapportere vellykket utførelse mens forretningsprosessen ender med et feil resultat.
Anthropic diskuterer en relatert utfordring i sin veiledning om å bygge effektive agenter, og bemerker at autonome systemer kan møte kumulerende feil etter hvert som de tar flere steg. Problemet blir bredere enn modellnøyaktighet fordi tilstand, kontekst, beslutninger og antakelser beveger seg gjennom arbeidsflyten.
This creates an important distinction between agentpålitelighet og forretningsprosesspålitelighet. En bedrift opplever ikke i siste ende en individuell agent. Den opplever resultatet som produseres av den komplette prosessen.
Figur 2: Lokal suksess garanterer ikke forretningssuksess

Dette er en av de viktige endringene som introduseres av Agentic AI. En arbeidsflyt kan mislykkes selv når hver komponent fremstår som sunn ved individuell inspeksjon.
Evne er ikke myndighet
Mye av den nåværende agentstakken er forståelig nok fokusert på evne. Team ønsker å vite om en agent kan resonere, velge riktig verktøy, fullføre en oppgave, komme seg etter feil, og operere med akseptabel nøyaktighet og latenstid.
Bedrifter har et annet krav: myndighet.
Anta at en underwriting‑agent er i stand til å godkjenne et lån. Det betyr ikke at den skal godkjenne hvert lån den kan vurdere. Dens myndighet kan avhenge av lånebeløp, risikokategori, kundetype, tilgjengelig bevis, konfidensnivå, tidligere beslutninger, eller om søknaden endret seg etter en tidligere gjennomgang.
Dette skaper en grense mellom hva en agent kan gjøre og hva en agent har lov til å gjøre.
OpenAI anbefaler å vurdere risikoen knyttet til agentverktøy og legge til sikkerhetstiltak eller menneskelig inngripen rundt sensitive og irreversible handlinger. Microsoft tar en lignende tilnærming i sin veiledning for agent‑drevne kjerneforretningsprosesser, hvor agenter kan ta rutinebeslutninger innen definerte grenser mens beslutningsrettigheter bestemmer hvilke handlinger som kan utføres uavhengig og hvilke som krever menneskelig godkjenning.
Etter hvert som agentens evne forbedres, blir dette skillet viktigere, ikke mindre. Mer kapable agenter kan ta mer konsekvensfulle handlinger. Bedrifter trenger derfor klarere måter å definere og håndheve grensene innen hvilke handlinger som er tillatt.
Spørsmålet går fra Kan agenten gjøre dette? til Under hvilke betingelser bør agenten få lov til å gjøre dette?
Forretningspolicy må komme nærmere utførelsen
Bedrifter har allerede omfattende mekanismer for å kontrollere menneskestyrte prosesser. De bruker SOP‑er, godkjenningsmatriser, etterlevelsespolicyer, risikogrenseverdier, opplæring, rollefordeling, revisjoner og eskaleringsprosedyrer. De fleste av disse mekanismene ble designet rundt en enkel antakelse: en person leser regelen, forstår situasjonen, og anvender regelen mens arbeidet utføres.
Agenter endrer den antakelsen.
Vurder en policy som krever sekundær godkjenning for transaksjoner over en viss terskel. Når et menneske utfører oppgaven, kan policyen eksistere i et dokument støttet av opplæring og arbeidsflytkontroller. Når en agent kan utføre hundrevis eller tusenvis av handlinger raskt, hindrer ikke selve policy‑dokumentet en handling som bryter den.
Et sted mellom den skriftlige policyen og forretningshandlingen må policyen bli operasjonell.
Dette betyr ikke at hver policy må bli deterministisk kode. Noen kontroller vil være deterministiske, noen vil kreve semantisk tolkning, noen vil avhenge av risiko eller konfidens, og andre vil fortsatt kreve menneskelig skjønn. Den større arkitektoniske endringen er at forretningspolicy begynner å bevege seg nærmere utførelsesløpet.
AWS gjør dette poenget spesielt i konteksten av Agentic AI i finansielle tjenester, inkludert behovet for policy‑basert validering av agenthandlinger og revisjonsspor rundt konsekvensfulle aktiviteter.
Historisk sett kunne organisasjoner definere mange styringskrav før utførelse og verifisere etterlevelse senere gjennom revisjoner og gjennomganger. Når autonome systemer opererer kontinuerlig og i maskinhastighet, må noen kontroller fungere mens prosessen kjører.
Menneske i sløyfen er nødvendig, men det er ikke driftsmodellen
Den vanligste responsen på usikkerhet i en AI‑arbeidsflyt er å sette et menneske i sløyfen. Det gir mening, spesielt for konsekvensfulle beslutninger, men det blir problematisk når menneskelig gjennomgang behandles som svaret på hver unntakssituasjon.
Forestill deg en agentisk operasjon som behandler tusenvis eller millioner av beslutninger. Hvis hver uvanlig situasjon, lavt konfidensresultat, policy‑uklarhet eller unntak blir sendt til en person, har ikke organisasjonen fjernet den operative flaskehalsen. Den har bare flyttet flaskehalsen til en gjennomgangskø. Over tid kan dette også skape et annet problem: når mennesker blir bedt om å godkjenne for mange rutinebeslutninger, kan menneskelig tilsyn selv bli mindre meningsfullt.
Mennesker forblir essensielle, men deres rolle må endres. I stedet for å gjennomgå hver beslutning, bør de fokusere på situasjoner hvor skjønn faktisk kreves, hvor en agents myndighet er nådd, eller hvor systemet møter en tilstand det ikke bør løse uavhengig.
En skalerbar driftsmodell kan derfor ikke stole kun på risikoscorering og menneskelig gjennomgang. Før en agenthandling blir til en forretningshandling, må systemet vurdere den nåværende forretningskonteksten, relevante retningslinjer, agentens myndighet og hva som allerede har skjedd i arbeidsflyten. Resultatet kan bli å fortsette, be om ytterligere bevis, holde handlingen, eller eskalere beslutningen til et menneske.
Figur 3: Menneskelig gjennomgang blir ett resultat av kjøretidskontroll

Dette endrer rollen til menneskelig tilsyn. Et menneske settes ikke lenger inn i hvert usikkert trinn som standard. Menneskelig intervensjon blir ett mulig resultat når forretningskonteksten, retningslinjen, myndigheten eller konsekvensen av en handling krever skjønn.
Skillet er viktig for bedriftsomfang. Noen handlinger bør gjennomføres automatisk fordi de tydelig er innenfor retningslinjer og myndighet. Noen bør pause fordi påkrevd bevis mangler eller forretningssituasjonen har endret seg. Andre bør eskaleres fordi beslutningen har krysset en grense som organisasjonen bevisst har reservert for mennesker.
Målet er ikke å fjerne mennesker fra kretsen. Det er å plassere mennesker i de riktige kretsene, samtidig som rutinebeslutninger kan fortsette innen klart definerte grenser. Etter hvert som agentbaserte systemer skalerer, kan kvaliteten på menneskelig tilsyn avhenge mindre av hvor mange beslutninger folk gjennomgår og mer av om driftsystemet kan identifisere de beslutningene hvor menneskelig skjønn faktisk er nødvendig.
Observabilitet er nødvendig, men å se er ikke å kontrollere
Bransjen har gjort betydelige fremskritt innen AI-observabilitet. Team kan inspisere prompt, modellrespons, spor, verktøykall, latens, tokenbruk, og i økende grad hele trajektorien en agent fulgte før den produserte et resultat.
Denne synligheten er essensiell. OpenAI-retningslinjer for agentsikkerhet og evaluering understreker også teknikker som evalueringer og sporvurdering for å forstå agentatferd.
Men kun synlighet løser ikke det operative problemet.
Forestill deg å oppdage at en underwriting-agent brøt en godkjenningspolicy 2 700 ganger i forrige uke. Det ville representere utmerket observabilitet og forferdelig drift.
For konsekvensfulle forretningsprosesser må bedrifter etter hvert ha evnen til ikke bare å forstå agentatferd, men også å reagere mens prosessen pågår.
Figur 4: Den operative kontrollsløyfen

Observabilitet svarer på hva agenten gjorde. Agentic Operations må også svare på om agenten bør fortsette.
Det skillet blir spesielt viktig når en handling er kostbar, har store konsekvenser, er vanskelig å reversere, eller kan påvirke mange etterfølgende beslutninger.
De vanskeligste feilene kan oppstå mellom agenter
Det finnes en annen utfordring som blir tydelig når bedrifter går over til multi‑agent‑ og lengre arbeidsflyter. Mange forretningsretningslinjer er ikke lokalt knyttet til én enkelt handling.
Vurder en retningslinje som begrenser total finansiell eksponering over en sekvens av beslutninger. Hver enkelt transaksjon kan være under den tillatte terskelen, mens den samlede eksponeringen overskrider den. Å se på hver handling isolert ville ikke vise noen overtredelse.
Det samme problemet kan oppstå med myndighet. En agent kan ha autorisasjon til å samle inn informasjon, men ikke til å ta en endelig beslutning. Etter flere overleveringer kan en nedstrøms agent motta informasjonen uten å beholde de myndighetsrestriksjonene som var knyttet til den opprinnelige oppgaven. Hvert enkelt trinn kan virke rimelig mens sekvensen bryter den tiltenkte forretningsprosessen.
Kontekst skaper et lignende problem. Informasjon som var viktig i første fase av en arbeidsflyt kan bli oppsummert, transformert eller utelatt flere trinn senere. Den nedstrøms agenten kan ikke resonere om informasjon den ikke lenger har, selv om resonneringen ellers er korrekt.
Disse feilene antyder at pålitelighetens enhet må utvides.
Vi vil fortsette å evaluere modeller ved å spørre om svarene deres er korrekte. Vi vil evaluere agenter ved å spørre om de fullførte oppgavene sine korrekt. Men på arbeidsflytnivå blir spørsmålet om informasjon, myndighet og retningslinjer overlevde gjennom sekvensen av handlinger. På forretningsnivå blir spørsmålet om det endelige resultatet både var korrekt og tillatt.
Dette er også i samsvar med det bredere livssyklusperspektivet i NIST AI Risk Management Framework, som understreker kontinuerlig måling og styring av AI‑risiko i stedet for å behandle evaluering som en engangsaktivitet før utrulling.
Dette er hvor Agentic Operations begynner
AI-styring, modellevaluering, LLMOps, observabilitet, sikkerhet og ansvarlig AI adresserer allerede viktige deler av driften av AI‑systemer. Agentic Operations erstatter ikke disse disiplinene. Det adresserer operasjonslaget som blir viktig når autonome og semi‑autonome systemer begynner å delta direkte i forretningsprosesser.
Agentic Operations er disiplinen som driver autonome og semi‑autonome AI‑systemer innen ekte forretningsprosesser, inkludert hvordan autoritet, kontekst, beslutninger, unntak, menneskelig inngripen og ansvarlighet håndteres under utførelse.
Skillet er viktig fordi objektet som administreres ikke lenger bare er en modell. Det er en pågående forretningsprosess der programvaren kan ta beslutninger og utføre handlinger uavhengig.
I praksis skaper dette et annet sett med operative spørsmål. Hva er en agent autorisert til å gjøre? Hvilken forretningskontekst må overleve gjennom en langvarig arbeidsflyt? Hva skjer når ny bevismateriale ugyldiggjør en tidligere beslutning? Hvordan kan en organisasjon oppdage når individuelt akseptable handlinger samlet sett bryter en policy? Når skal en agent fortsette, pause, stoppe eller eskalere? Månedene etter, kan organisasjonen rekonstruere hvorfor en bestemt beslutning ble tatt?
Det er også et spørsmål om eierskap. Når en agent utfører sin tekniske oppgave korrekt, men forretningsresultatet er feil, hvem eier feilen? Å delegere utførelse til en agent delegere ikke ansvaret til organisasjonen som driver den.
Agenter kan utføre arbeidet. Virksomheten eier fortsatt resultatet.
Målet er kontrollert autonomi
Fremtiden for Agentic AI blir noen ganger beskrevet som en utvikling mot full autonomi, hvor mennesker gradvis forsvinner fra forretningsarbeidsflyter. For de fleste virksomheter er sannsynligvis dette feil mål.
Det mer nyttige målet er kontrollert autonomi.
Mange AI‑assisterte prosesser i dag følger et mønster der en agent foreslår en handling og en person tar den endelige beslutningen. Etter hvert som tilliten øker, vil noen arbeidsflyter tillate agenter å ta beslutninger innen definert autoritet mens det omkringliggende systemet overvåker utførelsen og mennesker håndterer unntak. Modne, lav‑risiko arbeidsflyter kan etter hvert tillate agenter å bestemme og handle uavhengig mens konsekvensfulle beslutninger fortsatt blir overvåket og registrert.
Fig 5 : Økende nivå av autonomi

Den passende grensen vil variere etter prosess. En bank kan tillate betydelig autonomi i dokumentklassifisering mens den krever strenge kontroller rundt kredittbeslutninger. Et forsikringsselskap kan automatisere rutinemessige krav mens det eskalerer uvanlige kombinasjoner av bevis. En helseinstitusjon kan la agenter samle inn og oppsummere informasjon mens den forbeholder konsekvensfulle beslutninger til mennesker.
Det viktige spørsmålet er derfor ikke bare hvor autonom en agent kan bli. Det er hvor mye autonomi en organisasjon kan drifte på en ansvarlig måte.
Dette endrer også rollen til kontroller. Kontroller er ikke nødvendigvis mekanismer for å redusere autonomi. Gjort riktig, gjør de det mulig for en organisasjon å utvide autonomi med større tillit.
Å drive agenter kan bli vanskeligere enn å bygge dem
Modeller vil fortsette å forbedres. Bruk av verktøy vil bli bedre. Agent‑rammeverk vil bli bedre. Resonnering vil bli bedre, og mange problemer som i dag virker vanskelige vil etter hvert bli rutine.
Bedre modeller eliminerer imidlertid ikke forretningspolicyer, skiftende kontekst, unntak, organisatoriske grenser eller ansvarlighet. På noen måter gjør bedre agenter disse problemene enda viktigere. Et system som ikke kan handle autonomt har begrenset operasjonell autoritet. Et system som kan utføre tusenvis av forretningsbeslutninger skaper et helt annet ansvar.
Dette er grunnen til at neste fase av bedrifts‑AI kanskje ikke bestemmes av hvilken organisasjon som distribuerer flest agenter. Det kan bestemmes av hvilke organisasjoner som lærer seg å drifte dem.
De første 80 prosentene viser at agenten kan fungere. De resterende 20 prosentene avgjør om virksomheten kan stole på den i forretningen.
Etter hvert som agenter blir mer kapable, kan det definerende bedrifts‑spørsmålet skifte fra hva kan våre agenter gjøre til noe vanskeligere:
Hva er vi villige til å la dem gjøre, under hvilke betingelser, og hvordan vil vi vite når disse betingelsene endres?
Det er hvor Agentic Operations begynner.












