Tankeledare

AI‑agenter kan utföra arbetet. Men kan företag driva dem?

mm
Lägg till Unite.AI bland dina föredragna källor på Google

AI‑agenter blir märkbart bra på att slutföra uppgifter. Ge en agent ett mål, tillgång till rätt verktyg, tillräckligt med sammanhang och ett väl definierat arbetsflöde, så kan den undersöka information, analysera dokument, fatta beslut, uppdatera system och samordna med andra agenter.

Det är den spännande delen av agentbaserad AI. Det är också den del vi ofta ser i demonstrationer.

Företagsoperationer ser annorlunda ut. En låneansökan förändras mitt i underwritingprocessen. En kund lämnar ny information efter att verifieringen är klar. Två system är oense om samma konto. Ett godkännande som var giltigt igår kanske inte längre är giltigt idag. En agent sammanfattar ett ärende innan den överlämnas till en annan agent, och en till synes liten detalj försvinner i processen.

Den lyckliga vägen kan utgöra 80 procent av vad en agent behöver göra. Företag lever i de återstående 20 procenten.

80/20‑ramverket är ingen branschstatistik. Det är ett sätt att beskriva var operativ komplexitet tenderar att gömma sig. Den svåra delen av företagsoperationer är ofta inte det normala fallet, utan undantagen, överlämningarna, beroendena, det föränderliga sammanhanget och besluten där organisationen förblir ansvarig för resultatet.

När AI går från att svara på frågor till att utföra handlingar blir denna operativa komplexitet mycket viktigare. Företag måste tänka bortom hur agenter byggs och börja fundera på hur de drivs.

Det är där Agentic Operations börjar.

Från att generera svar till att utföra handlingar

Den första vågen av företagsgenerativ AI handlade i stor utsträckning om information. Modeller sammanfattade dokument, genererade rapporter, svarade på frågor, sökte i företagskunskap och hjälpte anställda att slutföra befintliga uppgifter snabbare.

Agenter introducerar något fundamentalt annorlunda. De kan utföra handlingar som förändrar tillståndet i en affärsprocess. En agent kan godkänna eller avvisa något, uppdatera ett registersystem, skicka en kundkommunikation, trigga ett annat arbetsflöde, kontakta en annan agent eller fatta ett beslut som bestämmer vad som händer härnäst.

OpenAI beskriver agenter i sin praktiska guide som system som självständigt utför uppgifter för användares räkning, med modeller för att hantera arbetsflödesexekvering och verktyg för att interagera med externa system. Den operativa konsekvensen av ett felaktigt svar är mycket annorlunda än konsekvensen av en felaktig handling.

Företagsfrågan förändras därför. Det räcker inte längre att fråga om en modell genererade ett bra svar eller om en agent framgångsrikt slutförde sin tilldelade uppgift. Företag behöver i allt högre grad veta om en handling alls skulle ha inträffat, med hänsyn till affärssammanhanget, policyer, befogenheter och allt som hände tidigare i processen.

Figur 1: Generativ AI producerar ett resultat. Agentbaserad AI förändrar affärstillståndet.

När AI kan förändra affärstillståndet och påverka efterföljande beslut kan tillförlitlighet inte längre mätas enbart på modellnivå.

En agent kan lyckas medan affärsprocessen misslyckas

Föreställ dig ett AI‑drivet låneunderwriting‑arbetsflöde. En agent extraherar ansökningsdokument, en annan verifierar inkomst, en tredje bedömer kreditinformation, och en senare agent sammanfattar ärendet innan en underwriting‑agent fattar eller rekommenderar ett beslut.

Varje agent har ett tydligt definierat ansvar, och varje kan utföra det ansvaret korrekt. Dokumentagenten kan extrahera rätt information. Inkomstverifieringsagenten kan framgångsrikt slutföra sin uppgift. Sammanfattningsagenten kan skapa en exakt sammanfattning av den information som finns tillgänglig för den. Underwriting‑agenten kan korrekt följa sina instruktioner.

Det slutgiltiga affärsbeslutet kan fortfarande vara fel.

Föreställ dig att uppdaterad inkomstinformation anländer efter den initiala verifieringen. Det nya dokumentet bearbetas, men dess betydelse minskar när ärendet sammanfattas för nästa steg. Den slutgiltiga underwriting‑agenten får en rimlig sammanfattning, men inte hela affärssammanhanget som fanns under hela processen.

Ingenting kraschade nödvändigtvis. Inget API misslyckades. Ingen enskild agent hallucinerade nödvändigtvis. Varje komponent kan rapportera en lyckad exekvering medan affärsprocessen når ett felaktigt resultat.

Anthropic diskuterar en relaterad utmaning i sin vägledning om att bygga effektiva agenter, och noterar att autonoma system kan drabbas av kumulativa fel när de tar fler steg. Problemet blir bredare än modellens noggrannhet eftersom tillstånd, sammanhang, beslut och antaganden rör sig genom arbetsflödet.

Detta skapar en viktig distinktion mellan agenttillförlitlighet och affärsprocessens tillförlitlighet. Ett företag upplever i slutändan inte en enskild agent. Det upplever resultatet som produceras av den kompletta processen.

Figur 2: Lokal framgång garanterar inte affärsframgång

Detta är en av de viktiga förändringarna som Agentic AI introducerar. Ett arbetsflöde kan misslyckas även när varje komponent verkar frisk vid oberoende granskning.

Förmåga är inte auktoritet

En stor del av den nuvarande agentstacken är förståeligt fokuserad på förmåga. Team vill veta om en agent kan resonera, välja rätt verktyg, slutföra en uppgift, återhämta sig från fel och fungera med acceptabel noggrannhet och svarstid.

Företag har ett annat krav: auktoritet.

Anta att en underwriting‑agent kan godkänna ett lån. Det betyder inte att den bör godkänna varje lån den kan utvärdera. Dess auktoritet kan bero på lånebelopp, riskkategori, kundtyp, tillgängliga bevis, förtroendenivå, tidigare beslut eller om ansökan förändrades efter en tidigare granskning.

Detta skapar en gräns mellan vad en agent kan göra och vad en agent får göra.

OpenAI rekommenderar att man bedömer riskerna med agentverktyg och inför skyddsåtgärder eller mänsklig inblandning kring känsliga och irreversibla åtgärder. Microsoft tar ett liknande tillvägagångssätt i sin vägledning för agentdrivna kärnaffärsprocesser, där agenter kan fatta rutinbeslut inom definierade gränser medan beslutsrättigheter avgör vilka åtgärder som kan utföras självständigt och vilka som kräver mänskligt godkännande.

Allt eftersom agenters förmåga förbättras blir denna distinktion viktigare, inte mindre. Mer kapabla agenter kan vidta mer betydelsefulla åtgärder. Företag behöver därför tydligare sätt att definiera och upprätthålla de gränser inom vilka dessa åtgärder är tillåtna.

Frågan förflyttas från Kan agenten göra detta? till Under vilka förutsättningar bör agenten tillåtas göra detta?

Affärspolicy måste komma närmare verkställandet

Företag har redan omfattande mekanismer för att kontrollera mänskligt styrda processer. De använder SOP:er, godkännandematriser, efterlevnadspolicyer, risktrösklar, utbildning, arbetsfördelning, revisioner och eskaleringsprocedurer. De flesta av dessa mekanismer designades kring ett enkelt antagande: en person läser regeln, förstår situationen och tillämpar regeln medan arbetet utförs.

Agenter förändrar det antagandet.

Betänk en policy som kräver sekundärt godkännande för transaktioner över en viss tröskel. När en människa utför uppgiften kan policyn finnas i ett dokument som stöds av utbildning och arbetsflödeskontroller. När en agent kan utföra hundratals eller tusentals åtgärder snabbt hindrar inte själva existensen av det policy‑dokumentet en handling som bryter mot den.

Någonstans mellan den skrivna policyn och affärshandlingen måste policyn bli operativ.

Detta betyder inte att varje policy måste bli deterministisk kod. Vissa kontroller kommer att vara deterministiska, vissa kommer att kräva semantisk tolkning, vissa kommer att bero på risk eller förtroende, och andra kommer fortsatt att kräva mänskligt omdöme. Den större arkitektoniska förändringen är att affärspolicyn börjar röra sig närmare exekveringsvägen.

AWS påpekar detta specifikt i samband med Agentic AI inom finansiella tjänster, inklusive behovet av policybaserad validering av agentåtgärder och revisionsspår kring betydelsefulla aktiviteter.

Historiskt sett kunde organisationer definiera många styrningskrav innan verkställandet och senare verifiera efterlevnad genom revisioner och granskningar. När autonoma system agerar kontinuerligt och i maskinhastighet måste vissa kontroller fungera medan processen pågår.

Människa i loopen är nödvändig, men det är inte driftsmodellen

Det vanligaste svaret på osäkerhet i ett AI‑arbetsflöde är att sätta in en människa i loopen. Det är logiskt, särskilt för betydelsefulla beslut, men det blir problematiskt när mänsklig granskning behandlas som svaret på varje avvikelse.

Föreställ dig en agentdriven verksamhet som bearbetar tusentals eller miljoner beslut. Om varje ovanlig situation, låg förtroenderesultat, policy‑oklarhet eller avvikelse dirigeras till en person, har organisationen inte eliminerat den operativa flaskhalsen. Den har bara flyttat flaskhalsen till en granskningskö. Med tiden kan detta också skapa ett annat problem: när människor ombeds godkänna för många rutinbeslut blir den mänskliga tillsynen i sig mindre meningsfull.

Människor förblir avgörande, men deras roll måste förändras. Istället för att granska varje beslut bör de fokusera på situationer där omdöme faktiskt krävs, där en agents auktoritet har nåtts, eller där systemet stöter på ett tillstånd som det inte bör lösa självständigt.

Ett skalbart driftmodell kan därför inte förlita sig enbart på riskpoängsättning och mänsklig granskning. Innan en agentåtgärd blir en affärsåtgärd måste systemet beakta den aktuella affärskontexten, relevanta policyer, agentens befogenhet och vad som redan har hänt i arbetsflödet. Resultatet kan bli att fortsätta, begära ytterligare bevis, hålla åtgärden eller eskalera beslutet till en människa.

Figur 3: Mänsklig granskning blir ett resultat av körningstidens kontroll

Detta förändrar rollen för mänsklig tillsyn. En människa infogas inte längre automatiskt i varje osäkert steg. Mänsklig intervention blir ett möjligt resultat när affärskontext, policy, befogenhet eller konsekvensen av en åtgärd kräver omdöme.

Distinktionen är viktig för företagsnivå. Vissa åtgärder bör gå vidare automatiskt eftersom de tydligt ligger inom policy och befogenhet. Andra bör pausas eftersom nödvändiga bevis saknas eller affärstillståndet har förändrats. Ytterligare några bör eskaleras eftersom beslutet har korsat en gräns som organisationen medvetet har reserverat för människor.

Målet är inte att ta bort människor från loopen. Det är att placera människor i rätt loopar, samtidigt som rutinbeslut får fortsätta inom tydligt definierade gränser. När agentbaserade system skalar kan kvaliteten på mänsklig tillsyn bero mindre på hur många beslut människor granskar och mer på om operativsystemet kan identifiera de beslut där mänskligt omdöme faktiskt är viktigt.

Observabilitet är nödvändig, men att se är inte att kontrollera

Branschen har gjort betydande framsteg inom AI-observabilitet. Team kan inspektera prompts, modellrespons, spår, verktygsanrop, latens, tokenanvändning och i allt högre grad hela den bana som en agent följt innan den producerade ett resultat.

Denna synlighet är avgörande. OpenAI vägledning om agentsäkerhet och utvärdering betonar också tekniker såsom utvärderingar och spårklassificering för att förstå agentbeteende.

Men synlighet ensam löser inte det operativa problemet.

Föreställ dig att upptäcka att en underwriting-agent bröt mot en godkännandepolicy 2 700 gånger förra veckan. Det skulle innebära utmärkt observabilitet men fruktansvärda operationer.

För betydelsefulla affärsprocesser behöver företag så småningom förmågan att inte bara förstå agentbeteende utan också att agera medan processen pågår.

Figur 4: Den operativa kontrollloopen

Observabilitet svarar på vad agenten gjorde. Agentbaserade operationer måste också svara på om agenten bör fortsätta.

Den distinktionen blir särskilt viktig när en åtgärd är kostsam, betydelsefull, svår att återkalla eller kan påverka många efterföljande beslut.

De svåraste felen kan inträffa mellan agenter

Det finns en annan utmaning som blir tydlig när företag går mot multi‑agent‑ och längre körande arbetsflöden. Många affärspolicyer är inte lokala för en enskild åtgärd.

Föreställ dig en policy som begränsar total finansiell exponering över en sekvens av beslut. Varje enskild transaktion kan ligga under den tillåtna tröskeln medan den kumulativa exponeringen överskrider den. Att granska varje åtgärd separat skulle inte visa någon överträdelse.

Samma problem kan uppstå med befogenhet. En agent kan vara auktoriserad att samla in information men inte fatta ett slutgiltigt beslut. Efter flera överlämningar kan en nedströms agent få informationen utan att behålla de befogenhetsrestriktioner som var kopplade till den ursprungliga uppgiften. Varje enskilt steg kan verka rimligt medan sekvensen bryter mot den avsedda affärsprocessen.

Kontext skapar ett liknande problem. Information som var viktig under det första steget i ett arbetsflöde kan sammanfattas, transformeras eller utelämnas flera steg senare. Den nedströms agenten kan inte resonera kring information som den inte längre har, även om dess resonemang annars är korrekt.

Dessa fel indikerar att pålitlighetsenheten måste utökas.

Vi kommer fortsätta utvärdera modeller genom att fråga om deras svar är korrekta. Vi kommer utvärdera agenter genom att fråga om de slutförde sina uppgifter korrekt. Men på arbetsflödesnivå blir frågan huruvida information, befogenhet och policy överlevde över sekvensen av åtgärder. På affärsnivå blir frågan om det slutgiltiga resultatet både var korrekt och tillåtet.

Detta är också i linje med det bredare livscykelperspektivet i NIST AI Risk Management Framework, som betonar pågående mätning och hantering av AI-risk snarare än att behandla utvärdering som en engångsaktivitet före distribution.

Här börjar agentbaserade operationer

AI-styrning, modellutvärdering, LLMOps, övervakning, säkerhet och ansvarsfull AI adresserar redan viktiga delar av att driva AI-system. Agentic Operations ersätter inte dessa discipliner. Det adresserar det operativa lagret som blir viktigt när autonoma och semi-autonoma system börjar delta direkt i affärsprocesser.

Agentic Operations är disciplinen för att driva autonoma och semi-autonoma AI-system inom verkliga affärsprocesser, inklusive hur auktoritet, kontext, beslut, undantag, mänsklig intervention och ansvarighet hanteras under körning.

Skillnaden är viktig eftersom objektet som hanteras inte längre bara är en modell. Det är en pågående affärsprocess där mjukvara kan fatta beslut och vidta åtgärder självständigt.

I praktiken skapar detta en annan uppsättning operativa frågor. Vad är en agent auktoriserad att göra? Vilken affärskontext måste överleva över ett långvarigt arbetsflöde? Vad händer när ny bevisning ogiltigförklarar ett tidigare beslut? Hur kan en organisation upptäcka när individuellt acceptabla handlingar gemensamt bryter mot en policy? När ska en agent fortsätta, pausa, stoppa eller eskalera? Månader senare, kan organisationen återskapa varför ett specifikt beslut fattades?

Det finns också en ägandefråga. När en agent utför sin tekniska uppgift korrekt men affärsresultatet är felaktigt, vem äger misslyckandet? Att delegera utförandet till en agent delegerar inte organisationens ansvar för den.

Agenter kan utföra arbetet. Företaget äger fortfarande resultatet.

Målet är kontrollerad autonomi

Framtiden för Agentic AI beskrivs ibland som en utveckling mot fullständig autonomi, där människor gradvis försvinner från affärsarbetsflöden. För de flesta företag är det sannolikt fel mål.

Det mer användbara målet är kontrollerad autonomi.

Många AI-assisterade processer idag följer ett mönster där en agent föreslår en åtgärd och en person fattar det slutgiltiga beslutet. Allteftersom förtroendet ökar kommer vissa arbetsflöden att tillåta agenter att fatta beslut inom definierad auktoritet medan det omgivande systemet övervakar utförandet och människor hanterar undantag. Mogna, lågriskarbetsflöden kan så småningom låta agenter att besluta och agera självständigt medan konsekvensfulla beslut förblir övervakade och registrerade.

Figur 5 : Ökande nivå av autonomi

Den lämpliga gränsen kommer att skilja sig åt beroende på process. En bank kan tillåta betydande autonomi i dokumentklassificering samtidigt som den kräver strikta kontroller kring kreditbeslut. En försäkringsgivare kan automatisera rutinmässiga anspråk samtidigt som den eskalerar ovanliga kombinationer av bevis. En vårdorganisation kan låta agenter samla in och sammanfatta information samtidigt som den reserverar konsekvensfulla beslut för människor.

Den viktiga frågan är därför inte bara hur autonom en agent kan bli. Det handlar om hur mycket autonomi en organisation kan ansvarsfullt driva.

Detta förändrar också kontrollernas roll. Kontroller är inte nödvändigtvis mekanismer för att minska autonomi. När de är väl implementerade möjliggör de för en organisation att utöka autonomi med större förtroende.

Att driva agenter kan bli svårare än att bygga dem

Modeller kommer att fortsätta förbättras. Verktygsanvändning kommer att förbättras. Agentramverk kommer att förbättras. Resonemang kommer att förbättras, och många problem som idag verkar svåra kommer så småningom att bli rutinmässiga.

Bättre modeller eliminerar dock inte affärspolicyer, förändrad kontext, undantag, organisatoriska gränser eller ansvar. På vissa sätt gör bättre agenter dessa frågor ännu viktigare. Ett system som inte kan agera autonomt har begränsad operativ auktoritet. Ett system som kan verkställa tusentals affärsbeslut skapar ett helt annat ansvar.

Detta är anledningen till att nästa fas av företags‑AI kanske inte bestäms av vilken organisation som distribuerar flest agenter. Det kan bestämmas av vilka organisationer som lär sig hur man driver dem.

De första 80 procenten visar att agenten kan fungera. De återstående 20 procenten avgör om företaget kan lita på den i affärssammanhang.

Allteftersom agenter blir mer kapabla, kan den avgörande företagsfrågan skifta från vad våra agenter kan göra till något svårare:

Vad är vi beredda att låta dem göra, under vilka villkor, och hur kommer vi att veta när dessa villkor förändras?

Det är där Agentic Operations börjar.

Rajesh Gupta är en AI‑produkt- och teknikledare, tidigare praktiker på Apple och Qualcomm, och grundare för andra gången. Han har mer än 15 år erfarenhet av maskininlärning, företags‑AI och Agentic AI, och bygger för närvarande RunCtrl AI med fokus på kontroll i realtid för agentbaserade affärsoperationer.