Thought leaders
AI‑agenten kunnen het werk doen. Maar kunnen ondernemingen ze exploiteren?

AI‑agenten worden opmerkelijk goed in het voltooien van taken. Geef een agent een doel, toegang tot de juiste hulpmiddelen, voldoende context en een goed gedefinieerde workflow, en hij kan informatie onderzoeken, documenten analyseren, beslissingen nemen, systemen bijwerken en coördineren met andere agenten.
Dat is het opwindende deel van Agentic AI. Het is ook het deel dat we meestal in demo’s zien.
Enterprise‑operaties zien er anders uit. Een leningaanvraag verandert halverwege de underwriting. Een klant levert nieuwe informatie aan nadat de verificatie is voltooid. Twee systemen zijn het oneens over dezelfde rekening. Een goedkeuring die gisteren nog geldig was, is vandaag mogelijk niet meer geldig. Een agent vat een zaak samen voordat hij deze aan een andere agent overdraagt, en een ogenschijnlijk klein detail verdwijnt in het proces.
Het gelukkige pad kan 80 procent van wat een agent moet doen vertegenwoordigen. Ondernemingen opereren in de resterende 20 procent.
De 80/20‑kadering is geen branchespecifieke statistiek. Het is een manier om te beschrijven waar operationele complexiteit zich vaak verbergt. Het moeilijke deel van enterprise‑operaties is vaak niet het normale geval, maar de uitzonderingen, overdrachten, afhankelijkheden, veranderende context en beslissingen waarbij de organisatie verantwoordelijk blijft voor het resultaat.
Naarmate AI verschuift van het beantwoorden van vragen naar het uitvoeren van acties, wordt deze operationele complexiteit veel belangrijker. Ondernemingen moeten verder kijken dan hoe agenten worden gebouwd en gaan nadenken over hoe ze worden geëxploiteerd.
Dat is waar Agentic Operations begint.
Van antwoorden genereren naar acties ondernemen
De eerste golf van enterprise Generative AI draaide grotendeels om informatie. Modellen vatten documenten samen, genereerden rapporten, beantwoordden vragen, doorzochten bedrijfskennis en hielpen medewerkers bestaande taken sneller uit te voeren.
Agenten introduceren iets fundamenteel anders. Ze kunnen acties ondernemen die de status van een bedrijfsproces veranderen. Een agent kan iets goedkeuren of afwijzen, een registratiesysteem bijwerken, een klantcommunicatie sturen, een andere workflow activeren, een andere agent oproepen, of een beslissing nemen die bepaalt wat er vervolgens gebeurt.
OpenAI beschrijft agenten in zijn praktische gids als systemen die zelfstandig taken uitvoeren namens gebruikers, modellen gebruiken om de workflow‑uitvoering te beheren en tools om met externe systemen te communiceren. Het operationele gevolg van een onjuist antwoord is heel anders dan het gevolg van een onjuiste handeling.
De vraag voor ondernemingen verandert daarom. Het is niet langer voldoende om te vragen of een model een goed antwoord heeft gegenereerd of of een agent zijn toegewezen taak succesvol heeft voltooid. Ondernemingen moeten steeds vaker weten of een actie überhaupt had moeten plaatsvinden, gezien de bedrijfscontext, beleidsregels, autoriteit en alles wat eerder in het proces is gebeurd.
Figuur 1: Generative AI levert een output op. Agentic AI verandert de bedrijfsstatus.

Zodra AI de bedrijfsstatus kan veranderen en daaropvolgende beslissingen kan beïnvloeden, kan betrouwbaarheid niet langer alleen op modelniveau worden gemeten.
Een agent kan slagen terwijl het bedrijfsproces faalt
Beschouw een AI‑aangedreven workflow voor lening‑underwriting. De ene agent haalt aanvraagdocumenten op, een andere verifieert inkomen, weer een andere beoordeelt kredietinformatie, en een latere agent vat de zaak samen voordat een underwriting‑agent een beslissing neemt of aanbeveelt.
Elke agent heeft een duidelijk gedefinieerde verantwoordelijkheid, en elke kan die verantwoordelijkheid correct uitvoeren. De document‑agent kan de juiste informatie extraheren. De inkomens‑verificatie‑agent kan zijn taak succesvol voltooien. De samenvattings‑agent kan een nauwkeurige samenvatting maken van de beschikbare informatie. De underwriting‑agent kan zijn instructies correct opvolgen.
De uiteindelijke zakelijke beslissing kan nog steeds verkeerd.
Stel je voor dat bijgewerkte inkomensinformatie arriveert na de eerste verificatie. Het nieuwe document wordt verwerkt, maar de betekenis ervan wordt verminderd wanneer de zaak wordt samengevat voor de volgende stap. De uiteindelijke underwriting‑agent ontvangt een redelijk samenvatting, maar niet de volledige bedrijfscontext die gedurende het hele proces bestond.
Er is niets per se gecrasht. Geen API is mislukt. Geen individuele agent heeft noodzakelijkerwijs gefantaseerd. Elk component kan een succesvolle uitvoering melden terwijl het bedrijfsproces tot een verkeerd resultaat leidt.
Anthropic bespreekt een verwante uitdaging in haar richtlijnen voor het bouwen van effectieve agenten, waarbij wordt opgemerkt dat autonome systemen samengestelde fouten kunnen ondervinden naarmate ze meer stappen nemen. Het probleem wordt breder dan modelnauwkeurigheid omdat status, context, beslissingen en aannames zich over de workflow verspreiden.
Dit creëert een belangrijk onderscheid tussen agentbetrouwbaarheid en betrouwbaarheid van bedrijfsprocessen. Een onderneming ervaart uiteindelijk niet een individuele agent. Ze ervaart het resultaat dat door het volledige proces wordt geproduceerd.
Figuur 2: Lokaal succes garandeert geen zakelijk succes

Dit is een van de belangrijke veranderingen die Agentic AI introduceert. Een workflow kan falen, zelfs wanneer elk onderdeel er onafhankelijk gezond uitziet bij inspectie.
Vermogen is geen autoriteit
Een groot deel van de huidige agentstack is begrijpelijkerwijs gericht op vermogen. Teams willen weten of een agent kan redeneren, het juiste hulpmiddel kan selecteren, een taak kan voltooien, van fouten kan herstellen en kan opereren met acceptabele nauwkeurigheid en latentie.
Ondernemingen hebben een andere eis: autoriteit.
Stel je een underwriting‑agent voor die in staat is een lening goed te keuren. Dat betekent niet dat hij elke lening die hij kan beoordelen, moet goedkeuren. Zijn autoriteit kan afhangen van het leenbedrag, de risicocategorie, het type klant, beschikbare bewijzen, het vertrouwensniveau, eerdere beslissingen, of of de aanvraag is gewijzigd na een eerdere beoordeling.
Dit creëert een grens tussen wat een agent kan doen en wat een agent mag doen.
OpenAI raadt aan om het risico dat gepaard gaat met agenttools te beoordelen en waarborgen of menselijke tussenkomst toe te voegen rond gevoelige en onomkeerbare handelingen. Microsoft neemt een vergelijkbare benadering in zijn richtlijnen voor door agents beheerde kernbedrijfsprocessen, waarbij agents routinematige beslissingen kunnen nemen binnen gedefinieerde grenzen, terwijl besluitvormingsrechten bepalen welke acties zelfstandig kunnen worden uitgevoerd en welke menselijke goedkeuring vereisen.
Naarmate het vermogen van agents verbetert, wordt dit onderscheid belangrijker, niet minder. Meer capabele agents kunnen meer ingrijpende acties ondernemen. Ondernemingen hebben daarom duidelijkere manieren nodig om de grenzen waarbinnen die acties zijn toegestaan, te definiëren en af te dwingen.
De vraag verschuift van Kan de agent dit doen? naar Onder welke voorwaarden mag de agent dit doen?
Bedrijfsbeleid moet dichter bij de uitvoering komen
Ondernemingen beschikken al over uitgebreide mechanismen voor het beheersen van door mensen uitgevoerde processen. Ze gebruiken SOP’s, goedkeuringsmatrixen, compliance‑beleid, risicodrempels, training, scheiding van taken, audits en escalatieprocedures. De meeste van deze mechanismen zijn ontworpen rond een eenvoudige veronderstelling: een persoon leest de regel, begrijpt de situatie en past de regel toe tijdens het uitvoeren van het werk.
Agents veranderen die veronderstelling.
Beschouw een beleid dat een secundaire goedkeuring vereist voor transacties boven een bepaalde drempel. Wanneer een mens de taak uitvoert, kan het beleid bestaan in een document ondersteund door training en workflow‑controles. Wanneer een agent honderden of duizenden acties snel kan uitvoeren, voorkomt het bestaan van dat beleidsdocument op zichzelf niet dat een actie die het schendt, wordt uitgevoerd.
Ergens tussen het geschreven beleid en de zakelijke actie moet het beleid operationeel worden.
Dit betekent niet dat elk beleid moet worden omgezet in deterministische code. Sommige controles zullen deterministisch zijn, sommige vereisen semantische interpretatie, sommige hangen af van risico of vertrouwen, en andere blijven menselijke beoordeling vereisen. De grotere architecturale verandering is dat bedrijfsbeleid steeds dichter bij het uitvoeringspad komt.
AWS maakt dit punt specifiek in de context van Agentic AI in de financiële sector, inclusief de noodzaak van beleidsgebaseerde validatie van agentacties en audit‑trails rond ingrijpende activiteiten.
Historisch gezien konden organisaties veel governance‑eisen definiëren vóór uitvoering en later compliance verifiëren via audits en beoordelingen. Wanneer autonome systemen continu en op machinale snelheid handelen, moeten sommige controles opereren terwijl het proces loopt.
Mens in de lus is noodzakelijk, maar het is niet het operationele model
De meest voorkomende reactie op onzekerheid in een AI‑workflow is om een mens in de lus te plaatsen. Dat is logisch, vooral bij ingrijpende beslissingen, maar het wordt problematisch wanneer menselijke beoordeling wordt gezien als het antwoord op elke uitzondering.
Stel je een agentische operatie voor die duizenden of miljoenen beslissingen verwerkt. Als elke ongebruikelijke situatie, resultaat met lage zekerheid, beleidsambiguïteit of uitzondering naar een persoon wordt doorgestuurd, heeft de organisatie de operationele knelpunt niet verwijderd. Het heeft het knelpunt simpelweg verplaatst naar een beoordelingswachtrij. Na verloop van tijd kan dit een ander probleem veroorzaken: wanneer mensen worden gevraagd te veel routinematige beslissingen goed te keuren, kan menselijke controle zelf minder betekenisvol worden.
Mensen blijven essentieel, maar hun rol moet veranderen. In plaats van elke beslissing te beoordelen, moeten ze zich richten op situaties waarin oordeel daadwerkelijk vereist is, waar de autoriteit van een agent is bereikt, of waar het systeem een conditie tegenkomt die het niet zelfstandig mag oplossen.
Een schaalbaar operationeel model kan daarom niet alleen op risicoscores en menselijke beoordeling vertrouwen. Voordat een agentactie een zakelijke actie wordt, moet het systeem de huidige zakelijke context, relevante beleidsregels, de autoriteit van de agent en wat er al in de workflow is gebeurd, in overweging nemen. Het resultaat kan zijn om door te gaan, extra bewijs aan te vragen, de actie vast te houden of de beslissing naar een mens te escaleren.
Figuur 3: Menselijke beoordeling wordt één uitkomst van runtime‑controle

Dit verandert de rol van menselijk toezicht. Een mens wordt niet langer standaard in elke onzekere stap ingevoegd. Menselijke interventie wordt één mogelijke uitkomst wanneer de zakelijke context, het beleid, de autoriteit of de consequentie van een actie oordeel vereist.
Het onderscheid is belangrijk voor schaal in ondernemingen. Sommige acties moeten automatisch worden uitgevoerd omdat ze duidelijk binnen beleid en autoriteit vallen. Andere moeten worden gepauzeerd omdat vereist bewijs ontbreekt of de zakelijke toestand is veranderd. Weer andere moeten worden geëscaleerd omdat de beslissing een grens heeft overschreden die de organisatie bewust voor mensen heeft gereserveerd.
Het doel is niet om mensen uit de lus te verwijderen. Het is om mensen in de juiste lussen te plaatsen, terwijl routinematige beslissingen binnen duidelijk gedefinieerde grenzen kunnen doorgaan. Naarmate agentische systemen opschalen, kan de kwaliteit van menselijk toezicht minder afhangen van hoeveel beslissingen mensen beoordelen en meer van of het operationele systeem de beslissingen kan identificeren waarbij menselijk oordeel daadwerkelijk van belang is.
Observeerbaarheid is noodzakelijk, maar zien is geen controle
De industrie heeft aanzienlijke vooruitgang geboekt op het gebied van AI‑observability. Teams kunnen prompts, modelreacties, traces, tool‑calls, latency, token‑gebruik en steeds vaker de volledige trajecten die een agent heeft gevolgd vóór het produceren van een uitkomst inspecteren.
Deze zichtbaarheid is essentieel. OpenAI‑richtlijnen voor agentsveiligheid en -evaluatie benadrukken ook technieken zoals evaluaties en trace‑beoordeling om het gedrag van agents te begrijpen.
Maar alleen zichtbaarheid lost het operationele probleem niet op.
Stel je voor dat je ontdekt dat een underwriting‑agent vorige week 2.700 keer een goedkeuringsbeleid heeft geschonden. Dat zou uitstekende observability en verschrikkelijke operaties betekenen.
Voor cruciale bedrijfsprocessen hebben ondernemingen uiteindelijk de mogelijkheid nodig niet alleen het gedrag van agents te begrijpen, maar ook te reageren terwijl het proces loopt.
Figuur 4: De operationele controlelus

Observability beantwoordt wat de agent heeft gedaan. Agentic Operations moet ook beantwoorden of de agent moet doorgaan.
Dat onderscheid wordt bijzonder belangrijk wanneer een actie duur, consequential, moeilijk ongedaan te maken of in staat is vele downstream‑beslissingen te beïnvloeden.
The Hardest Failures May Happen Between Agents
Er is een andere uitdaging die zichtbaar wordt naarmate ondernemingen overstappen op multi‑agent‑ en langerlopende workflows. Veel bedrijfsbeleid is niet lokaal voor één enkele actie.
Beschouw een beleid dat de totale financiële blootstelling over een reeks beslissingen beperkt. Elke individuele transactie kan onder de toegestane drempel liggen, terwijl de cumulatieve blootstelling die overschrijdt. Het afzonderlijk bekijken van elke actie zou geen overtreding tonen.
Hetzelfde probleem kan zich voordoen bij autoriteit. Een agent mag wel informatie verzamelen, maar geen definitieve beslissing nemen. Na meerdere overdrachten kan een downstream‑agent de informatie ontvangen zonder de autoriteitsbeperkingen die aan de oorspronkelijke taak waren gekoppeld te behouden. Elke individuele stap kan redelijk lijken, terwijl de reeks het beoogde bedrijfsproces schendt.
Context creëert een vergelijkbaar probleem. Informatie die tijdens de eerste fase van een workflow van belang was, kan enkele stappen later worden samengevat, getransformeerd of weggelaten. De downstream‑agent kan niet redeneren over informatie die hij niet meer heeft, zelfs als zijn redenering verder correct is.
Deze fouten suggereren dat de eenheid van betrouwbaarheid moet worden uitgebreid.
We zullen modellen blijven evalueren door te vragen of hun antwoorden correct zijn. We zullen agents evalueren door te vragen of ze hun taken correct hebben voltooid. Maar op workflow‑niveau wordt de vraag of informatie, autoriteit en beleid de reeks acties hebben overleefd. Op bedrijfsniveau wordt de vraag of de uiteindelijke uitkomst zowel correct als toegestaan was.
Dit is ook consistent met het bredere levenscyclus‑perspectief in het NIST AI Risk Management Framework, dat de nadruk legt op voortdurende meting en beheer van AI‑risico in plaats van evaluatie als een eenmalige activiteit vóór implementatie.
This Is Where Agentic Operations Begins
AI-governance, model-evaluatie, LLMOps, observability, security en responsible AI behandelen al belangrijke onderdelen van het exploiteren van AI-systemen. Agentic Operations vervangt deze disciplines niet. Het richt zich op de operationele laag die belangrijk wordt wanneer autonome en semi‑autonome systemen direct deelnemen aan bedrijfsprocessen.
Agentic Operations is de discipline van het exploiteren van autonome en semi‑autonome AI-systemen binnen echte bedrijfsprocessen, inclusief hoe autoriteit, context, beslissingen, uitzonderingen, menselijke interventie en verantwoordelijkheid tijdens de uitvoering worden beheerd.
Het onderscheid is belangrijk omdat het object dat wordt beheerd niet langer alleen een model is. Het is een doorlopend bedrijfsproces waarin software zelfstandig beslissingen kan nemen en acties kan uitvoeren.
In de praktijk creëert dit een andere reeks operationele vragen. Wat is een agent toegestaan te doen? Welke bedrijfscontext moet behouden blijven gedurende een langdurige workflow? Wat gebeurt er wanneer nieuw bewijs een eerdere beslissing ongeldig maakt? Hoe kan een organisatie detecteren wanneer individueel acceptabele acties collectief een beleid schenden? Wanneer moet een agent doorgaan, pauzeren, stoppen of escaleren? En maanden later, kan de organisatie reconstrueren waarom een bepaalde beslissing is genomen?
Er is ook een vraag naar eigendom. Wanneer een agent zijn technische taak correct uitvoert maar het zakelijke resultaat verkeerd is, wie draagt dan de verantwoordelijkheid voor de mislukking? Het delegeren van uitvoering aan een agent delegeert niet de aansprakelijkheid van de organisatie die hem exploiteert.
Agenten kunnen het werk uitvoeren. De onderneming blijft eigenaar van het resultaat.
Het doel is gecontroleerde autonomie
De toekomst van Agentic AI wordt soms beschreven als een evolutie naar volledige autonomie, waarbij mensen geleidelijk verdwijnen uit bedrijfsworkflows. Voor de meeste ondernemingen is dat waarschijnlijk het verkeerde doel.
Het nuttigere doel is gecontroleerde autonomie.
Veel AI‑ondersteunde processen volgen vandaag een patroon waarbij een agent een actie voorstelt en een persoon de uiteindelijke beslissing neemt. Naarmate het vertrouwen groeit, zullen sommige workflows agents toestaan beslissingen te nemen binnen een gedefinieerde autoriteit, terwijl het omringende systeem de uitvoering superviseert en mensen de uitzonderingen afhandelen. Volwassen, minder risicovolle workflows kunnen uiteindelijk agents toestaan zelfstandig te beslissen en te handelen, terwijl de gevolgde beslissingen gemonitord en vastgelegd blijven.
Fig 5 : Toenemend niveau van autonomie

De juiste grens zal per proces verschillen. Een bank kan aanzienlijke autonomie toestaan bij documentclassificatie, terwijl strikte controles vereist zijn rond kredietbeslissingen. Een verzekeraar kan routinematige claims automatiseren, maar ongebruikelijke combinaties van bewijs escaleren. Een zorgorganisatie kan agents laten informatie verzamelen en samenvatten, terwijl de gevolgde beslissingen voor mensen worden gereserveerd.
De belangrijke vraag is daarom niet simpelweg hoe autonoom een agent kan worden. Het is hoe veel autonomie een organisatie verantwoord kan exploiteren.
Dit verandert ook de rol van controles. Controles zijn niet noodzakelijk mechanismen om autonomie te verminderen. Goed toegepast stellen ze een organisatie in staat om autonomie uit te breiden met meer vertrouwen.
Het exploiteren van agents kan moeilijker worden dan ze bouwen
Modellen zullen blijven verbeteren. Het gebruik van tools zal verbeteren. Agent‑frameworks zullen verbeteren. Redeneren zal verbeteren, en veel problemen die nu moeilijk lijken, zullen uiteindelijk routine worden.
Beter presterende modellen elimineren echter niet de bedrijfsbeleid, veranderende context, uitzonderingen, organisatorische grenzen of verantwoordelijkheid. In zekere zin maken betere agents deze kwesties zelfs belangrijker. Een systeem dat niet autonoom kan handelen heeft beperkte operationele autoriteit. Een systeem dat duizenden bedrijfsbeslissingen kan uitvoeren, creëert een geheel andere verantwoordelijkheid.
Daarom wordt de volgende fase van enterprise AI mogelijk niet bepaald door welke organisatie de meeste agents inzet, maar door welke organisaties leren hoe ze ze moeten exploiteren.
De eerste 80 procent toont aan dat de agent kan werken. De resterende 20 procent bepaalt of de onderneming erop kan vertrouwen voor de business.
Naarmate agents capabeler worden, kan de bepalende ondernemingsvraag verschuiven van wat onze agents kunnen doen naar iets moeilijkers:
Wat zijn we bereid hen te laten doen, onder welke voorwaarden, en hoe weten we wanneer die voorwaarden veranderen?
Dat is waar Agentic Operations begint.












