Leader di pensiero

Gli agenti IA possono fare il lavoro. Ma le imprese possono gestirli?

mm
Aggiungi Unite.AI alle tue fonti preferite su Google

Gli agenti IA stanno diventando notevolmente bravi a completare compiti. Dai a un agente un obiettivo, l’accesso agli strumenti giusti, abbastanza contesto e un flusso di lavoro ben definito, e può ricercare informazioni, analizzare documenti, prendere decisioni, aggiornare i sistemi e coordinarsi con altri agenti.

Questa è la parte entusiasmante dell’IA agentica. È anche la parte che tendiamo a vedere nelle dimostrazioni.

Le operazioni aziendali appaiono diverse. Una domanda di prestito cambia a metà della valutazione del credito. Un cliente fornisce nuove informazioni dopo che la verifica è completata. Due sistemi non sono d’accordo sullo stesso conto. Un’approvazione valida ieri potrebbe non essere più valida oggi. Un agente riassume un caso prima di passarne a un altro agente, e un dettaglio apparentemente minore scompare nel processo.

Il percorso ideale può rappresentare l’80 % di ciò che un agente deve fare. Le imprese operano nel restante 20 %.

Il quadro 80/20 non è una statistica di settore. È un modo per descrivere dove tende a nascondersi la complessità operativa. La parte difficile delle operazioni aziendali spesso non è il caso normale, ma le eccezioni, i passaggi di consegna, le dipendenze, il contesto mutevole e le decisioni in cui l’organizzazione rimane responsabile del risultato.

Man mano che l’IA passa dal rispondere a domande al compiere azioni, questa complessità operativa diventa molto più importante. Le imprese dovranno pensare oltre a come gli agenti sono costruiti e iniziare a considerare come vengono gestiti.

È qui che Agentic Operations inizia.

Dal generare risposte al compiere azioni

La prima ondata di IA generativa aziendale riguardava principalmente le informazioni. I modelli riassumevano documenti, generavano report, rispondevano a domande, cercavano nella conoscenza aziendale e aiutavano i dipendenti a completare più rapidamente i compiti esistenti.

Gli agenti introducono qualcosa di fondamentalmente diverso. Possono compiere azioni che modificano lo stato di un processo aziendale. Un agente può approvare o rifiutare qualcosa, aggiornare un sistema di registrazione, inviare una comunicazione al cliente, avviare un altro flusso di lavoro, chiamare un altro agente o prendere una decisione che determina cosa accadrà successivamente.

OpenAI descrive gli agenti nella sua guida pratica come sistemi che svolgono autonomamente compiti per conto degli utenti, usando modelli per gestire l’esecuzione dei flussi di lavoro e strumenti per interagire con sistemi esterni. La conseguenza operativa di una risposta errata è molto diversa dalla conseguenza di un’azione errata.

La domanda aziendale quindi cambia. Non è più sufficiente chiedersi se un modello ha generato una risposta valida o se un agente ha completato con successo il compito assegnato. Le imprese hanno sempre più bisogno di sapere se un’azione sarebbe dovuta avvenire, considerando il contesto aziendale, le politiche, l’autorità e tutto ciò che è accaduto precedentemente nel processo.

Figura 1: L’IA generativa produce un output. L’IA agentica cambia lo stato aziendale.

Una volta che l’IA può modificare lo stato aziendale e influenzare decisioni successive, l’affidabilità non può più essere misurata solo a livello di modello.

Un agente può avere successo mentre il processo aziendale fallisce

Considera un flusso di lavoro di valutazione del credito di un prestito alimentato dall’IA. Un agente estrae i documenti della domanda, un altro verifica il reddito, un altro ancora valuta le informazioni creditizie, e un agente successivo riassume il caso prima che un agente di valutazione del credito prenda o consigli una decisione.

Ogni agente ha una responsabilità chiaramente definita e può svolgere correttamente tale responsabilità. L’agente documento può estrarre le informazioni corrette. L’agente di verifica del reddito può completare con successo il suo compito. L’agente di sintesi può creare un riassunto accurato delle informazioni a sua disposizione. L’agente di valutazione del credito può seguire correttamente le sue istruzioni.

La decisione aziendale finale può ancora essere sbagliata.

Immagina che le informazioni sul reddito aggiornate arrivino dopo la verifica iniziale. Il nuovo documento viene elaborato, ma la sua rilevanza si riduce quando il caso viene riassunto per il passaggio successivo. L’agente di valutazione del credito finale riceve un riassunto ragionevole, ma non il contesto aziendale completo che esisteva durante l’intero processo.

Non è necessariamente andato in crash nulla. Nessuna API è fallita. Nessun agente individuale ha necessariamente avuto allucinazioni. Ogni componente potrebbe segnalare un’esecuzione riuscita mentre il processo aziendale raggiunge un risultato errato.

Anthropic discute una sfida correlata nella sua guida sulla costruzione di agenti efficaci, osservando che i sistemi autonomi possono incontrare errori cumulativi man mano che compiono più passaggi. Il problema diventa più ampio della precisione del modello perché lo stato, il contesto, le decisioni e le ipotesi si spostano lungo il flusso di lavoro.

This creates an important distinction between affidabilità dell’agente e affidabilità del processo aziendale. Un’impresa non sperimenta alla fine un agente individuale. Sperimenta il risultato prodotto dall’intero processo.

Figura 2: Il successo locale non garantisce il successo aziendale

Questo è uno dei cambiamenti importanti introdotti dall’AI agentica. Un flusso di lavoro può fallire anche quando ogni componente appare sano se ispezionato singolarmente.

La capacità non è autorità

Gran parte dello stack attuale degli agenti è comprensibilmente focalizzata sulla capacità. I team vogliono sapere se un agente può ragionare, selezionare lo strumento giusto, completare un compito, recuperare dagli errori e operare con precisione e latenza accettabili.

Le imprese hanno un altro requisito: l’autorità.

Supponiamo che un agente di sottoscrizione sia in grado di approvare un prestito. Ciò non significa che debba approvare ogni prestito che può valutare. La sua autorità può dipendere dall’importo del prestito, dalla categoria di rischio, dal tipo di cliente, dalle prove disponibili, dal livello di confidenza, dalle decisioni precedenti o dal fatto che la domanda sia cambiata dopo una revisione precedente.

Questo crea un confine tra ciò che un agente può fare e ciò che un agente è autorizzato a fare.

OpenAI raccomanda di valutare il rischio associato agli strumenti degli agenti e di aggiungere salvaguardie o interventi umani attorno ad azioni sensibili e irreversibili. Microsoft adotta un approccio simile nella sua guida per i processi aziendali fondamentali operati da agenti, dove gli agenti possono prendere decisioni di routine entro limiti definiti mentre i diritti decisionali determinano quali azioni possono essere eseguite in modo autonomo e quali richiedono l’approvazione umana.

Man mano che la capacità degli agenti migliora, questa distinzione diventa più importante, non meno. Gli agenti più capaci possono compiere azioni più consequenziali. Le imprese, quindi, hanno bisogno di modi più chiari per definire e far rispettare i limiti entro i quali tali azioni sono consentite.

La domanda passa da L’agente può fare questo? a In quali condizioni l’agente dovrebbe essere autorizzato a fare questo?

Le politiche aziendali devono avvicinarsi all’esecuzione

Le imprese dispongono già di meccanismi estesi per controllare i processi operati da esseri umani. Utilizzano SOP, matrici di approvazione, politiche di conformità, soglie di rischio, formazione, separazione delle funzioni, audit e procedure di escalation. La maggior parte di questi meccanismi è stata progettata su un’assunzione semplice: una persona legge la regola, comprende la situazione e applica la regola mentre svolge il lavoro.

Gli agenti modificano tale assunzione.

Consideriamo una politica che richiede un’approvazione secondaria per le transazioni superiori a una certa soglia. Quando un essere umano esegue il compito, la politica può esistere in un documento supportato da formazione e controlli di flusso di lavoro. Quando un agente può eseguire centinaia o migliaia di azioni rapidamente, l’esistenza di quel documento di politica non impedisce di per sé un’azione che lo violi.

Da qualche parte tra la politica scritta e l’azione aziendale, la politica deve diventare operativa.

Ciò non significa che ogni politica debba diventare codice deterministico. Alcuni controlli saranno deterministici, altri richiederanno un’interpretazione semantica, alcuni dipenderanno dal rischio o dalla confidenza, e altri continueranno a richiedere il giudizio umano. Il più ampio cambiamento architettonico è che le politiche aziendali iniziano a spostarsi più vicino al percorso di esecuzione.

AWS sottolinea questo punto specificamente nel contesto dell’AI agentica nei servizi finanziari, includendo la necessità di una convalida basata su policy delle azioni degli agenti e di tracciamenti di audit per le attività consequenziali.

Storicamente, le organizzazioni potevano definire numerosi requisiti di governance prima dell’esecuzione e verificare la conformità in seguito tramite audit e revisioni. Quando i sistemi autonomi agiscono in modo continuo e a velocità di macchina, alcuni controlli devono operare mentre il processo è in esecuzione.

L’intervento umano è necessario, ma non è il modello operativo

La risposta più comune all’incertezza in un flusso di lavoro AI è inserire un umano nel ciclo. Ha senso, soprattutto per decisioni consequenziali, ma diventa problematica quando la revisione umana è trattata come la risposta a ogni eccezione.

Immaginate un’operazione agentica che elabora migliaia o milioni di decisioni. Se ogni situazione insolita, risultato a bassa confidenza, ambiguità di politica o eccezione viene indirizzata a una persona, l’organizzazione non ha eliminato il collo di bottiglia operativo. Lo ha semplicemente spostato in una coda di revisione. Col tempo, ciò può generare un altro problema: quando agli umani viene chiesto di approvare troppe decisioni di routine, la supervisione umana stessa può diventare meno significativa.

Gli esseri umani rimangono essenziali, ma il loro ruolo deve cambiare. Invece di esaminare ogni decisione, dovrebbero concentrarsi su situazioni in cui è realmente necessario un giudizio, in cui è stata raggiunta l’autorità di un agente, o in cui il sistema incontra una condizione che non dovrebbe risolvere in modo autonomo.

Un modello operativo scalabile, quindi, non può basarsi solo sulla valutazione del rischio e sulla revisione umana. Prima che un’azione di un agente diventi un’azione aziendale, il sistema deve considerare il contesto commerciale corrente, le politiche pertinenti, l’autorità dell’agente e ciò che è già accaduto nel flusso di lavoro. Il risultato può essere continuare, richiedere ulteriori prove, sospendere l’azione o escalare la decisione a un umano.

Figura 3: La revisione umana diventa un risultato del controllo in tempo reale

Ciò cambia il ruolo della supervisione umana. Un essere umano non viene più inserito per impostazione predefinita in ogni passaggio incerto. L’intervento umano diventa un possibile risultato quando il contesto aziendale, la politica, l’autorità o la conseguenza di un’azione richiedono un giudizio.

La distinzione è importante per la scala aziendale. Alcune azioni dovrebbero procedere automaticamente perché sono chiaramente entro la politica e l’autorità. Alcune dovrebbero essere messe in pausa perché le prove richieste mancano o lo stato aziendale è cambiato. Altre dovrebbero essere scalate perché la decisione ha superato un confine che l’organizzazione ha intenzionalmente riservato alle persone.

Lo scopo non è rimuovere gli esseri umani dal ciclo. Si tratta di inserire gli esseri umani nei cicli giusti, consentendo alle decisioni di routine di procedere entro limiti chiaramente definiti. Man mano che i sistemi agentici si scalano, la qualità della supervisione umana può dipendere meno dal numero di decisioni che le persone revisionano e più dal fatto che il sistema operativo riesca a identificare le decisioni in cui il giudizio umano è realmente necessario.

L’osservabilità è necessaria, ma vedere non è controllare

L’industria ha compiuto notevoli progressi nell’osservabilità dell’IA. I team possono ispezionare i prompt, le risposte del modello, le tracce, le chiamate agli strumenti, la latenza, l’uso dei token e, sempre più, l’intera traiettoria seguita da un agente prima di produrre un risultato.

Questa visibilità è essenziale. OpenAI linee guida sulla sicurezza e valutazione degli agenti sottolinea anche tecniche come le valutazioni e la classificazione delle tracce per comprendere il comportamento degli agenti.

Ma la sola visibilità non risolve il problema operativo.

Immaginate di scoprire che un agente di sottoscrizione ha violato una politica di approvazione 2,700 volte la scorsa settimana. Ciò rappresenterebbe un’ottima osservabilità e operazioni terribili.

Per i processi aziendali consequenziali, le imprese hanno alla fine bisogno della capacità non solo di comprendere il comportamento degli agenti, ma anche di rispondere mentre il processo è in esecuzione.

Figura 4: Il ciclo di controllo operativo

L’osservabilità risponde cosa ha fatto l’agente. Le Operazioni Agentiche devono anche rispondere se l’agente dovrebbe continuare.

Questa distinzione diventa particolarmente importante quando un’azione è costosa, consequenziale, difficile da invertire o capace di influenzare molte decisioni a valle.

I guasti più difficili possono verificarsi tra gli agenti

C’è un’altra sfida che diventa evidente man mano che le imprese si avvicinano a flussi di lavoro multi-agente e di lunga durata. Molte politiche aziendali non sono locali a una singola azione.

Consideriamo una politica che limita l’esposizione finanziaria totale lungo una sequenza di decisioni. Ogni singola transazione può essere al di sotto della soglia consentita, mentre l’esposizione cumulativa la supera. Analizzare ogni azione in modo indipendente non mostrerebbe violazioni.

Lo stesso problema può presentarsi con l’autorità. Un agente può essere autorizzato a raccogliere informazioni ma non a prendere una decisione finale. Dopo diversi passaggi, un agente a valle può ricevere le informazioni senza mantenere le restrizioni di autorità associate al compito originale. Ogni singolo passo può apparire ragionevole mentre la sequenza viola il processo aziendale previsto.

Il contesto crea un problema simile. Le informazioni che erano rilevanti durante la prima fase di un flusso di lavoro possono essere riassunte, trasformate o omesse diversi passaggi più tardi. L’agente a valle non può ragionare su informazioni che non possiede più, anche se il suo ragionamento è altrimenti corretto.

Questi fallimenti suggeriscono che l’unità di affidabilità debba espandersi.

Continueremo a valutare i modelli chiedendoci se le loro risposte sono corrette. Valuteremo gli agenti chiedendoci se hanno completato correttamente i loro compiti. Ma a livello di flusso di lavoro, la domanda diventa se informazioni, autorità e politiche sono sopravvissute lungo la sequenza di azioni. A livello aziendale, la domanda diventa se il risultato finale è stato sia corretto sia consentito.

Questo è anche coerente con la più ampia prospettiva del ciclo di vita nel NIST AI Risk Management Framework, che enfatizza la misurazione e la gestione continue del rischio IA piuttosto che considerare la valutazione come un’attività una tantum prima del dispiegamento.

Qui è dove iniziano le Operazioni Agentiche

La governance dell’IA, la valutazione dei modelli, LLMOps, l’osservabilità, la sicurezza e l’IA responsabile affrontano già parti importanti dell’operatività dei sistemi di IA. Le Operazioni Agentiche non sostituiscono queste discipline. Esse si occupano dello strato operativo che diventa rilevante quando i sistemi autonomi e semi‑autonomi iniziano a partecipare direttamente ai processi aziendali.

Le Operazioni Agentiche sono la disciplina che gestisce i sistemi di IA autonomi e semi‑autonomi all’interno di processi aziendali reali, includendo come autorità, contesto, decisioni, eccezioni, intervento umano e responsabilità vengano gestiti durante l’esecuzione.

La distinzione è importante perché l’oggetto gestito non è più solo un modello. È un processo aziendale continuo in cui il software può prendere decisioni e compiere azioni in modo indipendente.

In pratica, ciò genera un diverso insieme di quesiti operativi. Che cosa è autorizzato a fare un agente? Quale contesto aziendale deve persistere lungo un flusso di lavoro a lungo termine? Cosa succede quando nuove evidenze invalidano una decisione precedente? Come può un’organizzazione rilevare quando azioni individualmente accettabili violano collettivamente una politica? Quando un agente dovrebbe continuare, mettere in pausa, fermarsi o segnalare? Mesi dopo, l’organizzazione può ricostruire perché è stata presa una determinata decisione?

C’è anche una questione di proprietà. Quando un agente esegue correttamente il suo compito tecnico ma il risultato aziendale è errato, chi è responsabile del fallimento? Delegare l’esecuzione a un agente non delega la responsabilità dell’organizzazione che lo gestisce.

Gli agenti possono eseguire il lavoro. L’impresa rimane comunque proprietaria del risultato.

L’Obiettivo è l’Autonomia Controllata

Il futuro dell’IA Agentica viene talvolta descritto come una progressione verso l’autonomia completa, in cui gli esseri umani scompaiono gradualmente dai flussi di lavoro aziendali. Per la maggior parte delle imprese, probabilmente questo è l’obiettivo sbagliato.

L’obiettivo più utile è autonomia controllata.

Molti processi assistiti dall’IA oggi seguono uno schema in cui un agente propone un’azione e una persona prende la decisione finale. Man mano che la fiducia cresce, alcuni flussi di lavoro consentiranno agli agenti di prendere decisioni entro un’autorità definita mentre il sistema circostante supervisiona l’esecuzione e gli esseri umani gestiscono le eccezioni. Flussi di lavoro maturi e a basso rischio potranno eventualmente permettere agli agenti di decidere e agire in modo indipendente, mentre le decisioni consequenziali rimarranno monitorate e registrate.

Fig. 5: Livello crescente di autonomia

Il confine appropriato varierà a seconda del processo. Una banca può consentire un’ampia autonomia nella classificazione dei documenti, richiedendo però controlli rigorosi sulle decisioni di credito. Un’assicurazione può automatizzare le richieste di risarcimento di routine, escalando combinazioni insolite di evidenze. Un’organizzazione sanitaria può permettere agli agenti di raccogliere e sintetizzare informazioni, riservando le decisioni consequenziali alle persone.

La domanda importante, quindi, non è semplicemente quanto autonomo possa diventare un agente. È quanto autonomia un’organizzazione può gestire responsabilmente.

Questo cambia anche il ruolo dei controlli. I controlli non sono necessariamente meccanismi per ridurre l’autonomia. Se ben implementati, consentono a un’organizzazione di espandere l’autonomia con maggiore fiducia.

Gestire gli Agenti Potrebbe Rivelarsi Più Difficile Che Costruirli

I modelli continueranno a migliorare. L’uso degli strumenti migliorerà. I framework per agenti miglioreranno. Il ragionamento migliorerà, e molti problemi che oggi sembrano difficili diventeranno alla fine di routine.

Tuttavia, modelli migliori non eliminano le politiche aziendali, il contesto mutevole, le eccezioni, i confini organizzativi o la responsabilità. In alcuni modi, agenti più avanzati rendono queste questioni ancora più rilevanti. Un sistema che non può agire autonomamente ha un’autorità operativa limitata. Un sistema capace di eseguire migliaia di decisioni aziendali genera una responsabilità completamente diversa.

Ecco perché la prossima fase dell’IA aziendale potrebbe non essere determinata dall’organizzazione che distribuisce più agenti. Potrebbe essere determinata dalle organizzazioni che imparano a gestirli.

Gli ultimi 80 percento dimostrano che l’agente può funzionare. Il restante 20 percento determina se l’impresa può fidarsi di esso per il business.

Man mano che gli agenti diventano più capaci, la domanda chiave per l’impresa potrebbe spostarsi da cosa possono fare i nostri agenti a qualcosa di più difficile:

Cosa siamo disposti a far fare loro, in quali condizioni, e come sapremo quando tali condizioni cambiano?

È qui che iniziano le Operazioni Agentiche.

Rajesh Gupta è un leader di prodotto e tecnologia AI, ex professionista di Apple e Qualcomm, e fondatore per la seconda volta. Ha trascorso più di 15 anni lavorando su apprendimento automatico, AI aziendale e AI agentica, e attualmente sta costruendo RunCtrl AI, focalizzato sul controllo in tempo reale per operazioni aziendali agentiche.