Leaders d’opinion

Les agents IA peuvent faire le travail. Mais les entreprises peuvent‑elles les exploiter ?

mm
Ajouter Unite.AI à vos sources préférées sur Google

Les agents IA deviennent remarquablement performants pour accomplir des tâches. Donnez à un agent un objectif, l’accès aux bons outils, suffisamment de contexte et un flux de travail bien défini, et il peut rechercher des informations, analyser des documents, prendre des décisions, mettre à jour des systèmes et se coordonner avec d’autres agents.

C’est la partie passionnante de l’IA agentique. C’est aussi la partie que l’on voit généralement dans les démonstrations.

Les opérations d’entreprise sont différentes. Une demande de prêt évolue à mi-parcours de l’évaluation. Un client fournit de nouvelles informations après la fin de la vérification. Deux systèmes sont en désaccord sur le même compte. Une approbation valide hier peut ne plus l’être aujourd’hui. Un agent résume un dossier avant de le transmettre à un autre agent, et un détail apparemment mineur disparaît dans le processus.

Le scénario idéal peut représenter 80 % de ce qu’un agent doit faire. Les entreprises évoluent dans les 20 % restants.

Le cadre 80/20 n’est pas une statistique du secteur. C’est une façon de décrire où la complexité opérationnelle a tendance à se cacher. La partie difficile des opérations d’entreprise n’est souvent pas le cas normal, mais les exceptions, les transferts, les dépendances, le contexte changeant et les décisions où l’organisation reste responsable du résultat.

À mesure que l’IA passe de la réponse aux questions à la prise d’actions, cette complexité opérationnelle devient beaucoup plus importante. Les entreprises devront réfléchir au-delà de la façon dont les agents sont construits et commencer à envisager comment ils sont exploités.

C’est là que Agentic Operations commence.

De la génération de réponses à la prise d’actions

La première vague d’IA générative en entreprise portait principalement sur l’information. Les modèles résumaient des documents, généraient des rapports, répondaient aux questions, exploraient les connaissances de l’entreprise et aidaient les employés à accomplir plus rapidement les tâches existantes.

Les agents introduisent quelque chose de fondamentalement différent. Ils peuvent prendre des mesures qui modifient l’état d’un processus métier. Un agent peut approuver ou rejeter quelque chose, mettre à jour un système d’enregistrement, envoyer une communication à un client, déclencher un autre flux de travail, appeler un autre agent ou prendre une décision qui détermine ce qui se passe ensuite.

OpenAI décrit les agents dans son guide pratique en tant que systèmes qui accomplissent de façon autonome des tâches au nom des utilisateurs, en utilisant des modèles pour gérer l’exécution des flux de travail et des outils pour interagir avec des systèmes externes. La conséquence opérationnelle d’une réponse incorrecte est très différente de celle d’une action incorrecte.

La question pour l’entreprise change donc. Il ne suffit plus de se demander si un modèle a généré une bonne réponse ou si un agent a accompli avec succès la tâche qui lui était assignée. Les entreprises doivent de plus en plus savoir si une action aurait dû se produire du tout, compte tenu du contexte commercial, des politiques, de l’autorité et de tout ce qui s’est passé précédemment dans le processus.

Figure 1 : L’IA générative produit une sortie. L’IA agentique modifie l’état de l’entreprise.

Une fois que l’IA peut modifier l’état de l’entreprise et influencer les décisions ultérieures, la fiabilité ne peut plus être mesurée uniquement au niveau du modèle.

Un agent peut réussir alors que le processus métier échoue

Considérons un flux de travail d’évaluation de prêts alimenté par l’IA. Un agent extrait les documents de la demande, un autre vérifie les revenus, un autre évalue les informations de crédit, et un agent ultérieur résume le dossier avant qu’un agent d’évaluation ne prenne ou ne recommande une décision.

Chaque agent a une responsabilité clairement définie, et chacun peut l’exécuter correctement. L’agent document peut extraire les bonnes informations. L’agent de vérification des revenus peut accomplir sa tâche avec succès. L’agent de synthèse peut créer un résumé précis des informations dont il dispose. L’agent d’évaluation peut suivre correctement ses instructions.

La décision finale de l’entreprise peut encore être incorrecte.

Imaginez que des informations de revenu mises à jour arrivent après la vérification initiale. Le nouveau document est traité, mais son importance est réduite lorsque le dossier est résumé pour l’étape suivante. L’agent d’évaluation final reçoit un résumé raisonnable, mais pas le contexte commercial complet qui existait tout au long du processus.

Rien ne s’est nécessairement planté. Aucune API n’a échoué. Aucun agent individuel n’a nécessairement halluciné. Chaque composant peut signaler une exécution réussie tandis que le processus métier aboutit à un résultat erroné.

Anthropic évoque un défi connexe dans ses directives sur la construction d’agents efficaces, soulignant que les systèmes autonomes peuvent rencontrer des erreurs cumulatives à mesure qu’ils effectuent davantage d’étapes. Le problème dépasse la précision du modèle, car l’état, le contexte, les décisions et les hypothèses se déplacent tout au long du flux de travail.

Cela crée une distinction importante entre la fiabilité des agents et la fiabilité du processus métier. Une entreprise ne vit pas réellement l’expérience d’un agent individuel. Elle vit le résultat produit par le processus complet.

Figure 2 : Le succès local ne garantit pas le succès commercial

C’est l’un des changements importants introduits par l’IA agentique. Un flux de travail peut échouer même si chaque composant semble sain lorsqu’on l’inspecte séparément.

La capacité n’est pas l’autorité

La majeure partie de la pile d’agents actuelle se concentre naturellement sur la capacité. Les équipes souhaitent savoir si un agent peut raisonner, choisir le bon outil, accomplir une tâche, se remettre d’erreurs et fonctionner avec une précision et une latence acceptables.

Les entreprises ont une autre exigence : l’autorité.

Supposons qu’un agent de souscription soit capable d’approuver un prêt. Cela ne signifie pas qu’il doit approuver chaque prêt qu’il peut évaluer. Son autorité peut dépendre du montant du prêt, de la catégorie de risque, du type de client, des preuves disponibles, du niveau de confiance, des décisions antérieures, ou du fait que la demande ait changé après un examen précédent.

Cela crée une frontière entre ce qu’un agent peut faire et ce qu’un agent est autorisé à faire.

OpenAI recommande d’évaluer le risque lié aux outils d’agents et d’ajouter des garde‑fous ou une intervention humaine autour des actions sensibles et irréversibles. Microsoft adopte une approche similaire dans ses directives concernant les processus métier centraux opérés par des agents, où les agents peuvent prendre des décisions routinières dans des limites définies tandis que les droits de décision déterminent quelles actions peuvent être exécutées de façon autonome et lesquelles nécessitent une approbation humaine.

À mesure que la capacité des agents s’améliore, cette distinction devient plus importante, pas moins. Des agents plus capables peuvent entreprendre des actions aux conséquences plus importantes. Les entreprises ont donc besoin de moyens plus clairs pour définir et appliquer les limites dans lesquelles ces actions sont autorisées.

La question passe de L’agent peut‑il faire cela ? à Dans quelles conditions l’agent devrait‑il être autorisé à le faire ?

La politique d’entreprise doit se rapprocher de l’exécution

Les entreprises disposent déjà de mécanismes étendus pour contrôler les processus opérés par des humains. Elles utilisent des SOP, des matrices d’approbation, des politiques de conformité, des seuils de risque, la formation, la séparation des fonctions, des audits et des procédures d’escalade. La plupart de ces mécanismes ont été conçus autour d’une hypothèse simple : une personne lit la règle, comprend la situation et applique la règle tout en exécutant le travail.

Les agents modifient cette hypothèse.

Considérez une politique exigeant une approbation secondaire pour les transactions dépassant un certain seuil. Lorsqu’un humain exécute la tâche, la politique peut exister sous forme de document soutenu par la formation et les contrôles de flux de travail. Lorsqu’un agent peut exécuter des centaines ou des milliers d’actions rapidement, l’existence de ce document de politique n’empêche pas en soi une action qui la violerait.

Quelque part entre la politique écrite et l’action commerciale, la politique doit devenir opérationnelle.

Cela ne signifie pas que chaque politique doive être transformée en code déterministe. Certains contrôles seront déterministes, d’autres nécessiteront une interprétation sémantique, certains dépendront du risque ou du niveau de confiance, et d’autres continueront à requérir le jugement humain. Le changement architectural majeur est que la politique d’entreprise commence à se rapprocher du chemin d’exécution.

AWS souligne ce point spécifiquement dans le contexte de l’IA agentique dans les services financiers, y compris la nécessité d’une validation basée sur la politique des actions d’agents et de traces d’audit autour des activités à conséquences.

Historiquement, les organisations pouvaient définir de nombreuses exigences de gouvernance avant l’exécution et vérifier la conformité ultérieurement grâce aux audits et aux revues. Lorsque les systèmes autonomes agissent en continu et à la vitesse des machines, certains contrôles doivent fonctionner pendant que le processus est en cours.

L’humain dans la boucle est nécessaire, mais ce n’est pas le modèle opérationnel

La réponse la plus courante à l’incertitude dans un flux de travail IA consiste à placer un humain dans la boucle. Cela a du sens, notamment pour les décisions à conséquences, mais cela devient problématique lorsque la révision humaine est considérée comme la solution à chaque exception.

Imaginez une opération agentique traitant des milliers ou des millions de décisions. Si chaque situation inhabituelle, résultat à faible confiance, ambiguïté de politique ou exception est acheminé vers une personne, l’organisation n’a pas éliminé le goulot d’étranglement opérationnel. Elle l’a simplement déplacé vers une file d’attente de révision. Avec le temps, cela peut également engendrer un autre problème : lorsque les humains sont sollicités pour approuver trop de décisions routinières, la supervision humaine elle‑même peut perdre de son sens.

Les humains restent essentiels, mais leur rôle doit évoluer. Au lieu de passer en revue chaque décision, ils devraient se concentrer sur les situations où le jugement est réellement nécessaire, où l’autorité d’un agent a été atteinte, ou où le système rencontre une condition qu’il ne devrait pas résoudre de façon autonome.

Un modèle opérationnel évolutif ne peut donc pas se fonder uniquement sur le scoring de risque et la révision humaine. Avant qu’une action d’agent ne devienne une action métier, le système doit prendre en compte le contexte métier actuel, les politiques pertinentes, l’autorité de l’agent et ce qui s’est déjà produit dans le flux de travail. Le résultat peut être de poursuivre, de demander des preuves supplémentaires, de retenir l’action ou d’escalader la décision à un humain.

Figure 3 : La révision humaine devient l’un des résultats du contrôle à l’exécution

Cette évolution modifie le rôle de la supervision humaine. Un humain n’est plus inséré par défaut à chaque étape incertaine. L’intervention humaine devient un résultat possible lorsque le contexte métier, la politique, l’autorité ou la conséquence d’une action nécessitent un jugement.

La distinction est importante à l’échelle de l’entreprise. Certaines actions doivent s’exécuter automatiquement parce qu’elles sont clairement conformes à la politique et à l’autorité. D’autres doivent être mises en pause parce que les preuves requises sont manquantes ou que l’état du métier a changé. D’autres encore doivent être escaladées parce que la décision a franchi une limite que l’organisation a délibérément réservée aux personnes.

L’objectif n’est pas d’éliminer les humains du circuit. Il s’agit de placer les humains dans les bonnes boucles, tout en permettant aux décisions de routine de s’exécuter dans des limites clairement définies. À mesure que les systèmes agentiques s’étendent, la qualité de la supervision humaine pourra dépendre moins du nombre de décisions que les personnes examinent et davantage de la capacité du système opérationnel à identifier les décisions où le jugement humain est réellement nécessaire.

L’observabilité est nécessaire, mais voir n’est pas contrôler

L’industrie a réalisé des progrès significatifs en matière d’observabilité de l’IA. Les équipes peuvent inspecter les invites, les réponses du modèle, les traces, les appels d’outils, la latence, l’utilisation des jetons, et de plus en plus la trajectoire complète suivie par un agent avant de produire un résultat.

Cette visibilité est essentielle. Les directives d’OpenAI sur la sécurité et l’évaluation des agents soulignent également des techniques telles que les évaluations et le classement des traces pour comprendre le comportement des agents.

Mais la visibilité à elle seule ne résout pas le problème opérationnel.

Imaginez découvrir qu’un agent de souscription a enfreint une politique d’approbation 2 700 fois la semaine dernière. Cela représenterait une excellente observabilité mais des opérations désastreuses.

Pour les processus métier à fort enjeu, les entreprises doivent finalement être capables non seulement de comprendre le comportement des agents, mais aussi d’intervenir pendant que le processus est en cours.

Figure 4 : La boucle de contrôle opérationnel

L’observabilité répond à ce que l’agent a fait. Les Opérations agentiques doivent également répondre à la question de savoir si l’agent doit poursuivre.

Cette distinction devient particulièrement importante lorsqu’une action est coûteuse, à fort impact, difficile à annuler ou susceptible d’influencer de nombreuses décisions en aval.

Les pires défaillances peuvent survenir entre les agents

Un autre défi apparaît à mesure que les entreprises adoptent des flux de travail multi‑agents et de plus longue durée. De nombreuses politiques métier ne sont pas limitées à une seule action.

Considérez une politique qui limite l’exposition financière totale sur une séquence de décisions. Chaque transaction individuelle peut être en dessous du seuil autorisé alors que l’exposition cumulative le dépasse. Examiner chaque action séparément ne révélerait aucune violation.

Le même problème peut apparaître avec l’autorité. Un agent peut être autorisé à collecter des informations sans pouvoir prendre la décision finale. Après plusieurs transferts, un agent en aval peut recevoir l’information sans conserver les restrictions d’autorité attachées à la tâche initiale. Chaque étape individuelle peut sembler raisonnable alors que la séquence viole le processus métier prévu.

Le contexte crée un problème similaire. Une information pertinente lors de la première étape d’un flux de travail peut être résumée, transformée ou omise plusieurs étapes plus tard. L’agent en aval ne peut pas raisonner sur une information dont il ne dispose plus, même si son raisonnement serait autrement correct.

Ces défaillances suggèrent que l’unité de fiabilité doit s’élargir.

Nous continuerons d’évaluer les modèles en nous demandant si leurs réponses sont correctes. Nous évaluerons les agents en vérifiant s’ils ont correctement accompli leurs tâches. Mais au niveau du flux de travail, la question devient de savoir si l’information, l’autorité et la politique ont perduré tout au long de la séquence d’actions. Au niveau métier, la question devient de savoir si le résultat final était à la fois correct et autorisé.

Cela est également cohérent avec la perspective plus large du cycle de vie dans le Cadre de gestion des risques IA du NIST, qui met l’accent sur la mesure et la gestion continues du risque IA plutôt que de considérer l’évaluation comme une activité ponctuelle avant le déploiement.

C’est là que les Opérations agentiques commencent

La gouvernance de l’IA, l’évaluation des modèles, le LLMOps, l’observabilité, la sécurité et l’IA responsable couvrent déjà des parties importantes de l’exploitation des systèmes d’IA. Les Opérations Agentiques ne remplacent pas ces disciplines. Elles traitent la couche opérationnelle qui devient importante lorsque les systèmes autonomes et semi-autonomes commencent à participer directement aux processus métier.

Les Opérations Agentiques sont la discipline consistant à exploiter des systèmes d’IA autonomes et semi-autonomes au sein de processus métier réels, y compris la manière dont l’autorité, le contexte, les décisions, les exceptions, l’intervention humaine et la responsabilité sont gérés pendant l’exécution.

Cette distinction est importante car l’objet géré n’est plus seulement un modèle. Il s’agit d’un processus métier continu dans lequel le logiciel peut prendre des décisions et agir de manière indépendante.

En pratique, cela crée un ensemble différent de questions opérationnelles. Qu’est-ce qu’un agent est autorisé à faire ? Quel contexte métier doit survivre tout au long d’un flux de travail de longue durée ? Que se passe-t-il lorsqu’une nouvelle preuve invalide une décision antérieure ? Comment une organisation peut‑elle détecter quand des actions individuellement acceptables violent collectivement une politique ? Quand un agent doit‑il continuer, mettre en pause, arrêter ou escalader ? Des mois plus tard, l’organisation peut‑elle reconstruire pourquoi une décision particulière a été prise ?

Il y a également une question de propriété. Lorsqu’un agent exécute correctement sa tâche technique mais que le résultat commercial est erroné, qui porte la responsabilité de l’échec ? Déléguer l’exécution à un agent ne délègue pas la responsabilité de l’organisation qui l’exploite.

Les agents peuvent exécuter le travail. L’entreprise reste propriétaire du résultat.

L’objectif est l’autonomie contrôlée

L’avenir de l’IA agentique est parfois décrit comme une progression vers une autonomie totale, où les humains disparaissent progressivement des flux de travail métier. Pour la plupart des entreprises, c’est probablement le mauvais objectif.

L’objectif le plus utile est controlled autonomy.

De nombreux processus assistés par l’IA aujourd’hui suivent un schéma où un agent propose une action et une personne prend la décision finale. À mesure que la confiance grandit, certains flux de travail permettront aux agents de prendre des décisions dans le cadre d’une autorité définie tandis que le système environnant supervise l’exécution et les humains gèrent les exceptions. Les flux de travail matures et à faible risque pourront éventuellement permettre aux agents de décider et d’agir de manière indépendante, tandis que les décisions conséquentes restent surveillées et enregistrées.

Fig. 5 : Niveau croissant d’autonomie

La frontière appropriée variera selon le processus. Une banque peut autoriser une autonomie importante dans la classification de documents tout en imposant des contrôles stricts autour des décisions de crédit. Un assureur peut automatiser les réclamations courantes tout en escaladant les combinaisons inhabituelles de preuves. Une organisation de santé peut permettre aux agents de collecter et résumer l’information tout en réservant les décisions conséquentes aux personnes.

La question importante n’est donc pas simplement de savoir à quel point un agent peut devenir autonome. Il s’agit de déterminer quelle autonomie une organisation peut exploiter de manière responsable.

Cela modifie également le rôle des contrôles. Les contrôles ne sont pas nécessairement des mécanismes destinés à réduire l’autonomie. Bien conçus, ils permettent à une organisation d’étendre l’autonomie avec davantage de confiance.

Faire fonctionner les agents peut devenir plus difficile que les créer

Les modèles continueront de s’améliorer. L’utilisation des outils s’améliorera. Les cadres d’agents s’amélioreront. Le raisonnement s’améliorera, et de nombreux problèmes qui semblent difficiles aujourd’hui deviendront finalement routiniers.

Cependant, de meilleurs modèles n’éliminent pas les politiques commerciales, le contexte changeant, les exceptions, les limites organisationnelles ou la responsabilité. D’une certaine manière, de meilleurs agents rendent ces enjeux encore plus importants. Un système qui ne peut pas agir de façon autonome possède une autorité opérationnelle limitée. Un système capable d’exécuter des milliers de décisions commerciales crée une responsabilité entièrement différente.

C’est pourquoi la prochaine phase de l’IA d’entreprise ne sera peut‑être pas déterminée par l’organisation qui déploie le plus d’agents, mais par celle qui apprend à les exploiter.

Les 80 % initiaux montrent que l’agent peut fonctionner. Les 20 % restants déterminent si l’entreprise peut lui faire confiance pour les activités commerciales.

À mesure que les agents deviennent plus capables, la question déterminante pour l’entreprise peut passer de what can our agents do à quelque chose de plus difficile :

Quelles actions sommes‑nous prêts à leur permettre d’accomplir, sous quelles conditions, et comment saurons‑nous quand ces conditions évoluent ?

C’est là que les Opérations Agentiques commencent.

Rajesh Gupta est un leader produit et technologie en IA, ancien praticien chez Apple et Qualcomm, et fondateur pour la deuxième fois. Il a passé plus de 15 ans à travailler sur l’apprentissage automatique, l’IA d’entreprise et l’IA agentique, et il développe actuellement RunCtrl AI, axé sur le contrôle d’exécution des opérations commerciales agentiques.