Líderes de pensamento

Agentes de IA podem fazer o trabalho. Mas as empresas podem operá-los?

mm
Adicione Unite.AI às suas fontes preferidas no Google

Os agentes de IA estão ficando notavelmente bons em concluir tarefas. Dê a um agente um objetivo, acesso às ferramentas corretas, contexto suficiente e um fluxo de trabalho bem definido, e ele pode pesquisar informações, analisar documentos, tomar decisões, atualizar sistemas e coordenar com outros agentes.

Essa é a parte empolgante da IA Agente. Também é a parte que tendemos a ver em demonstrações.

As operações empresariais são diferentes. Uma solicitação de empréstimo muda no meio da análise de crédito. Um cliente fornece novas informações após a verificação ser concluída. Dois sistemas discordam sobre a mesma conta. Uma aprovação que era válida ontem pode não ser mais válida hoje. Um agente resume um caso antes de entregá-lo a outro agente, e um detalhe aparentemente menor desaparece no processo.

O caminho ideal pode representar 80 % do que um agente precisa fazer. As empresas vivem nos 20 % restantes.

A divisão 80/20 não é uma estatística da indústria. É uma forma de descrever onde a complexidade operacional tende a se ocultar. A parte difícil das operações empresariais costuma não ser o caso normal, mas as exceções, transferências, dependências, mudanças de contexto e decisões nas quais a organização permanece responsável pelo resultado.

À medida que a IA passa de responder perguntas para executar ações, essa complexidade operacional se torna muito mais importante. As empresas precisarão pensar além de como os agentes são construídos e começar a considerar como eles são operados.

É aí que Agentic Operations começa.

De Gerar Respostas a Executar Ações

A primeira onda de IA Generativa empresarial era, em grande parte, sobre informação. Os modelos resumiam documentos, geravam relatórios, respondiam perguntas, pesquisavam o conhecimento corporativo e ajudavam os funcionários a concluir tarefas existentes mais rapidamente.

Os agentes introduzem algo fundamentalmente diferente. Eles podem executar ações que alteram o estado de um processo de negócios. Um agente pode aprovar ou rejeitar algo, atualizar um sistema de registro, enviar uma comunicação ao cliente, disparar outro fluxo de trabalho, chamar outro agente ou tomar uma decisão que determina o que acontecerá a seguir.

OpenAI descreve agentes em seu guia prático como sistemas que realizam tarefas de forma independente em nome dos usuários, usando modelos para gerenciar a execução de fluxos de trabalho e ferramentas para interagir com sistemas externos. A consequência operacional de uma resposta incorreta é muito diferente da consequência de uma ação incorreta.

A questão empresarial, portanto, muda. Não basta mais perguntar se um modelo gerou uma boa resposta ou se um agente completou com sucesso a tarefa atribuída. As empresas precisam cada vez mais saber se uma ação deveria ter ocorrido, considerando o contexto de negócios, políticas, autoridade e tudo o que aconteceu anteriormente no processo.

Figura 1: IA Generativa produz uma saída. IA Agente altera o estado do negócio.

Quando a IA pode mudar o estado do negócio e influenciar decisões subsequentes, a confiabilidade não pode mais ser medida apenas ao nível do modelo.

Um agente pode ter sucesso enquanto o processo de negócios falha

Considere um fluxo de trabalho de análise de empréstimo alimentado por IA. Um agente extrai os documentos da solicitação, outro verifica a renda, outro avalia as informações de crédito e um agente posterior resume o caso antes que um agente de análise de crédito tome ou recomende uma decisão.

Cada agente tem uma responsabilidade claramente definida e pode desempenhá‑la corretamente. O agente de documentos pode extrair as informações corretas. O agente de verificação de renda pode concluir sua tarefa com sucesso. O agente de resumir pode criar um resumo preciso das informações disponíveis. O agente de análise de crédito pode seguir suas instruções corretamente.

A decisão final de negócios ainda pode ser incorreta.

Imagine que informações de renda atualizadas cheguem após a verificação inicial. O novo documento é processado, mas sua importância é reduzida quando o caso é resumido para a próxima etapa. O agente de análise de crédito final recebe um resumo razoável, apenas não o contexto completo de negócios que existia ao longo de todo o processo.

Nada necessariamente travou. Nenhuma API falhou. Nenhum agente individual necessariamente alucinou. Cada componente pode relatar execução bem‑sucedida enquanto o processo de negócios chega a um resultado errado.

Anthropic discute um desafio relacionado em sua orientação sobre a construção de agentes eficazes, observando que sistemas autônomos podem enfrentar erros cumulativos à medida que dão mais passos. A questão se torna mais ampla que a precisão do modelo porque estado, contexto, decisões e suposições se propagam ao longo do fluxo de trabalho.

Isso cria uma distinção importante entre confiabilidade do agente e confiabilidade do processo de negócios. Uma empresa não experimenta, em última análise, um agente individual. Ela experimenta o resultado produzido pelo processo completo.

Figura 2: Sucesso local não garante sucesso empresarial

Esta é uma das mudanças importantes introduzidas pela IA Agente. Um fluxo de trabalho pode falhar mesmo quando cada componente parece saudável ao ser inspecionado independentemente.

Capacidade Não É Autoridade

Grande parte da pilha atual de agentes está compreensivelmente focada na capacidade. As equipes querem saber se um agente pode raciocinar, selecionar a ferramenta correta, concluir uma tarefa, recuperar-se de erros e operar com precisão e latência aceitáveis.

As empresas têm outro requisito: autoridade.

Suponha que um agente de subscrição seja capaz de aprovar um empréstimo. Isso não significa que ele deva aprovar todos os empréstimos que pode avaliar. Sua autoridade pode depender do valor do empréstimo, da categoria de risco, do tipo de cliente, das evidências disponíveis, do nível de confiança, de decisões anteriores ou se a solicitação mudou após uma revisão anterior.

Isso cria uma fronteira entre o que um agente pode fazer e o que um agente tem permissão para fazer.

OpenAI recomenda avaliar o risco associado às ferramentas de agentes e adicionar salvaguardas ou intervenção humana em torno de ações sensíveis e irreversíveis. Microsoft adota uma abordagem semelhante em sua orientação para processos empresariais centrais operados por agentes, onde os agentes podem tomar decisões rotineiras dentro de limites definidos, enquanto os direitos de decisão determinam quais ações podem ser realizadas de forma independente e quais requerem aprovação humana.

À medida que a capacidade dos agentes melhora, essa distinção se torna mais importante, não menos. Agentes mais capazes podem tomar ações mais consequentes. Portanto, as empresas precisam de maneiras mais claras de definir e aplicar os limites dentro dos quais essas ações são permitidas.

A questão passa de O agente pode fazer isso? para Sob quais condições o agente deve ser autorizado a fazer isso?

A Política Empresarial Precisa Se Aproximar da Execução

As empresas já possuem mecanismos extensos para controlar processos operados por humanos. Elas utilizam SOPs, matrizes de aprovação, políticas de conformidade, limites de risco, treinamento, segregação de funções, auditorias e procedimentos de escalonamento. A maioria desses mecanismos foi projetada em torno de uma suposição simples: uma pessoa lê a regra, compreende a situação e aplica a regra enquanto executa o trabalho.

Os agentes mudam essa suposição.

Considere uma política que exige aprovação secundária para transações acima de determinado limite. Quando um humano executa a tarefa, a política pode existir em um documento apoiado por treinamento e controles de fluxo de trabalho. Quando um agente pode executar centenas ou milhares de ações rapidamente, a existência desse documento de política não impede, por si só, uma ação que a viole.

Em algum ponto entre a política escrita e a ação empresarial, a política precisa se tornar operacional.

Isso não significa que toda política precise se tornar código determinístico. Alguns controles serão determinísticos, alguns exigirão interpretação semântica, alguns dependerão de risco ou confiança, e outros continuarão a requerer julgamento humano. A mudança arquitetônica maior é que a política empresarial começa a se aproximar do caminho de execução.

AWS destaca esse ponto especificamente no contexto da IA Agente em serviços financeiros, incluindo a necessidade de validação baseada em políticas das ações dos agentes e trilhas de auditoria em torno de atividades consequentes.

Historicamente, as organizações podiam definir muitos requisitos de governança antes da execução e verificar a conformidade posteriormente por meio de auditorias e revisões. Quando sistemas autônomos atuam continuamente e em velocidade de máquina, alguns controles precisam operar enquanto o processo está em execução.

Humano no Loop É Necessário, Mas Não É o Modelo Operacional

A resposta mais comum à incerteza em um fluxo de trabalho de IA é colocar um humano no loop. Isso faz sentido, particularmente para decisões consequentes, mas torna-se problemático quando a revisão humana é tratada como a solução para toda exceção.

Imagine uma operação agente processando milhares ou milhões de decisões. Se cada situação incomum, resultado de baixa confiança, ambiguidade de política ou exceção for encaminhada a uma pessoa, a organização não removeu o gargalo operacional. Ela simplesmente deslocou o gargalo para uma fila de revisão. Com o tempo, isso também pode gerar outro problema: quando os humanos são solicitados a aprovar muitas decisões rotineiras, a supervisão humana pode tornar‑se menos significativa.

Os humanos continuam essenciais, mas seu papel precisa mudar. Em vez de revisar cada decisão, eles devem focar nas situações em que o julgamento é realmente necessário, onde a autoridade do agente foi atingida ou onde o sistema encontra uma condição que não deve resolver de forma independente.

Um modelo operacional escalável, portanto, não pode depender apenas de pontuação de risco e revisão humana. Antes que uma ação de agente se torne uma ação de negócios, o sistema precisa considerar o contexto empresarial atual, as políticas relevantes, a autoridade do agente e o que já ocorreu no fluxo de trabalho. O resultado pode ser continuar, solicitar evidências adicionais, segurar a ação ou escalar a decisão para um humano.

Figura 3: A revisão humana torna-se um dos resultados do controle em tempo de execução

Isso altera o papel da supervisão humana. Um humano não é mais inserido por padrão em cada passo incerto. A intervenção humana torna‑se um possível resultado quando o contexto empresarial, a política, a autoridade ou a consequência de uma ação exigem julgamento.

A distinção é importante para escala empresarial. Algumas ações devem prosseguir automaticamente porque estão claramente dentro da política e da autoridade. Outras devem ser pausadas porque evidências necessárias estão ausentes ou o estado do negócio mudou. Ainda outras devem ser escaladas porque a decisão ultrapassou um limite que a organização reservou intencionalmente para pessoas.

O objetivo não é remover humanos do ciclo. É colocar humanos nos ciclos corretos, permitindo que decisões rotineiras avancem dentro de limites claramente definidos. À medida que os sistemas agenticos escalam, a qualidade da supervisão humana pode depender menos de quantas decisões as pessoas revisam e mais de se o sistema operacional consegue identificar as decisões onde o julgamento humano realmente importa.

Observabilidade é Necessária, mas Ver Não é Controlar

A indústria avançou significativamente na observabilidade de IA. As equipes podem inspecionar prompts, respostas de modelo, rastros, chamadas de ferramentas, latência, uso de tokens e, cada vez mais, a trajetória completa que um agente seguiu antes de produzir um resultado.

Essa visibilidade é essencial. Orientação da OpenAI sobre segurança e avaliação de agentes também enfatiza técnicas como avaliações e classificação de rastros para entender o comportamento do agente.

Mas a visibilidade por si só não resolve o problema operacional.

Imagine descobrir que um agente de subscrição violou uma política de aprovação 2.700 vezes na semana passada. Isso representaria observabilidade excelente e operações terríveis.

Para processos de negócios críticos, as empresas eventualmente precisarão da capacidade não apenas de entender o comportamento do agente, mas também de responder enquanto o processo está em execução.

Figura 4: O loop de controle operacional

A observabilidade responde ao que o agente fez. Operações Agenticas também precisam responder se o agente deve continuar.

Essa distinção torna‑se particularmente importante quando uma ação é cara, consequente, difícil de reverter ou capaz de influenciar muitas decisões subsequentes.

As Falhas Mais Difíceis Podem Ocorrer Entre Agentes

Há outro desafio que se torna visível à medida que as empresas avançam para fluxos de trabalho multi‑agente e de longa duração. Muitas políticas empresariais não são locais a uma única ação.

Considere uma política que limita a exposição financeira total ao longo de uma sequência de decisões. Cada transação individual pode estar abaixo do limite permitido, enquanto a exposição cumulativa o ultrapassa. Analisar cada ação de forma independente não mostraria violação.

A mesma questão pode surgir com autoridade. Um agente pode estar autorizado a coletar informações, mas não a tomar a decisão final. Após várias transferências, um agente subsequente pode receber a informação sem manter as restrições de autoridade vinculadas à tarefa original. Cada passo individual pode parecer razoável, enquanto a sequência viola o processo de negócios pretendido.

O contexto cria um problema semelhante. Informações que eram relevantes na primeira fase de um fluxo de trabalho podem ser resumidas, transformadas ou omitidas várias etapas depois. O agente subsequente não pode raciocinar sobre informações que não possui mais, mesmo que seu raciocínio seja, de outra forma, correto.

Essas falhas sugerem que a unidade de confiabilidade precisa ser ampliada.

Continuaremos a avaliar modelos perguntando se suas respostas estão corretas. Avaliaremos agentes perguntando se eles concluíram suas tarefas corretamente. Mas, ao nível do fluxo de trabalho, a questão torna‑se se informação, autoridade e política sobreviveram ao longo da sequência de ações. No nível de negócios, a questão torna‑se se o resultado final foi tanto correto quanto permitido.

Isso também está alinhado com a perspectiva mais ampla do ciclo de vida no NIST AI Risk Management Framework, que enfatiza a medição e gestão contínuas do risco de IA, em vez de tratar a avaliação como uma atividade única antes da implantação.

É Aqui que as Operações Agenticas Começam

A governança de IA, a avaliação de modelos, LLMOps, a observabilidade, a segurança e a IA responsável já abordam partes importantes da operação de sistemas de IA. Operações Agenciais não substituem essas disciplinas. Ela trata da camada operacional que se torna importante quando sistemas autônomos e semiautônomos começam a participar diretamente dos processos de negócios.

Operações Agenciais é a disciplina de operar sistemas de IA autônomos e semiautônomos dentro de processos de negócios reais, incluindo como autoridade, contexto, decisões, exceções, intervenção humana e responsabilidade são gerenciados durante a execução.

A distinção importa porque o objeto gerenciado não é mais apenas um modelo. É um processo de negócios contínuo no qual o software pode tomar decisões e executar ações de forma independente.

Na prática, isso gera um conjunto diferente de questões operacionais. O que um agente está autorizado a fazer? Que contexto de negócios deve ser mantido ao longo de um fluxo de trabalho de longa duração? O que acontece quando novas evidências invalidam uma decisão anterior? Como uma organização pode detectar quando ações individualmente aceitáveis violam coletivamente uma política? Quando um agente deve continuar, pausar, interromper ou escalar? Meses depois, a organização pode reconstruir por que uma decisão específica foi tomada?

Também há uma questão de propriedade. Quando um agente executa sua tarefa técnica corretamente, mas o resultado de negócios está errado, quem é o responsável pela falha? Delegar a execução a um agente não delega a responsabilidade da organização que o opera.

Os agentes podem executar o trabalho. A empresa ainda detém o resultado.

O objetivo é autonomia controlada

O futuro da IA Agencial às vezes é descrito como uma progressão rumo à autonomia completa, onde os humanos desaparecem gradualmente dos fluxos de trabalho empresariais. Para a maioria das empresas, esse provavelmente é o objetivo errado.

O objetivo mais útil é autonomia controlada.

Muitos processos assistidos por IA hoje seguem um padrão em que um agente propõe uma ação e uma pessoa toma a decisão final. À medida que a confiança cresce, alguns fluxos de trabalho permitirão que agentes tomem decisões dentro de autoridade definida enquanto o sistema circundante supervisiona a execução e os humanos lidam com exceções. Fluxos de trabalho maduros e de baixo risco podem eventualmente permitir que agentes decidam e ajam de forma independente, enquanto decisões consequenciais permanecem monitoradas e registradas.

Fig 5 : Nível crescente de autonomia

A fronteira apropriada variará de acordo com o processo. Um banco pode permitir autonomia substancial na classificação de documentos, exigindo controles rigorosos nas decisões de crédito. Uma seguradora pode automatizar sinistros rotineiros, escalando combinações incomuns de evidências. Uma organização de saúde pode permitir que agentes coletem e resumam informações, reservando decisões consequenciais para as pessoas.

A questão importante, portanto, não é simplesmente quão autônomo um agente pode se tornar. É quanta autonomia uma organização pode operar de forma responsável.

Isso também altera o papel dos controles. Os controles não são necessariamente mecanismos para reduzir a autonomia. Quando bem implementados, permitem que uma organização expanda a autonomia com maior confiança.

Operar agentes pode ser mais difícil do que construí-los

Os modelos continuarão a melhorar. O uso de ferramentas melhorará. As estruturas de agentes melhorarão. O raciocínio avançará, e muitos problemas que hoje parecem difíceis acabarão se tornando rotineiros.

No entanto, modelos melhores não eliminam políticas de negócios, mudanças de contexto, exceções, limites organizacionais ou responsabilidade. De certa forma, agentes melhores tornam essas questões ainda mais importantes. Um sistema que não pode agir autonomamente tem autoridade operacional limitada. Um sistema capaz de executar milhares de decisões de negócios cria uma responsabilidade totalmente diferente.

É por isso que a próxima fase da IA empresarial pode não ser determinada por qual organização implanta mais agentes. Pode ser determinada por quais organizações aprendem a operá-los.

Os primeiros 80 % demonstram que o agente pode funcionar. Os 20 % restantes determinam se a empresa pode confiar nele para o negócio.

À medida que os agentes se tornam mais capazes, a questão definidora da empresa pode mudar de o que nossos agentes podem fazer para algo mais difícil:

O que estamos preparados para permitir que eles façam, sob quais condições, e como saberemos quando essas condições mudarem?

É aí que as Operações Agenciais começam.

Rajesh Gupta é um líder de produto e tecnologia de IA, ex-profissional da Apple e da Qualcomm, e fundador pela segunda vez. Ele tem mais de 15 anos de experiência trabalhando em aprendizado de máquina, IA empresarial e Agentic AI, e atualmente está construindo a RunCtrl AI, focada no controle em tempo de execução para operações empresariais agentic.