Líderes de opinión

Los agentes de IA pueden hacer el trabajo. ¿Pero pueden las empresas operarlos?

mm
Añade Unite.AI a tus fuentes preferidas en Google

Los agentes de IA están logrando un desempeño notablemente bueno al completar tareas. Dé a un agente un objetivo, acceso a las herramientas adecuadas, suficiente contexto y un flujo de trabajo bien definido, y podrá investigar información, analizar documentos, tomar decisiones, actualizar sistemas y coordinarse con otros agentes.

Esa es la parte emocionante de la IA agente. También es la parte que solemos ver en las demostraciones.

Las operaciones empresariales se ven diferentes. Una solicitud de préstamo cambia a mitad del proceso de suscripción. Un cliente proporciona nueva información después de que la verificación se completa. Dos sistemas discrepan sobre la misma cuenta. Una aprobación que era válida ayer puede ya no ser válida hoy. Un agente resume un caso antes de entregarlo a otro agente, y un detalle aparentemente menor desaparece en el proceso.

El camino óptimo puede representar el 80 % de lo que un agente necesita hacer. Las empresas viven en el 20 % restante.

El marco 80/20 no es una estadística de la industria. Es una forma de describir dónde tiende a ocultarse la complejidad operativa. La parte difícil de las operaciones empresariales a menudo no es el caso normal, sino las excepciones, los traspasos, las dependencias, el contexto cambiante y las decisiones donde la organización sigue siendo responsable del resultado.

A medida que la IA pasa de responder preguntas a tomar acciones, esta complejidad operativa se vuelve mucho más importante. Las empresas deberán pensar más allá de cómo se construyen los agentes y comenzar a considerar cómo se operan.

Eso es donde Agentic Operations comienza.

De generar respuestas a tomar acciones

La primera ola de IA generativa empresarial se centró principalmente en la información. Los modelos resumían documentos, generaban informes, respondían preguntas, buscaban conocimiento empresarial y ayudaban a los empleados a completar tareas existentes más rápidamente.

Los agentes introducen algo fundamentalmente diferente. Pueden tomar acciones que cambian el estado de un proceso empresarial. Un agente puede aprobar o rechazar algo, actualizar un sistema de registro, enviar una comunicación al cliente, activar otro flujo de trabajo, invocar a otro agente o tomar una decisión que determina lo que ocurre a continuación.

OpenAI describe a los agentes en su guía práctica como sistemas que cumplen tareas de forma independiente en nombre de los usuarios, utilizando modelos para gestionar la ejecución de flujos de trabajo y herramientas para interactuar con sistemas externos. La consecuencia operativa de una respuesta incorrecta es muy distinta de la consecuencia de una acción incorrecta.

Por lo tanto, la pregunta empresarial cambia. Ya no basta con preguntar si un modelo generó una buena respuesta o si un agente completó con éxito la tarea asignada. Cada vez más, las empresas necesitan saber si una acción debería haberse realizado en absoluto, considerando el contexto empresarial, las políticas, la autoridad y todo lo que ocurrió previamente en el proceso.

Figura 1: La IA generativa produce una salida. La IA agente cambia el estado del negocio.

Una vez que la IA puede cambiar el estado del negocio e influir en decisiones posteriores, la fiabilidad ya no puede medirse únicamente a nivel de modelo.

Un agente puede tener éxito mientras el proceso empresarial falla

Considere un flujo de trabajo de suscripción de préstamos impulsado por IA. Un agente extrae los documentos de la solicitud, otro verifica los ingresos, otro evalúa la información crediticia y un agente posterior resume el caso antes de que un agente de suscripción tome o recomiende una decisión.

Cada agente tiene una responsabilidad claramente definida, y cada uno puede desempeñar esa responsabilidad correctamente. El agente de documentos puede extraer la información correcta. El agente de verificación de ingresos puede completar su tarea con éxito. El agente de resumen puede crear un resumen preciso de la información disponible. El agente de suscripción puede seguir correctamente sus instrucciones.

La decisión empresarial final aún puede ser incorrecta.

Imagine que la información de ingresos actualizada llega después de la verificación inicial. El nuevo documento se procesa, pero su importancia se reduce cuando el caso se resume para el siguiente paso. El agente de suscripción final recibe un resumen razonable, pero no el contexto empresarial completo que existía a lo largo de todo el proceso.

No se colapsó nada necesariamente. Ninguna API falló. Ningún agente individual necesariamente alucinó. Cada componente podría informar una ejecución exitosa mientras el proceso empresarial alcanza un resultado incorrecto.

Anthropic discute un desafío relacionado en su guía sobre la construcción de agentes eficaces, señalando que los sistemas autónomos pueden enfrentar errores acumulativos a medida que realizan más pasos. El problema se vuelve más amplio que la precisión del modelo porque el estado, el contexto, las decisiones y las suposiciones se trasladan a lo largo del flujo de trabajo.

Esto crea una distinción importante entre la fiabilidad del agente y la fiabilidad del proceso empresarial. Una empresa no experimenta finalmente un agente individual. Experimenta el resultado producido por el proceso completo.

Figura 2: El éxito local no garantiza el éxito empresarial

Este es uno de los cambios importantes introducidos por la IA Agente. Un flujo de trabajo puede fallar incluso cuando cada componente parece saludable al inspeccionarse de forma independiente.

La capacidad no es autoridad

Gran parte de la pila actual de agentes se centra comprensiblemente en la capacidad. Los equipos quieren saber si un agente puede razonar, seleccionar la herramienta adecuada, completar una tarea, recuperarse de errores y operar con una precisión y latencia aceptables.

Las empresas tienen otro requisito: la autoridad.

Supongamos que un agente de suscripción es capaz de aprobar un préstamo. Eso no significa que deba aprobar cada préstamo que pueda evaluar. Su autoridad puede depender del monto del préstamo, la categoría de riesgo, el tipo de cliente, la evidencia disponible, el nivel de confianza, decisiones previas o si la solicitud cambió después de una revisión anterior.

Esto crea una frontera entre lo que un agente puede hacer y lo que un agente está autorizado a hacer.

OpenAI recomienda evaluar el riesgo asociado con las herramientas de agentes y añadir salvaguardas o intervención humana en torno a acciones sensibles e irreversibles. Microsoft adopta un enfoque similar en sus directrices para procesos empresariales centrales operados por agentes, donde los agentes pueden tomar decisiones rutinarias dentro de límites definidos mientras los derechos de decisión determinan qué acciones pueden realizarse de forma independiente y cuáles requieren aprobación humana.

A medida que mejora la capacidad de los agentes, esta distinción se vuelve más importante, no menos. Los agentes más capaces pueden realizar acciones más trascendentales. Por lo tanto, las empresas necesitan formas más claras de definir y hacer cumplir los límites dentro de los cuales esas acciones están permitidas.

La cuestión pasa de ¿Puede el agente hacer esto? a ¿En qué condiciones debería permitírsele al agente hacer esto?

La política empresarial debe acercarse a la ejecución

Las empresas ya cuentan con extensos mecanismos para controlar procesos operados por humanos. Utilizan SOPs, matrices de aprobación, políticas de cumplimiento, umbrales de riesgo, capacitación, segregación de funciones, auditorías y procedimientos de escalamiento. La mayoría de estos mecanismos se diseñaron bajo una suposición simple: una persona lee la norma, comprende la situación y aplica la norma mientras realiza el trabajo.

Los agentes cambian esa suposición.

Considere una política que requiera una aprobación secundaria para transacciones que superen un determinado umbral. Cuando un humano realiza la tarea, la política puede existir en un documento respaldado por capacitación y controles de flujo de trabajo. Cuando un agente puede ejecutar cientos o miles de acciones rápidamente, la existencia de ese documento de política no impide por sí misma una acción que lo viole.

En algún punto entre la política escrita y la acción empresarial, la política necesita volverse operativa.

Esto no significa que cada política deba convertirse en código determinista. Algunos controles serán deterministas, otros requerirán interpretación semántica, algunos dependerán del riesgo o la confianza, y otros seguirán necesitando juicio humano. El cambio arquitectónico mayor es que la política empresarial comienza a acercarse al camino de ejecución.

AWS destaca este punto específicamente en el contexto de la IA Agente en servicios financieros, incluyendo la necesidad de validación basada en políticas de las acciones de los agentes y registros de auditoría sobre actividades trascendentales.

Históricamente, las organizaciones podían definir muchos requisitos de gobernanza antes de la ejecución y verificar el cumplimiento posteriormente mediante auditorías y revisiones. Cuando los sistemas autónomos actúan de forma continua y a velocidad de máquina, algunos controles deben operar mientras el proceso está en marcha.

El humano en el bucle es necesario, pero no es el modelo operativo

La respuesta más común a la incertidumbre en un flujo de trabajo de IA es incluir a un humano en el bucle. Eso tiene sentido, particularmente para decisiones trascendentales, pero se vuelve problemático cuando la revisión humana se trata como la solución a cada excepción.

Imagine una operación agente que procesa miles o millones de decisiones. Si cada situación inusual, resultado de baja confianza, ambigüedad de política o excepción se dirige a una persona, la organización no ha eliminado el cuello de botella operativo. Simplemente ha trasladado el cuello de botella a una cola de revisión. Con el tiempo, esto también puede generar otro problema: cuando se pide a los humanos que aprueben demasiadas decisiones rutinarias, la supervisión humana misma puede volverse menos significativa.

Los humanos siguen siendo esenciales, pero su papel debe cambiar. En lugar de revisar cada decisión, deben centrarse en situaciones donde realmente se requiera juicio, donde se haya alcanzado la autoridad de un agente, o donde el sistema encuentre una condición que no debería resolver de forma independiente.

Por lo tanto, un modelo operativo escalable no puede depender únicamente de la puntuación de riesgo y la revisión humana. Antes de que una acción de agente se convierta en una acción empresarial, el sistema debe considerar el contexto comercial actual, las políticas relevantes, la autoridad del agente y lo que ya ha ocurrido en el flujo de trabajo. El resultado puede ser continuar, solicitar evidencia adicional, retener la acción o escalar la decisión a un humano.

Figura 3: La revisión humana se convierte en uno de los resultados del control en tiempo de ejecución

Esto cambia el papel de la supervisión humana. Un humano ya no se inserta por defecto en cada paso incierto. La intervención humana se convierte en un posible resultado cuando el contexto empresarial, la política, la autoridad o la consecuencia de una acción requieren juicio.

La distinción es importante para la escala empresarial. Algunas acciones deben proceder automáticamente porque están claramente dentro de la política y la autoridad. Otras deben pausarse porque falta la evidencia requerida o el estado del negocio ha cambiado. Otras más deben escalarse porque la decisión ha cruzado un límite que la organización ha reservado intencionalmente para las personas.

El objetivo no es eliminar a los humanos del ciclo. Es colocar a los humanos en los bucles correctos, mientras se permite que las decisiones rutinarias avancen dentro de límites claramente definidos. A medida que los sistemas agenticos escalan, la calidad de la supervisión humana puede depender menos de cuántas decisiones revisan las personas y más de si el sistema operativo puede identificar las decisiones donde el juicio humano realmente importa.

La observabilidad es necesaria, pero ver no es controlar

La industria ha logrado avances significativos en la observabilidad de IA. Los equipos pueden inspeccionar indicaciones, respuestas de modelos, trazas, llamadas a herramientas, latencia, uso de tokens y, cada vez más, la trayectoria completa que siguió un agente antes de producir un resultado.

Esta visibilidad es esencial. Orientación de OpenAI sobre la seguridad y evaluación de agentes también enfatiza técnicas como evaluaciones y clasificación de trazas para comprender el comportamiento de los agentes.

Pero la visibilidad por sí sola no resuelve el problema operativo.

Imagine descubrir que un agente de suscripción violó una política de aprobación 2 700 veces la semana pasada. Eso representaría una observabilidad excelente pero unas operaciones terribles.

Para procesos empresariales con consecuencias, las organizaciones eventualmente necesitan la capacidad no solo de comprender el comportamiento de los agentes, sino también de responder mientras el proceso está en ejecución.

Figura 4: El bucle de control operativo

La observabilidad responde qué hizo el agente. Las Operaciones Agenticas también deben responder si el agente debe continuar.

Esa distinción se vuelve particularmente importante cuando una acción es costosa, con consecuencias, difícil de revertir o capaz de influir en muchas decisiones posteriores.

Los fallos más difíciles pueden ocurrir entre agentes

Existe otro desafío que se vuelve visible a medida que las empresas avanzan hacia flujos de trabajo multiagente y de mayor duración. Muchas políticas empresariales no son locales a una sola acción.

Considere una política que limite la exposición financiera total a lo largo de una secuencia de decisiones. Cada transacción individual puede estar por debajo del umbral permitido, mientras que la exposición acumulada lo supera. Analizar cada acción de forma independiente no mostraría ninguna violación.

El mismo problema puede aparecer con la autoridad. Un agente puede estar autorizado a recopilar información pero no a tomar una decisión final. Después de varios traspasos, un agente posterior puede recibir la información sin conservar las restricciones de autoridad vinculadas a la tarea original. Cada paso individual puede parecer razonable mientras la secuencia viola el proceso empresarial previsto.

El contexto genera un problema similar. La información que era relevante durante la primera etapa de un flujo de trabajo puede resumirse, transformarse u omitirse varios pasos después. El agente posterior no puede razonar sobre información que ya no posee, aun si su razonamiento es de otro modo correcto.

Estos fallos sugieren que la unidad de fiabilidad necesita ampliarse.

Continuaremos evaluando los modelos preguntando si sus respuestas son correctas. Evaluaremos a los agentes preguntando si completaron sus tareas correctamente. Pero a nivel de flujo de trabajo, la pregunta pasa a ser si la información, la autoridad y la política sobrevivieron a lo largo de la secuencia de acciones. A nivel empresarial, la pregunta es si el resultado final fue tanto correcto como permitido.

Esto también es coherente con la perspectiva más amplia del ciclo de vida en el NIST AI Risk Management Framework, que enfatiza la medición y gestión continuas del riesgo de IA en lugar de tratar la evaluación como una actividad única antes del despliegue.

Aquí es donde comienzan las Operaciones Agenticas

La gobernanza de IA, la evaluación de modelos, LLMOps, la observabilidad, la seguridad y la IA responsable ya abordan partes importantes de la operación de sistemas de IA. Las Operaciones Agénticas no reemplazan estas disciplinas. Abordan la capa operativa que se vuelve importante cuando los sistemas autónomos y semiautónomos comienzan a participar directamente en los procesos empresariales.

Las Operaciones Agénticas son la disciplina de operar sistemas de IA autónomos y semiautónomos dentro de procesos empresariales reales, incluyendo cómo se gestionan la autoridad, el contexto, las decisiones, las excepciones, la intervención humana y la responsabilidad durante la ejecución.

La distinción importa porque el objeto que se gestiona ya no es solo un modelo. Es un proceso empresarial continuo en el que el software puede tomar decisiones y ejecutar acciones de forma independiente.

En la práctica, esto genera un conjunto diferente de preguntas operativas. ¿Qué está autorizado a hacer un agente? ¿Qué contexto empresarial debe mantenerse a lo largo de un flujo de trabajo de larga duración? ¿Qué ocurre cuando nueva evidencia invalida una decisión anterior? ¿Cómo puede una organización detectar cuándo acciones individualmente aceptables violan colectivamente una política? ¿Cuándo debe un agente continuar, pausar, detenerse o escalar? Meses después, ¿puede la organización reconstruir por qué se tomó una decisión concreta?

También existe una cuestión de propiedad. Cuando un agente realiza su tarea técnica correctamente pero el resultado empresarial es erróneo, ¿quién asume la falla? Delegar la ejecución a un agente no delega la responsabilidad de la organización que lo opera.

Los agentes pueden ejecutar el trabajo. La empresa sigue siendo la propietaria del resultado.

El objetivo es la autonomía controlada

El futuro de la IA Agéntica a veces se describe como una progresión hacia la autonomía completa, donde los humanos desaparecen gradualmente de los flujos de trabajo empresariales. Para la mayoría de las empresas, ese probablemente sea el objetivo equivocado.

El objetivo más útil es autonomía controlada.

Muchos procesos asistidos por IA hoy siguen un patrón en el que un agente propone una acción y una persona toma la decisión final. A medida que aumenta la confianza, algunos flujos de trabajo permitirán que los agentes tomen decisiones dentro de una autoridad definida mientras el sistema circundante supervisa la ejecución y los humanos gestionan las excepciones. Los flujos de trabajo maduros y de bajo riesgo pueden eventualmente permitir que los agentes decidan y actúen de forma independiente, mientras que las decisiones con consecuencias siguen siendo monitorizadas y registradas.

Fig 5 : Incremento del nivel de autonomía

El límite apropiado variará según el proceso. Un banco puede permitir una autonomía sustancial en la clasificación de documentos mientras exige controles estrictos en las decisiones de crédito. Una aseguradora puede automatizar reclamaciones rutinarias mientras escala combinaciones inusuales de evidencia. Una organización de salud puede permitir que los agentes recopilen y resuman información mientras reserva las decisiones con consecuencias para las personas.

Por lo tanto, la pregunta importante no es simplemente cuán autónomo puede llegar a ser un agente. Es cuánta autonomía puede operar responsablemente una organización.

Esto también cambia el papel de los controles. Los controles no son necesariamente mecanismos para reducir la autonomía. Bien implementados, permiten a una organización ampliar la autonomía con mayor confianza.

Operar agentes puede resultar más difícil que crearlos

Los modelos seguirán mejorando. El uso de herramientas mejorará. Los marcos de agentes mejorarán. El razonamiento mejorará, y muchos problemas que hoy parecen difíciles acabarán convirtiéndose en rutinarios.

Sin embargo, los modelos mejores no eliminan las políticas empresariales, el contexto cambiante, las excepciones, los límites organizacionales o la responsabilidad. En cierto modo, los agentes mejores hacen que estos temas sean más importantes. Un sistema que no puede actuar de forma autónoma tiene una autoridad operativa limitada. Un sistema capaz de ejecutar miles de decisiones empresariales genera una responsabilidad completamente distinta.

Por eso, la siguiente fase de la IA empresarial puede no estar determinada por qué organización despliega la mayor cantidad de agentes. Puede estar determinada por qué organizaciones aprenden a operarlos.

El primer 80 % demuestra que el agente puede funcionar. El 20 % restante determina si la empresa puede confiar en él para el negocio.

A medida que los agentes se vuelven más capaces, la pregunta definitoria para la empresa puede pasar de qué pueden hacer nuestros agentes a algo más difícil:

¿Qué estamos dispuestos a permitir que hagan, bajo qué condiciones, y cómo sabremos cuándo esas condiciones cambian?

Ahí es donde comienzan las Operaciones Agénticas.

Rajesh Gupta es un líder de producto y tecnología de IA, ex practicante en Apple y Qualcomm, y fundador por segunda vez. Ha pasado más de 15 años trabajando en aprendizaje automático, IA empresarial y IA agente, y actualmente está construyendo RunCtrl AI, centrado en el control en tiempo de ejecución para operaciones empresariales agenticas.