Líderes de opinión

Descodificando Oportunidades y Desafíos para Agentes de LLM en Inteligencia Artificial Generativa

mm
Añade Unite.AI a tus fuentes preferidas en Google

Estamos viendo una progresión de aplicaciones de Inteligencia Artificial Generativa impulsadas por grandes modelos de lenguaje (LLM) desde prompts hasta generación aumentada de recuperación (RAG) y agentes. Los agentes están siendo ampliamente discutidos en la industria y círculos de investigación, principalmente por el poder que esta tecnología proporciona para transformar aplicaciones empresariales y ofrecer experiencias superiores al cliente. Hay patrones comunes para construir agentes que permiten dar los primeros pasos hacia la inteligencia artificial general (AGI).

En mi artículo anterior, vimos una escalera de inteligencia de patrones para construir aplicaciones impulsadas por LLM. Comenzando con prompts que capturan el dominio del problema y utilizan la memoria interna de LLM para generar la salida. Con RAG, aumentamos el prompt con conocimiento externo buscado en una base de datos vectorial para controlar las salidas. A continuación, al encadenar llamadas a LLM, podemos construir flujos de trabajo para realizar aplicaciones complejas. Los agentes llevan esto al siguiente nivel al determinar automáticamente cómo se deben formar estas cadenas de LLM. Veamos con más detalle.

Agentes – Bajo el capó

Un patrón clave con los agentes es que utilizan el poder de comprensión del lenguaje de LLM para hacer un plan sobre cómo resolver un problema dado. LLM entiende el problema y nos da una secuencia de pasos para resolver el problema. Sin embargo, no se detiene ahí. Los agentes no son un sistema de soporte puro que nos proporcionará recomendaciones sobre cómo resolver el problema y luego nos pasará el testigo para que tomemos los pasos recomendados. Los agentes están dotados de herramientas para seguir adelante y tomar la acción. ¿Asustado, ¿verdad?

Si le pedimos a un agente una pregunta básica como esta:

Ser humano: ¿Qué empresa fundó el inventor del teléfono?

A continuación, se muestra un ejemplo de los pasos de pensamiento que podría seguir un agente.

Agente (PENSANDO)

  • Pensamiento: Necesito buscar al inventor del teléfono.
  • Acción: Buscar [inventor del teléfono]
  • Observación: Alexander Graham Bell
  • Pensamiento: Necesito buscar una empresa que fue fundada por Alexander Graham Bell
  • Acción: Buscar [empresa fundada por Alexander Graham Bell]
  • Observación: Alexander Graham Bell cofundó la Compañía de Teléfono y Telégrafo de América (AT&T) en 1885
  • Pensamiento: He encontrado la respuesta. La devolveré.

Agente (RESPUESTA): Alexander Graham Bell cofundó AT&T en 1885

Puedes ver que el agente sigue un método sistemático para descomponer el problema en subproblemas que se pueden resolver tomando acciones específicas. Las acciones aquí son recomendadas por LLM y podemos asignarlas a herramientas específicas para implementar estas acciones. Podríamos habilitar una herramienta de búsqueda para el agente de modo que, cuando se dé cuenta de que LLM ha proporcionado una búsqueda como acción, llame a esta herramienta con los parámetros proporcionados por LLM. La búsqueda aquí es en Internet, pero también se puede redirigir a buscar en una base de conocimientos interna, como una base de datos vectorial. El sistema ahora se vuelve autosuficiente y puede averiguar cómo resolver problemas complejos siguiendo una serie de pasos. Marcos como LangChain y LLaMAIndex nos brindan una forma fácil de construir estos agentes y conectarlos a herramientas y API. Amazon lanzó recientemente su marco de agentes Bedrock, que proporciona una interfaz visual para diseñar agentes.

Bajo el capó, los agentes siguen un estilo especial de enviar prompts a LLM que les hacen generar un plan de acción. El patrón de Pensamiento-Acción-Observación es popular en un tipo de agente llamado ReAct (Razonamiento y Acción). Otros tipos de agentes incluyen MRKL y Plan & Ejecutar, que principalmente difieren en su estilo de prompting.

Para agentes más complejos, las acciones pueden estar vinculadas a herramientas que causan cambios en los sistemas de origen. Por ejemplo, podríamos conectar el agente a una herramienta que verifica el saldo de vacaciones y solicita un permiso en un sistema ERP para un empleado. Ahora podríamos construir un chatbot agradable que interactuaría con los usuarios y, a través de un comando de chat, solicitaría un permiso en el sistema. ¡No más pantallas complejas para solicitar permisos, una interfaz de chat unificada y sencilla! ¡Suena emocionante!

Caveats y necesidad de Inteligencia Artificial Responsable

¿Qué pasa si tenemos una herramienta que invoca transacciones de comercio de acciones utilizando una API preautorizada? Construimos una aplicación donde el agente estudia los cambios de acciones (utilizando herramientas) y toma decisiones sobre la compra y venta de acciones. ¿Qué pasa si el agente vende la acción equivocada porque alucinó y tomó una mala decisión? Dado que los LLM son modelos enormes, es difícil determinar por qué toman algunas decisiones, por lo que las alucinaciones son comunes en ausencia de guardrails adecuados.

Aunque los agentes son fascinantes, probablemente habrás adivinado lo peligrosos que pueden ser. Si alucinan y toman una acción incorrecta, podrían causar grandes pérdidas financieras o problemas importantes en los sistemas empresariales. Por lo tanto, la Inteligencia Artificial Responsable se está convirtiendo en de suma importancia en la era de las aplicaciones impulsadas por LLM. Los principios de Inteligencia Artificial Responsable en torno a la reproducibilidad, la transparencia y la rendición de cuentas tratan de establecer guardrails en las decisiones tomadas por los agentes y sugieren un análisis de riesgos para decidir qué acciones necesitan un humano en el bucle. A medida que se diseñan agentes más complejos, necesitan más escrutinio, transparencia y rendición de cuentas para asegurarnos de que sepamos qué están haciendo.

Pensamientos finales

La capacidad de los agentes para generar un camino de pasos lógicos con acciones los acerca mucho a la razonamiento humano. Dotarlos de herramientas más poderosas puede darles superpoderes. Patrones como ReAct tratan de emular cómo los humanos resuelven el problema y veremos mejores patrones de agentes que serán relevantes para contextos y dominios específicos (banco, seguro, atención médica, industrial, etc.). El futuro está aquí y la tecnología detrás de los agentes está lista para que la usemos. Al mismo tiempo, debemos prestar mucha atención a los guardrails de Inteligencia Artificial Responsable para asegurarnos de que no estemos construyendo Skynet.

Dattaraj Rao, Chief Data Scientist en Persistent Systems, es el autor del libro “Keras to Kubernetes: The Journey of a Machine Learning Model to Production.” En Persistent Systems, Dattaraj lidera el AI Research Lab que explora algoritmos de última generación en Computer Vision, Natural Language Understanding, programación probabilística, Reinforcement Learning, Explainable AI, etc. y demuestra la aplicabilidad en los sectores de Salud, Banca y Industria. Dattaraj tiene 11 patentes en Machine Learning y Computer Vision.