Herramientas de IA 101

Más allá de ChatGPT: El agente de IA, un nuevo mundo de trabajadores

mm
Añade Unite.AI a tus fuentes preferidas en Google

Con los avances en el aprendizaje profundo, el procesamiento de lenguaje natural (NLP) y la IA, nos encontramos en un período en el que los agentes de IA podrían formar una parte significativa de la fuerza laboral global. Estos agentes de IA, que trascienden a los chatbots y asistentes de voz, están creando un nuevo paradigma para las industrias y nuestra vida diaria. Pero, ¿qué significa realmente vivir en un mundo aumentado por estos “trabajadores”? Este artículo explora a fondo este paisaje en evolución, evaluando las implicaciones, el potencial y los desafíos que se presentan.

Un resumen breve: La evolución de los trabajadores de IA

Antes de entender la revolución inminente, es crucial reconocer la evolución impulsada por la IA que ya ha ocurrido.

  • Sistemas de computación tradicionales: Desde los algoritmos de computación básicos, el viaje comenzó. Estos sistemas podían resolver tareas predefinidas utilizando un conjunto fijo de reglas.
  • Chatbots y asistentes de voz tempranos: A medida que la tecnología evolucionó, también lo hicieron nuestras interfaces. Herramientas como Siri, Cortana y chatbots tempranos simplificaron la interacción entre el usuario y la IA, pero tenían una comprensión y capacidad limitadas.
  • Redes neuronales y aprendizaje profundo: Las redes neuronales marcaron un punto de inflexión, imitando las funciones del cerebro humano y evolucionando a través de la experiencia. Las técnicas de aprendizaje profundo mejoraron aún más esto, permitiendo el reconocimiento de imágenes y habla sofisticados.
  • Modelos de NLP avanzados y arquitecturas de transformadores: La introducción de arquitecturas de transformadores revolucionó el paisaje de NLP. Sistemas como ChatGPT de OpenAI, BERT y T5 han permitido avances en la comunicación entre humanos y la IA. Con su profunda comprensión del lenguaje y el contexto, estos modelos pueden sostener conversaciones significativas, escribir contenido y responder a preguntas complejas con una precisión sin precedentes.

Entrar en el agente de IA: Más que una conversación

El paisaje actual de la IA sugiere algo más expansivo que las herramientas de conversación. Los agentes de IA, más allá de las funciones de chat, pueden realizar tareas, aprender de su entorno, tomar decisiones y incluso exhibir creatividad. No solo responden a preguntas, sino que resuelven problemas.

Los modelos de software tradicionales funcionaban en una ruta clara. Los stakeholders expresaban un objetivo a los administradores de software, quienes luego diseñaban un plan específico. Los ingenieros ejecutarían este plan a través de líneas de código. Este “paradigma heredado” de funcionalidad de software era claro, involucrando una multitud de intervenciones humanas.

Los agentes de IA, sin embargo, operan de manera diferente. Un agente:

  1. Tiene objetivos que busca lograr.
  2. Puede interactuar con su entorno.
  3. Formula un plan basado en estas observaciones para lograr su objetivo.
  4. Toma las acciones necesarias, ajustando su enfoque según el estado cambiante del entorno.

Lo que verdaderamente distingue a los agentes de IA de los modelos tradicionales es su capacidad para crear autonomamente un plan paso a paso para realizar un objetivo. En esencia, mientras que antes el programador proporcionaba el plan, hoy en día los agentes de IA trazan su propio curso.

Consideremos un ejemplo cotidiano. En el diseño de software tradicional, un programa notificaría a los usuarios sobre tareas vencidas según condiciones preestablecidas. Los desarrolladores establecerían estas condiciones según las especificaciones proporcionadas por el administrador de productos.

En el paradigma del agente de IA, el agente mismo determina cuándo y cómo notificar al usuario. Evalúa el entorno (hábitos del usuario, estado de la aplicación) y decide el mejor curso de acción. El proceso se vuelve más dinámico, más en el momento.

ChatGPT marcó un punto de inflexión en su uso tradicional con la integración de plugins, lo que le permitió utilizar herramientas externas para realizar múltiples solicitudes. Se convirtió en una manifestación temprana del concepto de agente. Si consideramos un ejemplo simple: un usuario que pregunta sobre el clima en la ciudad de Nueva York, ChatGPT, utilizando plugins, podría interactuar con una API de clima externa, interpretar los datos y incluso corregir su curso según las respuestas recibidas.

Paisaje actual de los agentes de IA

Paisaje actual de los agentes de IA

Los agentes de IA, incluidos Auto-GPT, AgentGPT y BabyAGI, están anunciando una nueva era en el vasto universo de la IA. Mientras que ChatGPT popularizó la IA generativa al requerir la entrada humana, la visión detrás de los agentes de IA es permitir que las IA funcionen de manera independiente, dirigiéndose hacia objetivos con poca o ninguna interferencia humana. Este potencial transformador ha sido subrayado por el ascenso meteórico de Auto-GPT, que ha obtenido más de 107.000 estrellas en GitHub en solo seis semanas desde su creación, un crecimiento sin precedentes en comparación con proyectos establecidos como el paquete de ciencia de datos “pandas”.

Agentes de IA vs. ChatGPT

Muchos agentes de IA avanzados, como Auto-GPT y BabyAGI, utilizan la arquitectura GPT. Su enfoque principal es minimizar la necesidad de intervención humana en la finalización de tareas de IA. Términos descriptivos como “GPT en un bucle” caracterizan la operación de modelos como AgentGPT y BabyAGI. Operan en ciclos iterativos para comprender mejor las solicitudes de los usuarios y refinar sus salidas. Mientras tanto, Auto-GPT amplía los límites aún más al incorporar el acceso a Internet y la ejecución de código, ampliando significativamente su alcance de resolución de problemas.

Innovaciones en los agentes de IA

  1. Memoria a largo plazo: Los LLM tradicionales tienen una memoria limitada, reteniendo solo los segmentos recientes de las interacciones. Para tareas comprehensivas, recordar toda la conversación o incluso conversaciones anteriores se vuelve crucial. Para superar esto, los agentes de IA han adoptado flujos de trabajo de incrustación, convirtiendo conversaciones textuales en matrices numéricas, ofreciendo una solución a las limitaciones de memoria.
  2. Habilidades de navegación web: Para mantenerse actualizado con eventos recientes, Auto-GPT ha sido equipado con capacidades de navegación, utilizando la API de búsqueda de Google. Esto ha generado debates dentro de la comunidad de IA sobre el alcance del conocimiento de una IA.
  3. Ejecución de código: Más allá de generar código, Auto-GPT puede ejecutar código de shell y Python. Esta capacidad sin precedentes le permite interactuar con otros software, ampliando así su dominio operativo.

Arquitectura de los agentes de IA AUTOGPT, AGENTGPT, LLM, MEMORIA y más

El diagrama visualiza la arquitectura de un sistema de IA impulsado por un modelo de lenguaje grande y agentes.

  • Entradas: El sistema recibe datos de fuentes diversas: comandos de usuario directos, bases de datos estructuradas, contenido web y sensores ambientales en tiempo real.
  • LLM y agentes: En el núcleo, el LLM procesa estas entradas, colaborando con agentes especializados como Auto-GPT para la cadena de pensamiento, AgentGPT para tareas específicas de web, BabyAGI para acciones específicas de tarea y HuggingGPT para el procesamiento en equipo.
  • Salidas: Una vez procesada la información, se transforma en un formato amigable para el usuario y luego se retransmite a dispositivos que pueden actuar o influir en el entorno externo.
  • Componentes de memoria: El sistema retiene información, tanto a corto como a largo plazo, a través de cachés temporales y bases de datos permanentes.
  • Entorno: Este es el reino externo, que afecta a los sensores y es impactado por las acciones del sistema.

Agentes de IA avanzados: Auto-GPT, BabyAGI y más

AutoGPT y AgentGPT

AutoGPT, una aplicación basada en Python lanzada en GitHub en marzo de 2023, es una aplicación ingeniosa que aprovecha el poder de GPT, el modelo generativo transformador de OpenAI. Lo que distingue a Auto-GPT de sus predecesores es su autonomía: está diseñado para realizar tareas con una guía humana mínima y tiene la capacidad única de autoiniciar solicitudes. Los usuarios solo necesitan definir un objetivo general, y Auto-GPT crea las solicitudes necesarias para lograr ese fin, lo que lo convierte en un posible avance revolucionario hacia la verdadera inteligencia artificial general (AGI).

Con características que abarcan la conectividad a Internet, la gestión de memoria y las capacidades de almacenamiento de archivos utilizando GPT-3.5, esta herramienta es apta para manejar una amplia gama de tareas, desde las convencionales como la composición de correos electrónicos hasta tareas intrincadas que normalmente requerirían mucha más participación humana.

Por otro lado, AgentGPT, también construido sobre el marco de GPT, es una interfaz centrada en el usuario que no requiere una amplia experiencia en codificación para configurarlo y usarlo. AgentGPT permite a los usuarios definir objetivos de IA, que luego desglosa en tareas manejables.

Interfaz de AgentGPT

Interfaz de AgentGPT

Además, AgentGPT se destaca por su versatilidad. No se limita a crear chatbots. La plataforma extiende sus capacidades para crear aplicaciones diversas como bots de Discord e incluso se integra sin problemas con Auto-GPT. Este enfoque garantiza que incluso aquellos sin una amplia experiencia en codificación puedan realizar tareas como la codificación autónoma completa, la generación de texto, la traducción de idiomas y la resolución de problemas.

LangChain es un marco que conecta los modelos de lenguaje grande (LLM) con diversas herramientas y utiliza agentes, a menudo percibidos como “bots”, para determinar y ejecutar tareas específicas eligiendo la herramienta adecuada. Estos agentes se integran sin problemas con recursos externos, mientras que una base de datos vectorial en LangChain almacena datos no estructurados, facilitando la recuperación rápida de información para los LLM.

BabyAGI

Luego, está BabyAGI, un agente simplificado pero poderoso. Para entender las capacidades de BabyAGI, imagina un administrador de proyectos digitales que crea, organiza y ejecuta tareas de manera autónoma con un enfoque claro en los objetivos dados. Mientras que la mayoría de las plataformas impulsadas por IA están limitadas por su conocimiento preentrenado, BabyAGI se destaca por su capacidad para adaptarse y aprender de las experiencias. Tiene una profunda capacidad para discernir la retroalimentación y, como los humanos, basar decisiones en prueba y error.

Notablemente, la fuerza subyacente de BabyAGI no es solo su adaptabilidad, sino también su habilidad para ejecutar código para objetivos específicos. Brilla en dominios complejos, como el comercio de criptomonedas, la robótica y la conducción autónoma, lo que lo convierte en una herramienta versátil en una multitud de aplicaciones.

Agente autónomo orientado a tareas de BabyAGI

https://yoheinakajima.com/task-driven-autonomous-agent-utilizing-gpt-4-pinecone-and-langchain-for-diverse-applications/

El proceso se puede categorizar en tres agentes:

  1. Agente de ejecución: El corazón del sistema, este agente aprovecha la API de OpenAI para el procesamiento de tareas. Dado un objetivo y una tarea, envía una solicitud a la API de OpenAI y recupera los resultados de la tarea.
  2. Agente de creación de tareas: Esta función crea tareas nuevas basadas en resultados anteriores y objetivos actuales. Se envía una solicitud a la API de OpenAI, que luego devuelve tareas potenciales, organizadas como una lista de diccionarios.
  3. Agente de priorización de tareas: La fase final implica la secuenciación de las tareas según la prioridad. Este agente utiliza la API de OpenAI para reordenar las tareas, asegurando que las más críticas se ejecuten primero.

En colaboración con el modelo de lenguaje de OpenAI, BabyAGI aprovecha las capacidades de Pinecone para el almacenamiento y recuperación de resultados de tareas centrados en el contexto.

Abajo se muestra una demostración de BabyAGI utilizando este enlace.

Para comenzar, necesitarás una clave de API de OpenAI válida. Para facilitar el acceso, la interfaz de usuario tiene una sección de configuración donde se puede ingresar la clave de API de OpenAI. Además, si deseas controlar los costos, recuerda establecer un límite en el número de iteraciones.

Una vez que configuré la aplicación, realicé un pequeño experimento. Publiqué una solicitud a BabyAGI: “Crea un hilo de tweets conciso centrado en el viaje de crecimiento personal, tocando hitos, desafíos y el poder transformador del aprendizaje continuo”.

BabyAGI respondió con un plan bien pensado. No era solo un modelo genérico, sino una hoja de ruta comprehensiva que indicaba que la IA subyacente había entendido verdaderamente las sutilezas de la solicitud.

Agente autónomo orientado a tareas de BabyAGI

Copiloto de IA de Deepnote

Deepnote AI Copilot redefine la dinámica de la exploración de datos en cuadernos. Pero, ¿qué lo distingue?

En su núcleo, Deepnote AI busca aumentar el flujo de trabajo de los científicos de datos. En el momento en que se proporciona una instrucción rudimentaria, la IA se activa, diseñando estrategias, ejecutando consultas SQL, visualizando datos con Python y presentando sus hallazgos de manera articulada.

Una de las fortalezas de Deepnote AI es su comprensión integral del espacio de trabajo. Al entender esquemas de integración y sistemas de archivos, alinea sus planes de ejecución perfectamente con el contexto organizacional, asegurando que sus perspectivas siempre sean relevantes.

La integración de la IA con los medios de cuaderno crea un bucle de retroalimentación único. Evalúa activamente las salidas de código, haciéndolo hábil en la autocorrección y asegurando que los resultados sean consistentes con los objetivos establecidos.

Deepnote AI se destaca por sus operaciones transparentes, brindando perspectivas claras sobre sus procesos. La interconexión de código y salidas garantiza que sus acciones sean siempre responsables y reproducibles.

CAMEL

CAMEL es un marco que busca fomentar la colaboración entre agentes de IA, apuntando a la finalización eficiente de tareas con una supervisión humana mínima.

CAMEL AGENTE DE IA

https://github.com/camel-ai/camel

Divide sus operaciones en dos tipos principales de agentes:

  • El agente de usuario de IA establece las instrucciones.
  • El agente asistente de IA ejecuta tareas según las directivas proporcionadas.

Una de las aspiraciones de CAMEL es desentrañar las complejidades de los procesos de pensamiento de la IA, apuntando a optimizar las sinergias entre múltiples agentes. Con características como el juego de roles y la inducción de inicio, garantiza que las tareas de la IA se alineen sin problemas con los objetivos humanos.

Simulación de Westworld: Vida en la IA

Derivada de inspiraciones como el software Unity y adaptada en Python, la simulación de Westworld es un salto hacia la simulación y optimización de entornos donde múltiples agentes de IA interactúan, casi como una sociedad digital.

Agentes generativos

Agentes generativos

Estos agentes no son solo entidades digitales. Simulan comportamientos humanos creíbles, desde rutinas diarias hasta interacciones sociales complejas. Su arquitectura extiende un modelo de lenguaje grande para almacenar experiencias, reflexionar sobre ellas y emplearlas para la planificación de comportamiento dinámico.

El entorno de sandbox interactivo de Westworld, reminiscente de Los Sims, da vida a una ciudad poblada por agentes generativos. Aquí, los usuarios pueden interactuar, observar y guiar a estos agentes a lo largo de su día, observando comportamientos emergentes y dinámicas sociales complejas.

La simulación de Westworld ejemplifica la fusión armoniosa de la capacidad computacional y las complejidades humanas. Al combinar vastos modelos de lenguaje con simulaciones de agentes dinámicos, traza un camino hacia la creación de experiencias de IA que son sorprendentemente indistinguibles de la realidad.

Conclusión

Los agentes de IA pueden ser increíblemente versátiles y están dando forma a las industrias, alterando flujos de trabajo y permitiendo logros que antes parecían imposibles. Pero, como todas las innovaciones revolucionarias, no están exentos de imperfecciones.

Mientras tienen el poder de transformar el tejido mismo de nuestra existencia digital, estos agentes aún luchan con ciertos desafíos, algunos de los cuales son inherentemente humanos, como comprender el contexto en escenarios matizados o abordar problemas que yacen fuera de sus conjuntos de datos entrenados.

En el próximo artículo, profundizaremos más en AutoGPT y GPT Engineer, examinando cómo configurarlos y usarlos. Además, exploraremos las razones por las que estos agentes de IA ocasionalmente fallan, como quedar atrapados en bucles, entre otros problemas. Así que ¡quédense atentos!

He dedicado los últimos cinco años sumergiéndome en el fascinante mundo de Machine Learning y Deep Learning. Mi pasión y experiencia me han llevado a contribuir a más de 50 proyectos de ingeniería de software diversos, con un enfoque particular en AI/ML. Mi curiosidad en curso también me ha llevado hacia el Procesamiento de Lenguaje Natural, un campo que estoy ansioso por explorar más a fondo.