Entrevistas

Div Garg, CEO y cofundador de AGI, Inc – Serie de entrevistas

mm
Añade Unite.AI a tus fuentes preferidas en Google

Div Garg, CEO y cofundador de AGI, Inc, es un investigador de inteligencia artificial y empresario centrado en agentes autónomos, inteligencia de borde, visión por computadora y robótica. Antes de fundar AGI, Inc., cofundó y dirigió MultiOn, un pionero temprano en agentes de uso de computadoras, y posteriormente se desempeñó como presidente de su junta directiva. Garg también pasó casi cuatro años como miembro de la facultad adjunta en la Universidad de Stanford, donde creó CS 25: Transformers United, el primer curso de la universidad dedicado a arquitecturas de transformadores. Su experiencia anterior incluye liderar el desarrollo de inteligencia artificial en Collaborative Robotics, realizar investigaciones en NVIDIA (NVDA ) y Apple (AAPL ), y trabajar en tecnologías de visión por computadora y conducción autónoma en Google, Uber y la Universidad de Cornell, donde su investigación incluyó el enfoque influyente de Pseudo-LiDAR para la percepción 3D basada en cámaras.

AGI, Inc. es una empresa de investigación de inteligencia artificial que desarrolla inteligencia privada, segura y accesible que opera directamente en dispositivos de borde. Su tecnología insignia, AGI-0, es un sistema de inteligencia artificial orientado a la acción diseñado para comprender las preferencias del usuario y completar tareas en varias aplicaciones en teléfonos, computadoras, dispositivos portátiles y otros dispositivos conectados, incluyendo flujos de trabajo que involucran compras, transporte, programación, mensajería y entretenimiento. La empresa también ofrece una plataforma que permite a los fabricantes de hardware y desarrolladores agregar agentes con pantalla que pueden razonar y actuar en aplicaciones existentes sin necesidad de integraciones separadas para cada aplicación. AGI, Inc. ha demostrado su tecnología con Lenovo y está optimizando su pila de agentes para dispositivos con procesadores Qualcomm (QCOM ) Snapdragon.

Ha trabajado en Apple, Google, Nvidia y ha ayudado a pionear sistemas de agentes tempranos en MultiOn antes de pausar su doctorado en Stanford para fundar AGI, Inc. ¿Qué limitación o momento específico lo convenció de que los enfoques de inteligencia artificial existentes no eran suficientes, y que construir un agente autónomo en el dispositivo era el camino correcto hacia adelante?

Este cambio ocurrió en algún momento entre 2023 y 2024 mientras trabajaba en agentes web. Podíamos crear agentes para realizar acciones en navegadores, pero solo si el sitio web tenía una estructura adecuada con la que el agente pudiera trabajar. Tan pronto como algo salía mal y no se comportaba como una versión idealizada del DOM, como una ventana emergente o un efecto de animación, el agente dejaba de funcionar. Por otro lado, todo lo que importa cuando las personas quieren interactuar con sus teléfonos inteligentes está sucediendo dentro de aplicaciones. Las aplicaciones no proporcionan ningún tipo de API; presentan pantallas en su lugar.

Esta diferencia llevó a nuestras conclusiones. La solución al problema no iba a ser APIs más sofisticadas o modelos más grandes, sino el agente que operaría el dispositivo desde la perspectiva de una persona. Esto significaba tratar al teléfono inteligente como lo haría una persona – interactuando con sus pantallas.

Muchos asistentes de inteligencia artificial de hoy en día aún dependen en gran medida de APIs, integraciones y orquestación en la nube. ¿Qué se rompe fundamentalmente en ese modelo, y por qué cree que la ejecución en el dispositivo es la capa que falta?

Hay tres problemas con eso. El primero es la cobertura. Las APIs requieren que todos los desarrolladores se comuniquen con usted, lo que limita las capacidades de su agente a la del socio más lento. Las intenciones de la aplicación de Apple son un ejemplo excelente de esta tecnología que se inició en la WWDC 2024. Luego está la privacidad. La orquestación en la nube requiere que el contenido de su pantalla, mensajes y actividades se envíen a los servidores de un tercero. Finalmente, está el problema del costo y la latencia. Todo el procesamiento de ida y vuelta a través de la nube lo hace lento y caro.

La ejecución en el dispositivo resuelve todos estos problemas. Su agente no depende de nadie más y se comunica con el sistema interactuando directamente con la interfaz de usuario.

Su enfoque cambia la inteligencia artificial de responder preguntas a completar tareas en varias aplicaciones. ¿Cuáles fueron los desafíos técnicos más difíciles para permitir que un agente operara un teléfono de manera confiable como lo haría un ser humano?

Controlar un teléfono de manera confiable es más difícil de lo que puede sonar. Primero, un agente debe percibir la pantalla del teléfono como lo haría un ser humano, dar sentido a lo que viene a continuación y realizar la acción adecuada. La percepción se realiza mediante un modelo de visión-lenguaje capaz de reconocer botones, cuadros de texto, menús, diseños, etc. La selección de la acción es necesaria para manejar ambigüedades, páginas parcialmente cargadas, diálogos modales y errores. Finalmente, la acción debe ser lo suficientemente precisa para que un toque aterrice en la ubicación correcta.

El problema más significativo, sin embargo, radica en la capacidad de interactuar de manera confiable con aplicaciones complejas durante un período prolongado. Reservar un Uber es una cosa, pero realizar un proceso de varios pasos dentro de una aplicación en la que cada paso depende de interacciones anteriores es un juego completamente diferente. Esto es precisamente por lo que entrenar modelos de extremo a extremo fue esencial para el desarrollo del producto.

Ha descrito esto como una transición de asistentes a agentes. ¿Qué significa realmente esta transición en la práctica para los usuarios cotidianos, y con qué rapidez espera que el comportamiento cambie?

El cambio práctico proviene de la interfaz en sí. Donde hoy tenemos la aplicación y aprendemos a usar la aplicación, mañana tendremos al agente, y las aplicaciones se convertirán en capacidades compuestas por el agente en nuestro nombre. Dejamos de pensar en aplicaciones y comenzamos a pensar en intención: “Resérvalo un viaje a casa”. “Envíe las fotos del fin de semana a mamá”. “Muéstrame hoteles en Lisboa donde pueda obtener un poco de paz para el próximo fin de semana”. El agente sabe qué aplicaciones usar.

El cambio de comportamiento comienza lentamente y se acelera a medida que avanza. Al principio, las personas probarán este enfoque para tareas simples en las que confían y luego expandirán tanto como puedan. El desencadenante para la aceptación a gran escala llegará cuando el agente obtenga las tareas rutinarias correctas en nuestros teléfonos cada vez.

Con asociaciones como Qualcomm y Lenovo, ¿qué tan importante es la integración de hardware y software para hacer que la inteligencia artificial agente sea usable a gran escala?

Esta es la diferencia entre un prototipo utilizado para fines de investigación y una aplicación que es realmente usable. Los dispositivos con procesadores Snapdragon tienen unidades de procesamiento de neuronas, lo que garantiza que los algoritmos del agente puedan operar en el dispositivo con retrasos y consumo de energía mínimos. Qualcomm ha pasado años trabajando para lograr esta optimización, y la asociación que anunciamos en la MWC 2026 tenía este objetivo exacto en mente.

El otro extremo es Lenovo. Lenovo puede llegar a cientos de millones de usuarios en todo el mundo a través de teléfonos inteligentes, tabletas y PCs, buscando diferenciarse mediante la inteligencia artificial. Pasar por socios con carteras de dispositivos existentes y llegar a ellos de manera rápida y transparente es mejor que la ruta alternativa. Lo sé por experiencia.

La confianza parece ser una barrera importante. ¿Cómo diseña sistemas en los que los usuarios se sientan cómodos permitiendo que la inteligencia artificial tome acciones en su nombre, especialmente cuando esas acciones abarcan varias aplicaciones y datos sensibles?

La confianza se construye sobre la base de ser transparente sobre lo que el agente es y no es capaz de hacer. Cualquier acción que involucre algo importante, como realizar una compra real, enviar un mensaje o cambiar la configuración de la cuenta, requiere la aprobación del usuario. El agente tiene la capacidad de ir hasta la página de pago por su cuenta, pero no más allá hasta que usted lo haga. Nuestra asociación con Visa agrega rieles de pago autenticados encima de eso.

Todo esto se hace sobre la base de dos filosofías simples. La primera es “humano en el bucle para cualquier cosa sustancial”. La segunda es la de “reversibilidad siempre que sea posible”. Además, el agente solo verá lo que es visible en la pantalla y honrará los permisos del sistema que se han establecido.

Hay una narrativa creciente de que la economía de las aplicaciones podría verse interrumpida. ¿Ve a los agentes reemplazando completamente a las aplicaciones, o cambiando la forma en que se acceden y monetizan las aplicaciones?

Las aplicaciones nunca desaparecen. La dinámica simplemente cambia. Para hoy, la aplicación es cómo la marca se comunica con el consumidor. Mañana, el agente será, y la aplicación será la herramienta utilizada por el agente. Los desarrolladores de aplicaciones están aquí para quedarse porque siempre habrá una necesidad de la aplicación detrás de la llamada de servicio, el mensaje de texto o la transacción. La diferencia estará en la interfaz en la que se toman esas opciones.

Esto representa un nuevo frente para las aplicaciones y para las marcas que las utilizan. Esto representa una oportunidad increíble para explorar y desarrollar con nuestros socios en desarrollo y plataformas por igual.

Su sistema evita depender de APIs. ¿Eso crea tensión con los desarrolladores y las plataformas, o en última instancia desbloquea un ecosistema más abierto?

Es menos controvertido de lo que suena. No hay competencia entre los desarrolladores y nosotros. La forma en que funciona la interfaz es el mismo proceso que una persona utilizaría una aplicación, por lo que el agente utiliza las mismas interfaces que cualquier otra persona. Los desarrolladores pueden emplear prácticas técnicas comunes para bloquear el acceso, y entendemos su razonamiento.

Un resultado más intrigante es la ausencia de controversia. Un sistema abierto con interoperabilidad universal beneficia a todos, en comparación con un sistema cerrado, donde cada asistente solo se puede utilizar en aplicaciones específicas, porque solo admite ese tipo de integración personalizada. La universalidad ayuda a los usuarios, pero también ayuda a las aplicaciones con valor real.

La inteligencia artificial en el dispositivo a menudo se presenta como una ventaja en términos de privacidad. ¿Cómo equilibra el procesamiento local con la necesidad de modelos poderosos que tradicionalmente requieren un gran poder de cómputo?

Es un sistema híbrido que seguirá evolucionando hacia un sistema completamente en el dispositivo. Tanto las acciones como el razonamiento ligero ocurren en el teléfono, mientras que el razonamiento pesado ocurre en la nube. Con la optimización de la pila a través de nuestro trabajo con Qualcomm y las capacidades de las NPUs de los teléfonos que se vuelven cada vez más avanzadas, hay un cambio hacia que el modelo sea más localizado. Actualmente, la mayoría de los teléfonos insignia disponibles en el mercado pueden manejar la carga de trabajo requerida.

La dicotomía de tener un rendimiento poderoso y sacrificar la localización o viceversa también está obsoleta. Los modelos se vuelven más eficientes, y el hardware del teléfono se vuelve más capaz. Todo se puede lograr cuando la pila está debidamente optimizada.

Mirando hacia adelante tres a cinco años, ¿cómo se ve un dispositivo nativo de inteligencia artificial completamente realizado, y qué necesita suceder técnicamente y culturalmente antes de que esa visión se vuelva mainstream?

La implementación real sería un solo agente que lo sigue en los dispositivos. Le dice a su PC que busque información sobre regalos, cambie a su teléfono inteligente para hacer una compra, luego le dice a su coche que se calienta. La intención es la misma; el contexto permanece constante, mientras que la superficie cambia. Los teléfonos son el punto de inserción, ya que es donde sucede la mayoría de la computación en este momento. Después, se mudará a las PCs, TVs, coches y, en última instancia, a gafas inteligentes, y la colaboración con Qualcomm hace una gran diferencia en ese respecto.

Desde un punto de vista técnico, es continuar con el razonamiento en el dispositivo y aumentar la confiabilidad a largo plazo, así como las transiciones adecuadas entre dispositivos. Desde una perspectiva cultural, el cambio sería confiar cada vez más en los agentes con tareas cada vez más complejas, lo que se basa en el agente que le dice todo lo que no puede hacer sin vacilación, y también no romper ninguna de las simples promesas hechas a usted.

Gracias por la gran entrevista, los lectores que deseen aprender más pueden visitar AGI, Inc.

Antoine es un líder visionario y socio fundador de Unite.AI, impulsado por una pasión inquebrantable por dar forma y promover el futuro de la IA y la robótica. Como empresario serial, cree que la IA será tan disruptiva para la sociedad como la electricidad, y a menudo se le escucha hablando con entusiasmo sobre el potencial de las tecnologías disruptivas y la AGI.

Como futurista, está dedicado a explorar cómo estas innovaciones darán forma a nuestro mundo. Además, es el fundador de Securities.io, una plataforma enfocada en invertir en tecnologías de vanguardia que están redefiniendo el futuro y remodelando sectores enteros.