Líderes de opinión

El Futuro de la Inteligencia Artificial Generativa es el Borde

mm
Añade Unite.AI a tus fuentes preferidas en Google

El surgimiento de ChatGPT y la Inteligencia Artificial Generativa en general, es un momento crucial en la historia de la tecnología y se compara con el amanecer de Internet y el smartphone. La Inteligencia Artificial Generativa ha demostrado un potencial ilimitado en su capacidad para mantener conversaciones inteligentes, aprobar exámenes, generar programas/código complejos y crear imágenes y videos atractivos. Aunque las GPU ejecutan la mayoría de los modelos de Inteligencia Artificial Generativa en la nube, tanto para el entrenamiento como para la inferencia, esta no es una solución escalable a largo plazo, especialmente para la inferencia, debido a factores que incluyen el costo, el poder, la latencia, la privacidad y la seguridad. Este artículo aborda cada uno de estos factores, junto con ejemplos motivadores para mover las cargas de trabajo de computación de Inteligencia Artificial Generativa al borde.

La mayoría de las aplicaciones se ejecutan en procesadores de alto rendimiento, ya sea en el dispositivo (por ejemplo, smartphones, escritorios, portátiles) o en centros de datos. A medida que aumenta la participación de aplicaciones que utilizan Inteligencia Artificial, estos procesadores con solo CPU son inadecuados. Además, la rápida expansión de las cargas de trabajo de Inteligencia Artificial Generativa está generando una demanda exponencial de servidores con GPU costosos y consumidores de energía, lo que a su vez está aumentando los costos de infraestructura. Estos servidores con Inteligencia Artificial pueden costar hasta 7 veces el precio de un servidor regular, y las GPU representan el 80% de este costo adicional.

Además, un servidor en la nube consume entre 500W y 2000W, mientras que un servidor con Inteligencia Artificial consume entre 2000W y 8000W, es decir, 4 veces más. Para respaldar estos servidores, los centros de datos necesitan módulos de enfriamiento adicionales y mejoras en la infraestructura, lo que puede ser aún mayor que la inversión en computación. Los centros de datos ya consumen 300 TWH por año, casi el 1% del consumo total de energía en todo el mundo. Si las tendencias de adopción de Inteligencia Artificial continúan, es posible que hasta el 5% del consumo de energía en todo el mundo sea utilizado por los centros de datos para 2030. Además, hay una inversión sin precedentes en centros de datos de Inteligencia Artificial Generativa. Se estima que los centros de datos consumirán hasta $500 mil millones en gastos de capital para 2027, principalmente impulsados por los requisitos de infraestructura de Inteligencia Artificial.

El consumo de electricidad de los centros de datos, ya de 300 TwH, aumentará significativamente con la adopción de la Inteligencia Artificial Generativa.

El costo de la computación de Inteligencia Artificial, así como el consumo de energía, obstaculizará la adopción masiva de la Inteligencia Artificial Generativa. Los desafíos de escalabilidad se pueden superar moviendo la computación de Inteligencia Artificial al borde y utilizando soluciones de procesamiento optimizadas para las cargas de trabajo de Inteligencia Artificial. Con este enfoque, también se obtienen otros beneficios para el cliente, incluyendo la latencia, la privacidad, la confiabilidad y la capacidad aumentada.

La computación sigue a los datos al Borde

Desde hace una década, cuando la Inteligencia Artificial surgió del mundo académico, el entrenamiento y la inferencia de los modelos de Inteligencia Artificial han ocurrido en la nube/centro de datos. Con la mayoría de los datos generados y consumidos en el borde, especialmente video, solo tenía sentido mover la inferencia de los datos al borde, mejorando así el costo total de propiedad (TCO) para las empresas debido a los costos reducidos de red y computación. Mientras que los costos de inferencia de Inteligencia Artificial en la nube son recurrentes, el costo de la inferencia en el borde es un gasto de hardware de una sola vez. En esencia, aumentar el sistema con un procesador de Inteligencia Artificial de borde reduce los costos operativos generales. Al igual que la migración de las cargas de trabajo de Inteligencia Artificial convencional al Borde (por ejemplo, electrodoméstico, dispositivo), las cargas de trabajo de Inteligencia Artificial Generativa seguirán el mismo camino. Esto traerá ahorros significativos para las empresas y los consumidores.

El movimiento hacia el borde, combinado con un acelerador de Inteligencia Artificial eficiente para realizar funciones de inferencia, ofrece otros beneficios. En primer lugar, la latencia. Por ejemplo, en aplicaciones de juegos, los personajes no jugables (NPC) pueden ser controlados y mejorados mediante la Inteligencia Artificial Generativa. Utilizando modelos LLM que se ejecutan en aceleradores de Inteligencia Artificial de borde en una consola de juegos o PC, los jugadores pueden dar a estos personajes objetivos específicos para que participen de manera significativa en la historia. La baja latencia de la inferencia local en el borde permitirá que el habla y los movimientos de los NPC respondan a las órdenes y acciones de los jugadores en tiempo real. Esto proporcionará una experiencia de juego inmersiva de manera rentable y eficiente en términos de energía.

En aplicaciones como la atención médica, la privacidad y la confiabilidad son extremadamente importantes (por ejemplo, evaluación de pacientes, recomendaciones de medicamentos). Los datos y los modelos de Inteligencia Artificial Generativa asociados deben estar en las instalaciones para proteger los datos de los pacientes (privacidad) y cualquier interrupción de la red que bloquee el acceso a los modelos de Inteligencia Artificial en la nube puede ser catastrófica. Un electrodoméstico de Inteligencia Artificial de borde que ejecuta un modelo de Inteligencia Artificial Generativa creado específicamente para cada cliente empresarial, en este caso un proveedor de atención médica, puede resolver de manera transparente los problemas de privacidad y confiabilidad, al mismo tiempo que ofrece menor latencia y costo.

La Inteligencia Artificial Generativa en dispositivos de borde garantizará una baja latencia en los juegos y preservará los datos de los pacientes y mejorará la confiabilidad en la atención médica.

Muchos modelos de Inteligencia Artificial Generativa que se ejecutan en la nube pueden tener cerca de un billón de parámetros, estos modelos pueden abordar eficazmente las consultas de propósito general. Sin embargo, las aplicaciones específicas de las empresas requieren que los modelos entreguen resultados pertinentes para el caso de uso. Tomemos el ejemplo de un asistente de Inteligencia Artificial Generativa creado para tomar pedidos en un restaurante de comida rápida, para que este sistema tenga una interacción con el cliente sin problemas, el modelo de Inteligencia Artificial Generativa subyacente debe estar entrenado en los artículos del menú del restaurante, también conociendo los alérgenos y los ingredientes. El tamaño del modelo se puede optimizar utilizando un modelo LLM grande para entrenar un modelo LLM relativamente pequeño de 10-30 mil millones de parámetros y luego utilizar un ajuste fino adicional con los datos específicos del cliente. Un modelo como este puede entregar resultados con mayor precisión y capacidad. Y dado que el tamaño del modelo es más pequeño, se puede implementar eficazmente en un acelerador de Inteligencia Artificial en el borde.

La Inteligencia Artificial Generativa ganará en el Borde

Siempre habrá una necesidad de Inteligencia Artificial Generativa que se ejecute en la nube, especialmente para aplicaciones de propósito general como ChatGPT y Claude. Pero cuando se trata de aplicaciones específicas de las empresas, como el relleno generativo de Adobe Photoshop o Github Copilot, la Inteligencia Artificial Generativa en el borde no solo es el futuro, sino también el presente. Los aceleradores de Inteligencia Artificial personalizados son la clave para hacer esto posible, especialmente para aplicaciones como estas.

Como veterano del Valle de Silicio, y CEO de Kinara Inc, Ravi Annavajjhala aporta más de 20 años de experiencia que abarcan el desarrollo de negocios, marketing e ingeniería, creando productos de tecnología de vanguardia y llevándolos al mercado. En su actual cargo como director ejecutivo de Deep Vision, Ravi forma parte de su junta directiva y ha recaudado $50M para llevar el procesador Ara-1 de la empresa desde la etapa pre-silicio hasta la producción a gran escala y para aumentar el procesador de segunda generación, Ara-2, en volumen. Antes de unirse a Deep Vision, Ravi ocupó puestos de liderazgo ejecutivo en Intel y SanDisk, donde desempeñó papeles clave en el impulso del crecimiento de los ingresos, la evolución de las asociaciones estratégicas y el desarrollo de hojas de ruta de productos que lideraron la industria con características y capacidades de vanguardia.