Líderes de opinión

Por qué la próxima fase de la infraestructura de inteligencia artificial requerirá más que centros de datos de hipercala

mm
Añade Unite.AI a tus fuentes preferidas en Google

La inteligencia artificial está entrando en una etapa en la que la estrategia de infraestructura se está volviendo inseparable de la capacidad del modelo. Durante años, los centros de datos de hipercala han impulsado el auge de la formación a gran escala, lo que ha permitido que los modelos fronterizos crezcan de millones a billones de parámetros. Pero a medida que la adopción de la inteligencia artificial se acelera en empresas, industrias y sistemas en tiempo real, la inferencia está reemplazando a la formación como la carga de trabajo dominante, y la inferencia tiene requisitos fundamentalmente diferentes.

La próxima era de la inteligencia artificial no puede ser respaldada solo por instalaciones de hipercala. En su lugar, se está emergiendo un modelo híbrido en el que los campus centralizados para la formación se complementan con centros de datos comerciales distribuidos y alineados con la potencia para la inferencia. Este cambio está siendo impulsado por las limitaciones de latencia, las necesidades de soberanía de datos, las realidades energéticas y los límites físicos de la expansión continua de hipercala.

La divergencia de la formación y la inferencia

La formación sigue siendo una actividad centralizada. Exige clusters masivos, tuberías de datos de alta velocidad y trabajos de larga duración que se benefician de las economías de escala. Los campus de hipercala están optimizados para esto con cómputo denso, telas de red especializadas y disponibilidad global. Pero la inferencia se comporta de manera diferente. Es de duración corta, alto volumen, sensible a la latencia y a menudo vinculada a la geografía o los límites de la empresa. Los análisis de el trabajo reciente de Akamai sobre sistemas agénticos muestran que la mayoría de las organizaciones ahora apuntan a una latencia de extremo a extremo inferior a 500 milisegundos para los casos de uso críticos de inteligencia artificial, y los flujos de trabajo de múltiples agentes frecuentemente exceden ese umbral simplemente debido al tránsito de red y la ejecución del lado del CPU.

La latencia no es una métrica abstracta. En robótica y sistemas autónomos, los bucles de control a menudo se ejecutan a 100 a 1.000 hercios cada 1 a 10 milisegundos. Cualquier inteligencia fuera de la tabla debe respetar esas limitaciones de tiempo. Un viaje de ida y vuelta de 50 milisegundos a un centro de datos distante rompe por completo el régimen de control. En el comercio financiero y la detección de fraude, los milisegundos determinan los resultados económicos. En la automatización industrial, la inferencia retrasada puede desestabilizar los procesos o comprometer la seguridad. Y en experiencias interactivas como juegos, AR/VR y copilotos en tiempo real, la respuesta se degrada bruscamente por encima de 100 a 150 milisegundos.

Los sistemas de inteligencia artificial modernos dependen cada vez más de flujos de trabajo de múltiples agentes que consisten en cadenas de docenas de llamadas secuenciales. El análisis de Akamai muestra que la ejecución del lado del CPU puede representar la mayoría de la latencia total, y cada viaje de red agrega retrasos adicionales. Un flujo de trabajo con 50 llamadas secuenciales puede incurrir en segundos de latencia de transporte cuando se enruta a una región de hipercala distante. Coloque ese mismo flujo de trabajo en un centro de datos hiperlocal ubicado en el mismo campus o área metropolitana y la física cambia. La inferencia local puede ofrecer una latencia de ida y vuelta de 1 a 5 milisegundos. Un flujo de trabajo de 50 pasos que tomaría segundos en una región distante puede completarse en 50 a 250 milisegundos localmente, manteniéndose dentro de los presupuestos de latencia de la empresa.

La soberanía de datos y las realidades de la red impulsan las implementaciones locales

La latencia es solo una parte de la historia. Para industrias reguladas como la atención médica, las finanzas y el sector público, la soberanía de datos es a menudo el principal impulsor de la inferencia local. Ejecutar cargas de trabajo de inteligencia artificial detrás de un firewall de empresa conserva los perímetros de seguridad existentes, reduce la exposición multitenant, simplifica el cumplimiento y mantiene los datos sensibles fuera de la infraestructura de nube compartida. Los proveedores de hipercala ofrecen una seguridad sólida, pero la superficie de ataque y la cadena de confianza son inherentemente más amplias. Las empresas prefieren cada vez más arquitecturas de inferencia que se alineen con su postura de seguridad existente.

Además de las preocupaciones sobre la latencia y la seguridad, la disponibilidad de energía se está convirtiendo en una restricción igualmente importante. Los grandes campus de hipercala a menudo enfrentan retrasos de varios años debido a las limitaciones de transmisión y las colas de interconexión. Las implementaciones comerciales más pequeñas, especialmente aquellas ubicadas cerca de cargas existentes o generación distribuida, pueden ser energizadas mucho más rápidamente. Esto importa porque la demanda de inteligencia artificial está chocando con una paradoja extraña.

Al mismo tiempo que los operadores luchan por asegurar nuevas conexiones de red, enormes cantidades de energía renovable están siendo limitadas. A nivel mundial, la limitación de energía renovable supera los 200 teravatios-hora por año. En los Estados Unidos, la limitación se estima en aproximadamente 20 teravatios-hora anual. ERCOT solo limitó más de 9 teravatios-hora de generación de viento y solar en un año reciente. Mientras que CAISO descartó 3.4 teravatios-hora de solar y viento en 2024, con la energía solar que representó el 93% de toda la producción recortada. Las encuestas del sistema energético muestran consistentemente que tanto la energía solar como la eólica enfrentan una limitación significativa cuando la generación supera la capacidad de la red. La limitación de la energía solar es particularmente común en regiones con picos fuertes al mediodía, mientras que la limitación del viento a menudo ocurre durante las horas de menor demanda o en corredores restringidos. Los centros de datos distribuidos ubicados cerca de la generación, especialmente en regiones ricas en energía solar, pueden convertir la energía aislada en capacidad de inferencia útil.

Los campus de hipercala seguirán siendo esenciales para la formación, pero enfrentan límites físicos y económicos en crecimiento. Conectar a la red de transmisión puede ser un proceso largo, requiere nuevas subestaciones, mejoras de transmisión, permisos de múltiples agencias y revisión comunitaria. Estos son procesos que rutinariamente toman años. Las instalaciones de hipercala requieren grandes huellas de tierra, asignaciones de agua significativas y aprobaciones ambientales complejas. Las comunidades están cada vez más resistentes al desarrollo de nuevos centros de datos debido al ruido, el uso de agua y el impacto en la tierra. Y los campus centralizados concentran el riesgo de tal manera que los eventos climáticos, los apagones de la red o las interrupciones geopolíticas pueden afectar grandes porciones de la capacidad de cómputo global. Las arquitecturas distribuidas proporcionan redundancia geográfica y resiliencia operativa.

El futuro es una arquitectura de inteligencia artificial de varios niveles

Cuando se trata de garantizar que el cómputo de inferencia se ejecute sin problemas, la eficiencia puede volverse tan importante como la capacidad bruta. La inferencia consume energía continuamente, y los analistas de la industria sugieren que la inferencia puede representar eventualmente la mayoría del consumo de energía relacionado con la inteligencia artificial. Las ganancias de eficiencia de la integración de energía renovable local, la reducción de las pérdidas de transmisión, las implementaciones de tamaño adecuado, los perfiles térmicos mejorados y las tasas de utilización más altas se vuelven esenciales para satisfacer la demanda global de inteligencia artificial de manera sostenible. Los centros de datos comerciales distribuidos están bien posicionados para ofrecer estas ganancias porque pueden ubicarse donde la energía es abundante, económica o subutilizada.

La próxima fase de la infraestructura de inteligencia artificial será una mezcla híbrida de campus de hipercala que dominan la formación, centros de datos comerciales distribuidos que atienden a la inferencia, y dispositivos de borde que atienden a las cargas de trabajo ultralocales. Esta arquitectura de varios niveles refleja las realidades físicas de la energía, la latencia, la seguridad y la escala. A medida que la inteligencia artificial se incorpora a los sistemas en tiempo real en todas las industrias, la infraestructura debe evolucionar en consecuencia para acercar la inferencia al mundo que sirve.

Jeff Thramann, M.D. es un inventor y empresario serial con más de 130 patentes a su nombre, y ha fundado y salido de seis empresas. Como fundador y CEO de LT350, es un empresario médico y estratega de infraestructura de inteligencia artificial enfocado en arquitecturas de cómputo distribuido y diseño de centros de datos de próxima generación que aprovechan la infraestructura existente para minimizar el impacto de los centros de datos.