Modelos y plataformas de IA

Alibaba planea modelo de 5 a 10 billones de parámetros en impulso de IA de pila completa

mm
Añade Unite.AI a tus fuentes preferidas en Google

El CEO de Alibaba Group, Eddie Wu, dijo que la compañía planea entrenar un nuevo modelo de inteligencia artificial a escala de 5 a 10 billones de parámetros, presentando una hoja de ruta de IA de pila completa que abarca modelos, chips e infraestructura en la nube en una presentación principal en la Conferencia Apsara 2026 en Hangzhou el 22 de septiembre de 2026.

La Conferencia Apsara es el evento insignia anual de Alibaba Cloud. La agenda oficial de la conferencia ubicó el discurso de Wu en la Ceremonia de Apertura y la Sesión Principal de Apsara, que también incluyó sesiones dedicadas a Qwen y al trabajo de silicio de T-Head. El organizador describe la edición 2026 como abarcando tres foros principales de ponencias, más de 120 foros paralelos y una exposición tecnológica de 50.000 metros cuadrados que reúne a más de 1.000 empresas.

Planes para un modelo de 5 a 10 billones de parámetros

Wu dijo que la vía técnica hacia la superinteligencia artificial, o ASI, se ha vuelto cada vez más clara, señalando la Mejora Recursiva Autónoma, o RSI, un proceso en el que los modelos se enfrentan a tareas del mundo real y retroalimentación, identifican sus propias limitaciones y diseñan experimentos de forma autónoma, sintetizan datos y evalúan resultados en un ciclo continuo de auto‑evolución. Dijo que el equipo Qwen de Alibaba está explorando RSI y ha logrado avances significativos, mientras continúa la investigación sobre la arquitectura del modelo y la optimización de datos.

El modelo planificado, con 5 a 10 billones de parámetros, está destinado a realizar tareas más complejas y de horizonte más largo y a avanzar hacia la ASI, dijo Wu. Señaló que los modelos multimodales que unifican la comprensión y la generación son otra dirección de investigación central, argumentando que los modelos necesitan capacidades multimodales profundas para comprender y comunicar señales humanas como la voz, imágenes, expresiones faciales y gestos, y para alinearse con la cultura, la estética y los valores humanos.

Wu describió el año pasado como aquel en el que la IA pasó de la inteligencia general artificial como punto de partida hacia una ASI auto‑iterativa, con el paradigma de “vibe coding” madurando hacia el “vibe working” de espectro completo y lo que él describió como avances decisivos en la ejecución de tareas de largo horizonte. Planteó dos perspectivas de la era: que las máquinas producirán más de 1.000 veces el pensamiento de toda la humanidad combinada, y que los productos que realmente definirán la era aún no han llegado. El pensamiento de las máquinas actualmente representa menos del 3 % de todo el pensamiento humano, dijo, mientras que la potencia de las máquinas ya impulsa el 99,9 % del trabajo físico mundial, y predijo que el pensamiento de las máquinas llegará a soportar el 99,9 % de todo el pensamiento.

Wu calificó la codificación de IA como “simplemente la bombilla de la era de la Inteligencia de Máquina”, argumentando que simplemente automatizar el trabajo humano existente nunca definirá una nueva era. Trazando una analogía con la electrificación, señaló que la Pearl Street Station de Thomas Edison en 1882 alimentaba apenas 400 bombillas, mientras que el aire acondicionado llegó en 1902 y la primera computadora digital en 1946.

Wu dijo que la era de la Inteligencia de Máquina se sustenta en tres pilares de infraestructura: modelos de IA, chips de IA y la nube de IA. Afirmó que Alibaba sigue comprometido a construir esa infraestructura central en los tres ámbitos como una prioridad estratégica a largo plazo.

Chip Zhenwu V900 y Supernodos AI M890

Wu dijo que la unidad de semiconductores T-Head de Alibaba está construyendo una cartera de chips para centros de datos que cubre la serie Zhenwu de chips GPU, la serie Yitian de chips CPU, la serie Panmai de tarjetas de interfaz de red inteligentes y los chips de interconexión ICN, abarcando en conjunto el silicio esencial necesario para construir clústeres de IA de ultra gran escala.

En la conferencia, Alibaba presentó la Zhenwu V900 de próxima generación, que Wu describió como “el chip de IA más potente de China en la actualidad”. Dijo que la V900 ofrece tres veces el rendimiento de su predecesora, la Zhenwu M890, y que un único clúster construido sobre ella puede soportar hasta 500.000 tarjetas para el entrenamiento e inferencia de modelos de vanguardia. Citando la madurez de las líneas de productos de T-Head y su adopción entre los clientes, afirmó que Alibaba anticipa un crecimiento significativo en los volúmenes anuales de envíos de chips de IA.

Wu dijo que el Supernodo AI M890 propio de Alibaba ya ofrece inferencia de alta eficiencia para modelos de base de más de 2 billones de parámetros, un nivel de capacidad que, según él, solo unas pocas empresas a nivel mundial poseen, y que Alibaba Cloud está poniendo los Supernodos AI en línea a escala comercial. Afirmó que la compañía está persiguiendo una co‑optimización de extremo a extremo entre chips, servidores, supernodos, redes, modelos y motores de inferencia para maximizar el rendimiento de tokens y la eficiencia de costos en toda su infraestructura de clústeres de IA.

Objetivo de nube de 20 gigavatios y impulso de dispositivos Qwen

Wu describió la nube de IA como la red que entrega tokens donde sea necesario, afirmando que requiere una infraestructura hiperescalable y distribuida globalmente que co‑optimiza GPUs, CPUs, redes, almacenamiento y bases de datos. Dijo que la demanda de los clientes por IA sigue siendo excepcionalmente robusta, con la demanda a medio y largo plazo de la industria superando con mucho las capacidades de suministro de Alibaba y las escasez globales en la cadena de suministro de centros de datos de IA limitando actualmente la velocidad a la que la empresa puede escalar la infraestructura de cómputo. Afirmó que la provisión de capacidad de cómputo de IA está impulsando un crecimiento acelerado de los ingresos en Alibaba Cloud.

Wu fijó un objetivo para que Alibaba Cloud opere más de 20 gigavatios de capacidad global de centros de datos para 2032, describiendo la expansión como una respuesta a la demanda de la industria de IA, que está aumentando exponencialmente.

Wu también afirmó que el Qwen-27B de código abierto de Alibaba se ha convertido en el modelo más popular entre los desarrolladores de todo el mundo en entornos de escritorio, y que la compañía seguirá perfeccionando esos modelos para que los desarrolladores y las empresas puedan desplegar inteligencia localmente. En la conferencia, Alibaba lanzó Qwen Intelligence, una solución integral diseñada para socios que permite a los dispositivos móviles razonar y ejecutar tareas complejas.

Wu concluyó su intervención reiterando la convicción de Alibaba de que, a medida que la IA se vuelve más capaz, la humanidad será más poderosa, describiendo esa convicción como el propósito último del compromiso de la empresa con la era de la Inteligencia de Máquinas.

Theo Nash es un especialista en inteligencia artificial generada en Unite.AI, que cubre la infraestructura de inteligencia artificial, el cómputo y los sistemas de hardware que alimentan la inteligencia artificial moderna. Su trabajo se centra en los fundamentos técnicos detrás de las cargas de trabajo de inteligencia artificial a gran escala, incluyendo centros de datos, aceleradores, redes y las pilas de software que los unen.
Con una perspectiva analítica y basada en la ingeniería, Theo examina cómo los avances en GPUs, silicio personalizado, arquitecturas de memoria y sistemas distribuidos permiten nuevas generaciones de modelos de inteligencia artificial. Presta especial atención a los compromisos de rendimiento, la eficiencia energética, la escalabilidad y las limitaciones prácticas que dan forma a la implementación en el mundo real de la infraestructura de inteligencia artificial.
Los artículos escritos por Theo Nash son generados por inteligencia artificial y revisados por el equipo editorial de Unite.AI para garantizar la precisión técnica, la claridad y la cobertura responsable del paisaje de cómputo de inteligencia artificial en constante evolución.