Modelos y plataformas de IA

WEKA lanza NeuralMesh 6 y WEKApod 3 a medida que la infraestructura de IA se dirige hacia la inferencia

mm
Añade Unite.AI a tus fuentes preferidas en Google

WEKA ha introducido una renovación coordinada de software y hardware dirigida a uno de los problemas más costosos que surgen en la industria de la IA: mantener las GPU productivas a medida que los modelos se mueven desde el entrenamiento hacia la inferencia continua y a gran escala.

Los anuncios incluyen NeuralMesh 6, una actualización importante de la plataforma de datos y memoria de la empresa, junto con los aparatos WEKApod de tercera generación diseñados para nubes de IA, desarrolladores de modelos, organizaciones de investigación y empresas que operan infraestructura de GPU.

Juntos, los lanzamientos reflejan un cambio más amplio en el diseño de la infraestructura de IA, con el almacenamiento que evoluciona desde un repositorio pasivo hasta una capa de memoria y entrega de datos activa.

Un impulso unificado hacia la producción de IA

Los requisitos de infraestructura de la inferencia de IA difieren considerablemente de los de entrenamiento de modelos. Los trabajos de entrenamiento suelen procesar grandes conjuntos de datos a través de tuberías relativamente predecibles. Los sistemas de generación aumentada, razonamiento de contexto largo y sistemas de razonamiento deben acceder a datos cambiantes, mantener el contexto a lo largo de interacciones repetidas y soportar a muchos usuarios concurrentes sin dejar que las GPU costosas esperen información.

La respuesta de WEKA es tratar el almacenamiento, la extensión de memoria, el acceso a archivos, el acceso a objetos y el movimiento de datos como partes de la misma plataforma. NeuralMesh está diseñado para proporcionar una base de datos compartida para el entrenamiento, la inferencia y el cálculo de alto rendimiento en entornos locales, nubes públicas y despliegues híbridos.

El nuevo lanzamiento amplía esa arquitectura con multi-tenencia, almacenamiento de objetos nativo, caché distribuida, reducción de datos automatizada, operaciones de Kubernetes y observabilidad centralizada.

En lugar de presentar los anuncios de software y aparatos como actualizaciones no relacionadas, la empresa los presenta como dos partes del mismo sistema. NeuralMesh 6 controla cómo se almacenan, mueven, aíslan y entregan los datos, mientras que WEKApod 3 proporciona hardware diseñado alrededor de esas funciones.

NeuralMesh 6 unifica las cargas de trabajo de archivos y objetos

Una de las adiciones más importantes en NeuralMesh 6 es una implementación nativa de S3 que se ejecuta en almacenamiento NVMe. Los mismos bloques de datos subyacentes se pueden acceder a través de protocolos de objetos S3 y interfaces de sistema de archivos de red o POSIX sin mantener copias separadas.

Eso es importante porque las tuberías de IA a menudo mueven información entre el almacenamiento de objetos, los sistemas de archivos de alto rendimiento, los entornos de entrenamiento y los clusters de inferencia. Cada copia consume capacidad, introduce retrasos y complica la gobernanza. Un espacio de nombres unificado podría permitir que los datos creados a través de un protocolo se vuelvan inmediatamente disponibles a través de otro.

WEKA afirma que su implementación admite entre 2,000 y 5,000 conexiones S3 concurrentes por nodo. También admite S3 sobre Remote Direct Memory Access, lo que permite que los datos se muevan hacia la memoria de la GPU sin seguir el camino convencional a través de múltiples capas de CPU y sistema operativo.

La plataforma introduce dos niveles de multi-tenencia. Los clusters componibles asignan recursos de procesador, memoria y almacenamiento dedicados a inquilinos individuales, mientras que la multi-tenencia virtual proporciona aislamiento de red, cifrado independiente, autenticación separada y controles de calidad de servicio por inquilino.

Los entornos virtuales pueden admitir más de 1,000 inquilinos aislados por cluster, según la empresa. Combinar los modelos físicos y virtuales podría permitir que un gran operador de infraestructura admita a decenas de miles de clientes lógicamente separados sin desplegar un cluster de almacenamiento independiente para cada uno.

Esto es particularmente relevante para los proveedores de GPU como servicio y las nubes de IA soberanas que necesitan equilibrar la alta utilización de la infraestructura con un aislamiento estricto de los clientes.

Moviendo datos hacia dondequiera que estén disponibles las GPU

NeuralMesh 6 también introduce la replicación de metadatos y la caché remota para las cargas de trabajo de IA distribuidas en centros de datos, nubes y regiones geográficas.

La replicación tradicional generalmente requiere que se copie todo el conjunto de datos antes de que se pueda iniciar una carga de trabajo. NeuralMesh hace que los metadatos del destino sean inmediatamente visibles, y luego transfiere los datos subyacentes a medida que se solicitan.

Eso podría permitir a los operadores mover trabajos hacia la capacidad de GPU disponible sin replicar primero cada archivo asociado con el proyecto. El enfoque está diseñado para admitir la expansión de la nube, la infraestructura de IA distribuida y la colaboración entre equipos de investigación o ingeniería geográficamente separados.

También representa un primer paso hacia un modelo de espacio de nombres global en el que los datos se pueden dirigir de manera coherente independientemente de dónde se almacenaron originalmente.

Otra nueva característica aplica la huella dactilar, el hash de similitud, la deduplicación y la compresión continuamente en lugar de tratar la reducción de datos como un proceso de fondo opcional.

WEKA afirma que NeuralMesh 6 puede proporcionar hasta seis veces de ahorro de capacidad en los datos de entrenamiento de IA con menos del 5% de sobrecarga de escritura. Las reducciones reales dependerán del conjunto de datos. Los puntos de control, las capas de contenedores, las versiones del modelo, los datos de entrenamiento iterativos y otros pueden contener una repetición significativa, mientras que otros tipos de datos pueden comprimirse menos efectivamente.

La empresa planea analizar los datos de los clientes representativos antes de la implementación y utilizar la estimación resultante como parte de sus compromisos de capacidad y rendimiento.

Convirtiendo el almacenamiento en una capa de memoria de IA extendida

NeuralMesh también incorpora WEKA’s Augmented Memory Grid, que utiliza el almacenamiento NVMe como una extensión persistente de la memoria de la GPU para la inferencia.

Los grandes modelos de lenguaje crean una caché de clave-valor que contiene información calculada a partir de una solicitud o conversación. Para los contextos largos y los flujos de trabajo de agente, esa caché puede volverse extremadamente grande. Cuando no puede permanecer en la memoria de la GPU de alta ancho de banda, los sistemas pueden necesitar descartarla, volver a calcularla o moverla a una infraestructura más lenta.

Augmented Memory Grid almacena esa caché en una capa persistente respaldada por NVMe y utiliza Remote Direct Memory Access y NVIDIA GPUDirect Storage para moverla de regreso a las GPU.

El objetivo es preservar el contexto reutilizable mientras se reduce la recomputación de prellenado repetida, una de las etapas más intensivas en recursos de la inferencia de contexto largo.

WEKA informa que las pruebas en Oracle Cloud Infrastructure utilizando GPU H100 de NVIDIA produjeron diez veces más rendimiento de tokens, diez veces más usuarios concurrentes y siete veces más tokens por GPU.

Esas cifras son benchmarks específicos de la carga de trabajo y no expectativas de rendimiento universales, pero ilustran por qué la gestión de caché persistente se está convirtiendo en una parte importante del diseño de la infraestructura de inferencia.

WEKApod 3 toma el control de la capa de hardware

Mientras que los sistemas WEKApod anteriores combinaban el software de WEKA con infraestructura prevalidada, la tercera generación se mueve más hacia el diseño de sistemas integrados verticalmente.

WEKA diseñó el nuevo chasis de dos unidades de rack, la interconexión de unidades, la arquitectura de enfriamiento, los dominios de falla y el sistema de servicio. Los aparatos utilizan PCI Express Gen 6 internamente y la conectividad de red NVIDIA ConnectX para la conexión a la infraestructura de Ethernet Spectrum-X.

La familia WEKApod ahora consta de tres sistemas configurables. Nitro se optimiza para la inferencia y las cargas de trabajo de fábrica de IA intensivas en ancho de banda. Prime combina celda de nivel triple y celda de nivel cuádruple para equilibrar el rendimiento y la capacidad. Prime Max prioriza la densidad de almacenamiento máxima, con capacidad para hasta 70 unidades NVMe en un chasis de dos unidades de rack.

En una escala de rack completa, WEKA afirma que Prime Max puede proporcionar 441,5 petabytes de capacidad bruta y 1,1 exabytes de capacidad efectiva después de la reducción de datos de NeuralMesh. El sistema de nivel de rack tiene una tasa de transferencia de hasta 10,2 terabytes por segundo y 210 millones de operaciones de entrada/salida por segundo.

La distinción entre capacidad bruta y efectiva es importante. La cifra de exabyte depende de la reducción que se puede lograr en los datos almacenados y no debe interpretarse como más de un exabyte de flash físico.

Aun así, una mayor densidad puede tener consecuencias significativas en las instalaciones donde el almacenamiento compite con las GPU por espacio en el rack, enfriamiento y capacidad eléctrica.

Diseñado para centros de datos con restricciones

Los nuevos sistemas también abordan las limitaciones físicas que cada vez más dan forma a los proyectos de infraestructura de IA.

Los clusters de GPU requieren grandes cantidades de electricidad, enfriamiento, redes y espacio en el piso. Los sistemas de almacenamiento que consumen estos recursos de manera ineficiente pueden reducir la cantidad de aceleradores que una instalación puede admitir.

WEKA afirma que los nuevos aparatos proporcionan 267% más densidad de capacidad efectiva y 114% más densidad de rendimiento que las alternativas públicamente disponibles más cercanas en sus respectivas categorías.

La empresa también ha diseñado los sistemas para operar en temperaturas ambientales de hasta 35 grados Celsius. La reducción de potencia controlada por software está destinada a reducir el rendimiento gradualmente durante el estrés térmico en lugar de activar un apagado.

Un diseño de unidad de disco sin backplane crea dominios de falla más pequeños, mientras que las unidades de arranque extraíbles y los procedimientos de reemplazo guiados están destinados a reducir el tiempo de mantenimiento. Los clientes pueden configurar el tipo de chasis, la memoria, la capacidad de la unidad y la cuenta de la unidad, con despliegues que van desde menos de un petabyte hasta más de 100 petabytes.

Construyendo un ecosistema alrededor de las fábricas de IA

Los anuncios de socios que lo acompañan sugieren que la plataforma llegará a los clientes a través de integradores de infraestructura, proveedores de nube y proveedores de orquestación de IA.

Spectro Cloud está posicionando NeuralMesh como una capa de datos que se puede combinar con PaletteAI para implementar y operar fábricas de IA empresariales. World Wide Technology y Computacenter planean incorporar los sistemas en proyectos de infraestructura más amplios, mientras que Glocomp destacó la demanda de los clientes de un mejor rendimiento de IA y costos de infraestructura más predecibles.

Esta estrategia de ecosistema es importante porque la mayoría de las organizaciones no están ensamblando entornos de producción de IA a partir de un solo proveedor.

Un despliegue típico puede incluir GPU, redes, almacenamiento, software de modelado, observabilidad, seguridad y productos de gobernanza de múltiples proveedores. Las configuraciones validadas conjuntamente pueden reducir el trabajo de integración, aunque los clientes aún necesitarán probar el rendimiento utilizando sus propios modelos, conjuntos de datos, redes y requisitos de concurrencia.

Qué significa esto para la infraestructura de IA

El aspecto más importante del anuncio no es ningún número de capacidad o rendimiento individual. Es la creciente convergencia del almacenamiento, la caché distribuida, la gestión de memoria, la movilidad de datos y el aislamiento de inquilinos.

A medida que los agentes de IA conservan historias más largas, acceden a más información empresarial y operan continuamente, la infraestructura que rodea las GPU determinará cada vez más el costo de cada respuesta útil.

Agregar más aceleradores no resolverá los cuellos de botella causados por el procesamiento de contexto repetido, el movimiento de datos lento, los protocolos fragmentados o la capacidad de almacenamiento subutilizada. La próxima fase de la infraestructura de IA dependerá tanto de alimentar y gestionar las GPU de manera eficiente como de aumentar la computación bruta.

NeuralMesh 6 está programado para estar disponible generalmente durante la segunda mitad de 2026, con los clientes existentes elegibles para actualizar a través del canal de software estándar. Los nuevos sistemas WEKApod Nitro, Prime y Prime Max están disponibles para pedir, con entregas esperadas para comenzar en el otoño de 2026.

Antoine es un líder visionario y socio fundador de Unite.AI, impulsado por una pasión inquebrantable por dar forma y promover el futuro de la IA y la robótica. Como empresario serial, cree que la IA será tan disruptiva para la sociedad como la electricidad, y a menudo se le escucha hablando con entusiasmo sobre el potencial de las tecnologías disruptivas y la AGI.

Como futurista, está dedicado a explorar cómo estas innovaciones darán forma a nuestro mundo. Además, es el fundador de Securities.io, una plataforma enfocada en invertir en tecnologías de vanguardia que están redefiniendo el futuro y remodelando sectores enteros.