Modelos y plataformas de IA

Cerebras informa un aumento de 5 veces en el rendimiento de inferencia gracias a la desagregación

mm
Añade Unite.AI a tus fuentes preferidas en Google

Cerebras Systems dijo el 1 de octubre de 2026 que incrementó el rendimiento de inferencia 5 veces en resultados preliminares usando una técnica llamada desagregación, con el mismo número de sistemas Cerebras y sin pérdida en la velocidad de generación de tokens. La divulgación apareció en Inferencia desagregada desde cero, una publicación del blog de la empresa escrita por Isaac Tai y Zhenwei Gao que inicia una serie planificada sobre el tema.

La publicación enmarca la serie para lectores que han escuchado el término desagregación, o la afirmación de que el prellenado está limitado por el cómputo y la decodificación por la memoria, y se preguntan qué significa realmente cada uno. Construye la explicación desde cero, comenzando con cómo los aceleradores equilibran la aritmética con el movimiento de datos.

El prellenado y la decodificación imponen demandas diferentes al hardware

La publicación define la intensidad aritmética como el número de operaciones de punto flotante dividido por la cantidad de bytes transferidos entre la memoria y las unidades de cómputo de un acelerador. En uno de sus ejemplos, sumar dos matrices realiza 1 FLOP por cada 6 bytes movidos, una intensidad aritmética de 0,167 FLOP por byte, y esa relación se mantiene constante a medida que las matrices crecen. La multiplicación de matrices se comporta de manera diferente: cada valor de salida se construye a partir de una fila completa de una entrada y una columna completa de la otra, de modo que los valores cargados contribuyen a más salidas y la intensidad aritmética aumenta con el tamaño de la entrada.

La publicación explica que la inferencia es una cadena de esas multiplicaciones de matrices entre los pesos fijos de un modelo y sus tokens de entrada, y se ejecuta en dos fases con perfiles de intensidad diferentes. Durante el prellenado, todo el prompt se procesa en paralelo como una gran operación matricial, y los prompts del mundo real pueden contener miles o incluso cientos de miles de tokens. Durante la decodificación, los tokens se generan uno a la vez, y el modelo depende de la caché KV, que almacena claves y valores calculados para tokens anteriores de modo que se reutilizan en lugar de volver a calcularse.

Ambas fases aún deben mover todos los pesos del modelo, potencialmente cientos de gigabytes o terabytes, a las unidades de cómputo para cada token generado. La publicación muestra que el movimiento de memoria se mantiene casi constante mientras la intensidad aritmética disminuye después del prellenado, y cita esa brecha como la razón por la cual añadir capacidad de cómputo bruto no necesariamente hace que los tokens lleguen más rápido durante la decodificación.

La desagregación divide la inferencia en grupos separados

En producción, un servidor de inferencia suele gestionar muchas solicitudes simultáneamente, y cuando el prellenado y la decodificación se ejecutan en el mismo hardware, el prellenado intensivo en cómputo puede retrasar las solicitudes de decodificación activas. Los planificadores deben entonces elegir entre atender rápidamente nuevas solicitudes hasta su primer token, mantener las respuestas activas transmitiéndose sin problemas y maximizar el rendimiento total. El procesamiento por lotes permite que las solicitudes concurrentes compartan el trabajo de leer los pesos del modelo, pero lotes más grandes pueden hacer que cada paso de decodificación tome más tiempo, de modo que el rendimiento total puede aumentar mientras cada usuario recibe tokens más lentamente.

La publicación describe la desagregación como un patrón de diseño de sistemas que ejecuta las dos fases en grupos de hardware separados. Una vez que las etapas están separadas, los operadores pueden asignar hardware, establecer políticas de procesamiento por lotes y priorizar la latencia o el rendimiento para cada etapa de forma independiente: un sistema con objetivos estrictos de tiempo al primer token puede reservar más capacidad para el prellenado, mientras que uno diseñado para una transmisión fluida puede asignar a la decodificación un grupo más grande o con una programación más ajustada. Los grupos también pueden escalarse individualmente.

La separación introduce un nuevo requisito. Después de que el prellenado construye la caché KV, ese estado específico de la solicitud debe transferirse al grupo de decodificación, donde se carga en memoria antes de que la generación pueda continuar, mientras que los pesos del modelo ya están cargados en ambos grupos. La publicación señala que la transferencia agrega sobrecarga de red y coordinación, que cualquiera de los grupos puede permanecer inactivo si las capacidades no coinciden con la demanda, y que la latencia adicional depende de si la caché se mueve entre máquinas co‑ubicadas o entre regiones. Argumenta que la desagregación resulta más atractiva a gran escala, donde los beneficios de dimensionar y programar los grupos de forma independiente pueden superar los costos de transferencia y operación, y que cambia la interfaz de control del sistema de servicio en lugar de solo suavizar la transmisión.

Hardware heterogéneo, resultados preliminares y asociaciones

Cerebras dijo que lidera el desarrollo de la desagregación heterogénea, combinando varios tipos de chips en un único sistema de inferencia y asignando hardware diferente a los segmentos que están limitados por la memoria o por el cómputo. La publicación contrasta el diseño a escala de oblea de la compañía, que distribuye SRAM junto al cómputo en toda la oblea, con las GPU, que organizan los datos del modelo desde la memoria de gran ancho de banda a través de memorias y cachés más pequeñas en el chip.

Un gráfico de ancho de banda máximo de memoria publicado en la publicación, con fecha 10 de septiembre de 2026, enumera la SRAM integrada en el Cerebras WSE-3 en 21 000 TB/s por oblea, junto a un acelerador de SRAM integrado sin nombre en 150 TB/s y GPUs HBM4 en 23,3 y 22 TB/s. El gráfico advierte que las cifras de SRAM suman el ancho de banda de memoria local a lo largo de un procesador, mientras que las cifras de HBM miden el tráfico desde la memoria externa, por lo que los valores describen niveles de memoria diferentes en lugar de velocidades de token medidas.

La publicación también reproduce datos de Artificial Analysis del 10 de septiembre de 2026 para GPT-oss-120B ejecutando razonamiento avanzado con 10 000 tokens de entrada. Enumera a Cerebras con 1 669 tokens de salida por segundo, a SambaNova con 708, a Groq con 475, a Microsoft Azure con 319, a Nebius con 294 y a Baseten con 293.

Cerebras afirmó que, en un sistema tradicional agregado, aumentar la capacidad implicaba desplegar más hardware, y que al aprovechar aceleradores de socios para gestionar el procesamiento de prompts incrementó la capacidad 5 veces en pruebas iniciales con la misma huella de WSE. La empresa dijo que ha anunciado alianzas con varios socios de hardware para llevar al mercado más tokens ultrarrápidos, y un diagrama en la publicación muestra los sistemas AWS Trainium y AMD Helios Instinct GPU entre las opciones de hardware de pre‑relleno que alimentan un pool de decodificación de Cerebras.

La publicación identifica las aplicaciones agente como un ajuste convincente para la desagregación heterogénea, ya que a menudo implican flujos de trabajo largos y de múltiples turnos en los que el contexto crece a través de llamadas al modelo y los retrasos en cada paso se acumulan. Cerebras dijo que las próximas entregas cubrirán las pilas de hardware y software involucradas y los compromisos económicos de desplegar inferencia desagregada a gran escala.

Theo Nash es un especialista generado por IA en Unite.AI, cubriendo la infraestructura de IA, el cómputo y los sistemas de hardware que impulsan la inteligencia artificial moderna. Su trabajo se centra en los fundamentos técnicos detrás de cargas de trabajo de IA a gran escala, incluidos los centros de datos, los aceleradores, la conectividad y las pilas de software que los integran.

Con una perspectiva analítica y orientada a la ingeniería, Theo examina cómo los avances en GPUs, silicio personalizado, arquitecturas de memoria y sistemas distribuidos permiten nuevas generaciones de modelos de IA. Presta especial atención a los compromisos de rendimiento, la eficiencia energética, la escalabilidad y las limitaciones prácticas que moldean el despliegue real de la infraestructura de IA.

Los artículos escritos por Theo Nash son generados por IA y revisados por el equipo editorial de Unite.AI para garantizar la precisión técnica, la claridad y una cobertura responsable del panorama de cómputo de IA, que evoluciona rápidamente.