Modelos e plataformas de IA
Cerebras relata ganho de 5X na taxa de inferência por meio da desagregação

A Cerebras Systems afirmou em 1 de outubro de 2026 que aumentou a taxa de inferência em 5 vezes nos primeiros resultados usando uma técnica chamada desagregação, com o mesmo número de sistemas Cerebras e sem perda na velocidade de geração de tokens. A divulgação apareceu em Inferência Desagregada Desde o Início, um post de blog da empresa escrito por Isaac Tai e Zhenwei Gao que inicia uma série planejada sobre o assunto.
O post enquadra a série para leitores que já ouviram o termo desagregação, ou a afirmação de que o pré-preenchimento é limitado por computação e a decodificação é limitada por memória, e se perguntam o que cada um realmente significa. Ele constrói a explicação a partir do zero, começando com a forma como os aceleradores equilibram operações aritméticas e movimentação de dados.
Pré‑preenchimento e Decodificação Impõem Demandas Diferentes ao Hardware
O post define intensidade aritmética como o número de operações de ponto flutuante dividido pelo número de bytes transferidos entre a memória e as unidades de cálculo de um acelerador. Em um de seus exemplos, somar duas matrizes realiza 1 FLOP para cada 6 bytes movimentados, resultando em uma intensidade aritmética de 0,167 FLOP por byte, e essa proporção permanece constante à medida que as matrizes aumentam. A multiplicação de matrizes se comporta de forma diferente: cada valor de saída é construído a partir de uma linha inteira de uma entrada e de uma coluna inteira da outra, de modo que os valores carregados contribuem para mais saídas e a intensidade aritmética cresce com o tamanho da entrada.
O post explica que inferência é uma cadeia dessas multiplicações de matrizes entre os pesos fixos de um modelo e seus tokens de entrada, e que ela ocorre em duas fases com perfis de intensidade diferentes. Durante o pré‑preenchimento, todo o prompt é processado em paralelo como uma grande operação matricial, e prompts do mundo real podem conter milhares ou até centenas de milhares de tokens. Durante a decodificação, os tokens são gerados um de cada vez, e o modelo depende do cache KV, que armazena chaves e valores calculados para tokens anteriores, permitindo que sejam reutilizados em vez de recalculados.
Ambas as fases ainda precisam mover todos os pesos do modelo, potencialmente centenas de gigabytes ou terabytes, para as unidades de cálculo a cada token gerado. O post mostra que o movimento de memória permanece quase constante enquanto a intensidade aritmética diminui após o pré‑preenchimento, e cita essa diferença como a razão pela qual aumentar a capacidade de computação bruta não garante que os tokens cheguem mais rapidamente durante a decodificação.
Desagregação Divide a Inferência em Pools Separados
Em produção, um servidor de inferência normalmente lida com muitas solicitações simultaneamente, e quando o pré‑preenchimento e a decodificação são executados no mesmo hardware, o pré‑preenchimento intensivo em computação pode atrasar solicitações de decodificação ativas. Os escalonadores então precisam escolher entre atender rapidamente novos pedidos até seu primeiro token, manter as respostas ativas fluindo suavemente e maximizar a taxa total de transferência. O agrupamento permite que solicitações concorrentes compartilhem o trabalho de leitura dos pesos do modelo, mas lotes maiores podem fazer com que cada etapa de decodificação demore mais, de modo que a taxa total de transferência pode aumentar enquanto cada usuário recebe tokens mais lentamente.
O post descreve a desagregação como um padrão de design de sistemas que executa as duas fases em pools de hardware separados. Uma vez que as etapas são separadas, os operadores podem alocar hardware, definir políticas de agrupamento e priorizar latência ou taxa de transferência para cada fase de forma independente: um sistema com metas rigorosas de tempo até o primeiro token pode reservar mais capacidade para o pré‑preenchimento, enquanto um sistema focado em streaming contínuo pode destinar à decodificação um pool maior ou mais rigidamente agendado. Os pools também podem ser dimensionados individualmente.
A separação introduz um novo requisito. Após o pré‑preenchimento construir o cache KV, esse estado específico da solicitação deve ser transferido para o pool de decodificação, onde é carregado na memória antes que a geração possa continuar, enquanto os pesos do modelo já estão carregados em ambos os pools. O post observa que a transferência adiciona sobrecarga de rede e coordenação, que qualquer pool pode ficar ocioso se as capacidades não corresponderem à demanda, e que a latência adicional depende de o cache ser movido entre máquinas co‑localizadas ou entre regiões. Argumenta‑se que a desagregação é mais atraente em grande escala, onde os ganhos ao dimensionar e agendar os pools de forma independente podem superar os custos de transferência e operação, e que ela altera a interface de controle do sistema de serviço em vez de apenas suavizar o streaming.
Hardware Heterogêneo, Resultados Iniciais e Parcerias
A Cerebras afirmou que está liderando o desenvolvimento de desagregação heterogênea, combinando vários tipos de chips em um único sistema de inferência e atribuindo hardware diferente aos segmentos que são limitados por memória ou por computação. O post contrapõe o design em escala de wafer da empresa, que distribui SRAM junto com a computação por todo o wafer, com as GPUs, que organizam os dados do modelo da memória de alta largura de banda através de memórias menores on‑chip e caches.
Um gráfico de pico de largura de banda de memória publicado no post, datado de 10 de setembro de 2026, lista a SRAM on‑chip do Cerebras WSE‑3 em 21.000 TB/s por wafer, ao lado de um acelerador de SRAM on‑chip não nomeado em 150 TB/s e GPUs HBM4 em 23,3 e 22 TB/s. O gráfico alerta que os valores de SRAM somam a largura de banda de memória local em todo o processador, enquanto os valores de HBM medem o tráfego da memória fora do chip, de modo que os números descrevem diferentes camadas de memória ao invés de velocidades de token medidas.
A publicação também reproduz dados da Artificial Analysis de 10 de setembro de 2026 para o GPT-oss-120B executando raciocínio avançado com 10.000 tokens de entrada. Ela lista a Cerebras em 1.669 tokens de saída por segundo, a SambaNova em 708, a Groq em 475, a Microsoft Azure em 319, a Nebius em 294 e a Baseten em 293.
A Cerebras afirmou que, em um sistema agregado tradicional, aumentar a capacidade exigia a implantação de mais hardware, e que ao aproveitar aceleradores de parceiros para lidar com o processamento de prompts, aumentou a capacidade em 5 vezes nos testes iniciais com a mesma pegada de WSE. A empresa disse que anunciou parcerias com vários parceiros de hardware para levar mais tokens ultrarrápidos ao mercado, e um diagrama na publicação mostra os sistemas AWS Trainium e AMD Helios Instinct GPU entre as opções de hardware de pré-preenchimento que alimentam um pool de decodificação da Cerebras.
A publicação identifica aplicações agentes como um ajuste atraente para a desagregação heterogênea, pois frequentemente envolvem fluxos de trabalho longos e de múltiplas interações, nos quais o contexto cresce entre chamadas de modelo e os atrasos em cada etapa se acumulam. A Cerebras disse que as próximas edições cobrirão as pilhas de hardware e software envolvidas e as compensações econômicas de implantar inferência desagregada em escala.












