Modelos e plataformas de IA
A Cerebras Executa o GPT-5.6 Sol da OpenAI a 750 Tokens Por Segundo em um Novo Nível Ultrafast

A Cerebras agora executa o modelo de bandeira da OpenAI a uma velocidade que nenhuma nuvem de GPU alcançou publicamente. Em 13 de agosto de 2026, o fabricante de chips de escala de wafer anunciou que impulsiona o GPT-5.6 Sol em um novo nível de serviço da OpenAI chamado Ultrafast, entregando até 750 tokens de saída por segundo e, de acordo com a conta da OpenAI, executando o modelo até 14× mais rápido do que o processamento padrão. O Ultrafast é lançado primeiro na API da OpenAI como uma visualização limitada para um grupo seleto de clientes, com acesso expandido à medida que a capacidade cresce.
A afirmação central é uma específica: inteligência de fronteira sem a penalidade de velocidade. O GPT-5.6 Sol é o modelo mais capaz da OpenAI, e no silício da Cerebras, gera tokens rapidamente o suficiente para ser colocado dentro de produtos em tempo real, em vez de atrás de um trabalho em lote noturno. Ambas as empresas enquadram o nível como removendo a compensação entre um modelo inteligente o suficiente para trabalhos de alto risco e um rápido o suficiente para ser usado enquanto o trabalho está acontecendo.
Os Números de Velocidade Por Trás do Ultrafast
O número de 750 tokens de saída por segundo é o destaque, mas as comparações mais reveladoras são as corridas head-to-head publicadas pela Cerebras. Contra as velocidades de saída relatadas pela Artificial Analysis, a empresa afirma que o GPT-5.6 Sol no Ultrafast executa 11× mais rápido do que o Claude Fable 5 e 5× mais rápido do que o Opus 4.8 no modo Fast.
A Cerebras também passou o nível por uma passagem completa do Exame Final da Humanidade, um benchmark de 2.500 perguntas com nível de dificuldade de PhD. O GPT-5.6 Sol no Ultrafast respondeu todas as 2.500 perguntas em 11 horas e 11 minutos; o Claude Fable 5 precisou de 78 horas e 27 minutos para alcançar conclusões comparáveis: quase 7× mais lento, de acordo com a Cerebras. No GDP-Val, um benchmark para trabalhos de conhecimento economicamente valiosos, a empresa relata uma aceleração de ponta a ponta de 5,6× sobre o processamento padrão sem degradação de qualidade.
Essas são avaliações realizadas pelo fornecedor, e a Cerebras é explícita sobre isso: a comparação do Exame Final da Humanidade foi benchmarkada pela Cerebras em 10 e 13-15 de julho de 2026, e a figura do GDP-Val vem de seu próprio teste de 31 de julho de 2026. Trate-as como as próprias medições da empresa, não como resultados independentes.
Por Que o Chip de Escala de Wafer Vence na Latência
O mecanismo importa aqui, porque explica por que um fabricante de chips relativamente pequeno está servindo o modelo mais importante da OpenAI a velocidades que os incumbentes de GPU não alcançaram. A inferência rápida em um modelo grande é fundamentalmente um problema de movimento de dados: nos GPUs, os pesos do modelo devem ser transportados repetidamente entre a memória no chip e o armazenamento fora do chip para gerar cada token sucessivo, e a largura de banda da memória se torna o gargalo.
A resposta da Cerebras é eliminar esse movimento. Seu Wafer-Scale Engine embala 44 GB de SRAM em um único chip de tamanho de wafer, então os pesos do modelo permanecem no chip e os tokens fluem através das camadas pipelineadas em wafers sem interrupção. Como os pesos nunca deixam o silício, a abordagem dimensiona com o tamanho do modelo — que é o argumento da empresa de que a vantagem de velocidade se mantém à medida que os modelos de fronteira crescem. Para a economia da inferência, isso é o jogo todo: o custo e a latência de servir um modelo são dominados por quão rápido você pode alimentar os pesos para o cálculo, e manter 44 GB residente em um único die ataca diretamente isso.
Uma Parceria de US$ 10 Bilhões Alcança a Bandeira
O Ultrafast é o produto mais visível até agora de uma relação que vem se construindo por meses. A OpenAI escolheu a Cerebras para US$ 10 bilhões em computação de baixa latência mais cedo em 2026, e este lançamento coloca essa capacidade atrás do modelo principal da empresa, em vez de um menor ou especializado. A OpenAI descreve o Ultrafast como “o próximo passo” na parceria para trazer inferência de baixa latência para sua plataforma.
Para a Cerebras, a colocação é significativa. A startup argumentou por muito tempo que sua arquitetura de escala de wafer é a forma certa para a inferência, mesmo enquanto o centro de gravidade do mercado está com os fornecedores de GPU — uma disputa que se desenrola por toda a indústria de aceleradores, enquanto os incumbentes se movem para incorporar modelos diretamente em seu silício. A colocação da camada de serviço para o modelo de bandeira da OpenAI dá à Cerebras uma conta de referência de produção no topo do mercado. O modelo em si ancora a família GPT-5.6 da OpenAI (Sol como a bandeira, ao lado do Terra equilibrado e do Luna eficiente em termos de custo), então o Ultrafast anexa a Cerebras à frente dessa linha.
Quem Obtém e Para Que Serve
A OpenAI está posicionando o nível para trabalhos sensíveis ao tempo e de alto risco: resposta a incidentes enquanto uma interrupção ainda está se desenrolando, pesquisa financeira enquanto as condições do mercado estão se movendo, suporte ao cliente em tempo real e voz, comércio e loops de pesquisa ao vivo que costumavam ser executados à noite. O acesso antecipado foi concedido a empresas em codificação, comércio e finanças, incluindo Jane Street, Podium, Basis e Rogo.
> “O aumento de velocidade trazido pela Cerebras é impressionante”, disse John Crepezzi, Assistente de IA da Jane Street, no anúncio da OpenAI. “Isso permite diferentes maneiras de usar os modelos e torna prático para os desenvolvedores trabalharem de forma mais focada e produtiva ao lado deles.”
A OpenAI está mantendo a rollout estreita por propósito. A empresa afirma que está usando o período de visualização para aprender onde uma mudança de velocidade de magnitude cria o maior valor e expandirá o acesso à medida que a capacidade cresce. Tanto a OpenAI quanto a Cerebras estão aceitando inscrições para atualizações à medida que a visualização se amplia.
O Que Acontece em Seguida
O observável de curto prazo é a capacidade, não a capacidade. O Ultrafast é uma visualização limitada, e ambas as empresas vinculam uma disponibilidade mais ampla ao crescimento da capacidade, em vez de uma data fixa — então o ritmo da expansão é o que importa. A pergunta mais longa é se a vantagem de memória no chip da Cerebras se mantém à medida que os modelos da OpenAI crescem, o que é exatamente a aposta que a arquitetura de escala de wafer é construída.












