Modelos e plataformas de IA
Cerebras Executa o GPT-5.6 Sol da OpenAI a 750 Tokens por Segundo no Novo Nível Ultrafast

A Cerebras (CBRS ) agora está executando o modelo principal da OpenAI em uma velocidade que nenhuma nuvem de GPU igualou publicamente. Em 13 de agosto de 2026, a fabricante de chips em escala de wafer anunciou que ela alimenta o GPT-5.6 Sol em um novo nível de serviço da OpenAI chamado Ultrafast, oferecendo até 750 tokens de saída por segundo e, segundo a OpenAI, executando o modelo até 14× mais rápido que o processamento Standard. O Ultrafast é lançado inicialmente na API da OpenAI como uma pré‑visualização limitada para um grupo seleto de clientes, com acesso se expandindo à medida que a capacidade cresce.
A afirmação central é específica: inteligência de fronteira sem a penalidade de velocidade. O GPT-5.6 Sol é o modelo mais avançado da OpenAI e, no silício da Cerebras, gera tokens rápido o suficiente para ser incorporado a produtos em tempo real, em vez de ficar atrás de um processamento em lote noturno. Ambas as empresas apresentam o nível como a eliminação do trade‑off entre um modelo inteligente o bastante para trabalhos críticos e um modelo rápido o bastante para ser usado enquanto o trabalho ainda está em andamento.
Os Números de Velocidade por Trás do Ultrafast
O número de 750 tokens de saída por segundo é o destaque, mas as comparações mais reveladoras são os testes lado a lado publicados pela Cerebras. Em relação às velocidades de saída reportadas pela Artificial Analysis, a empresa afirma que o GPT-5.6 Sol no Ultrafast funciona 11× mais rápido que o Claude Fable 5 e 5× mais rápido que o Opus 4.8 no modo Fast.
A Cerebras também submeteu o nível a uma passagem completa do Humanity’s Last Exam, um benchmark de 2.500 questões com dificuldade de nível de doutorado. O GPT-5.6 Sol no Ultrafast respondeu todas as 2.500 perguntas em 11 horas e 11 minutos; o Claude Fable 5 precisou de 78 horas e 27 minutos para chegar a conclusões comparáveis: quase 7× mais lento, segundo a Cerebras. No GDP‑Val, um benchmark para trabalho de conhecimento economicamente valioso, a empresa relata um ganho de velocidade de 5,6× de ponta a ponta em relação ao processamento Standard, sem degradação de qualidade.
Essas são avaliações realizadas pelo fornecedor, e a Cerebras deixa isso explícito: a comparação do Humanity’s Last Exam foi benchmarkada pela Cerebras em 10 de julho e de 13 a 15 de julho de 2026, e o dado do GDP‑Val provém de seus próprios testes de 31 de julho de 2026. Considere-os como medições da própria empresa, não como resultados independentes.
Por que o Chip em Escala de Wafer Ganha em Latência
O mecanismo é importante aqui, pois explica por que uma fabricante de chips relativamente pequena está atendendo ao maior modelo da OpenAI em velocidades que os concorrentes baseados em GPU não conseguiram igualar. A inferência rápida em um modelo grande é fundamentalmente um problema de movimentação de dados: nas GPUs, os pesos do modelo precisam ser transferidos repetidamente entre a memória on‑chip e o armazenamento off‑chip para gerar cada token sucessivo, e a largura de banda da memória torna‑se o gargalo.
A resposta da Cerebras é eliminar esse movimento. Seu Wafer‑Scale Engine incorpora 44 GB de SRAM em um único chip do tamanho de um wafer, de modo que os pesos do modelo permanecem on‑chip e os tokens fluem através das camadas em pipeline entre wafers sem interrupção. Como os pesos nunca deixam o silício, a abordagem escala com o tamanho do modelo — que é o argumento da empresa de que a vantagem de velocidade se mantém à medida que os modelos de fronteira crescem. Em termos de economia de inferência, esse é o ponto central: o custo e a latência de servir um modelo são dominados pela rapidez com que você pode alimentar os pesos ao processamento, e manter 44 GB residentes em um único die ataca isso diretamente.
Uma Parceria de US$ 10 Bilhões Alcança o Modelo Principal
O Ultrafast é o produto mais visível até agora de um relacionamento que vem se desenvolvendo há meses. A OpenAI recorreu à Cerebras para US$ 10 bilhões em computação de baixa latência no início de 2026, e este lançamento coloca essa capacidade por trás do modelo principal da empresa, em vez de um modelo menor ou especializado. A OpenAI descreve o Ultrafast como “o próximo passo” na parceria para levar inferência ultra‑baixa latência à sua plataforma.
Para a Cerebras, essa posição é significativa. A startup tem argumentado há muito tempo que sua arquitetura em escala de wafer é a forma ideal para inferência, mesmo com o centro de gravidade do mercado concentrado nos fornecedores de GPU — uma disputa que se desenrola em todo o negócio de aceleradores à medida que os incumbentes avançam para incorporar modelos diretamente em seu silício. Conquistar a camada de serviço para o modelo principal da OpenAI fornece à Cerebras uma conta de referência de produção no topo do mercado. O próprio modelo ancora a família GPT-5.6 lançada pela OpenAI (Sol como o principal, ao lado do equilibrado Terra e do econômico Luna), de modo que o Ultrafast coloca a Cerebras na frente dessa linha.
Quem Recebe e Para Que Serve
A OpenAI está posicionando o nível para trabalhos sensíveis ao tempo e de alto risco: resposta a incidentes enquanto uma interrupção ainda está ocorrendo, pesquisa financeira enquanto as condições de mercado mudam, suporte ao cliente e voz em tempo real, comércio e ciclos de pesquisa ao vivo que antes eram executados durante a noite. O acesso inicial foi concedido a empresas nos setores de codificação, comércio e finanças, incluindo Jane Street, Podium, Basis e Rogo.
“O aumento de velocidade trazido pela Cerebras é impressionante”, disse John Crepezzi, AI Assistants na Jane Street, no anúncio da OpenAI. “Ele possibilita diferentes formas de usar os modelos e torna prático para os desenvolvedores trabalhar de maneira mais focada e produtiva ao lado deles.”
A OpenAI está mantendo o lançamento restrito de propósito. A empresa afirma que está usando o período de pré‑visualização para descobrir onde uma mudança de velocidade de ordem de magnitude gera mais valor, e expandirá o acesso à medida que a capacidade cresce. Tanto a OpenAI quanto a Cerebras estão aceitando inscrições para atualizações à medida que a pré‑visualização se amplia.
O Que Vem a Seguir
O que se observa a curto prazo é a capacidade, não a capacidade funcional. O Ultrafast é uma pré‑visualização limitada, e ambas as empresas vinculam qualquer disponibilidade mais ampla ao crescimento de capacidade, e não a uma data fixa — portanto, o ritmo de expansão é o que deve ser acompanhado. A questão mais ampla é se a vantagem da memória on‑chip da Cerebras se mantém à medida que os modelos da OpenAI escalam, que é exatamente a aposta sobre a qual a arquitetura em escala de wafer foi construída.












