Modelos e plataformas de IA

Cerebras Apresenta Qwen3‑235B: Uma Nova Era para Velocidade, Escala e Custo de IA

mm
Adicione Unite.AI às suas fontes preferidas no Google

Cerebras Systems (CBRS ) lançou oficialmente Qwen3‑235B, um modelo de IA de ponta com suporte de contexto de 131.000 tokens, estabelecendo um novo padrão de desempenho em raciocínio, geração de código e aplicações de IA em escala empresarial. Agora disponível por meio da Cerebras Inference Cloud, o modelo oferece capacidades que rivalizam com os sistemas de fronteira mais avançados — enquanto opera 30 vezes mais rápido e com um décimo do custo dos modelos de código fechado mais avançados de hoje.

Raciocínio de IA em Tempo Real atinge Velocidade de Quebra

O raciocínio de IA historicamente foi lento, com modelos grandes frequentemente levando um minuto ou mais para responder a consultas complexas. Cerebras elimina esse gargalo. Impulsionado por seu Wafer-Scale Engine 3 (WSE‑3) proprietário, Qwen3‑235B alcança 1.500 tokens por segundo, um recorde mundial para inferência de IA de fronteira.

Esse nível de desempenho transforma a experiência do usuário — reduzindo a latência de 60-120 segundos para apenas 0,6 segundos, mesmo ao processar tarefas de raciocínio avançado ou executar fluxos de trabalho de múltiplos passos, como geração aumentada de recuperação (RAG). De acordo com os resultados dos benchmarks da Artificial Analysis, nenhum outro fornecedor — aberto ou fechado — atualmente iguala essa velocidade de inferência para um modelo de fronteira.

Um Novo Padrão de Contexto: 131K Tokens para Aplicações do Mundo Real

Em conjunto com este lançamento, Cerebras expandiu a janela de contexto do modelo de 32K para os 131K tokens totalmente suportados pelo Qwen3‑235B. Esse salto no tamanho do contexto permite que o modelo ingira e raciocine sobre volumes massivos de dados — abrangendo código completo, repositórios de documentos e material técnico de longo prazo.

Enquanto 32K de contexto permite tarefas de geração básica, 131K abre a porta para desenvolvimento de produção. A IA agora pode funcionar como um colaborador de código profundo, sintetizando dezenas de arquivos e gerenciando dependências complexas em tempo real — tornando-a ideal para casos de uso empresariais em engenharia de software, análise de documentos e computação científica.

Por que Cerebras é Diferente: Hardware Projetado para IA desde o Início

Fundada por uma equipe de arquitetos de computador pioneiros, pesquisadores de IA e engenheiros de sistemas, Cerebras Systems adotou uma abordagem radicalmente diferente para resolver os desafios de escalabilidade de IA gerativa. Em vez de confiar em clusters de GPU, Cerebras construiu um supercomputador de IA específico em torno do seu próprio chip: o Wafer-Scale Engine 3.

Esse chip é único na indústria. Ele tem o tamanho de um prato de jantar e abriga centenas de milhares de núcleos otimizados para IA com memória no chip medida em dezenas de gigabytes. Esse design permite que o processamento e a memória fiquem lado a lado — eliminando a latência, as restrições de largura de banda e a complexidade de orquestração das soluções de multi-GPU tradicionais.

Ao agrupar seus sistemas CS-3, Cerebras pode criar supercomputadores de IA capazes de executar modelos de trilhão de parâmetros com facilidade, tudo enquanto evita a carga técnica de computação distribuída. Essa abordagem unificada é a base de suas velocidades de inferência recordes e do habilitador de novas capacidades de contexto.

Eficiência de MoE Permite Redução Dramática de Custo

Qwen3‑235B é construído usando uma arquitetura de mistura de especialistas (MoE) — um design de modelo que ativa apenas um subconjunto de especialistas internos dependendo da entrada, resultando em eficiência computacional drasticamente melhorada.

Devido a isso, Cerebras pode oferecer o modelo a um preço que reduz significativamente os custos em comparação com alternativas de código fechado. Especificamente, a inferência está disponível por $0,60 por milhão de tokens de entrada e $1,20 por milhão de tokens de saída, representando uma redução de mais de 90% no custo em comparação com modelos proprietários da OpenAI, Anthropic ou Google.

Integração Perfeita com Cline no VS Code

Para demonstrar a velocidade e a aplicação do mundo real do Qwen3‑235B, Cerebras se associou à Cline, o agente de codificação agente líder dentro do Microsoft Visual Studio Code, atualmente instalado por mais de 1,8 milhão de desenvolvedores.

Os usuários do Cline já podem acessar Qwen3‑32B com 64K de contexto como parte da camada gratuita. Com o anúncio de hoje, o suporte será expandido para incluir Qwen3‑235B e seu contexto completo de 131K, permitindo um nível de raciocínio e geração de código dentro do editor que nunca foi alcançado em tempo real.

Saoud Rizwan, CEO da Cline, explicou: “Com a inferência da Cerebras, os desenvolvedores que usam o Cline estão tendo um vislumbre do futuro, à medida que o Cline raciocina sobre problemas, lê código e escreve código em quase tempo real. Tudo acontece tão rápido que os desenvolvedores permanecem no fluxo, iterando à velocidade do pensamento. Esse tipo de inferência rápida não é apenas agradável — mostra-nos o que é possível quando a IA realmente acompanha os desenvolvedores.”

Uma Alternativa Aberta a Modelos Fechados

O desempenho do Qwen3‑235B é comparável ao de alguns dos modelos de IA mais sofisticados do mercado hoje, incluindo Claude 4 Sonnet, Gemini 2.5 Flash e DeepSeek R1, como validado por benchmarks independentes. No entanto, Cerebras fornece isso em um formato de acesso aberto, oferecendo transparência e portabilidade que os modelos fechados não possuem.

Essa abordagem de modelo aberto permite que as empresas:

  • Personalizem e ajustem em dados proprietários
  • Implantem IA em infraestrutura privada ou em ambientes de nuvem híbrida
  • Evitem o bloqueio de fornecedores e riscos de privacidade de dados

Combinação com a plataforma de nuvem escalável da Cerebras e implantação opcional no local dos sistemas CS-3, as organizações ganham controle total sobre como a IA é aplicada a tarefas críticas.

O que Isso Significa para a Indústria

O lançamento do Qwen3‑235B marca um ponto de inflexão. Cerebras redefiniu os limites do que é possível com grandes modelos de linguagem, combinando inteligência de fronteira com velocidade e eficiência de custo sem precedentes.

Agora é viável construir ferramentas de IA que:

  • Respondam em tempo real a consultas de desenvolvedores
  • Raciocinem sobre documentação completa ou bases de conhecimento
  • Gerem e depurem código de produção ao vivo dentro do IDE
  • Escalem para casos de uso empresariais sem sprawl de GPU ou contas de inferência mensais de seis dígitos

À medida que a demanda por infraestrutura de IA cresce, Cerebras demonstra que não é necessário comprometer entre desempenho, preço e abertura. Seu design de hardware e software, desde o Wafer-Scale Engine até a Cerebras Inference Cloud, aponta para um novo modelo de implantação de IA — um que é mais rápido, mais simples e muito mais acessível.

Pensamento Final

Ao lançar Qwen3‑235B com 131K de contexto, inferência ultra-rápida e preços de tokens acessíveis, Cerebras Systems posicionou-se como um dos únicos verdadeiros desafiantes dos incumbentes impulsionados por GPU. Para empresas, pesquisadores e desenvolvedores, esse lançamento é mais do que apenas um modelo mais rápido — é um ponto de inflexão que traz IA em tempo real, de produção e aberta ao alcance.

Antoine é um líder visionário e sócio-fundador da Unite.AI, impulsionado por uma paixão inabalável por moldar e promover o futuro da IA e da robótica. Um empreendedor serial, ele acredita que a IA será tão disruptiva para a sociedade quanto a eletricidade, e é frequentemente pego falando sobre o potencial das tecnologias disruptivas e da AGI.

Como um futurista, ele está dedicado a explorar como essas inovações moldarão nosso mundo. Além disso, ele é o fundador da Securities.io, uma plataforma focada em investir em tecnologias de ponta que estão redefinindo o futuro e remodelando setores inteiros.