Modelos e plataformas de IA
Cerebras Apresenta a Solução de Inferência de IA Mais Rápida do Mundo: 20 Vezes Mais Rápida a um Fração do Custo

Cerebras Systems (CBRS ), uma pioneira em computação de alta performance de IA, introduziu uma solução revolucionária que está prestes a revolucionar a inferência de IA. Em 27 de agosto de 2024, a empresa anunciou o lançamento da Cerebras Inference, o serviço de inferência de IA mais rápido do mundo. Com métricas de desempenho que superam as de sistemas baseados em GPU tradicionais, a Cerebras Inference entrega 20 vezes a velocidade a um fração do custo, estabelecendo um novo padrão em computação de IA.
Velocidade e Eficiência de Custo Sem Precedentes
A Cerebras Inference é projetada para entregar desempenho excepcional em vários modelos de IA, particularmente no segmento em rápida evolução de modelos de linguagem grande (LLMs). Por exemplo, ela processa 1.800 tokens por segundo para o modelo Llama 3.1 8B e 450 tokens por segundo para o modelo Llama 3.1 70B. Esse desempenho não é apenas 20 vezes mais rápido do que o de soluções baseadas em GPU da NVIDIA (NVDA ), mas também vem a um custo significativamente menor. A Cerebras oferece esse serviço a partir de apenas 10 centavos por milhão de tokens para o modelo Llama 3.1 8B e 60 centavos por milhão de tokens para o modelo Llama 3.1 70B, representando uma melhoria de 100x no preço-desempenho em comparação com as ofertas baseadas em GPU existentes.
Mantendo a Precisão ao Empurrar os Limites da Velocidade
Um dos aspectos mais impressionantes da Cerebras Inference é sua capacidade de manter a precisão de ponta enquanto entrega velocidade inigualável. Ao contrário de outras abordagens que sacrificam a precisão para a velocidade, a solução da Cerebras permanece no domínio de 16 bits durante toda a execução da inferência. Isso garante que os ganhos de desempenho não venham à custa da qualidade das saídas do modelo de IA, um fator crucial para os desenvolvedores focados na precisão.
Micah Hill-Smith, Co-Fundador e CEO da Artificial Analysis, destacou a importância desse feito: “A Cerebras está entregando velocidades uma ordem de magnitude mais rápidas do que as soluções baseadas em GPU para os modelos de IA Llama 3.1 8B e 70B da Meta. Estamos medindo velocidades acima de 1.800 tokens de saída por segundo no Llama 3.1 8B e acima de 446 tokens de saída por segundo no Llama 3.1 70B – um novo recorde nesses benchmarks.”
A Importância Crescente da Inferência de IA
A inferência de IA é o segmento de computação de IA de crescimento mais rápido, responsável por aproximadamente 40% do mercado total de hardware de IA. A introdução da inferência de IA de alta velocidade, como a oferecida pela Cerebras, é semelhante à introdução da internet de banda larga – desbloqueando novas oportunidades e anunciando uma nova era para as aplicações de IA. Com a Cerebras Inference, os desenvolvedores agora podem construir aplicações de IA de próxima geração que exigem desempenho complexo e em tempo real, como agentes de IA e sistemas inteligentes.
Andrew Ng, Fundador da DeepLearning.AI, enfatizou a importância da velocidade no desenvolvimento de IA: “A DeepLearning.AI tem várias workflows agênticas que exigem a ativação de um LLM repetidamente para obter um resultado. A Cerebras construiu uma capacidade de inferência impressionantemente rápida que será muito útil para essas cargas de trabalho.”

Amplo Suporte da Indústria e Parcerias Estratégicas
A Cerebras conquistou um forte apoio de líderes da indústria e formou parcerias estratégicas para acelerar o desenvolvimento de aplicações de IA. Kim Branson, SVP de AI/ML da GlaxoSmithKline, uma cliente precoce da Cerebras, enfatizou o potencial transformador dessa tecnologia: “Velocidade e escala mudam tudo.”
Outras empresas, como LiveKit, Perplexity e Meter, também expressaram entusiasmo pelo impacto que a Cerebras Inference terá em suas operações. Essas empresas estão aproveitando o poder das capacidades de computação da Cerebras para criar experiências de IA mais responsivas e humanas, melhorar a interação do usuário em mecanismos de busca e aprimorar sistemas de gerenciamento de rede.
Cerebras Inference: Níveis e Acessibilidade
A Cerebras Inference está disponível em três níveis competitivamente precificados: Grátis, Desenvolvedor e Empresarial. O nível Grátis fornece acesso gratuito à API com limites de uso generosos, tornando-a acessível a uma ampla gama de usuários. O nível Desenvolvedor oferece uma opção de implantação flexível e sem servidor, com modelos Llama 3.1 precificados em 10 centavos e 60 centavos por milhão de tokens. O nível Empresarial atende a organizações com cargas de trabalho sustentadas, oferecendo modelos personalizados, acordos de nível de serviço personalizados e suporte dedicado, com preços disponíveis mediante solicitação.
Alimentando a Cerebras Inference: O Wafer Scale Engine 3 (WSE-3)
No coração da Cerebras Inference está o sistema Cerebras CS-3, impulsionado pelo processador de IA de ponta Wafer Scale Engine 3 (WSE-3). Esse processador de IA é inigualável em tamanho e velocidade, oferecendo 7.000 vezes mais largura de banda de memória do que o H100 da NVIDIA. A escala maciça do WSE-3 permite que ele lidere com muitos usuários simultâneos, garantindo velocidades abrasadoras sem comprometer o desempenho. Essa arquitetura permite que a Cerebras evite as compensações que normalmente atormentam os sistemas baseados em GPU, fornecendo o melhor desempenho da classe para cargas de trabalho de IA.
Integração Sem Fio e API Amigável ao Desenvolvedor
A Cerebras Inference é projetada com os desenvolvedores em mente. Ela apresenta uma API que é totalmente compatível com a API de Conclusões de Chat da OpenAI, permitindo uma migração fácil com alterações mínimas de código. Essa abordagem amigável ao desenvolvedor garante que a integração da Cerebras Inference em fluxos de trabalho existentes seja o mais fácil possível, permitindo a implantação rápida de aplicações de IA de alta performance.
Sistemas Cerebras: Impulsionando a Inovação em Diversas Indústrias
A Cerebras Systems não é apenas uma líder em computação de IA, mas também um jogador-chave em várias indústrias, incluindo saúde, energia, governo, computação científica e serviços financeiros. As soluções da empresa foram instrumentais em impulsionar avanços em instituições como os Laboratórios Nacionais, Aleph Alpha, The Mayo Clinic e GlaxoSmithKline.
Ao fornecer velocidade, escalabilidade e precisão inigualáveis, a Cerebras está habilitando organizações em todo esses setores a lidar com alguns dos problemas mais desafiadores em IA e além. Seja acelerando a descoberta de drogas na saúde ou melhorando as capacidades computacionais na pesquisa científica, a Cerebras está à frente na condução da inovação.
Conclusão: Uma Nova Era para a Inferência de IA
A Cerebras Systems está estabelecendo um novo padrão para a inferência de IA com o lançamento da Cerebras Inference. Ao oferecer 20 vezes a velocidade dos sistemas baseados em GPU tradicionais a um fração do custo, a Cerebras não apenas está tornando a IA mais acessível, mas também está pavimentando o caminho para a próxima geração de aplicações de IA. Com sua tecnologia de ponta, parcerias estratégicas e compromisso com a inovação, a Cerebras está prestes a liderar a indústria de IA em uma nova era de desempenho e escalabilidade sem precedentes.
Para obter mais informações sobre a Cerebras Systems e experimentar a Cerebras Inference, visite www.cerebras.ai.












