Parcerias

Crusoe assina acordo de vários anos para impulsionar o treinamento e a inferência da Perplexity

mm
Adicione Unite.AI às suas fontes preferidas no Google

Crusoe, em 15 de setembro de 2026, anunciou uma parceria de vários anos com Perplexity, sob a qual Perplexity executará todo o ciclo de vida de seus modelos na Crusoe Cloud, treinando modelos de ponta em clusters dedicados NVIDIA GB300 NVL72 e servindo-os em produção por meio do serviço Managed Inference da Crusoe.

O anúncio, datado de São Francisco, também compromete a Crusoe a adotar o Perplexity Enterprise Pro e Max para seus 1.800 funcionários. Segundo o comunicado, a implantação tem o objetivo de equipar a equipe com busca de conhecimento na web e interna, pesquisa em múltiplas etapas, análise de dados e acesso a modelos de IA de ponta.

O comunicado caracteriza os produtos da Perplexity como operando em tempo real para milhões de usuários, um ambiente em que a latência e a taxa de transferência da inferência são o produto, e não apenas métricas teóricas. Crusoe afirmou que seu serviço Managed Inference foi desenvolvido para inferência de nível de produção, impulsionado por otimizações proprietárias e projetado para desempenho e custo em diversos modelos populares, e que a Crusoe Cloud oferece a profundidade operacional e a escala necessárias para acompanhar o crescimento da Perplexity.

Declarações Executivas

Chase Lochmiller, cofundador e CEO da Crusoe, disse que as empresas de IA que se movem mais rápido precisam de infraestrutura que acompanhe todo o ciclo de vida do modelo e escale com elas à medida que crescem. “A Perplexity está construindo o futuro de como as pessoas encontram respostas, e a Crusoe é um parceiro fundamental para tornar isso possível, do primeiro elétron ao último token”, disse Lochmiller.

Aravind Srinivas, cofundador e CEO da Perplexity, afirmou que operar IA na escala da Perplexity significa que cada milissegundo de latência é percebido pelos usuários. Ele descreveu a Crusoe como construída em torno dessa restrição, chamando-a de inferência de alta taxa de transferência e baixa latência, sustentada por hardware de próxima geração.

Dion Harris, diretor sênior de Soluções de Infraestrutura HPC e IA na NVIDIA, afirmou que a IA moderna requer uma arquitetura de computação unificada, da pesquisa à implantação. Alimentada pelo NVIDIA GB300 NVL72 e NVIDIA InfiniBand, Harris disse que a Crusoe Cloud permite que a Perplexity treine, ajuste finamente e sirva modelos de ponta em produção com a velocidade e eficiência que a IA agente exige.

A Plataforma GB300 NVL72

Os clusters de treinamento dedicados mencionados no acordo operam com o GB300 NVL72 da NVIDIA, que NVIDIA descreve como um sistema totalmente refrigerado a líquido, de escala de rack, integrando 72 GPUs Blackwell Ultra e 36 CPUs Grace baseadas em Arm. As especificações publicadas pela NVIDIA listam 130 TB/s de largura de banda NVLink, 20 TB de memória GPU com até 576 TB/s de largura de banda, 37 TB de memória rápida e 2.592 núcleos de CPU Arm Neoverse V2. Cada GPU do sistema recebe 800 Gb/s de conectividade de rede por meio de um módulo de I/O ConnectX-8 SuperNIC, funcionando com as plataformas de rede Quantum‑X800 InfiniBand ou Spectrum‑X Ethernet.

A NVIDIA afirma que as fábricas de IA construídas sobre o GB300 NVL72 proporcionam até 50 vezes mais desempenho geral de produção de IA em comparação com plataformas baseadas em Hopper. A empresa atribui esse número a uma melhoria declarada de 10 vezes na responsividade do usuário, medida em tokens por segundo por usuário, e a uma melhoria de 5 vezes na taxa de transferência por megawatt em relação ao Hopper, observando que os números são projeções de desempenho sujeitas a alterações.

Serviço de Inferência Gerenciada e Histórico

O elemento de produção do acordo funciona no Managed Inference da Crusoe, que a empresa tornou disponível ao público em 20 de novembro de 2025, para cargas de trabalho de inferência de produção na Crusoe Cloud. O serviço é alimentado pelo motor de inferência proprietário da Crusoe, construído em torno do MemoryAlloy, um cache de chave‑valor em todo o cluster que elimina preenchimentos duplicados ao permitir que GPUs busquem caches de prefixo de nós locais e remotos. A Crusoe afirma que o motor oferece até 9,9 vezes mais rapidez no tempo até o primeiro token e 5 vezes maior taxa de transferência, comparado ao vLLM para o modelo Llama‑3.3‑70B em uma implantação de quatro nós.

A Crusoe oferece o serviço em três opções de implantação, de acordo com sua página do produto Managed Inference. O Serverless Inference oferece consumo baseado em uso de modelos abertos por meio de uma API totalmente gerenciada, direcionado a cargas de trabalho em estágio inicial, tráfego de baixo volume e experimentação rápida. As implantações Self‑Serve, que a página indica já estar disponíveis ao público, executam modelos otimizados para taxa de transferência ou responsividade, incluindo modelos personalizados com o Serverless Fine‑Tuning da Crusoe. As implantações Tailored combinam clientes com a equipe da Crusoe para um endpoint dedicado e benchmarkado, uma opção que a página direciona a modelos proprietários.

Os desenvolvedores acessam o serviço por meio do Crusoe Intelligence Foundry, um hub onde podem gerar chaves de API, usar endpoints gerenciados ajustados para cada modelo, monitorar métricas de desempenho e habilitar taxa de transferência provisionada para implantações em escala de produção. O hub de modelos da Crusoe lista modelos abertos pré‑configurados de laboratórios incluindo DeepSeek, Google, Z.ai, OpenAI, Meta, Alibaba e NVIDIA, com contagens de parâmetros e comprimentos de contexto declarados para cada modelo.

Theo Nash é um especialista em AI gerado pela Unite.AI, cobrindo infraestrutura de AI, computação e os sistemas de hardware que alimentam a inteligência artificial moderna. Seu trabalho se concentra nas fundações técnicas por trás das cargas de trabalho de AI em larga escala, incluindo centros de dados, aceleradores, redes e as pilhas de software que os unem.
Com uma perspectiva analítica e orientada por engenharia, Theo examina como os avanços em GPUs, silício personalizado, arquiteturas de memória e sistemas distribuídos permitem novas gerações de modelos de AI. Ele presta atenção especial às trocas de desempenho, eficiência energética, escalabilidade e às restrições práticas que moldam a implantação real da infraestrutura de AI.
Os artigos escritos por Theo Nash são gerados por AI e revisados pela equipe editorial da Unite.AI para garantir a precisão técnica, clareza e cobertura responsável do paisagem de computação de AI em rápida evolução.