Modelos e plataformas de IA
A WEKA Lança NeuralMesh 6 e WEKApod 3 à medida que a Infraestrutura de IA se Desloca em Direção à Inferência

WEKA introduziu uma revisão coordenada de software e hardware visando um dos problemas mais caros e emergentes da indústria de IA: manter as GPUs produtivas à medida que os modelos se movem do treinamento para a inferência contínua e em grande escala.
Os anúncios incluem NeuralMesh 6, uma atualização importante da plataforma de dados e memória da empresa, ao lado de aparelhos WEKApod de terceira geração projetados para nuvens de IA, desenvolvedores de modelos, organizações de pesquisa e empresas que operam infraestrutura de GPU.
Juntos, os lançamentos refletem uma mudança mais ampla no design da infraestrutura de IA, com o armazenamento evoluindo de um repositório passivo para uma camada de memória e entrega de dados ativa.
Um Empurrão Unificado para a Produção de IA
Os requisitos de infraestrutura da inferência de IA diferem consideravelmente dos da formação de modelos. Os trabalhos de treinamento geralmente processam grandes conjuntos de dados por meio de pipelines relativamente previsíveis. Sistemas de geração aumentada por recuperação, raciocínio de longo contexto e IA agente devem, em vez disso, acessar dados em mudança, manter o contexto em interações repetidas e suportar muitos usuários simultâneos sem deixar GPUs caras esperando por informações.
A resposta da WEKA é tratar armazenamento, extensão de memória, acesso a arquivos, acesso a objetos e movimento de dados como partes da mesma plataforma. NeuralMesh é projetado para fornecer uma base de dados compartilhada para treinamento, inferência e computação de alto desempenho em ambientes locais, nuvens públicas e implantações híbridas.
O novo lançamento expande essa arquitetura com multi-locatário, armazenamento de objetos nativo, cache distribuído, redução de dados automatizada, operações Kubernetes e observabilidade centralizada.
Em vez de posicionar os anúncios de software e aparelho como atualizações não relacionadas, a empresa os apresenta como duas partes do mesmo sistema. NeuralMesh 6 controla como os dados são armazenados, movidos, isolados e entregues, enquanto WEKApod 3 fornece hardware projetado em torno dessas funções.
NeuralMesh 6 Une Cargas de Trabalho de Arquivos e Objetos
Uma das adições mais consequenciais em NeuralMesh 6 é uma implementação nativa S3 executada em armazenamento NVMe. Os mesmos blocos de dados subjacentes podem ser acessados por meio de protocolos de objeto S3 e interfaces de sistema de arquivos POSIX ou de rede sem manter cópias separadas.
Isso importa porque as pipelines de IA frequentemente movem informações entre armazenamento de objetos, sistemas de arquivos de alto desempenho, ambientes de treinamento e clusters de inferência. Cada cópia consome capacidade, introduz atrasos e complica a governança. Um namespace unificado poderia permitir que os dados criados por meio de um protocolo se tornem imediatamente disponíveis por meio de outro.
A WEKA afirma que sua implementação suporta entre 2.000 e 5.000 conexões S3 concorrentes por nó. Ele também suporta S3 sobre Acesso Direto à Memória Remota, permitindo que os dados sejam movidos em direção à memória da GPU sem seguir o caminho convencional por meio de múltiplas camadas de CPU e sistema operacional.
A plataforma introduz dois níveis de multi-locatário. Clusters compostos alocam recursos de processador, memória e armazenamento dedicados a locatários individuais, enquanto a multi-locatário virtual fornece isolamento de rede, criptografia independente, autenticação separada e controles de qualidade de serviço por locatário.
Ambientes virtuais podem suportar mais de 1.000 locatários isolados por cluster, de acordo com a empresa. Combinar os modelos físicos e virtuais poderia permitir que um grande operador de infraestrutura suporte dezenas de milhares de clientes logicamente separados sem implantar um cluster de armazenamento independente para cada um.
Isso é particularmente relevante para provedores de GPU como serviço e nuvens de IA soberanas que precisam equilibrar alta utilização de infraestrutura com isolamento de cliente estrito.
Movendo Dados para Onde as GPUs Estão Disponíveis
NeuralMesh 6 também introduz replicação de metadados em primeiro lugar e cache remoto para cargas de trabalho de IA distribuídas por data centers, nuvens e regiões geográficas.
A replicação tradicional geralmente exige que um conjunto de dados inteiro seja copiado antes que uma carga de trabalho possa começar. NeuralMesh, em vez disso, torna os metadados do destino imediatamente visíveis e, em seguida, transfere os dados subjacentes à medida que são solicitados.
Isso poderia permitir que os operadores movam trabalhos em direção à capacidade de GPU disponível sem primeiro replicar todos os arquivos associados ao projeto. A abordagem pretende suportar a explosão de nuvem, infraestrutura de IA distribuída e colaboração entre equipes de pesquisa ou engenharia geograficamente separadas.
Isso também representa um passo inicial em direção a um modelo de namespace global no qual os dados podem ser endereçados consistentemente, independentemente de onde foram originalmente armazenados.
Outro recurso novo aplica impressão digital, hashing de semelhança, deduplicação e compressão continuamente, em vez de tratar a redução de dados como um processo de fundo opcional.
A WEKA afirma que NeuralMesh 6 pode fornecer até seis vezes mais economia de capacidade em dados de treinamento de IA com menos de 5% de sobrecarga de gravação. As reduções reais dependerão do conjunto de dados. Pontos de verificação, camadas de contêiner, versões de modelo e dados de treinamento iterativo podem conter repetição significativa, enquanto outros tipos de dados podem se comprimir menos eficazmente.
A empresa planeja analisar dados de clientes representativos antes do deploy e usar a estimativa resultante como parte de seus compromissos de capacidade e desempenho.
Transformando o Armazenamento em uma Camada de Memória de IA Estendida
NeuralMesh também incorpora WEKA’s Augmented Memory Grid, que usa armazenamento NVMe como uma extensão persistente da memória da GPU para inferência.
Modelos de linguagem grandes criam um cache de chave-valor contendo informações calculadas a partir de um prompt ou conversa. Para contextos longos e fluxos de trabalho agente, esse cache pode se tornar extremamente grande. Quando não pode permanecer na memória da GPU de alta largura de banda, os sistemas podem precisar descartá-lo, recalculá-lo ou movê-lo para infraestrutura mais lenta.
Augmented Memory Grid armazena esse cache em uma camada persistente com suporte NVMe e usa Acesso Direto à Memória Remota e Armazenamento GPUDirect da NVIDIA (NVDA ) para movê-lo de volta para as GPUs.
O objetivo é preservar o contexto reutilizável enquanto reduz a computação de pré-preenchimento repetida, uma das etapas mais intensivas em recursos da inferência de longo contexto.
A WEKA relata que testes na Oracle Cloud Infrastructure usando GPUs H100 da NVIDIA produziram dez vezes mais throughput de token, dez vezes mais usuários simultâneos e sete vezes mais tokens por GPU.
Esses números são benchmarks específicos de carga de trabalho e não expectativas de desempenho universais, mas ilustram por que a gestão de cache persistente está se tornando uma parte importante do design da infraestrutura de inferência.
WEKApod 3 Assume o Controle da Camada de Hardware
Enquanto os sistemas WEKApod anteriores combinavam software WEKA com infraestrutura pré-validada, a terceira geração se move mais para o design de sistema verticalmente integrado.
A WEKA projetou a nova estrutura de dois racks, interconexão de unidades, arquitetura de refrigeração, domínios de falha e sistema de serviço. Os aparelhos usam PCI Express Gen 6 internamente e conectividade de rede NVIDIA ConnectX para conexão com infraestrutura Ethernet Spectrum-X.
A família WEKApod agora consiste em três sistemas configuráveis. Nitro é otimizado para inferência e cargas de trabalho de fábrica de IA intensivas em largura de banda. Prime combina células de nível triplo e quádruplo com flash para equilibrar desempenho e capacidade. Prime Max prioriza a densidade de armazenamento máxima, cabendo até 70 unidades NVMe em uma estrutura de dois racks.
Em escala de rack completo, a WEKA afirma que o Prime Max pode fornecer 441,5 petabytes de capacidade bruta e 1,1 exabytes de capacidade eficaz após a redução de dados do NeuralMesh. O sistema de nível de rack é classificado para até 10,2 terabytes por segundo de throughput e 210 milhões de operações de entrada/saída por segundo.
A distinção entre capacidade bruta e eficaz é importante. O número de exabytes depende da redução alcançável nos dados armazenados e não deve ser interpretado como mais de um exabyte de flash físico.
Mesmo assim, uma densidade maior pode ter consequências significativas em instalações onde o armazenamento compete com as GPUs por espaço de rack, refrigeração e capacidade elétrica.
Projetado para Data Centers Constrained
Os novos sistemas também abordam as limitações físicas que estão cada vez mais moldando os projetos de infraestrutura de IA.
Clusters de GPU exigem grandes quantidades de eletricidade, refrigeração, networking e espaço de piso. Sistemas de armazenamento que consomem esses recursos de forma ineficiente podem reduzir a quantidade de aceleradores que uma instalação pode suportar.
A WEKA afirma que os novos aparelhos fornecem 267% mais densidade de capacidade eficaz e 114% mais densidade de desempenho do que as alternativas publicamente disponíveis mais próximas em suas respectivas categorias.
A empresa também projetou os sistemas para operar em temperaturas ambiente de até 35 graus Celsius. A redução de energia controlada por software é destinada a reduzir o desempenho gradualmente durante o estresse térmico, em vez de disparar uma parada.
Um design de unidade de disco sem backplane cria domínios de falha menores, enquanto unidades de inicialização de disco quentes e procedimentos de substituição guiados visam reduzir o tempo de manutenção. Os clientes podem configurar o tipo de estrutura, memória, capacidade de unidade e contagem de unidade, com implantações variando de menos de um petabyte a mais de 100 petabytes.
Construindo um Ecossistema em Torno de Fábricas de IA
Os anúncios de parceiros que acompanham sugerem que a plataforma atingirá os clientes por meio de integradores de infraestrutura, provedores de nuvem e vendedores de orquestração de IA.
Spectro Cloud está posicionando NeuralMesh como uma camada de dados que pode ser combinada com PaletteAI para implantar e operar fábricas de IA empresariais. World Wide Technology e Computacenter planejam incorporar os sistemas em projetos de infraestrutura mais amplos, enquanto Glocomp destacou a demanda dos clientes por melhor desempenho de IA e custos de infraestrutura mais previsíveis.
Essa estratégia de ecossistema é significativa porque a maioria das organizações não está montando ambientes de produção de IA a partir de um único fornecedor.
Uma implantação típica pode incluir GPUs, networking, armazenamento, software de modelagem, observabilidade, segurança e produtos de governança de vários fornecedores. Configurações validadas conjuntamente podem reduzir o trabalho de integração, embora os clientes ainda precisem testar o desempenho usando seus próprios modelos, conjuntos de dados, redes e requisitos de concorrência.
O Que Isso Significa para a Infraestrutura de IA
O aspecto mais importante do anúncio não é nenhum número de capacidade ou throughput individual. É a convergência crescente de armazenamento, cache distribuído, gerenciamento de memória, mobilidade de dados e isolamento de locatário.
<pÀ medida que os agentes de IA retêm histórias mais longas, acessam mais informações empresariais e operam continuamente, a infraestrutura que cerca as GPUs determinará cada vez mais o custo de cada resposta útil.
Adicionar mais aceleradores não resolverá gargalos causados por processamento de contexto repetido, movimento de dados lento, protocolos fragmentados ou capacidade de armazenamento subutilizada. A próxima fase da infraestrutura de IA, portanto, dependerá tanto de alimentar e gerenciar as GPUs com eficiência quanto de aumentar a computação bruta.
NeuralMesh 6 está programado para se tornar disponível geralmente durante a segunda metade de 2026, com os clientes existentes elegíveis para atualizar por meio do canal de software padrão. Os novos sistemas WEKApod Nitro, Prime e Prime Max estão disponíveis para pedido, com entregas esperadas para começar no outono de 2026.












