Modelos e plataformas de IA

Enfabrica Apresenta Tecido de Memória Baseado em Ethernet que Pode Redefinir a Inferência de IA em Escala

mm
Adicione Unite.AI às suas fontes preferidas no Google

Enfabrica, uma startup da Silicon Valley apoiada pela Nvidia (NVDA ), apresentou um produto inovador que pode mudar significativamente a forma como as cargas de trabalho de IA em grande escala são implantadas e dimensionadas. O novo sistema de tecido de memória elástica (EMFASYS) da empresa é o primeiro tecido de memória baseado em Ethernet disponível comercialmente, projetado especificamente para resolver o gargalo principal da inferência de IA gerativa: o acesso à memória.

Em um momento em que os modelos de IA estão se tornando mais complexos, conscientes do contexto e persistentes, exigindo vastas quantidades de memória por sessão de usuário, o EMFASYS oferece uma abordagem inovadora para desacoplar a memória do processamento, permitindo que os centros de dados de IA melhorem significativamente o desempenho, reduzam os custos e aumentem a utilização de seus recursos mais caros: os GPUs.

O que é um Tecido de Memória — e Por Que Ele Importa?

Tradionalmente, a memória dentro dos centros de dados está fortemente ligada ao servidor ou nó em que reside. Cada GPU ou CPU tem acesso apenas à memória de alta largura de banda diretamente anexada a ela — geralmente HBM para GPUs ou DRAM para CPUs. Essa arquitetura funciona bem quando as cargas de trabalho são pequenas e previsíveis. Mas a IA gerativa mudou o jogo. As LLMs exigem acesso a janelas de contexto grandes, histórico do usuário e memória de multi-agente — tudo isso deve ser processado rapidamente e sem atraso. Essas demandas de memória frequentemente ultrapassam a capacidade disponível de memória local, criando gargalos que deixam os núcleos GPU inativos e inflam os custos de infraestrutura.

Um tecido de memória resolve isso transformando a memória em um recurso compartilhado e distribuído — uma espécie de pool de memória anexada à rede, acessível por qualquer GPU ou CPU na cluster. Pense nisso como criar uma “nuvem de memória” dentro da prateleira do centro de dados. Em vez de replicar a memória em servidores ou sobrecarregar a memória HBM cara, um tecido permite que a memória seja agregada, desagregada e acessada sob demanda por meio de uma rede de alta velocidade. Isso permite que as cargas de trabalho de inferência de IA sejam escaladas de forma mais eficiente sem serem limitadas pelos limites de memória física de um único nó.

A Abordagem da Enfabrica: Ethernet e CXL, Juntos pela Primeira Vez

O EMFASYS alcança essa arquitetura de memória de escala de prateleira combinando duas tecnologias poderosas: RDMA sobre Ethernet e Compute Express Link (CXL). O primeiro permite a transferência de dados de ultra-baixa latência e alta taxa de transferência por meio de redes Ethernet padrão. O segundo permite que a memória seja desanexada dos CPUs e GPUs e reunida em recursos compartilhados, acessíveis por meio de links CXL de alta velocidade.

No núcleo do EMFASYS está o chip ACF-S da Enfabrica, um “SuperNIC” de 3,2 terabits por segundo (Tbps) que combina a rede e o controle de memória em um único dispositivo. Esse chip permite que os servidores se conectem a pools maciços de DRAM DDR5 de commodity — até 18 terabytes por nó — distribuídos por toda a prateleira. Crucialmente, ele o faz usando portas Ethernet padrão, permitindo que os operadores aproveitem a infraestrutura de centro de dados existente sem investir em interconexões proprietárias.

O que torna o EMFASYS particularmente atraente é sua capacidade de descarregar dinamicamente as cargas de trabalho limitadas por memória dos GPUs caros para DRAM muito mais acessível, mantendo uma latência de acesso no nível de microssegundos. A pilha de software por trás do EMFASYS inclui mecanismos de cache inteligente e balanceamento de carga que escondem a latência e orquestram o movimento de memória de maneiras transparentes para as LLMs em execução no sistema.

Implicações para a Indústria de IA

Isso é mais do que apenas uma solução de hardware inteligente — representa uma mudança filosófica na forma como a infraestrutura de IA é construída e escalada. À medida que a IA gerativa passa de novidade para necessidade, com bilhões de consultas de usuário sendo processadas diariamente, o custo de atender a esses modelos se tornou insustentável para muitas empresas. Os GPUs frequentemente estão subutilizados não por falta de processamento, mas porque ficam inativos esperando por memória. O EMFASYS aborda esse desequilíbrio diretamente.

Ao permitir que a memória seja anexada a um tecido e acessível via Ethernet, a Enfabrica oferece aos operadores de centros de dados uma alternativa escalável para comprar continuamente mais GPUs ou HBM. Em vez disso, eles podem aumentar a capacidade de memória de forma modular, usando DRAM de commodity e rede inteligente, reduzindo a pegada geral e melhorando a economia da inferência de IA.

As implicações vão além das economias de custo imediatas. Esse tipo de arquitetura desagregada abre caminho para modelos de memória como serviço, onde o contexto, o histórico e o estado do agente podem persistir além de uma única sessão ou servidor, abrindo a porta para sistemas de IA mais inteligentes e personalizados. Isso também prepara o palco para nuvens de IA mais resilientes, onde as cargas de trabalho podem ser distribuídas elasticamente por toda a prateleira ou centro de dados sem limitações rígidas de memória.

Olhando para o Futuro

O EMFASYS da Enfabrica está atualmente sendo testado com clientes selecionados, e embora a empresa não tenha divulgado quem são esses parceiros, a Reuters relata que os principais provedores de nuvem de IA já estão testando o sistema. Isso posiciona a Enfabrica não apenas como um fornecedor de componentes, mas como um habilitador-chave na próxima geração de infraestrutura de IA.

Ao desacoplar a memória do processamento e torná-la disponível por meio de redes Ethernet de alta velocidade e commodity, a Enfabrica está criando as bases para uma nova era de arquitetura de IA — uma em que a inferência pode ser escalada sem compromisso, em que os recursos não estão mais ilhados e em que a economia de implantação de grandes modelos de linguagem finalmente começa a fazer sentido.

Em um mundo cada vez mais definido por sistemas de IA ricos em contexto e multi-agente, a memória não é mais um ator de apoio — é o palco. E a Enfabrica está apostando que quem construir o melhor palco definirá o desempenho da IA nos anos que se seguem.

Antoine é um líder visionário e sócio-fundador da Unite.AI, impulsionado por uma paixão inabalável por moldar e promover o futuro da IA e da robótica. Um empreendedor serial, ele acredita que a IA será tão disruptiva para a sociedade quanto a eletricidade, e é frequentemente pego falando sobre o potencial das tecnologias disruptivas e da AGI.

Como um futurista, ele está dedicado a explorar como essas inovações moldarão nosso mundo. Além disso, ele é o fundador da Securities.io, uma plataforma focada em investir em tecnologias de ponta que estão redefinindo o futuro e remodelando setores inteiros.