AI 모델 및 플랫폼
Enfabrica, 에테넷 기반 메모리 패브릭으로 AI 추론을 대규모로 재정의할 수 있는 기술을 공개

Enfabrica, Nvidia가 지원하는 실리콘 밸리의 스타트업은 대규모 AI 워크로드를 배포하고 확장하는 방식을 크게 바꿀 수 있는 혁신적인 제품을 공개했습니다. 회사의 새로운 Elastic Memory Fabric System (EMFASYS)은 제네러티브 AI 추론의 핵심 병목 현상을 해결하기 위해 특별히 설계된 최초의 상용 에테넷 기반 메모리 패브릭입니다: 메모리 접근.
AI 모델이 더 복잡하고 컨텍스트에 민감하며 지속적이 되면서 사용자 세션당大量의 메모리가 필요한 상황에서 EMFASYS는 메모리를 컴퓨팅에서 분리하는 새로운 접근 방식을 제공하여 AI 데이터 센터가 성능을 크게 개선하고 비용을 줄이고 가장 비싼 자원인 GPU의 활용도를 높일 수 있습니다.
메모리 패브릭이란 무엇이며 왜 중요한가?
전통적으로 데이터 센터의 메모리는 서버 또는 노드에紧密하게 결합되어 있습니다. 각 GPU 또는 CPU는 직접 연결된 고대역폭 메모리만 액세스할 수 있습니다. 일반적으로 GPU의 경우 HBM, CPU의 경우 DRAM입니다. 이 아키텍처는 워크로드가 작고 예측 가능할 때 잘 작동합니다. 그러나 제네러티브 AI는 게임을 바꿨습니다. 대형 컨텍스트 창, 사용자 기록 및 멀티 에이전트 메모리에 대한 액세스가 필요하며 모두 빠르고 지연 없이 처리되어야 합니다. 이러한 메모리 요구는 종종 로컬 메모리의 사용 가능한 용량을 초과하여 GPU 코어가 중단되고 인프라 비용이 증가합니다.
메모리 패브릭은 이를 해결하여 메모리를 공유된 분산 자원으로 변환합니다. 이는 데이터 센터 랙 내에서 “메모리 클라우드”를 생성하는 것입니다. 서버 간에 메모리를 복제하거나 비싼 HBM을 과부화시키지 않고, 패브릭을 사용하여 메모리를 집계하고 분리하고 고속 네트워크를 통해 요구에 따라 액세스할 수 있습니다. 이를 통해 AI 추론 워크로드가 더 효율적으로 확장할 수 있으며 단일 노드의 물리적 메모리 제한에 구속되지 않습니다.
Enfabrica의 접근 방식: 에테넷과 CXL, 함께 작동
EMFASYS는 랙 규모의 메모리 아키텍처를 달성하기 위해 두 가지 강력한 기술을 결합합니다: 에테넷을 통한 RDMA 및 컴퓨팅 익스프레스 링크 (CXL). 전자는 표준 에테넷 네트워크를 통해 초저지연, 고처리량 데이터 전송을 가능하게 합니다. 후자는 메모리를 CPU 및 GPU에서 분리하고 공유 리소스로 풀링하여 고속 CXL 링크를 통해 액세스할 수 있습니다.
EMFASYS의 핵심은 Enfabrica의 ACF-S 칩입니다. 이는 3.2 테라비트당 초 (Tbps) “슈퍼 NIC”로, 네트워킹 및 메모리 제어를 단일 장치로 결합합니다. 이 칩을 사용하면 서버가 랙에 분산된大量의 저렴한 DRAM (최대 18 테라바이트당 노드)에 인터페이스할 수 있으며, 이는 표준 에테넷 포트를 사용하여 수행됩니다. 이를 통해 운영자는专有 인터커넥트에 투자하지 않고 기존 데이터 센터 인프라를 활용할 수 있습니다.
EMFASYS가 특히 매력적인 이유는 GPU-부착 HBM에서 메모리 제한 워크로드를 동적으로 오프로드하여 훨씬 더 저렴한 DRAM으로 옮길 수 있으며, 마이크로초 수준의 액세스 지연 시간을 유지하는 것입니다. EMFASYS의 소프트웨어 스택에는 지연 시간을 숨기고 메모리 이동을 LLM이 시스템에서 실행 중인 방식으로 투명하게 조직하는 지능형 캐싱 및 로드 밸런싱 메커니즘이 포함되어 있습니다.
AI 산업에 대한 영향
이것은 단순한 하드웨어 솔루션이 아니라 AI 인프라를 구축하고 확장하는 방식에 대한 철학적 전환을 나타냅니다. 제네러티브 AI가 新奇에서 필요로 바뀌면서 일일적으로 처리되는 사용자 쿼리가 수십억 개가 되면서, 이러한 모델을 제공하는 비용은 많은 회사에게 부담이 되었습니다. GPU는 컴퓨팅이 부족해서가 아니라 메모리를 기다리면서 종종 활용되지 않습니다. EMFASYS는 이러한 불균형을 직접 해결합니다.
에테넷을 통해 액세스할 수 있는 풀링된 패브릭 부착 메모리를 제공함으로써 Enfabrica는 데이터 센터 운영자가 더 많은 GPU 또는 HBM을 계속 구매하는 대신, 모듈식으로 메모리 용량을 증가시킬 수 있는 대안을 제공합니다. 이는 저렴한 DRAM과 지능형 네트워킹을 사용하여 전체 부품과 경제성을 개선합니다.
影响은 즉각적인 비용 절감을 넘어섭니다. 이러한 종류의 분리된 아키텍처는 메모리-서비스 모델을 가능하게 하여 컨텍스트, 기록 및 에이전트 상태가 세션 또는 서버를 넘어 지속할 수 있으며, 더 지능적이고 개인화된 AI 시스템으로의 길을 열어줍니다. 또한 메모리 제한 없이 랙 또는 전체 데이터 센터에 걸쳐 작업을 탄력적으로 분산할 수 있는 더 강력한 AI 클라우드를 위한 단계를 마련합니다.
미래를 향해
Enfabrica의 EMFASYS는 현재 선택된 고객과 샘플링 중이며, 회사는 아직 이러한 파트너가 누구인지 공개하지 않았습니다. 그러나 로이터 통신에 따르면 주요 AI 클라우드 제공업체가 이미 이 시스템을 시험 중입니다. 이는 Enfabrica를 단순한 구성 요소 공급자 이상으로, 차세대 AI 인프라의 핵심 활성화자로 пози션합니다.
컴퓨팅에서 메모리를 분리하고 고속 에테넷 네트워크를 통해 액세스할 수 있도록 함으로써 Enfabrica는妥協 없이 확장할 수 있는 추론을 위한 새로운 AI 아키텍처 시대를 위한 기초를 마련하고 있습니다. 여기서 리소스는 더 이상 중단되지 않으며, 대형 언어 모델을 배포하는 경제성이终于 의미를 갖게 됩니다.
컨텍스트가 풍부하고 멀티 에이전트 AI 시스템으로 점점 더 정의되는 세계에서 메모리는 더 이상 보조 역할이 아닙니다. 그것은舞台입니다. Enfabrica는舞台를 가장 잘 구축하는 사람이 향후 수년 동안 AI의 성능을 정의할 것이라고 베팅합니다.












