AI 모델 및 플랫폼

Cerebras, 분산을 통해 추론 처리량 5배 향상 보고

mm
Unite.AI를 Google의 선호 소스에 추가

Cerebras Systems는 2026년 10월 1일, 동일한 수의 Cerebras 시스템을 사용하고 토큰 생성 속도 손실 없이 분산이라는 기법을 활용한 초기 결과에서 추론 처리량을 5배 늘렸다고 밝혔습니다. 이 발표는 Isaac Tai와 Zhenwei Gao가 작성한 분산 추론: 근본부터라는 회사 블로그 게시물에서 이루어졌으며, 해당 주제에 대한 예정된 시리즈를 시작합니다.

이 게시물은 분산이라는 용어를 들어보았거나, 프리필은 연산에, 디코드는 메모리에 제한된다는 주장에 대해 실제 의미가 궁금했던 독자를 위해 시리즈의 배경을 제시합니다. 가속기가 연산과 데이터 이동을 어떻게 균형 맞추는지부터 시작해 근본부터 설명을 전개합니다.

프리필과 디코드는 하드웨어에 서로 다른 요구를 부과합니다

게시물은 연산 집약도(arithmetic intensity)를 메모리와 가속기의 연산 유닛 사이에서 전송되는 바이트 수로 나눈 부동소수점 연산 횟수로 정의합니다. 예시 중 하나에서는 두 행렬을 더할 때 6바이트가 이동할 때마다 1 FLOP이 수행되며, 이는 바이트당 0.167 FLOP의 연산 집약도이며, 행렬이 커져도 이 비율은 일정하게 유지됩니다. 행렬 곱셈은 다르게 동작합니다: 각 출력값은 한 입력의 전체 행과 다른 입력의 전체 열을 사용해 만들어지므로, 로드된 값이 더 많은 출력에 기여하고 연산 집약도가 입력 크기에 따라 증가합니다.

게시물에 따르면 추론은 모델의 고정 가중치와 입력 토큰 사이에서 이러한 행렬 곱셈이 연속적으로 이루어지는 과정이며, 서로 다른 연산 집약도 프로파일을 갖는 두 단계로 실행됩니다. 프리필 단계에서는 전체 프롬프트가 대규모 행렬 연산으로 병렬 처리되며, 실제 프롬프트는 수천에서 수십만 토큰에 이를 수 있습니다. 디코드 단계에서는 토큰이 하나씩 생성되며, 모델은 KV 캐시를 활용합니다. KV 캐시는 이전 토큰에 대해 계산된 키와 값을 저장해 재계산 없이 재사용합니다.

두 단계 모두 생성되는 각 토큰에 대해 모델의 가중치 전체, 수백 기가바이트에서 테라바이트에 달할 수 있는 양을 연산 유닛으로 이동시켜야 합니다. 게시물은 프리필 이후 연산 집약도는 감소하지만 메모리 이동량은 거의 일정하게 유지된다고 보여주며, 이 차이가 순수 연산 능력을 추가해도 디코드 단계에서 토큰 도착 속도가 반드시 빨라지지는 않는 이유라고 설명합니다.

분산은 추론을 별도의 풀로 분리합니다

실제 운영 환경에서 추론 서버는 일반적으로 다수의 요청을 동시에 처리합니다. 프리필과 디코드가 동일한 하드웨어에서 실행될 경우, 연산 집약적인 프리필이 활성 디코드 요청을 지연시킬 수 있습니다. 스케줄러는 새로운 요청을 첫 토큰까지 빠르게 전달할지, 활성 응답을 원활히 스트리밍할지, 전체 처리량을 최대화할지 중에서 선택해야 합니다. 배칭은 동시에 들어오는 요청들이 모델 가중치를 읽는 작업을 공유하도록 하지만, 배치 규모가 커지면 각 디코드 단계가 더 오래 걸려 전체 처리량은 증가하면서도 각 사용자가 토큰을 받는 속도는 느려질 수 있습니다.

게시물은 분산을 두 단계를 별도의 하드웨어 풀에서 실행하는 시스템 설계 패턴으로 설명합니다. 단계가 분리되면 운영자는 하드웨어를 할당하고, 배칭 정책을 설정하며, 각 단계에 대해 지연 시간이나 처리량을 독립적으로 우선순위화할 수 있습니다. 첫 토큰 도달 시간이 엄격한 시스템은 프리필에 더 많은 용량을 예약할 수 있고, 원활한 스트리밍을 목표로 하는 시스템은 디코드에 더 크거나 더 촘촘히 스케줄된 풀을 제공할 수 있습니다. 또한 각 풀은 개별적으로 확장할 수 있습니다.

분리에는 새로운 요구사항이 생깁니다. 프리필 단계에서 KV 캐시가 구축된 후, 해당 요청에 특화된 상태를 디코드 풀로 전달해야 하며, 생성이 계속되기 전에 메모리에 로드됩니다. 모델 가중치는 이미 두 풀 모두에 로드되어 있습니다. 게시물은 이 핸드오프가 네트워크 및 조정 오버헤드를 추가하고, 용량이 수요와 맞지 않을 경우 어느 풀이라도 유휴 상태가 될 수 있으며, 추가 지연 시간은 캐시가 동일 위치의 머신 간에 이동하는지 혹은 지역을 넘어 이동하는지에 따라 달라진다고 지적합니다. 분산은 규모가 클 때 가장 매력적이며, 풀을 독립적으로 크기 조정하고 스케줄링함으로써 얻는 이점이 전송 및 운영 비용을 능가할 수 있다고 주장합니다. 또한 이는 스트리밍을 부드럽게 만드는 것에 그치지 않고 서비스 시스템의 제어 인터페이스 자체를 변화시킵니다.

이기종 하드웨어, 초기 결과 및 파트너십

Cerebras는 이기종 분산 개발을 선도하고 있다고 밝혔으며, 하나의 추론 시스템에 여러 종류의 칩을 결합하고 메모리 제한 구간과 연산 제한 구간에 서로 다른 하드웨어를 할당합니다. 게시물은 전체 웨이퍼에 걸쳐 SRAM을 연산과 함께 배치하는 회사의 웨이퍼 규모 설계와, 고대역폭 메모리에서 모델 데이터를 작은 온칩 메모리와 캐시를 통해 단계적으로 전달하는 GPU를 비교합니다.

게시물에 실린 2026년 9월 10일자 공개 최고 메모리 대역폭 차트에서는 Cerebras WSE-3 온칩 SRAM이 웨이퍼당 21,000 TB/s로 표시되고, 이름이 밝혀지지 않은 온칩 SRAM 가속기가 150 TB/s, HBM4 GPU가 각각 23.3 및 22 TB/s로 나열됩니다. 차트는 SRAM 수치는 프로세서 전체의 로컬 메모리 대역폭을 합산한 것이고, HBM 수치는 외부 메모리에서의 트래픽을 측정한 것이므로, 이 수치는 토큰 속도를 측정한 것이 아니라 서로 다른 메모리 계층을 나타낸다고 경고합니다.

이 게시물은 또한 2026년 9월 10일의 Artificial Analysis 데이터를 재현하며, 10,000 입력 토큰으로 고급 추론을 수행하는 GPT-oss-120B에 대한 내용입니다. 여기에는 Cerebras가 초당 1,669 출력 토큰, SambaNova가 708, Groq가 475, Microsoft Azure가 319, Nebius가 294, Baseten이 293으로 나와 있습니다.

Cerebras는 전통적인 집합 시스템에서는 용량을 늘리려면 더 많은 하드웨어를 배치해야 했으며, 파트너 가속기를 활용해 프롬프트 처리를 담당함으로써 동일한 WSE 풋프린트에서 초기 테스트에서 용량을 5배 증가시켰다고 밝혔습니다. 회사는 여러 하드웨어 파트너와의 협력을 발표하여 더 빠른 토큰을 시장에 제공할 것이라고 말했으며, 게시물의 다이어그램에는 AWS Trainium 및 AMD Helios Instinct GPU 시스템이 Cerebras 디코드 풀에 공급되는 프리필 하드웨어 옵션 중에 포함되어 있는 것으로 나타났습니다.

이 게시물은 에이전트형 애플리케이션이 이질적인 분산에 적합한 매력적인 사례라고 지적합니다. 이러한 애플리케이션은 모델 호출 간에 컨텍스트가 증가하고 각 단계에서 지연이 누적되는 길고 다중 턴의 워크플로우를 자주 포함하기 때문입니다. Cerebras는 다음 시리즈에서 관련 하드웨어 및 소프트웨어 스택과 대규모 분산 추론을 배포할 때의 경제적 트레이드오프를 다룰 것이라고 밝혔습니다.

Theo Nash은 Unite.AI에서 AI 생성 전문가로서 AI 인프라, 컴퓨팅 및 현대 인공지능을 구동하는 하드웨어 시스템을 다룹니다. 그의 작업은 대규모 AI 워크로드의 기술적 기반에 초점을 맞추며, 데이터 센터, 가속기, 네트워킹 및 이를 연결하는 소프트웨어 스택을 포함합니다.

분석적이고 엔지니어링 중심의 관점으로 Theo는 GPU, 맞춤형 실리콘, 메모리 아키텍처 및 분산 시스템의 진보가 새로운 세대의 AI 모델을 어떻게 가능하게 하는지 검토합니다. 그는 성능 트레이드오프, 에너지 효율성, 확장성 및 AI 인프라의 실제 배포를 형성하는 실질적인 제약 조건에 특히 주목합니다.

Theo Nash가 작성한 기사들은 AI가 생성했으며, Unite.AI의 편집팀이 검토하여 빠르게 진화하는 AI 컴퓨팅 환경에 대한 기술적 정확성, 명확성 및 책임 있는 보도를 보장합니다.