AI 모델 및 플랫폼
Cerebras, 새로운 Ultrafast 등급에서 OpenAI의 GPT-5.6 Sol을 초당 750 토큰 속도로 실행

Cerebras (CBRS ) 는 이제 OpenAI의 대표 모델을 GPU 클라우드가 공개적으로 매치하지 못한 속도로 실행하고 있습니다. 2026년 8월 13일, 웨이퍼 스케일 칩 제조업체가 발표했습니다 이 모델이 Ultrafast라는 새로운 OpenAI 서비스 등급에서 GPT-5.6 Sol을 구동하며, 초당 최대 750개의 출력 토큰을 제공하고, OpenAI에 따르면, 모델이 표준 처리보다 최대 14배 빠르게 실행됩니다. Ultrafast는 제한된 미리보기 형태로 선택된 고객 그룹에게 먼저 OpenAI API를 통해 출시되며, 용량이 증가함에 따라 접근성이 확대됩니다.
핵심 주장은 명확하다. 속도 저하 없이 최첨단 지능을 제공한다는 것이다. GPT-5.6 Sol은 OpenAI의 가장 뛰어난 모델이며, Cerebras 칩에서는 야간 일괄 처리 작업에 묶어 두는 대신 실시간 제품에 사용할 수 있을 만큼 빠르게 토큰을 생성한다. 두 회사는 이 등급이 중요한 업무를 처리할 만큼 똑똑한 모델과 업무가 진행되는 동안 사용할 만큼 빠른 모델 사이의 상충관계를 없앤다고 설명한다.
Ultrafast 뒤의 속도 수치
초당 출력 토큰 750개라는 수치가 눈길을 끌지만, Cerebras가 공개한 직접 비교가 더 많은 것을 보여 준다. 회사는 Artificial Analysis가 발표한 출력 속도와 비교해 Ultrafast의 GPT-5.6 Sol이 Claude Fable 5보다 11배, Fast 모드의 Opus 4.8보다 5배 빠르다고 주장한다.
Cerebras는 또한 이 등급을 인간의 마지막 시험(Humanity’s Last Exam)이라는 2,500문제의 벤치마크에 적용했으며, 이는 박사 수준의 난이도로 설계되었습니다. Ultrafast에서 GPT-5.6 Sol은 2,500문제를 11시간 11분 만에 모두 답했으며, Claude Fable 5는 비교 가능한 결론에 도달하는 데 78시간 27분이 필요했습니다: Cerebras에 따르면 거의 7배 느린 것입니다. 경제적으로 가치 있는 지식 작업을 위한 벤치마크인 GDP-Val에서는 표준 처리 대비 5.6배의 엔드투엔드 속도 향상을 품질 저하 없이 보고했습니다.
이 평가는 공급업체가 직접 수행했으며 Cerebras도 이를 명시한다. Humanity’s Last Exam 비교는 Cerebras가 2026년 7월 10일과 13~15일에 실시했고, GDP-Val 수치는 2026년 7월 31일 자체 시험에서 나왔다. 독립적인 결과가 아니라 회사 자체 측정치로 봐야 한다.
왜 웨이퍼 스케일 칩이 지연 시간에서 승리하는가
이 작동 원리는 중요하다. 비교적 작은 칩 제조업체가 기존 GPU 업체들이 따라오지 못한 속도로 OpenAI의 가장 큰 모델을 서비스하는 이유를 설명하기 때문이다. 대형 모델의 빠른 추론은 근본적으로 데이터 이동의 문제다. GPU에서는 다음 토큰을 생성할 때마다 모델 가중치를 온칩 메모리와 외부 저장장치 사이에서 반복해서 옮겨야 하므로 메모리 대역폭이 병목이 된다.
Cerebras의 해결책은 이 이동을 없애는 것입니다. 웨이퍼 스케일 엔진은 44GB SRAM을 단일 웨이퍼 크기 칩에 탑재하여 모델 가중치가 온칩에 머무르고 토큰이 웨이퍼를 가로질러 파이프라인화된 레이어를 끊김 없이 흐르게 합니다. 가중치가 실리콘을 떠나지 않기 때문에 이 접근 방식은 모델 크기에 따라 확장되며—이는 최첨단 모델이 커짐에 따라 속도 이점이 유지된다는 회사의 주장입니다. 추론 경제성 측면에서 이것이 핵심이며: 모델을 제공하는 비용과 지연 시간은 가중치를 얼마나 빠르게 연산에 공급하느냐에 좌우되고, 44GB를 하나의 다이에 상주시키는 것이 이를 직접적으로 해결합니다.
$10 Billion 파트너십이 플래그십에 도달하다
Ultrafast는 수개월에 걸쳐 구축된 관계에서 가장 눈에 띄는 제품입니다. OpenAI는 2026년 초에 저지연 컴퓨팅을 위해 $10 billion 규모로 Cerebras와 협력했습니다, 그리고 이번 출시를 통해 그 용량을 회사의 최상위 모델 뒤에 배치했으며, 작은 모델이나 특수 모델이 아닌 최고 모델에 적용했습니다. OpenAI는 Ultrafast를 파트너십에서 “다음 단계”라며 플랫폼에 초저지연 추론을 제공한다고 설명합니다.
Cerebras에게 이 배치는 중요합니다. 이 스타트업은 시장의 중심이 GPU 공급업체에 있더라도 웨이퍼 스케일 아키텍처가 추론에 가장 적합하다고 오랫동안 주장해 왔으며—이는 기존 업체들이 모델을 직접 실리콘에 내장합니다로 전환하면서 가속기 비즈니스 전반에 걸친 경쟁으로 나타납니다. OpenAI의 플래그십을 위한 서비스 레이어를 확보함으로써 Cerebras는 시장 최고 수준의 생산 레퍼런스 계정을 얻게 됩니다. 해당 모델은 OpenAI가 출시한 GPT-5.6 제품군의 핵심이며(플래그십인 Sol, 균형 잡힌 Terra, 비용 효율적인 Luna와 함께), 따라서 Ultrafast는 Cerebras를 그 라인업의 앞부분에 배치합니다.
누가 이용하고 무엇을 위한 것인가
OpenAI는 이 등급을 시간에 민감하고 고위험 작업에 맞추고 있습니다: 장애가 진행 중일 때의 사고 대응, 시장 상황이 변동하는 동안의 금융 연구, 실시간 고객 지원 및 음성, 상거래, 그리고 이전에 야간에 진행되던 실시간 연구 루프 등. 초기 접근은 코딩, 상거래, 금융 분야의 기업들에게 제공되었으며, Jane Street, Podium, Basis, Rogo 등이 포함됩니다.
“Cerebras가 가져온 속도 향상은 인상적입니다,” 라고 OpenAI의 발표에서 Jane Street의 AI 어시스턴트 담당 John Crepezzi가 말했습니다. “이는 모델을 활용하는 다양한 방식을 가능하게 하며, 개발자들이 모델과 함께 보다 집중되고 생산적으로 작업할 수 있게 합니다.”
OpenAI는 의도적으로 롤아웃 범위를 좁게 유지하고 있습니다. 회사는 미리보기 기간을 활용해 속도 변화가 한 단계 크게 증가할 때 가장 큰 가치를 창출하는 영역을 파악하고, 용량이 늘어남에 따라 접근성을 확대할 것이라고 밝혔습니다. OpenAI와 Cerebras 모두 미리보기가 확대됨에 따라 업데이트 신청을 받고 있습니다.
다음에 일어날 일
단기적으로 관찰되는 것은 능력이 아니라 용량입니다. Ultrafast는 제한된 미리보기이며, 양사는 보다 광범위한 제공을 고정된 날짜가 아니라 용량 증가에 연동시킵니다—따라서 확장 속도가 주목할 만한 요소입니다. 더 긴 질문은 OpenAI의 모델이 확장됨에 따라 Cerebras의 온칩 메모리 이점이 유지될 수 있는가인데, 이는 바로 웨이퍼 스케일 아키텍처가 기반으로 하는 베팅입니다.












