AI 모델 및 플랫폼
세레브라스, Qwen3‑235B 공개: AI 속도, 규모, 비용의 새로운 시대

세레브라스 시스템즈는 공식적으로 Qwen3‑235B를 출시했습니다. 이는 131,000토큰의 전체 컨텍스트 지원을 제공하는 최첨단 AI 모델로, 이유 추론, 코드 생성, 기업 규모의 AI 애플리케이션에서 새로운 성능 기준을 설정합니다. 현재 세레브라스 인퍼런스 클라우드에서 제공되는 이 모델은 가장 진보된 프론티어 시스템과 비교할 수 있는 기능을 제공합니다. 그러나 오늘날의 선도적인 클로즈드 소스 모델보다 30배 빠르며 10분의 1의 비용으로 작동합니다. (CBRS )
실시간 AI 추론, 속도 기록 달성
AI 추론은 역사적으로 느렸습니다. 큰 모델은 복잡한 쿼리에 응답하기 위해 1분 이상이 걸릴 수 있습니다. 세레브라스는 이 병목 현상을 제거했습니다. 자체 웨이퍼 스케일 엔진 3(WSE-3)을 통해 구동되는 Qwen3‑235B는 1,500토큰/초를 달성하여 프론티어 AI 추론에 대한 세계 기록을 세웠습니다.
이 수준의 성능은 사용자 경험을 변환합니다. 복잡한 이유 추론 작업이나 다단계 워크플로우를 처리할 때 대기 시간을 60-120초에서 0.6초로 단축합니다. 인공 지능 분석의 벤치마크 결과에 따르면 현재 열린 또는 닫힌 제공업체 중에 이 추론 속도에 해당하는 프론티어 수준의 모델은 없습니다.
컨텍스트의 새로운 표준: 실제 애플리케이션을 위한 131K 토큰
이 출시와 함께 세레브라스는 모델 컨텍스트 창을 32K에서 Qwen3‑235B에서 지원하는 전체 131K 토큰으로 확대했습니다. 컨텍스트 크기의 이 점프는 모델이 대량의 데이터를 섭취하고 추론할 수 있도록 합니다. 이는 전체 코드베이스, 다중 문서 저장소 및 긴 기술 자료를 포함합니다.
32K 컨텍스트는 기본 생성 작업에 충분하지만 131K는 생산급 개발을 가능하게 합니다. AI는 이제 깊은 코드 협력자로 작동하여 수십 개의 파일을 합성하고 복잡한 종속성을 실시간으로 관리할 수 있습니다. 이는 소프트웨어 엔지니어링, 문서 분석 및 과학적 컴퓨팅의 기업 사용 사례에 이상적입니다.
세레브라스가 다른 점: 하드웨어, 기초부터 AI를 위해 설계됨
세레브라스 시스템즈는 컴퓨터 아키텍트, AI 연구자 및 시스템 엔지니어의 팀에 의해 설립되었습니다. 세레브라스는 생성적 AI를 확장하는 도전을 해결하기 위해 근본적으로 다른 접근 방식을 취했습니다. GPU 클러스터에 의존하는 대신 세레브라스는 자체 칩인 웨이퍼 스케일 엔진 3을 중심으로 전용 AI 슈퍼컴퓨터를 구축했습니다.
이 칩은 업계에서 볼 수 없는 것입니다. 그것은 식사 접시 크기이고 수십만 개의 AI 최적화 코어와 칩상의 메모리가 수십 기가바이트로 구성되어 있습니다. 이러한 설계로 인해 컴퓨팅과 메모리가 나란히 위치하여 전통적인 다중 GPU 솔루션의 대기 시간, 대역폭 제한 및 오케스트레이션 복잡성을 제거할 수 있습니다.
세레브라스는 CS-3 시스템을 클러스터링하여 대규모 AI 모델을 쉽게 실행할 수 있는 AI 슈퍼컴퓨터를 만들 수 있습니다. 또한 분산 컴퓨팅의 기술적 부담을 피할 수 있습니다. 이러한 통합 접근 방식은 기록적인 추론 속도와 새로운 고 컨텍스트 기능의 기초입니다.
MoE 효율성, 비용 대폭 절감
Qwen3‑235B는 전문가 혼합 (MoE) 아키텍처를 사용하여 구축되었습니다. 이는 입력에 따라 내부 전문가의 하위 집합만 활성화하여 계산 효율성을 크게 향상시킵니다.
이를 통해 세레브라스는 폐쇄형 대안보다 훨씬 저렴하게 모델을 제공할 수 있습니다. 추론 비용은 입력 토큰 100만 개당 0.60달러, 출력 토큰 100만 개당 1.20달러로, 오픈AI·앤트로픽·구글의 독점 모델보다 90% 이상 저렴합니다.
VS Code의 Cline과 원활한 통합
Qwen3‑235B의 속도와 실제 활용 사례를 보여주기 위해 세레브라스는 마이크로소프트 비주얼 스튜디오 코드에서 사용되는 주요 에이전틱 코딩 에이전트인 Cline과 협력했습니다. 현재 180만 명의 개발자가 설치한 Cline을 사용할 수 있습니다.
Cline 사용자는 이미 무료 티어의 일부로 64K 컨텍스트를 가진 Qwen3‑32B에 액세스할 수 있습니다. 오늘의 발표와 함께 지원은 Qwen3‑235B와 전체 131K 컨텍스트를 포함하도록 확대되어 편집기 내에서 이전에 실시간으로 달성할 수 없었던 수준의 이유 추론 및 코드 생성을 가능하게 합니다.
사우드 리즈완, Cline의 CEO는 “Cerebras 추론과 함께 Cline을 사용하는 개발자는 미래를 엿보게 됩니다. Cline은 문제를 추론하고 코드베이스를 읽으며 거의 실시간으로 코드를 작성합니다. 모든 과정이 매우 빨라 개발자는 몰입을 유지한 채 사고의 속도로 반복할 수 있습니다. 빠른 추론은 단순히 좋은 기능을 넘어 개발자가 보조를 맞출 수 있는 AI의 가능성을 보여줍니다”라고 설명했습니다.
닫힌 모델의 대안: 오픈 모델
Qwen3‑235B의 성능은 현재 시장에서 가장 정교한 AI 모델과 비교할 수 있습니다. 클라우드 4 소네트, 제미니 2.5 플래시, 딥시크 R1 등 독립 벤치마크에 의해 검증되었습니다. 그러나 세레브라스는 이를 오픈 액세스 형식으로 제공하여 투명성과 이식성을 제공합니다. 이는 닫힌 모델에서는 찾을 수 없습니다.
이 오픈 모델 접근 방식은 기업이 다음을 가능하게 합니다.
- 사유 데이터에 맞게 사용자 지정 및 미세 조정
- 사유 인프라 또는 하이브리드 클라우드 환경에서 AI 배포
- 벤더 잠금 및 데이터 개인 정보 보호 위험 회피
세레브라스의 확장 가능한 클라우드 플랫폼과 선택적 온프레미스 배포를 통해 CS-3 시스템을 결합하여 조직은 임무에 중요한 작업에 AI를 적용하는 방법에 대한 전체 제어를 얻습니다.
이것이 산업에 의미하는 것
Qwen3‑235B의 출시로 한계가 재정의되었습니다. 세레브라스는 프론티어 지능과 함께 беспрецедент한 속도 및 비용 효율성을 결합하여 대규모 언어 모델의 가능성에 대한 새로운 기준을 설정했습니다.
이제 다음을 구축하는 것이 가능합니다.
- 개발자 쿼리에 실시간으로 응답하는 AI 도구
- 전체 문서 또는 지식 베이스에 대한 이유 추론
- IDE 내에서 라이브 생산 수준의 코드 생성 및 디버깅
- GPU 확장 또는 6자리 월간 추론 비용 없이 기업 사용 사례에 확장
AI 인프라의 수요가 증가함에 따라 세레브라스는 성능, 가격 및 오픈성 사이에서 타협할 필요가 없음을 보여줍니다. 웨이퍼 스케일 엔진에서 세레브라스 인퍼런스 클라우드까지의 하드웨어-소프트웨어 공통 설계는 더 빠르고 더 간단하며 더 접근하기 쉬운 AI 배포 모델을 가리킵니다.
최종 생각
131K 컨텍스트, 초고속 추론 및 합리적인 토큰 가격을 가진 Qwen3‑235B를 출시함으로써 세레브라스 시스템즈는 GPU 기반 기존 업체에 대한 진정한 도전자 중 하나로 자리 잡았습니다. 기업, 연구자 및 개발자를 위한 이 출시로 실시간, 생산급, 오픈 AI가 손 닿을 수 있는 곳으로 다가옵니다.












