파트너십
Crusoe, Perplexity 훈련 및 추론을 지원하기 위한 다년 계약 체결

Crusoe는 2026년 9월 15일에 Perplexity와 다년 파트너십을 발표했습니다. 이를 통해 Perplexity는 Crusoe Cloud에서 전체 모델 수명 주기를 운영하고, 전용 NVIDIA GB300 NVL72 클러스터에서 최첨단 모델을 훈련하며, Crusoe의 Managed Inference 서비스를 통해 프로덕션에서 제공할 예정입니다.
샌프란시스코를 발신지로 한 이번 발표는 Crusoe가 1,800명의 직원에게 Perplexity Enterprise Pro와 Max를 도입하도록 약속합니다. 보도자료에 따르면, 이번 배포는 직원들에게 웹 및 내부 지식 검색, 다단계 연구, 데이터 분석, 그리고 최첨단 AI 모델에 대한 접근성을 제공하기 위한 것입니다.
보도자료는 Perplexity의 제품을 수백만 사용자를 위한 실시간 운영으로 설명하며, 이 환경에서는 추론 지연 시간과 처리량이 이론적 벤치마크가 아닌 실제 제품이라고 강조합니다. Crusoe는 자체 최적화를 기반으로 한 프로덕션 급 추론을 제공하고, 인기 모델 전반에 걸쳐 성능과 비용을 최적화하도록 설계된 Managed Inference 서비스를 구축했으며, Crusoe Cloud가 Perplexity의 성장에 맞춰 운영 깊이와 규모를 제공한다고 밝혔습니다.
임원 발언
Crusoe 공동 설립자이자 CEO인 Chase Lochmiller는 가장 빠르게 움직이는 AI 기업들은 전체 모델 수명 주기 전반에 걸쳐 속도를 맞추고 성장에 따라 확장되는 인프라가 필요하다고 말했습니다. “Perplexity는 사람들이 답을 찾는 방식을 미래로 만들고 있으며, Crusoe는 최초 전자부터 마지막 토큰까지 이를 가능하게 하는 핵심 파트너입니다,” 라고 Lochmiller는 전했습니다.
Perplexity 공동 설립자이자 CEO인 Aravind Srinivas는 Perplexity 규모에서 AI를 운영한다는 것은 지연 시간의 1밀리초마다 사용자가 체감한다는 의미라고 말했습니다. 그는 Crusoe가 이러한 제약을 중심으로 설계되었으며, 차세대 하드웨어를 기반으로 한 고처리량, 저지연 추론이라고 설명했습니다.
NVIDIA의 HPC 및 AI 인프라 솔루션 수석 이사인 Dion Harris는 현대 AI는 연구 단계부터 배포 단계까지 통합 컴퓨팅 아키텍처가 필요하다고 말했습니다. NVIDIA GB300 NVL72와 NVIDIA InfiniBand로 구동되는 Crusoe Cloud는 Perplexity가 최첨단 모델을 훈련, 미세조정 및 프로덕션에서 제공할 수 있도록, 에이전시 AI가 요구하는 속도와 효율성을 제공한다고 Harris는 설명했습니다.
GB300 NVL72 플랫폼
계약서에 명시된 전용 훈련 클러스터는 NVIDIA의 GB300 NVL72에서 운영되며, NVIDIA는 이를 72개의 Blackwell Ultra GPU와 36개의 Arm 기반 Grace CPU를 통합한 완전 액체 냉각 랙 규모 시스템이라고 설명합니다. NVIDIA가 발표한 사양에는 130 TB/s의 NVLink 대역폭, 최대 576 TB/s 대역폭을 가진 20 TB GPU 메모리, 37 TB의 고속 메모리, 그리고 2,592개의 Arm Neoverse V2 CPU 코어가 포함됩니다. 시스템 내 각 GPU는 ConnectX-8 SuperNIC IO 모듈을 통해 800 Gb/s 네트워크 연결을 제공받으며, Quantum-X800 InfiniBand 또는 Spectrum-X Ethernet 네트워킹 플랫폼과 함께 작동합니다.
NVIDIA는 GB300 NVL72 기반 AI 팩토리가 Hopper 기반 플랫폼에 비해 전체 AI 팩토리 출력 성능이 최대 50배 향상된다고 주장합니다. 이 수치는 사용자당 초당 토큰 수로 측정된 사용자 반응성이 10배 개선되고, Hopper 대비 메가와트당 처리량이 5배 향상된 것에 기인한다며, 이러한 수치는 변동 가능성이 있는 예상 성능임을 밝혔습니다.
Managed Inference 서비스 및 역사
계약의 프로덕션 제공 요소는 Crusoe Managed Inference에서 운영되며, 회사는 이를 2025년 11월 20일에 일반 제공했습니다. 이 서비스는 MemoryAlloy를 중심으로 구축된 Crusoe 고유의 추론 엔진으로 구동되며, 클러스터 전체에 걸친 키-값 캐시를 통해 GPU가 로컬 및 원격 노드에서 프리픽스 캐시를 가져와 중복 프리필을 제거합니다. Crusoe에 따르면 이 엔진은 첫 토큰까지의 시간을 최대 9.9배 빠르게 하고, 처리량을 5배 높이며, 이는 네 개 노드 배포에서 Llama-3.3-70B 모델에 대해 vLLM과 비교한 벤치마크 결과입니다.
Crusoe는 Managed Inference 제품 페이지에 따라 세 가지 배포 옵션으로 서비스를 제공합니다. Serverless Inference는 완전 관리형 API를 통해 오픈 모델을 사용량 기반으로 제공하며, 초기 단계 워크로드, 저볼륨 트래픽 및 빠른 실험에 적합합니다. 페이지에서 현재 일반 제공 중이라고 밝힌 Self-Serve Deployments는 처리량 또는 반응성을 최적화한 모델을 실행하며, Crusoe의 Serverless Fine-Tuning으로 맞춤화된 모델도 포함합니다. Tailored Deployments는 고객을 Crusoe 팀과 연결해 전용 벤치마크 엔드포인트를 제공하며, 이 옵션은 독점 모델을 대상으로 합니다.
개발자는 Crusoe Intelligence Foundry를 통해 서비스에 접근할 수 있으며, 여기서 API 키를 생성하고 각 모델에 맞춘 관리형 엔드포인트를 사용하며, 성능 지표를 모니터링하고 프로덕션 규모 배포를 위한 프로비저닝된 처리량을 활성화할 수 있습니다. Crusoe의 모델 허브에는 DeepSeek, Google, Z.ai, OpenAI, Meta, Alibaba, NVIDIA 등 연구소에서 제공하는 사전 구성된 오픈 모델이 나열되어 있으며, 각 모델의 파라미터 수와 컨텍스트 길이가 명시되어 있습니다.












