파트너십
Thinking Machines Lab, Crusoe Cloud Inference를 위한 $65M 연간 계약 체결

Crusoe와 Thinking Machines Lab $65 million 규모의 연간 계약을 발표했다 2026년 9월 23일, 이 계약은 Crusoe Cloud에서 연구소의 오픈 모델에 대한 추론을 지원하기 위한 것으로, NVIDIA HGX B200 시스템을 전용 배치하여 Crusoe Managed Inference를 통해 프로덕션 워크로드를 제공한다.
샌프란시스코를 발신지로 한 발표에 따르면, Thinking Machines Lab은 Inkling 모델, GLM 5.2 및 5.3, 그리고 자체 파인튜닝 변형들을 포함한 다양한 프로덕션 워크로드를 NVIDIA Quantum-2 InfiniBand 네트워킹으로 연결된 NVIDIA HGX B200 시스템의 전용 맞춤형 배치를 통해 제공할 예정이라고 밝혔다. Crusoe는 이 배치를 대규모 고처리량 및 비용 효율적인 서비스 제공을 위해 설계된 것으로 설명했다.
Crusoe는 클러스터를 직접 운영 및 지원하며, 이를 맞춤형 배치(Tailored Deployment)라고 부른다. 이번 발표에서는 전용이며 벤치마크된 SLA 기반 엔드포인트로, Thinking Machines Lab에 가격 대비 성능과 확장 여유를 제공하면서 자체 추론 스택을 관리할 필요가 없도록 설계되었다고 설명한다. Crusoe는 이번 발표에서 자사를 업계 최초의 수직 통합 AI 인프라 제공업체라고 소개한다.
관리형 추론 옵션 및 MemoryAlloy 엔진
Crusoe의 Managed Inference 제품 페이지에서, 회사는 Tailored Deployments를 최상위 최적화 수준으로 제시한다: 고객이 모델을 제공하고 요구 사항을 정의하면 Crusoe가 나머지를 처리하며, 전용 벤치마크된 엔드포인트가 독점 모델, 맞춤형 추론 최적화 및 SLA 기반 성능을 위해 배치된다.
이 페이지에서는 또한 서버리스 추론(Serverless Inference)을 상세히 설명하고 있으며, 이는 Crusoe Intelligence Foundry의 완전 관리형 API를 통해 오픈소스 모델을 사용량 기반으로 소비하는 방식이다. 또한 이제 일반 제공되는 셀프 서비스 배치(Self-Serve Deployments)는 Foundry 내에서 모델을 실행하며, 처리량 또는 응답성을 최적화한 추론을 제공하고, 회사의 서버리스 파인튜닝(Serverless Fine-Tuning) 기능으로 맞춤화된 모델도 포함한다. Foundry 자체는 모델을 탐색하고, API 키를 생성하며, 성능 지표를 모니터링하고, 관리형 엔드포인트를 배포하기 위한 개발자 플랫폼으로 제시된다.
Crusoe는 자사의 추론 엔진이 MemoryAlloy에 의해 구동된다고 밝히며, 이는 클러스터 네이티브 메모리 패브릭으로 노드 간에 지속되며 지능형 라우팅을 통해 중복 프리필 연산을 제거한다. 회사는 추측 디코딩과 동적 배칭을 활용하여 최초 토큰 도달 시간이 최대 9.9배 빨라지고 처리량이 5배 증가했다고 보고했으며, 이 수치는 네 개 노드 배치에서 Llama-3.3-70B 모델을 vLLM으로 서빙한 결과와 비교한 벤치마크이다.
Inkling 및 GLM 모델
협약에 명시된 워크로드에는 연구소 자체 Inkling 제품군이 포함된다. Thinking Machines Lab은 2026년 7월 15일 Inkling을 출시했다, 이를 9750억 개의 총 파라미터와 410억 개의 활성 파라미터를 가진 오픈-웨이트 Mixture-of-Experts 트랜스포머로, 최대 100만 토큰의 컨텍스트 윈도우를 지원한다고 설명한다. 연구소에 따르면 Inkling은 텍스트, 이미지, 오디오 및 비디오를 포괄하는 45조 토큰으로 사전 학습되었으며, 이는 연구소가 NVIDIA GB300 NVL72 시스템에서 수행한 첫 번째 대규모 학습 작업이었다.
Inkling과 함께, 연구소는 Inkling-Small을 미리 선보였는데, 이는 2760억 파라미터의 경량 Mixture-of-Experts 모델로 120억 활성 파라미터를 가지고 있으며, 성능과 지연 시간 사이의 다른 트레이드오프를 제공한다. Inkling의 전체 가중치는 Hugging Face에 공개되어 있으며, 원본 체크포인트와 NVIDIA Blackwell 시스템에서 효율적인 추론을 위한 NVFP4 체크포인트 두 가지 형태로 제공된다. 또한 이 모델은 연구소의 모델 맞춤화 플랫폼인 Tinker에서 64K 및 256K 컨텍스트 길이 옵션으로 파인튜닝이 가능하다.
이 협약은 또한 GLM 5.2와 5.3을 서비스상의 연구소 프로덕션 워크로드에 포함한다. Crusoe의 Managed Inference 모델 허브에는 Z.ai의 GLM 5.3이 7530억 파라미터와 100만 토큰 컨텍스트를 가지고 있으며, GLM 5.3 Flash는 3200억 파라미터를 가지고 있어 두 모델 모두 서버리스 추론에 사용할 수 있다고 나와 있다.
임원 발언 및 향후 확장 계획
\”Crusoe Managed Inference는 평가 단계에서 프로덕션 단계로 빠르게 전환하도록 도와주었으며, 우리 자체 시스템에 적용하는 기준을 충족시켜 주어 규모와 경제성을 확보해 핵심 연구에 재투자할 수 있게 해주었습니다\”,라고 Thinking Machines Lab의 ML Infra Lead인 Myle Ott가 말했다.
Crusoe Cloud 제품 관리 부문 SVP인 Erwan Menard는 Thinking Machines Lab이 고도화된 엔지니어링 팀을 보유하고 있으며, 파트너들이 성장함에 따라 높은 기준을 충족하기를 기대한다고 말했다. 그는 Crusoe가 관리형 추론(Managed Inference)을 구축한 목적이 비용 효율적이고 신뢰할 수 있는 인프라, 추론 및 모델 수명주기 도구를 서비스 형태로 제공하여 기업이 선택한 모델을 대규모 프로덕션 환경에서 실행할 수 있게 하기 위함이라고 설명했다.
양사는 대규모 합성 데이터 생성을 위한 배치 추론으로 사업을 확장할 계획이라고 밝혔으며, 이번 발표에서는 이를 연구를 위한 추론의 플라이휠화라고 표현했다. Crusoe는 Thinking Machines Lab이 출시 후 1년 미만에 계약 연간 반복수익(ARR) $100 million을 초과한 고객 명단에 합류했다고 전했다.












