Hợp tác

Thinking Machines Lab ký thỏa thuận hàng năm trị giá $65 triệu cho Crusoe Cloud Inference

mm
Thêm Unite.AI vào các nguồn ưu tiên của bạn trên Google

Crusoe và Thinking Machines Lab đã công bố một thỏa thuận hàng năm trị giá $65 triệu vào ngày 23 tháng 9, 2026, để cung cấp khả năng suy luận cho các mô hình mở của phòng thí nghiệm trên Crusoe Cloud, với các khối lượng công việc sản xuất được phục vụ trên một triển khai chuyên dụng của hệ thống NVIDIA HGX B200 thông qua Crusoe Managed Inference.

Thông cáo báo chí, có ngày tại San Francisco, cho biết Thinking Machines Lab sẽ cung cấp một loạt các khối lượng công việc sản xuất, bao gồm các mô hình Inkling, GLM 5.2 và 5.3, cùng các biến thể tinh chỉnh riêng của mình, trên một Triển khai Tailored Deployment chuyên dụng của hệ thống NVIDIA HGX B200 được kết nối với mạng lưới NVIDIA Quantum-2 InfiniBand. Crusoe mô tả triển khai này được thiết kế để đạt tốc độ truyền tải cao, chi phí hiệu quả khi mở rộng.

Crusoe sẽ vận hành và hỗ trợ cụm máy trực tiếp dưới dạng Tailored Deployment, mà bản công bố mô tả là một điểm cuối chuyên dụng, đã được benchmark, có SLA hỗ trợ, nhằm cung cấp cho Thinking Machines Lab hiệu năng chi phí và khả năng mở rộng mà không cần quản lý ngăn xếp suy luận riêng. Trong bản công bố, Crusoe tự mô tả mình là nhà cung cấp hạ tầng AI tích hợp dọc đầu tiên trong ngành.

Các tùy chọn Managed Inference và Engine MemoryAlloy

Trên trang sản phẩm Managed Inference của Crusoe, công ty giới thiệu Tailored Deployments là mức tối ưu cao nhất: khách hàng mang mô hình và xác định yêu cầu trong khi Crusoe xử lý phần còn lại, với một điểm cuối chuyên dụng, đã được benchmark, được định vị cho các mô hình độc quyền, tối ưu hoá suy luận tùy chỉnh, và hiệu năng có SLA hỗ trợ.

Trang này cũng mô tả Serverless Inference, việc tiêu thụ dựa trên mức sử dụng các mô hình mã nguồn mở thông qua API được quản lý hoàn toàn trong Crusoe Intelligence Foundry, và Self-Serve Deployments, hiện đã khả dụng chung, cho phép chạy các mô hình trong Foundry với suy luận được tối ưu cho thông lượng hoặc độ phản hồi, bao gồm các mô hình được tùy chỉnh bằng tính năng Serverless Fine-Tuning của công ty. Foundry tự nó được giới thiệu như một nền tảng dành cho nhà phát triển để khám phá mô hình, tạo khóa API, giám sát các chỉ số hiệu năng và triển khai các điểm cuối được quản lý.

Crusoe cho biết engine suy luận của mình được hỗ trợ bởi MemoryAlloy, một lớp vải bộ nhớ gốc cụm cho phép duy trì qua các nút và cung cấp định tuyến thông minh để loại bỏ tính toán tiền đi lặp lại. Công ty báo cáo tốc độ đến token đầu tiên nhanh hơn tới 9,9x và thông lượng cao hơn 5x nhờ giải mã suy đoán và batch động, các số liệu này được benchmark so với vLLM phục vụ mô hình Llama-3.3-70B trong một triển khai bốn nút.

Các mô hình Inkling và GLM

Các khối lượng công việc được nêu trong thỏa thuận bao gồm cả họ mô hình Inkling của phòng thí nghiệm. Thinking Machines Lab đã phát hành Inkling vào ngày 15 tháng 7, 2026, mô tả nó là một transformer Mixture-of-Experts có trọng số mở với tổng cộng 975 tỷ tham số và 41 tỷ tham số hoạt động, hỗ trợ cửa sổ ngữ cảnh lên tới 1 triệu token. Theo phòng thí nghiệm, Inkling đã được tiền huấn luyện trên 45 nghìn tỷ token bao gồm văn bản, hình ảnh, âm thanh và video, và nỗ lực này là lần chạy huấn luyện lớn đầu tiên của phòng thí nghiệm, thực hiện trên hệ thống NVIDIA GB300 NVL72.

Cùng với Inkling, phòng thí nghiệm đã giới thiệu trước Inkling-Small, một mô hình Mixture-of-Experts nhẹ hơn với 276 tỷ tham số và 12 tỷ tham số hoạt động, mang lại sự cân bằng khác về hiệu năng và độ trễ. Toàn bộ trọng số của Inkling được công bố trên Hugging Face, cả dưới dạng checkpoint gốc và checkpoint NVFP4 để suy luận hiệu quả trên hệ thống NVIDIA Blackwell, và mô hình này có sẵn để tinh chỉnh trên Tinker, nền tảng tùy chỉnh mô hình của phòng thí nghiệm, với các tùy chọn độ dài ngữ cảnh 64K và 256K.

Thỏa thuận cũng đưa GLM 5.2 và 5.3 vào danh sách các khối lượng công việc sản xuất của phòng thí nghiệm trên dịch vụ. Trung tâm mô hình Managed Inference của Crusoe liệt kê GLM 5.3 của Z.ai với 753 tỷ tham số và ngữ cảnh 1.000.000 token, và GLM 5.3 Flash với 320 tỷ tham số, cả hai đều có sẵn cho Serverless Inference.

Tuyên bố của lãnh đạo và kế hoạch mở rộng

“Crusoe Managed Inference đã đưa chúng tôi từ giai đoạn đánh giá sang sản xuất một cách nhanh chóng và đáp ứng các tiêu chuẩn mà chúng tôi đặt ra cho hệ thống của mình, mang lại quy mô và hiệu quả kinh tế để tái đầu tư vào nghiên cứu cốt lõi của công việc chúng tôi thực hiện,” Myle Ott, Trưởng nhóm Hạ tầng ML tại Thinking Machines Lab, nói.

Erwan Menard, Phó Chủ tịch Cấp cao phụ trách Quản lý Sản phẩm cho Crusoe Cloud, cho biết Thinking Machines Lab có một đội ngũ kỹ thuật tinh vi, mong đợi các đối tác đáp ứng tiêu chuẩn cao khi công ty phát triển. Ông nói Crusoe đã xây dựng Managed Inference để cung cấp hạ tầng, suy luận và công cụ vòng đời mô hình hiệu quả về chi phí, đáng tin cậy dưới dạng dịch vụ, giúp các công ty có thể chạy các mô hình đã chọn trong môi trường sản xuất quy mô lớn.

Các công ty cho biết họ cũng đang tìm cách mở rộng sang batch inference cho việc tạo dữ liệu tổng hợp quy mô lớn, mà bản công bố mô tả như việc biến suy luận thành một bánh xe quay cho nghiên cứu. Crusoe cho biết Thinking Machines Lab đã gia nhập danh sách khách hàng đã đưa Crusoe Managed Inference vượt qua $100 triệu ARR đã ký hợp đồng trong chưa đầy một năm kể từ khi ra mắt.

Theo Nash là một chuyên gia được tạo bởi trí tuệ nhân tạo tại Unite.AI, chuyên về cơ sở hạ tầng trí tuệ nhân tạo, tính toán và các hệ thống phần cứng hỗ trợ trí tuệ nhân tạo hiện đại. Công việc của ông tập trung vào các nền tảng kỹ thuật đằng sau các công việc trí tuệ nhân tạo quy mô lớn, bao gồm trung tâm dữ liệu, tăng tốc, mạng và các phần mềm liên kết chúng lại với nhau.
Với quan điểm phân tích và kỹ thuật, Theo nghiên cứu cách các tiến bộ trong GPU, silicon tùy chỉnh, kiến trúc bộ nhớ và hệ thống phân tán cho phép tạo ra các mô hình trí tuệ nhân tạo mới. Ông đặc biệt chú ý đến việc trao đổi hiệu suất, hiệu quả năng lượng, khả năng mở rộng và các hạn chế thực tế định hình việc triển khai cơ sở hạ tầng trí tuệ nhân tạo trong thế giới thực.
Các bài viết được viết bởi Theo Nash được tạo bởi trí tuệ nhân tạo và được nhóm biên tập của Unite.AI xem xét để đảm bảo độ chính xác kỹ thuật, sự rõ ràng và phạm vi bao quát có trách nhiệm về tính toán trí tuệ nhân tạo đang phát triển nhanh chóng.