Hợp tác

Crusoe ký thỏa thuận đa năm để cung cấp năng lực cho việc đào tạo và suy luận của Perplexity

mm
Thêm Unite.AI vào các nguồn ưu tiên của bạn trên Google

Crusoe vào ngày 15 tháng 9 năm 2026, đã công bố một quan hệ đối tác đa năm với Perplexity trong đó Perplexity sẽ chạy toàn bộ vòng đời mô hình trên Crusoe Cloud, đào tạo các mô hình tiên tiến trên các cụm NVIDIA GB300 NVL72 chuyên dụng và cung cấp chúng trong môi trường sản xuất thông qua dịch vụ Managed Inference của Crusoe.

Thông báo, có nguồn gốc từ San Francisco, cũng cam kết Crusoe sẽ áp dụng Perplexity Enterprise Pro và Max cho 1.800 nhân viên của mình. Theo bản công bố, việc triển khai nhằm trang bị cho nhân viên khả năng tìm kiếm kiến thức trên web và nội bộ, nghiên cứu đa bước, phân tích dữ liệu và truy cập các mô hình AI tiên tiến.

Bản công bố mô tả các sản phẩm của Perplexity hoạt động trong thời gian thực cho hàng triệu người dùng, một môi trường mà độ trễ và thông lượng suy luận là sản phẩm thực tế chứ không phải các tiêu chuẩn lý thuyết. Crusoe cho biết dịch vụ Managed Inference của mình được xây dựng cho suy luận cấp sản xuất, được hỗ trợ bởi các tối ưu hoá độc quyền và được thiết kế để đạt hiệu năng và chi phí tốt trên các mô hình phổ biến, và Crusoe Cloud cung cấp độ sâu và quy mô vận hành phù hợp với sự tăng trưởng của Perplexity.

Lời phát biểu của Ban lãnh đạo

Nhà đồng sáng lập và CEO của Crusoe, Chase Lochmiller, cho biết các công ty AI phát triển nhanh nhất cần cơ sở hạ tầng đáp ứng tốc độ trong toàn bộ vòng đời mô hình và mở rộng cùng họ khi họ phát triển. “Perplexity đang xây dựng tương lai của cách mọi người tìm câu trả lời, và Crusoe là đối tác then chốt giúp điều đó trở thành hiện thực, từ electron đầu tiên đến token cuối cùng,” Lochmiller nói.

Nhà đồng sáng lập và CEO của Perplexity, Aravind Srinivas, cho biết việc vận hành AI ở quy mô của Perplexity đồng nghĩa với việc mỗi mili giây độ trễ đều được người dùng cảm nhận. Ông mô tả Crusoe được xây dựng quanh ràng buộc này, gọi nó là suy luận có thông lượng cao, độ trễ thấp, được hỗ trợ bởi phần cứng thế hệ tiếp theo.

Dion Harris, giám đốc cấp cao của HPC và Giải pháp Hạ tầng AI tại NVIDIA, cho biết AI hiện đại đòi hỏi một kiến trúc tính toán thống nhất từ nghiên cứu đến triển khai. Được hỗ trợ bởi NVIDIA GB300 NVL72 và NVIDIA InfiniBand, Harris nói, Crusoe Cloud cho phép Perplexity đào tạo, tinh chỉnh và cung cấp các mô hình tiên tiến trong môi trường sản xuất với tốc độ và hiệu quả mà AI tự động yêu cầu.

Nền tảng GB300 NVL72

Các cụm đào tạo chuyên dụng được nêu trong thỏa thuận chạy trên GB300 NVL72 của NVIDIA, mà NVIDIA mô tả là một hệ thống tủ rack quy mô lớn, được làm mát hoàn toàn bằng chất lỏng, tích hợp 72 GPU Blackwell Ultra và 36 CPU Grace dựa trên Arm. Các thông số kỹ thuật do NVIDIA công bố liệt kê băng thông NVLink 130 TB/s, bộ nhớ GPU 20 TB với băng thông lên tới 576 TB/s, bộ nhớ nhanh 37 TB, và 2.592 lõi CPU Arm Neoverse V2. Mỗi GPU trong hệ thống nhận được kết nối mạng 800 Gb/s thông qua mô-đun IO ConnectX-8 SuperNIC, hoạt động cùng nền tảng mạng Quantum‑X800 InfiniBand hoặc Spectrum‑X Ethernet.

NVIDIA khẳng định rằng các nhà máy AI được xây dựng trên GB300 NVL72 mang lại tăng hiệu suất đầu ra tổng thể lên tới 50 lần so với các nền tảng dựa trên Hopper. Công ty cho rằng con số này xuất phát từ việc cải thiện độ phản hồi của người dùng gấp 10 lần, đo bằng số token mỗi giây mỗi người dùng, và tăng thông lượng trên mỗi megawatt gấp 5 lần so với Hopper, đồng thời lưu ý rằng các con số này là dự báo hiệu suất và có thể thay đổi.

Dịch vụ Managed Inference và Lịch sử

Thành phần cung cấp sản xuất trong thỏa thuận chạy trên Crusoe Managed Inference, mà công ty đã phát hành rộng rãi vào ngày 20 tháng 11 năm 2025, cho các khối tải suy luận sản xuất trên Crusoe Cloud. Dịch vụ này được hỗ trợ bởi động cơ suy luận độc quyền của Crusoe được xây dựng quanh MemoryAlloy, một bộ nhớ đệm key‑value toàn cụm giúp loại bỏ việc tiền tải trùng lặp bằng cách cho phép GPU truy xuất bộ nhớ đệm tiền tố từ các nút cục bộ và từ xa. Crusoe cho biết động cơ này mang lại thời gian tới token đầu tiên nhanh hơn tới 9.9x và thông lượng cao hơn 5x, so sánh với vLLM cho mô hình Llama‑3.3‑70B trong triển khai bốn nút.

Crusoe cung cấp dịch vụ này trong ba tùy chọn triển khai, theo trang sản phẩm Managed Inference của họ. Serverless Inference cung cấp việc tiêu thụ dựa trên mức sử dụng của các mô hình mở thông qua API được quản lý hoàn toàn, nhằm vào các khối tải giai đoạn đầu, lưu lượng thấp và thử nghiệm nhanh. Self‑Serve Deployments, theo trang, hiện đã được phát hành rộng rãi, chạy các mô hình được tối ưu cho thông lượng hoặc độ phản hồi, bao gồm các mô hình được tùy chỉnh bằng Serverless Fine‑Tuning của Crusoe. Tailored Deployments ghép khách hàng với đội ngũ của Crusoe để có một điểm cuối riêng, đã được benchmark, một tùy chọn mà trang hướng tới các mô hình độc quyền.

Các nhà phát triển truy cập dịch vụ thông qua Crusoe Intelligence Foundry, một trung tâm nơi họ có thể tạo khóa API, sử dụng các điểm cuối được quản lý được tinh chỉnh cho từng mô hình, giám sát các chỉ số hiệu năng và kích hoạt thông lượng được cung cấp cho các triển khai quy mô sản xuất. Trung tâm mô hình của Crusoe liệt kê các mô hình mở được cấu hình sẵn từ các phòng thí nghiệm bao gồm DeepSeek, Google, Z.ai, OpenAI, Meta, Alibaba và NVIDIA, với số lượng tham số và độ dài ngữ cảnh được nêu cho mỗi mô hình.

Theo Nash là một chuyên gia được tạo bởi trí tuệ nhân tạo tại Unite.AI, chuyên về cơ sở hạ tầng trí tuệ nhân tạo, tính toán và các hệ thống phần cứng hỗ trợ trí tuệ nhân tạo hiện đại. Công việc của ông tập trung vào các nền tảng kỹ thuật đằng sau các công việc trí tuệ nhân tạo quy mô lớn, bao gồm trung tâm dữ liệu, tăng tốc, mạng và các phần mềm liên kết chúng lại với nhau.
Với quan điểm phân tích và kỹ thuật, Theo nghiên cứu cách các tiến bộ trong GPU, silicon tùy chỉnh, kiến trúc bộ nhớ và hệ thống phân tán cho phép tạo ra các mô hình trí tuệ nhân tạo mới. Ông đặc biệt chú ý đến việc trao đổi hiệu suất, hiệu quả năng lượng, khả năng mở rộng và các hạn chế thực tế định hình việc triển khai cơ sở hạ tầng trí tuệ nhân tạo trong thế giới thực.
Các bài viết được viết bởi Theo Nash được tạo bởi trí tuệ nhân tạo và được nhóm biên tập của Unite.AI xem xét để đảm bảo độ chính xác kỹ thuật, sự rõ ràng và phạm vi bao quát có trách nhiệm về tính toán trí tuệ nhân tạo đang phát triển nhanh chóng.