Partnerstwa
Crusoe zawiera wieloletni kontrakt na zasilanie treningu i inferencji Perplexity

Crusoe w dniu 15 września 2026 r. ogłosił wieloletnie partnerstwo z Perplexity, w ramach którego Perplexity będzie prowadzić pełny cykl życia modeli w Crusoe Cloud, trenując modele na granicy możliwości na dedykowanych klastrach NVIDIA GB300 NVL72 oraz udostępniając je w produkcji za pośrednictwem usługi Managed Inference firmy Crusoe.
Ogłoszenie, datowane w San Francisco, zobowiązuje również Crusoe do przyjęcia Perplexity Enterprise Pro i Max dla swoich 1 800 pracowników. Według komunikatu, wdrożenie ma na celu wyposażenie personelu w wyszukiwanie wiedzy w sieci i wewnętrzne, badania wieloetapowe, analizę danych oraz dostęp do modeli AI na granicy możliwości.
Komunikat opisuje produkty Perplexity jako działające w czasie rzeczywistym dla milionów użytkowników, w środowisku, w którym opóźnienie i przepustowość inferencji są produktem, a nie jedynie teoretycznymi benchmarkami. Crusoe oświadczył, że jego usługa Managed Inference jest zbudowana pod kątem inferencji klasy produkcyjnej, napędzana własnymi optymalizacjami i zaprojektowana pod kątem wydajności i kosztów w różnych popularnych modelach, a Crusoe Cloud zapewnia operacyjną głębokość i skalę, które odpowiadają wzrostowi Perplexity.
Oświadczenia kierownictwa
Współzałożyciel i CEO Crusoe, Chase Lochmiller, powiedział, że najszybciej rozwijające się firmy AI potrzebują infrastruktury, która nadąża za całym cyklem życia modeli i skaluje się wraz z ich rozwojem. „Perplexity buduje przyszłość sposobu, w jaki ludzie znajdują odpowiedzi, a Crusoe jest kluczowym partnerem umożliwiającym to, od pierwszego elektronu po ostatni token” – powiedział Lochmiller.
Współzałożyciel i CEO Perplexity, Aravind Srinivas, stwierdził, że prowadzenie AI w skali Perplexity oznacza, że każdy milisekundowy opóźnienie jest odczuwany przez użytkowników. Opisał Crusoe jako zaprojektowane wokół tego ograniczenia, określając je jako inferencję o wysokiej przepustowości i niskim opóźnieniu, wspieraną przez sprzęt najnowszej generacji.
Dion Harris, starszy dyrektor ds. rozwiązań HPC i infrastruktury AI w NVIDIA, stwierdził, że nowoczesna AI wymaga jednolitej architektury obliczeniowej od badań po wdrożenie. Zasilany przez NVIDIA GB300 NVL72 i NVIDIA InfiniBand, Harris powiedział, że Crusoe Cloud umożliwia Perplexity trenowanie, dostrajanie i udostępnianie modeli na granicy możliwości w produkcji z prędkością i wydajnością, jakich wymaga agentowa AI.
Platforma GB300 NVL72
Dedykowane klastry treningowe wymienione w umowie działają na GB300 NVL72 firmy NVIDIA, którą NVIDIA opisuje jako w pełni chłodzone cieczą, system rack‑scale integrujący 72 procesory graficzne Blackwell Ultra oraz 36 procesorów CPU Grace o architekturze Arm. Opublikowane specyfikacje NVIDIA podają 130 TB/s przepustowości NVLink, 20 TB pamięci GPU z maksymalną przepustowością do 576 TB/s, 37 TB szybkiej pamięci oraz 2 592 rdzenie CPU Arm Neoverse V2. Każdy GPU w systemie otrzymuje 800 Gb/s łączności sieciowej poprzez moduł IO ConnectX‑8 SuperNIC, współpracujący z platformami sieciowymi Quantum‑X800 InfiniBand lub Spectrum‑X Ethernet.
NVIDIA twierdzi, że fabryki AI zbudowane na GB300 NVL72 zapewniają nawet 50‑krotny wzrost ogólnej wydajności produkcji AI w porównaniu z platformami opartymi na Hopper. Firma przypisuje tę wartość deklarowanemu 10‑krotnemu ulepszeniu responsywności użytkownika, mierzonemu w tokenach na sekundę na użytkownika, oraz 5‑krotnemu wzrostowi przepustowości na megawat, w porównaniu z Hopper, i zaznacza, że podane liczby są prognozowanymi wynikami, które mogą ulec zmianie.
Usługa Managed Inference i historia
Element obsługujący produkcję w ramach umowy działa na Crusoe Managed Inference, które firma udostępniła publicznie 20 listopada 2025 r. dla obciążeń inferencji produkcyjnej w Crusoe Cloud. Usługa jest napędzana własnym silnikiem inferencji Crusoe, opartym na MemoryAlloy, klastrze o pamięci podręcznej klucz‑wartość, który eliminuje podwójne wstępne wypełnienia, umożliwiając GPU pobieranie pamięci podręcznej prefiksów z węzłów lokalnych i zdalnych. Crusoe podaje, że silnik zapewnia do 9,9‑krotnego przyspieszenia czasu do pierwszego tokenu oraz 5‑krotny wzrost przepustowości, w porównaniu z vLLM dla modelu Llama‑3.3‑70B w czterowęzłowym wdrożeniu.
Crusoe oferuje usługę w trzech opcjach wdrożenia, zgodnie ze swoją stroną produktu Managed Inference. Serverless Inference zapewnia konsumpcję opartą na użyciu otwartych modeli poprzez w pełni zarządzane API, skierowane do wczesnych etapów obciążeń, niskiego wolumenu ruchu i szybkich eksperymentów. Self‑Serve Deployments, które strona informuje, że są już dostępne publicznie, uruchamiają modele zoptymalizowane pod kątem przepustowości lub responsywności, w tym modele dostosowane przy użyciu Serverless Fine‑Tuning firmy Crusoe. Tailored Deployments łączą klientów z zespołem Crusoe, aby zapewnić dedykowany, benchmarkowany punkt końcowy – opcję skierowaną do modeli własnościowych.
Programiści uzyskują dostęp do usługi poprzez Crusoe Intelligence Foundry, centrum, w którym mogą generować klucze API, korzystać z zarządzanych punktów końcowych dopasowanych do każdego modelu, monitorować metryki wydajności oraz włączać przydzieloną przepustowość dla wdrożeń na skalę produkcyjną. Hub modeli Crusoe wymienia wstępnie skonfigurowane otwarte modele z laboratoriów, w tym DeepSeek, Google, Z.ai, OpenAI, Meta, Alibaba i NVIDIA, podając liczbę parametrów i długość kontekstu dla każdego modelu.












