साझेदारियाँ

Thinking Machines Lab ने $65 मिलियन वार्षिक सौदा किया Crusoe Cloud Inference के लिए

mm
Unite.AI को Google पर अपने पसंदीदा स्रोतों में जोड़ें

Crusoe और Thinking Machines Lab घोषित किया $65 मिलियन वार्षिक समझौता 23 सितंबर, 2026 को, लैब के खुले मॉडलों के लिए Crusoe Cloud पर इन्फ़रेंस को शक्ति देने के लिए, जहाँ उत्पादन कार्यभार NVIDIA HGX B200 सिस्टम्स की एक समर्पित तैनाती के माध्यम से Crusoe Managed Inference द्वारा प्रदान किए जाएंगे।

सैन फ्रांसिस्को डेटलाइन के साथ यह घोषणा करती है कि Thinking Machines Lab उत्पादन कार्यभारों की एक श्रृंखला, जिसमें उसके Inkling मॉडल, GLM 5.2 और 5.3, तथा उसके स्वयं के फाइन‑ट्यून्ड वैरिएंट शामिल हैं, को NVIDIA Quantum-2 InfiniBand नेटवर्किंग से जुड़े NVIDIA HGX B200 सिस्टम्स की एक समर्पित Tailored Deployment पर सेवा देगा। Crusoe ने इस तैनाती को उच्च थ्रूपुट, लागत‑प्रभावी स्केलेबल सर्विंग के लिए डिज़ाइन किया हुआ बताया।

Crusoe क्लस्टर को सीधे Tailored Deployment के रूप में चलाएगा और समर्थन देगा, जिसे रिलीज़ में एक समर्पित, बेंचमार्क्ड, SLA‑समर्थित एंडपॉइंट के रूप में वर्णित किया गया है, जिसका उद्देश्य Thinking Machines Lab को मूल्य‑प्रदर्शन और स्केल करने के लिए हेडरूम प्रदान करना है, बिना अपने स्वयं के इन्फ़रेंस स्टैक को प्रबंधित किए। रिलीज़ में, Crusoe ने खुद को उद्योग का पहला वर्टिकली इंटीग्रेटेड AI इन्फ्रास्ट्रक्चर प्रदाता बताया है।

प्रबंधित इन्फ़रेंस विकल्प और MemoryAlloy इंजन

On Crusoe की Managed Inference उत्पाद पृष्ठ, कंपनी Tailored Deployments को अपनी उच्चतम अनुकूलन स्तर के रूप में प्रस्तुत करती है: ग्राहक मॉडल लाता है और आवश्यकताओं को परिभाषित करता है जबकि Crusoe बाकी सब संभालता है, एक समर्पित, बेंचमार्क्ड एंडपॉइंट के साथ जो स्वामित्व वाले मॉडलों, विशेष इन्फ़रेंस अनुकूलन, और SLA‑समर्थित प्रदर्शन के लिए स्थित है।

यह पृष्ठ Serverless Inference, ओपन‑सोर्स मॉडलों की उपयोग‑आधारित खपत के माध्यम से Crusoe Intelligence Foundry में पूर्ण‑प्रबंधित API, और Self‑Serve Deployments, जो अब सामान्य उपलब्ध हैं, को भी विस्तृत करता है, जो Foundry में मॉडलों को चलाते हैं और इन्फ़रेंस को थ्रूपुट या प्रतिक्रिया गति के लिए अनुकूलित करते हैं, जिसमें कंपनी की Serverless Fine‑Tuning सुविधा के साथ अनुकूलित मॉडल शामिल हैं। Foundry स्वयं को मॉडल खोजने, API कुंजियाँ उत्पन्न करने, प्रदर्शन मीट्रिक की निगरानी करने, और प्रबंधित एंडपॉइंट तैनात करने के लिए एक डेवलपर प्लेटफ़ॉर्म के रूप में प्रस्तुत करता है।

Crusoe कहता है कि उसका इन्फ़रेंस इंजन MemoryAlloy द्वारा संचालित है, जो एक क्लस्टर‑नेटिव मेमोरी फैब्रिक है जो नोड्स के बीच बना रहता है और बुद्धिमान रूटिंग को सक्षम करता है ताकि दोहराव वाले प्री‑फ़िल गणना को समाप्त किया जा सके। कंपनी रिपोर्ट करती है कि स्पेकुलेटिव डिकोडिंग और डायनामिक बैचिंग का उपयोग करके समय‑से‑पहले‑टोकन में 9.9 गुना तेज़ी और थ्रूपुट में 5 गुना वृद्धि प्राप्त हुई, ये आंकड़े vLLM के खिलाफ बेंचमार्क किए गए थे जो चार‑नोड तैनाती में Llama-3.3-70B मॉडल सर्व कर रहा था।

Inkling और GLM मॉडल

समझौते में नामित कार्यभारों में लैब का अपना Inkling परिवार शामिल है। Thinking Machines Lab ने Inkling को 15 जुलाई, 2026 को जारी किया, इसे एक ओपन‑वेट्स Mixture‑of‑Experts ट्रांसफ़ॉर्मर के रूप में वर्णित किया जिसमें कुल 975B पैरामीटर और 41B सक्रिय पैरामीटर हैं, और यह अधिकतम 1M टोकन के कॉन्टेक्स्ट विंडो का समर्थन करता है। लैब के अनुसार, Inkling को 45 ट्रिलियन टोकन पर प्री‑ट्रेन किया गया था, जिसमें टेक्स्ट, इमेज, ऑडियो और वीडियो शामिल हैं, और यह लैब की पहली बड़ी प्रशिक्षण रन थी, जो NVIDIA GB300 NVL72 सिस्टम्स पर की गई।

Inkling के साथ, लैब ने Inkling‑Small का प्रीव्यू किया, जो 276B पैरामीटर वाला हल्का‑वजन Mixture‑of‑Experts मॉडल है, जिसमें 12B सक्रिय पैरामीटर हैं और यह अलग प्रदर्शन और लेटेंसी ट्रेड‑ऑफ़ रखता है। Inkling के पूर्ण वेट्स Hugging Face पर प्रकाशित किए गए हैं, मूल चेकपॉइंट और NVIDIA Blackwell सिस्टम्स पर कुशल इन्फ़रेंस के लिए NVFP4 चेकपॉइंट दोनों के रूप में, और मॉडल Tinker पर फाइन‑ट्यूनिंग के लिए उपलब्ध है, जो लैब का मॉडल‑कस्टमाइज़ेशन प्लेटफ़ॉर्म है, जिसमें 64K और 256K कॉन्टेक्स्ट लंबाई विकल्प हैं।

समझौते में GLM 5.2 और 5.3 को भी सेवा पर लैब के उत्पादन कार्यभारों में शामिल किया गया है। Crusoe की Managed Inference मॉडल हब Z.ai के GLM 5.3 को 753B पैरामीटर के साथ 1,000,000‑टोकन कॉन्टेक्स्ट पर सूचीबद्ध करती है और GLM 5.3 Flash को 320B पैरामीटर के साथ, दोनों Serverless Inference के लिए उपलब्ध हैं।

कार्यकारी बयानों और नियोजित विस्तार

“Crusoe Managed Inference ने हमें मूल्यांकन से उत्पादन तक जल्दी पहुँचाया और हमारे अपने सिस्टम्स के मानकों को पूरा किया, जिससे हमें स्केल और आर्थिकता मिली जिससे हम अपने कोर अनुसंधान में पुनः निवेश कर सकें,” Myle Ott, ML Infra Lead, Thinking Machines Lab ने कहा।

Erwan Menard, Crusoe Cloud के प्रोडक्ट मैनेजमेंट के SVP, ने कहा कि Thinking Machines Lab की एक परिष्कृत इंजीनियरिंग टीम है जो भागीदारों से उम्मीद करती है कि वे इसके उच्च मानकों को पूरा करें जैसे ही यह बढ़ता है। उन्होंने कहा कि Crusoe ने Managed Inference को लागत‑प्रभावी, विश्वसनीय इन्फ़्रास्ट्रक्चर, इन्फ़रेंस, और मॉडल लाइफ़साइकल टूलिंग को सेवा के रूप में प्रदान करने के लिए बनाया है ताकि कंपनियां अपने चुने हुए मॉडलों को स्केल पर उत्पादन में चला सकें।

कंपनियों ने कहा कि वे बड़े‑पैमाने पर सिंथेटिक डेटा जनरेशन के लिए बैच इन्फ़रेंस में विस्तार करने की भी योजना बना रहे हैं, जिसे रिलीज़ ने अनुसंधान के लिए इन्फ़रेंस को एक फ़्लायव्हील में बदलने के रूप में प्रस्तुत किया है। Crusoe ने कहा कि Thinking Machines Lab एक ग्राहक सूची में शामिल हो गया है जिसने Crusoe Managed Inference को लॉन्च के एक वर्ष से कम समय में $100 मिलियन से अधिक अनुबंधित ARR तक पहुंचाया है।

थियो नैश यूनाइट.एआई में एक एआई-जनरेटेड विशेषज्ञ है, जो एआई इंफ्रास्ट्रक्चर, कंप्यूट, और आधुनिक कृत्रिम बुद्धिमत्ता को शक्ति प्रदान करने वाले हार्डवेयर सिस्टम को कवर करता है। उनका काम बड़े पैमाने पर एआई कार्यभार के पीछे के तकनीकी आधारों पर केंद्रित है, जिसमें डेटा सेंटर, एक्सेलरेटर, नेटवर्किंग, और सॉफ्टवेयर स्टैक शामिल हैं जो उन्हें एक साथ जोड़ते हैं।
एक विश्लेषणात्मक और इंजीनियरिंग-चालित दृष्टिकोण के साथ, थियो जीपीयू, कस्टम सिलिकॉन, मेमोरी आर्किटेक्चर, और वितरित प्रणालियों में प्रगति का अध्ययन करता है कि वे नए पीढ़ी के एआई मॉडल को कैसे सक्षम बनाते हैं। वह प्रदर्शन व्यापार-ऑफ, ऊर्जा दक्षता, स्केलेबिलिटी, और व्यावहारिक प्रतिबंधों पर विशेष ध्यान देता है जो एआई इंफ्रास्ट्रक्चर के वास्तविक दुनिया के तैनाती को आकार देते हैं।
थियो नैश द्वारा लिखित लेख एआई-जनरेटेड हैं और यूनाइट.एआई की संपादकीय टीम द्वारा तकनीकी सटीकता, स्पष्टता, और तेजी से विकसित हो रहे एआई कंप्यूट लैंडस्केप के जिम्मेदार कवरेज को सुनिश्चित करने के लिए समीक्षा की जाती है।