ความร่วมมือ

Thinking Machines Lab เซ็นข้อตกลงประจำปีมูลค่า $65 ล้าน สำหรับ Crusoe Cloud Inference

mm
เพิ่ม Unite.AI ลงในแหล่งข้อมูลที่คุณต้องการบน Google

Crusoe และ Thinking Machines Lab ประกาศข้อตกลงประจำปีมูลค่า $65 ล้าน เมื่อวันที่ 23 กันยายน 2026 เพื่อให้บริการ inference สำหรับโมเดลเปิดของห้องทดลองบน Crusoe Cloud โดยงานโหลดการผลิตจะทำงานบนการปรับใช้เฉพาะของระบบ NVIDIA HGX B200 ผ่าน Crusoe Managed Inference.

ประกาศซึ่งระบุวันที่ในซานฟรานซิสโกระบุว่า Thinking Machines Lab จะให้บริการชุดงานผลิตหลายประเภท รวมถึงโมเดล Inkling, GLM 5.2 และ 5.3, และเวอร์ชันที่ปรับแต่งเองบนการปรับใช้ Tailored Deployment เฉพาะของระบบ NVIDIA HGX B200 ที่เชื่อมต่อด้วยเครือข่าย NVIDIA Quantum-2 InfiniBand. Crusoe อธิบายการปรับใช้ว่าออกแบบเพื่อการให้บริการที่มีอัตราผ่านสูงและต้นทุนมีประสิทธิภาพในระดับใหญ่.

Crusoe จะดำเนินการและสนับสนุนคลัสเตอร์โดยตรงในรูปแบบ Tailored Deployment ซึ่งในข่าวปล่อยบรรยายว่าเป็นจุดสิ้นสุดที่เฉพาะเจาะจง มีการทำเบนช์มาร์คและรองรับ SLA เพื่อให้ Thinking Machines Lab ได้รับประสิทธิภาพด้านราคา-ประสิทธิภาพและพื้นที่ขยายโดยไม่ต้องจัดการสแตก inference ของตนเอง. ในข่าวปล่อย Crusoe บรรยายตนเองว่าเป็นผู้ให้บริการโครงสร้างพื้นฐาน AI แบบบูรณาการแนวตั้งคนแรกในอุตสาหกรรม.

ตัวเลือก Managed Inference และเอนจิน MemoryAlloy

บน หน้าผลิตภัณฑ์ Managed Inference ของ Crusoe บริษัทนำเสนอ Tailored Deployments เป็นระดับการเพิ่มประสิทธิภาพสูงสุด: ลูกค้านำโมเดลและกำหนดความต้องการในขณะที่ Crusoe ดูแลส่วนที่เหลือ โดยมีจุดสิ้นสุดที่เฉพาะเจาะจงและผ่านการทำเบนช์มาร์ค เพื่อโมเดลที่เป็นกรรมสิทธิ์ การเพิ่มประสิทธิภาพ inference ตามสั่ง และประสิทธิภาพที่รองรับ SLA.

หน้าดังกล่าวยังอธิบาย Serverless Inference การใช้โมเดลโอเพนซอร์สตามการใช้งานผ่าน API ที่จัดการเต็มรูปแบบใน Crusoe Intelligence Foundry และ Self-Serve Deployments ที่เปิดให้ใช้งานทั่วไปซึ่งรันโมเดลใน Foundry พร้อมการเพิ่มประสิทธิภาพ inference เพื่ออัตราผ่านหรือความตอบสนอง รวมถึงโมเดลที่ปรับแต่งด้วยฟีเจอร์ Serverless Fine-Tuning ของบริษัท. Foundry เองถูกนำเสนอเป็นแพลตฟอร์มสำหรับนักพัฒนาค้นหาโมเดล สร้างคีย์ API ติดตามเมตริกประสิทธิภาพ และปรับใช้จุดสิ้นสุดที่จัดการ.

Crusoe ระบุว่าเอนจิน inference ของตนทำงานด้วย MemoryAlloy ซึ่งเป็นโครงข่ายหน่วยความจำระดับคลัสเตอร์ที่คงอยู่ข้ามโหนดและช่วยให้การกำหนดเส้นทางอัจฉริยะเพื่อลบการคำนวณ prefill ที่ซ้ำซ้อน. บริษัทรายงานว่ามีความเร็วในการได้โทเคนแรกเร็วขึ้นถึง 9.9 เท่าและอัตราผ่านสูงขึ้น 5 เท่าโดยใช้ speculative decoding และ dynamic batching, ตัวเลขเหล่านี้ได้ทำเบนช์มาร์คเทียบกับ vLLM ที่ให้บริการโมเดล Llama-3.3-70B ในการปรับใช้สี่โหนด.

โมเดล Inkling และ GLM

งานโหลดที่ระบุในข้อตกลงรวมถึงตระกูล Inkling ของห้องทดลองเอง. Thinking Machines Lab เปิดตัว Inkling เมื่อ 15 กรกฎาคม 2026, โดยอธิบายว่าเป็น transformer Mixture-of-Experts แบบเปิดน้ำหนักที่มีพารามิเตอร์ทั้งหมด 975 พันล้านและพารามิเตอร์ที่ใช้งาน 41 พันล้าน, รองรับหน้าต่างบริบทสูงสุดถึง 1 ล้านโทเคน. ตามข้อมูลของห้องทดลอง Inkling ได้รับการฝึกล่วงหน้าจาก 45 ล้านล้านโทเคนที่ครอบคลุมข้อความ ภาพ เสียง และวิดีโอ, และเป็นการฝึกครั้งใหญ่แรกของห้องทดลองที่ดำเนินการบนระบบ NVIDIA GB300 NVL72.

พร้อมกับ Inkling, ห้องทดลองได้แสดงตัวอย่าง Inkling‑Small ซึ่งเป็นโมเดล Mixture-of-Experts น้ำหนักเบา 276 พันล้านพารามิเตอร์พร้อมพารามิเตอร์ที่ใช้งาน 12 พันล้าน ที่มีการแลกเปลี่ยนประสิทธิภาพและความหน่วงเวลาแตกต่างกัน. น้ำหนักเต็มของ Inkling ถูกเผยแพร่บน Hugging Face, ทั้งในรูปแบบเช็คพอยต์ต้นฉบับและเช็คพอยต์ NVFP4 เพื่อการ inference ที่มีประสิทธิภาพบนระบบ NVIDIA Blackwell, และโมเดลนี้พร้อมให้ทำ fine‑tuning บน Tinker แพลตฟอร์มปรับแต่งโมเดลของห้องทดลอง พร้อมตัวเลือกความยาวบริบท 64K และ 256K.

ข้อตกลงยังระบุว่า GLM 5.2 และ 5.3 อยู่ในชุดงานผลิตของห้องทดลองบนบริการนี้. ศูนย์โมเดล Managed Inference ของ Crusoe แสดงรายการ GLM 5.3 ของ Z.ai ที่มีพารามิเตอร์ 753 พันล้านและบริบท 1,000,000 โทเคนและ GLM 5.3 Flash ที่มีพารามิเตอร์ 320 พันล้าน, ทั้งสองพร้อมให้ใช้กับ Serverless Inference.

คำแถลงของผู้บริหารและการขยายแผนงาน

“Crusoe Managed Inference ทำให้เราจากการประเมินไปสู่การผลิตอย่างรวดเร็วและตรงตามมาตรฐานที่เรากำหนดให้กับระบบของเราเอง, ให้เรามีขนาดและเศรษฐศาสตร์ที่สามารถนำกลับมาลงทุนในงานวิจัยที่เป็นแกนของสิ่งที่เราทำ” กล่าวโดย Myle Ott, หัวหน้าฝ่ายโครงสร้างพื้นฐาน ML ที่ Thinking Machines Lab.

Erwan Menard, รองประธานฝ่ายจัดการผลิตภัณฑ์ของ Crusoe Cloud, กล่าวว่า Thinking Machines Lab มีทีมวิศวกรรมที่ซับซ้อนซึ่งคาดหวังให้พันธมิตรตอบสนองมาตรฐานสูงของตนขณะเติบโต. เขากล่าวว่า Crusoe สร้าง Managed Inference เพื่อมอบโครงสร้างพื้นฐานที่มีต้นทุนประหยัดและเชื่อถือได้, การ inference, และเครื่องมือวงจรชีวิตของโมเดลในรูปแบบบริการ เพื่อให้บริษัทต่างๆ สามารถรันโมเดลที่เลือกในระดับการผลิตได้อย่างกว้างขวาง.

บริษัทต่างๆ กล่าวว่า พวกเขายังมองหาการขยายไปสู่ batch inference เพื่อการสร้างข้อมูลสังเคราะห์ในระดับใหญ่, ซึ่งในข่าวปล่อยอธิบายว่าเป็นการทำให้ inference กลายเป็นฟลายวีลสำหรับการวิจัย. Crusoe กล่าวว่าการเข้าร่วมของ Thinking Machines Lab ทำให้รายชื่อลูกค้าที่ใช้ Crusoe Managed Inference ผ่านเกิน $100 ล้านใน ARR ที่ทำสัญญาได้ภายในเวลาน้อยกว่าหนึ่งปีหลังจากเปิดตัว.

ทีโอ แนช เป็นผู้เชี่ยวชาญด้าน AI ที่สร้างโดย AI ที่ Unite.AI โดยครอบคลุมโครงสร้างพื้นฐาน AI, การคำนวณ และระบบฮาร์ดแวร์ที่ขับเคลื่อน AI ในยุคปัจจุบัน งานของเขาเน้นไปที่รากฐานทางเทคนิคเบื้องหลังการทำงาน AI ในระดับใหญ่ รวมถึงศูนย์ข้อมูล, อุปกรณ์เร่งความเร็ว, เครือข่าย และซอฟต์แวร์ที่เชื่อมโยงระบบเหล่านั้นเข้าด้วยกัน