Συνεργασίες
Η Thinking Machines Lab υπογράφει ετήσια συμφωνία $65M για το Crusoe Cloud Inference

Crusoe και Thinking Machines Lab ανακοίνωσαν μια ετήσια συμφωνία αξίας $65 εκατομμύρια στις 23 Σεπτεμβρίου 2026, για την ενίσχυση της inference των ανοιχτών μοντέλων του εργαστηρίου στο Crusoe Cloud, με παραγωγικά φορτία εργασίας να εξυπηρετούνται σε μια αφιερωμένη ανάπτυξη συστημάτων NVIDIA HGX B200 μέσω του Crusoe Managed Inference.
Η ανακοίνωση, με ημερομηνία Σαν Φρανσίσκο, δηλώνει ότι η Thinking Machines Lab θα εξυπηρετήσει μια σειρά παραγωγικών φορτών εργασίας, συμπεριλαμβανομένων των μοντέλων Inkling, GLM 5.2 και 5.3, καθώς και των δικών της προσαρμοσμένων παραλλαγών, σε μια αφιερωμένη Tailored Deployment συστημάτων NVIDIA HGX B200 συνδεδεμένων με δίκτυο NVIDIA Quantum-2 InfiniBand. Η Crusoe περιέγραψε την ανάπτυξη ως σχεδιασμένη για υψηλή διαπερατότητα, οικονομική εξυπηρέτηση σε κλίμακα.
Η Crusoe θα διαχειρίζεται και θα υποστηρίζει το σύμπλεγμα απευθείας ως Tailored Deployment, το οποίο η ανακοίνωση περιγράφει ως αφιερωμένο, δοκιμασμένο, SLA‑υποστηριζόμενο σημείο άκρης που στοχεύει να προσφέρει στη Thinking Machines Lab απόδοση‑τιμή και περιθώριο κλιμάκωσης χωρίς να διαχειρίζεται το δικό της stack inference. Στην ανακοίνωση, η Crusoe περιγράφει τον εαυτό της ως τον πρώτο στην βιομηχανία πάροχο AI υποδομής κάθετης ενσωμάτωσης.
Επιλογές Managed Inference και η Μηχανή MemoryAlloy
Στην σελίδα προϊόντος Managed Inference της Crusoe, η εταιρεία παρουσιάζει τις Tailored Deployments ως το υψηλότερο επίπεδο βελτιστοποίησης: ο πελάτης φέρνει το μοντέλο και ορίζει τις απαιτήσεις, ενώ η Crusoe διαχειρίζεται το υπόλοιπο, με ένα αφιερωμένο, δοκιμασμένο σημείο άκρης προσαρμοσμένο για ιδιόκτητα μοντέλα, εξειδικευμένη βελτιστοποίηση inference και απόδοση με υποστήριξη SLA.
Η σελίδα περιγράφει επίσης το Serverless Inference, κατανάλωση βάσει χρήσης ανοιχτών μοντέλων μέσω πλήρως διαχειριζόμενου API στο Crusoe Intelligence Foundry, καθώς και τις Self‑Serve Deployments, τώρα γενικά διαθέσιμες, που εκτελούν μοντέλα στο Foundry με inference βελτιστοποιημένο για διαπερατότητα ή ανταπόκριση, συμπεριλαμβανομένων μοντέλων προσαρμοσμένων με τη λειτουργία Serverless Fine‑Tuning της εταιρείας. Το Foundry παρουσιάζεται ως πλατφόρμα για προγραμματιστές για ανακάλυψη μοντέλων, δημιουργία κλειδιών API, παρακολούθηση μετρικών απόδοσης και ανάπτυξη διαχειριζόμενων σημείων άκρης.
Η Crusoe δηλώνει ότι η μηχανή inference της τροφοδοτείται από το MemoryAlloy, ένα ενσωματωμένο στο σύμπλεγμα memory fabric που παραμένει διασυνολικά και επιτρέπει έξυπνη δρομολόγηση για την εξάλειψη περιττής προ‑συμπλήρωσης υπολογισμών. Η εταιρεία αναφέρει έως και 9,9x ταχύτερο χρόνο‑πρώτου‑token και 5x υψηλότερη διαπερατότητα χρησιμοποιώντας υποθετική αποκωδικοποίηση και δυναμική ομαδοποίηση, αριθμούς που συγκρίνει με το vLLM που εξυπηρετεί το μοντέλο Llama‑3.3‑70B σε ανάπτυξη τεσσάρων κόμβων.
Τα μοντέλα Inkling και GLM
Τα ονομασμένα φορτία εργασίας της συμφωνίας περιλαμβάνουν τη δική του οικογένεια Inkling του εργαστηρίου. Η Thinking Machines Lab δημοσίευσε το Inkling στις 15 Ιουλίου 2026, περιγράφοντάς το ως έναν μετασχηματιστή Mixture‑of‑Experts ανοιχτών βαρών με 975 δισεκατομμύρια συνολικές παραμέτρους και 41 δισεκατομμύρια ενεργές παραμέτρους, υποστηρίζοντας ένα παράθυρο συμφραζομένων έως 1 M tokens. Σύμφωνα με το εργαστήριο, το Inkling προεκπαιδεύτηκε σε 45 τρισεκατομμύρια tokens που καλύπτουν κείμενο, εικόνες, ήχο και βίντεο, και η προσπάθεια αυτή ήταν η πρώτη σημαντική εκπαίδευση του εργαστηρίου, πραγματοποιημένη σε συστήματα NVIDIA GB300 NVL72.
Παράλληλα με το Inkling, το εργαστήριο παρουσίασε το Inkling‑Small, ένα ελαφρύτερο μοντέλο Mixture‑of‑Experts με 276 δισεκατομμύρια παραμέτρους και 12 δισεκατομμύρια ενεργές παραμέτρους, που προσφέρει διαφορετική απόδοση και ανταπόκριση. Τα πλήρη βάρη του Inkling δημοσιεύονται στο Hugging Face, τόσο ως το αρχικό checkpoint όσο και ως checkpoint NVFP4 για αποδοτική inference σε συστήματα NVIDIA Blackwell, και το μοντέλο είναι διαθέσιμο για fine‑tuning στο Tinker, την πλατφόρμα προσαρμογής μοντέλων του εργαστηρίου, με επιλογές μήκους συμφραζομένων 64 K και 256 K.
Η συμφωνία τοποθετεί επίσης τα GLM 5.2 και 5.3 μεταξύ των παραγωγικών φορτών εργασίας του εργαστηρίου στην υπηρεσία. Το Managed Inference hub της Crusoe καταγράφει το GLM 5.3 της Z.ai με 753 δισεκατομμύρια παραμέτρους και παράθυρο 1.000.000 tokens, καθώς και το GLM 5.3 Flash με 320 δισεκατομμύρια παραμέτρους, και τα δύο διαθέσιμα για Serverless Inference.
Δηλώσεις Εκτελεστικών και Προγραμματισμένη Επέκταση
“Το Crusoe Managed Inference μας πήγε από την αξιολόγηση στην παραγωγή γρήγορα και πληρούσε τα πρότυπα που θέτουμε στα δικά μας συστήματα, δίνοντάς μας την κλίμακα και την οικονομία για επανεπένδυση στην έρευνα που αποτελεί τον πυρήνα του έργου μας,” είπε ο Myle Ott, ML Infra Lead στη Thinking Machines Lab.
Ο Erwan Menard, SVP of Product Management για το Crusoe Cloud, δήλωσε ότι η Thinking Machines Lab διαθέτει μια εξελιγμένη ομάδα μηχανικών που αναμένει από τους συνεργάτες να ανταποκριθούν στα υψηλά της πρότυπα καθώς μεγαλώνει. Πρόσθεσε ότι η Crusoe δημιούργησε το Managed Inference για να προσφέρει οικονομικά αποδοτική, αξιόπιστη υποδομή, inference και εργαλεία κύκλου ζωής μοντέλων ως υπηρεσία, ώστε οι εταιρείες να μπορούν να εκτελούν τα επιλεγμένα μοντέλα τους στην παραγωγή σε κλίμακα.
Οι εταιρείες δήλωσαν ότι σκοπεύουν επίσης να επεκταθούν σε batch inference για δημιουργία συνθετικών δεδομένων μεγάλης κλίμακας, κάτι που η ανακοίνωση περιγράφει ως μετατροπή του inference σε κινητήρα για την έρευνα. Η Crusoe ανέφερε ότι η Thinking Machines Lab εντάσσεται σε μια λίστα πελατών που έχει φτάσει το Crusoe Managed Inference πάνω από $100 εκατομμύρια σε συμβατικό ARR λιγότερο από ένα χρόνο από την έναρξη.












