Kumppanuudet

Thinking Machines Lab solmii 65 miljoonan dollarin vuotuisen sopimuksen Crusoe Cloud Inference -palvelusta

mm
Lisää Unite.AI suosikkilähteisiisi Google-palvelussa

Crusoe ja Thinking Machines Lab julisti 65 miljoonan dollarin vuotuisen sopimuksen 23. syyskuuta 2026, voidakseen tehostaa inferenssiä laboratorion avoimille malleille Crusoe Cloudissa, ja tuotantotyöt käsitellään omistetussa NVIDIA HGX B200 -järjestelmäasennuksessa Crusoe Managed Inference -palvelun kautta.

Ilmoitus, jonka toimipaikkana on San Francisco, toteaa, että Thinking Machines Lab tarjoaa laajan valikoiman tuotantotyökuormia, mukaan lukien sen Inkling-mallit, GLM 5.2 ja 5.3 sekä omat hienosäädetyt varianttinsa, omistetussa Tailored Deployment -asennuksessa NVIDIA HGX B200 -järjestelmillä, jotka on yhdistetty NVIDIA Quantum-2 InfiniBand -verkkoon. Crusoe kuvaili asennuksen suunnitelluksi korkean läpimenoajan ja kustannustehokkaan skaalautuvan palvelun mahdollistajaksi.

Crusoe ajaa ja tukee klusteria suoraan Tailored Deployment -ratkaisuna, jonka tiedotteessa kuvataan omistetuksi, benchmarkatuksi ja SLA-takuulla varustetuksi päätepisteeksi, jonka tarkoituksena on tarjota Thinking Machines Labille hinta‑suorituskyky ja kapasiteettivara skaalautumiseen ilman oman inferenssikerran hallintaa. Tiedotteessa Crusoe kuvaa itseään alan ensimmäiseksi pystysuunnassa integroiduksi AI‑infrastruktuuripalveluntarjoajaksi.

Hallinnoidut inferenssivaihtoehdot ja MemoryAlloy‑moottori

On Crusoe Managed Inference -tuotesivu yritys esittelee Tailored Deployments -ratkaisut optimoiduin tasoinaan: asiakas tuo mallin ja määrittelee vaatimukset, kun Crusoe hoitaa loput, tarjoten omistetun, benchmarkatun päätepisteen, joka on suunnattu omistusoikeudellisille malleille, räätälöidylle inferenssien optimoinnille ja SLA-takuulla varustetulle suorituskyvylle.

Sivu kuvaa myös Serverless Inference -palvelun, avoimen lähdekoodin mallien käyttöön perustuvan kulutuksen täysin hallinnoidun API:n kautta Crusoe Intelligence Foundryssa, sekä Self-Serve Deployments -ratkaisut, jotka ovat nyt yleisesti saatavilla; ne suorittavat malleja Foundryssa inferenssin optimoimalla läpimenoa tai reagointikykyä, mukaan lukien yrityksen Serverless Fine-Tuning -ominaisuudella räätälöidyt mallit. Foundry esitetään kehittäjäalustana mallien löytämiseen, API-avainten luomiseen, suorituskykymittareiden seurantaan ja hallittujen päätepisteiden käyttöönottoon.

Crusoe kertoo, että sen inferenssi­moottori toimii MemoryAlloyn avulla, klusterin natiivina muistikankaana, joka säilyy solmujen välillä ja mahdollistaa älykkään reitityksen ylimääräisen esitäytön laskennan poistamiseksi. Yritys raportoi jopa 9,9‑kertaisesta nopeammasta ensimmäisen tokenin saamisesta ja 5‑kertaisesta korkeammasta läpimenosta spekulatiivista dekoodausta ja dynaamista ryhmittelyä käyttäen; luvut on benchmarkattu vLLM:n kanssa, joka palvelee Llama-3.3-70B -mallia neljän solmun asennuksessa.

Inkling- ja GLM-mallit

Sopimuksen nimissä olevat työkuormat sisältävät laboratorion oman Inkling-perheen. Thinking Machines Lab julkaisi Inklingin 15. heinäkuuta 2026, kuvaillen sitä avoimen painon Mixture-of-Experts -muunnoksena, jossa on 975 miljardia kokonaisparametria ja 41 miljardia aktiivisia parametreja, ja joka tukee enintään 1 miljoonaa tokenia kattavaa kontekstiajankohtaa. Laboratorion mukaan Inkling esikoulutettiin 45 triljoonan tokenin datalla, joka sisälsi tekstiä, kuvia, ääntä ja videota, ja hanke oli laboratorion ensimmäinen suuri koulutuskierros, joka toteutettiin NVIDIA GB300 NVL72 -järjestelmissä.

Inklingin rinnalla laboratorio esitteli Inkling-Smallin, kevyemmän 276 miljardia parametria sisältävän Mixture-of-Experts -mallin, jossa on 12 miljardia aktiivisia parametreja ja joka tarjoaa erilaisen suorituskyky‑ ja viive‑tasapainon. Inklingin täydet painot on julkaistu Hugging Face-palvelussa, sekä alkuperäisenä tarkistuspisteenä että NVFP4‑tarkistuspisteenä tehokasta inferenssiä varten NVIDIA Blackwell -järjestelmissä, ja malli on saatavilla hienosäätöön Tinkerissä, laboratorion mallien räätälöintialustassa, jossa on 64 K ja 256 K kontekstipituusvaihtoehdot.

Sopimus asettaa myös GLM 5.2:n ja 5.3:n laboratorion tuotantotyökuormiin palvelussa. Crusoe Managed Inference -mallihubi listaa Z.ai:n GLM 5.3:n, jossa on 753 miljardia parametria ja 1 000 000 tokenin konteksti, sekä GLM 5.3 Flashin, jossa on 320 miljardia parametria; molemmat ovat saatavilla Serverless Inference -palvelussa.

Johtajien lausunnot ja suunniteltu laajentuminen

„Crusoe Managed Inference siirsi meidät arvioinnista tuotantoon nopeasti ja täytti ne standardit, joita vaadimme omilta järjestelmiltämme, tarjoten meille skaalautuvuutta ja taloudellista tehokkuutta, jotta voimme investoida uudelleen tutkimukseen, joka on toimintaamme ytimessä“, sanoi Myle Ott, ML-infrastruktuurijohtaja Thinking Machines Labissa.

Erwan Menard, Crusoe Cloudin tuotehallinnan SVP, totesi, että Thinking Machines Labilla on kehittynyt insinööritiimi, joka odottaa kumppaneiden täyttävän sen korkean tason kasvun myötä. Hän sanoi, että Crusoe rakensi Managed Inference -palvelun tarjoamaan kustannustehokasta, luotettavaa infrastruktuuria, inferenssiä ja mallien elinkaaren työkaluja palveluna, jotta yritykset voivat ajaa valitsemiaan malleja tuotannossa mittakaavassa.

Yritykset ilmoittivat myös suunnittelevansa laajentumista eräinferenssiin suurten synteettisten datamassojen tuottamiseksi, mikä tiedotteessa esitetään inferenssin muuttamisena tutkimuksen pyöriväksi voimaksi. Crusoe kertoi, että Thinking Machines Lab liittyy asiakaslistaan, jonka Crusoe Managed Inference on nostanut yli 100 miljoonaa dollaria sopimuksellista vuotuista toistuvaa tuloa (ARR) alle vuosiin lanseerauksesta.

Theo Nash on tekoälygeneroitu asiantuntija Unite.AI:ssa, joka kattaa tekoälyinfrastruktuurin, laskennan ja modernin tekoälyä voimistavat laitteistojärjestelmät. Hänen työnsä keskittyy suurten tekoälykuormien taustalla oleviin teknisiin perusteisiin, mukaan lukien datakeskukset, kiihdyttimet, verkkotiet ja ohjelmistopinot, jotka sitoutuvat niihin.
Analyytisesta ja insinöörijohtoisesta näkökulmasta Theo tarkastelee, miten GPU:n, mukautetun piirin, muistiarkkitehtuurien ja hajautettujen järjestelmien edistysaskeleet mahdollistavat uusia tekoälymallien sukupolvia. Hän kiinnittää erityistä huomiota suorituskyky-yhteyksiin, energiatehokkuuteen, skaalautuvuuteen ja käytännön rajoituksiin, jotka muokkaavat tekoälyinfrastruktuurin todellista käyttöönottoa.
Artikkelit, joita Theo Nash on kirjoittanut, on tekoälygeneroitu ja Unite.AI:n toimittajatiimi on tarkastanut ne varmistaakseen teknisen tarkkuuden, selkeyden ja vastuullisen kattavuuden nopeasti kehittyvässä tekoälylaskennan maisemassa.