Haastattelut
Corey Sanders, Senior Vice President Product at CoreWeave – Haastattelusarja

Corey Sanders, CoreWeaven Senior Vice President Product, johtaa tuotestrategiaa ja -toteutusta yhdessä nopeimmin kasvavista AI-pohjaisista pilviympäristöistä. Hän on vastuussa innovaatioiden skaalauttamisesta, asiakasten kanssa yhteistyössä toteutettavien ratkaisujen muotoilusta ja CoreWeaven aseman vahvistamisesta AI-infrastruktuurimarkkinoilla. Ennen CoreWeavea Sanders työskenteli kaksikymmentä vuotta Microsoftilla johtavissa asemissa, jotka kattoivat pilvi-insinööritöiden, teollisuusspesifisten alustojen, kaupallisen ratkaisustrategian ja suurten yritysten kumppanuuksien, ja hänellä on syvä kokemus teknisen toteutuksen ja markkinointistrategian yhdistämisestä.
CoreWeave (CRWV ) on AI-pohjainen pilviyhtiö, joka on rakennettu erityisesti suorituskykyisen laskennan ja laajamittaisten tekoälytyökuormien tarpeisiin. Yritys toimii nopeasti laajenevalla jalansijalla datakeskuksissa ympäri Yhdysvaltoja ja Eurooppaa, ja se tarjoaa GPU-kiihdytettyä infrastruktuuria ja ohjelmistoja, jotka on suunniteltu tekoälykoulutukseen, inferenceen ja edistyneisiin laskentatapauksiin. Keskittyessään tarkoitukseen suunniteltuun arkkitehtuuriin yleispätevien pilviympäristöjen sijaan CoreWeave on tullut oleelliseksi infrastruktuurikumppaniksi tekoälylaboratorioille ja yrityksille, jotka etsivät suorituskykyä, skaalautuvuutta ja tehokkuutta laajassa mittakaavassa.
Olit yli 20 vuotta Microsoftilla, ja työskentelit Windowsin insinööritöissä, pilvipalveluiden myyntistrategiassa ja Microsoft (MSFT ) Cloud for Industry -projektissa. Mitä tämä kehitys opetti sinulle siitä, mitkä tekijät todella ohjaavat yritysten omaksumista, ja miten soveltat näitä oppeja nykyään CoreWeavessa?
Yritysten omaksuminen alkaa siitä, että ratkaistaan tietty asiakkaan ongelma. Innovointi itsessään ei ole välttämätöntä yrityksille. On tärkeää asettua heidän asemaansa ja ymmärtää, mitä heidän ongelmiaan oikeasti vaivaa – olipa se tuen kustannus, toiminnalliset monimutkaisuudet, asiakkaiden kanssa vuorovaikutus tai globaalien tiimien ja uusien tuotelinjojen hallinta – ja tarjota palveluita, jotka auttavat. Usein he ovat valmiita ottamaan riskin ja kokeilemaan uusia lähestymistapoja, mutta tärkeintä on auttaa heitä ratkaisemaan ongelmiaan. Yleisin virhe, jonka olen nähnyt tuotesuunnittelussa, on se, että joutuu liian kiinni tuotteen “coolnessiin”. Vaikka se on tärkeää kuluttajamarkkinoilla, yritysasiakkaat pitävät lopulta enemmän hyödyllisyydestä kuin coolnessista.
CoreWeavea kuvaillaan usein tarjoavan tarkoitukseen suunniteltua AI-infrastruktuuria. Mitä tarkoitukseen suunnittelu tarkoittaa käytännössä tuotepuolella, ja missä yleispätevät pilviympäristöt kamppailevat tekoälytyökuormien kanssa?
Tarkoitukseen suunnittelun suurin etu on kyky keskittyä ja tarjota palveluita ilman, että on ratkaistava jokaista yleistä käyttötapausta. Esitän kaksi esimerkkiä: yksi ohjelmistopuolella ja yksi laitteistopuolella.
Ohjelmistopuolella Object Storage -tarjoammme LOTA-välimuistilla on keskittynyt nimenomaan tekoälytyökuormien välimuistiin. Se asentuu suoraan GPU-solmuihin, tarjoaa S3-päätepisteen sovellukselle ja vastaa GPU-pyyntöihin jakamalla välimuistinsa useiden solmujen yli. Tämä lisää lähetysnopeutta GPU:lle jopa 7 GB/s, mikä ylittää selvästi yleispätevien pilvien tarjoamat arvot. Voimme saavuttaa tämän, koska teemme oletuksia tekoälytyökuormien ympärillä, lukemisen ja kirjoittamisen jakautumisesta ja klusterien asettelusta. Jos asiakas käyttäisi tätä tietokannan tai verkkokaupan isäntänä, se ei vaikuttaisi samalla tavalla. Tämä on määritelmä tarkoitukseen suunnitellusta ohjelmistosta.
Laitteistoesimerkki on samankaltainen. Ottaen huomioon laajamittaisten uusimman sukupolven NVIDIA (NVDA ) -tuotteiden käytön – joista monet vaativat nestejäähdytystä – CoreWeave on kehittänyt erityistä asiantuntemusta ja datakeskusrakenteita, jotka tukevat näitä tarpeita. Toisin kuin suuremmat pilvet, jotka rakentavat vaihtokelpoisuutta ja joutuvat myöhemmin lisäämään nestejäähdytystä, CoreWeave rakentaa datakeskuksia AI:lle alusta alkaen. Tämä johtaa alempiin kustannuksiin ja suurempaan saatavuuteen uusimpien SKU-tyyppien osalta.
Alla on kuva LOTA-välimuistista.

Kun asiakkaat ensin ajattelevat tekoälyn skaalauttamista, he usein luulevat, että he tarvitsevat vain pääsyn GPU:hin. Mitä he yleensä toteavat puuttuvan, kun he aloittavat mallien kouluttamisen tai palvelun suurella mittakaavalla?
Ottaen huomioon suurten GPU-klusterien monimutkaisuuden, ympäröivät palvelut muodostuvat todellisiksi menestyksen moottoreiksi. Tähän kuuluvat ilmiselvät asiat, kuten tallennus ja verkkoyhteydet, mutta myös kriittiset operatiiviset palvelut, kuten havainnointi, orkestraatio ja turvallisuus. Tässä CoreWeave erottuu Mission Control -tarjoamme kanssa. Se tarjoaa asiakkaille syvän ymmärryksen solmujen terveydestä ja suorituksesta heidän laivastonsa yli, integroiden tietämys suoraan orkestraatiomoottoriin. Tämä mahdollistaa asiakkaiden kohdella infrastruktuuriaan yhtenäisenä, yhtenäiseksi työentiteettinä eikä 1000 yksittäisenä GPU:na.
Mitä ovat tärkeimmät tuotekehitysprioriteetit, joihin keskityt parantaaksesi asiakkaiden lopputuloksia, olipa kyseessä sitten suorituskyky, luotettavuus, kustannusten ennustettavuus tai kehittäjän kokemus?
Ydinpalvelussamme keskitymme jatkuvasti suorituskykyyn, luotettavuuteen ja havainnointiin. Meidän on varmistettava, että asiakkaat voivat suorittaa työtehtäviä toistuvasti ja ennustettavasti hyödyntäen jokaista GPU:ssa olevaa TFLOPia. Tämän lisäksi työskentelemme asiakkaiden perehdytyksen yksinkertaistamiseksi, jotka eivät välttämättä ole tuttuja jokaisesta SLURM-työkalun (jota kaikki käyttävät, mutta jota melkein kaikki inhoavat) nuppineulasta. Lopulta kehitämme lisäpalveluita ja laskumalleja, joiden avulla on helpompi innovoida ja aloittaa pienissä mittakaavoissa. Tällä hetkellä kokeilu on yllättävän hankalaa johtuen korkeista kynnyksistä, kuten kapasiteetin rajoituksista, kolmen vuoden sitoutumisista ja erityistä asiantuntijuutta vaativista aloittamisesta. Haluamme palauttaa innovaation helppouden AI-alustalle.
Kun enemmän tekoälytyökuormia siirtyy koulutuksesta inferenceen, miten tämä siirtymä vaikuttaa infrastruktuurin suunnitteluun ja tuotekehitysstrategioihin?
Se luo merkittäviä mahdollisuuksia soveltaa CoreWeaven olemassa olevaa erottuvuutta inference-vaatimuksiin. Esimerkiksi mainitsin aiemmin LOTA-välimuistin, joka on keskittynyt tekoälytyökuormien koulutukseen; voimme kuitenkin ottaa saman teknologian, integroida sen joihinkin KVCacheen ja muuttaa sen voimalliseksi inference-erottuvuudeksi. Samoin työkalut kuten Mission Control tulevat entistä tärkeämmiksi inferenceksi, koska GPU-terveyden seuraaminen on olennainen osa korkean saatavuuden agenteille sovellusten suorittamisessa.
Mitä määrittelee johtajuuden AI-pilvimarkkinoilla seuraavien yhden tai kahden vuoden aikana, ja mitkä kyvykkyydet tulevat olemaan tärkeimpiä asiakkaille?
Uskon, että johtajuus määritellään kahdella asialla. Ensinnäkin on kyky tarjota kasvavat mittakaavat koulutukselle. Tämä edellyttää edistystä havainnoinnissa, terveyden seuraamisessa ja automaattisessa palauttamisessa. Kun siirrytään sadoista tuhansiin GPU:hin, jotka on jakautunut maailmanlaajuisesti, manuaalinen vasteiden käsittely on mahdotonta.
Toiseksi on tarjottava oikeat palvelut inference- ja agenteille työkuormille. Tämä edellyttää globaaleja käyttöönotto-ominaisuuksia ja liiketoimintamalleja, jotka kannustavat kokeilua. Tämä käyttömalli auttoi pilviä kasvamaan alun perin, ja se on jossain määrin hävinnyt tekoälyn aikakaudella. Meidän on palautettava se paremman alustatuen, monipilviominaisuuksien ja monialueellisen helppokäyttöisyyden kautta.
Aikaisemmin johtit teollisuusspesifisiä pilvialustoja terveydenhuollossa, vähittäiskaupassa, rahoituspalveluissa, valmistuksessa ja suvereenissa pilvessä. Mitkä niistä opetuksista suoraan kääntyvät tekoälyinfrastruktuuriin, ja mitkä eivät?
GPU-sukupolven muutokset jatkavat uusien monimutkaisuuksien esittelyä. Jokainen uusi julkaisu tuo lisääntyneen interaktiivisuuden, suuremman muistin ja suuremman tehon, mikä edellyttää meiltä uudelleenarviointia solmujen yhteyksistä ja ohjelmistojen toimittamisesta. Meidän on oltava armottomia tässä suhteessa, jotta voimme ylläpitää johtajuuttamme. Toisaalta nopeasti paraneva alue on asiakkaiden kyky sopeutua suurempiin laskentakokoonpanoihin; heidän sopeutumisnopeus on vaikuttava.
Kun tekoälydatakeskukset ja -klusterit jatkavat kasvamistaan, mitkä operatiiviset haasteet ovat vaikeimmin ratkaistavissa tällä hetkellä, ja mitkä paranevat nopeimmin?
GPU-sukupolvien muutokset jatkavat uusien monimutkaisuuksien esittelyä suunnittelussa ja ohjelmistojen toimittamisessa. Jokainen uusi GPU-julkaisu tuo lisääntyneen interaktiivisuuden, suuremman muistin ja suuremman tehon, mikä edellyttää meiltä uudelleenarviointia solmujen yhteyksistä, hyllyjen hallintaa ja ohjelmistojen toimittamista. Meidän on jatkossakin panostettava tähän työhön, jotta voimme ylläpitää johtajuuttamme. Ne, jotka paranevat nopeimmin, ovat asiakkaiden kykyä saavuttaa suurempaa mittakaavaa.
Teckoälyinfrastruktuurissa luotettavuus ylittää yksinkertaisen käytettävyyden. Miten CoreWeave määrittelee luotettavuuden, ja mitkä indikaattorit heijastavat parhaiten onnistumista asiakkaan näkökulmasta?
Suurella mittakaavalla asiakkaan tärkein asia on yksinkertaisesti saada työ tehtyä. Massiivisissa toiminnissa yksittäiset virheet tai hidastukset ovat odotettavissa. Avainasia on, miten havaitsemme ja vastaamme automaattisesti näihin ongelmiin, jotta työ saadaan valmiiksi haasteista huolimatta. Tämän vuoksi integroidaan Mission Control korkeampiin palveluihin, kuten SUNK (Slurm on Kubernetes). Se mahdollistaa asiakkaiden vastata virheisiin automaattisesti ilman, että he menettävät tunteja tai viikkoja työtä. Meille onnistuminen ei ole vain solmun käytettävyydestä; se on työn onnistumisesta.
Mitä suurta muutosta tekoälyinfrastruktuurissa uskot olevan yhä aliarvostettuna, liittyen siihen, onko kyse laitteiston kehittymisestä, pinottujen pinnoitusten erikoistumisesta, suvereniteetin vaatimuksista vai uusista käyttöönottomalleista?
Uskon, että vahvistusoppimisen (RL) uudelleenlämmitys osana tekoälypinottuja on yhä aliarvostettu. Vaikka se ei ole uusi tutkimuksen ala, se oli suurelta osin varjoon jäänyt tekoälymallien (LLM) alkuvaiheessa. RL tekee paluun ja tulee olemaan tärkeässä roolissa tekoälypalvelujen tekemisessä vastaanottavammiksi asiakkaiden muuttuville maisemille. Tämän vuoksi olemme erittäin innoissamme palvelimettomasta RL-tarjoomme.
Kiitos haastattelusta, lukijat, jotka haluavat oppia lisää, voivat vierailla CoreWeaven sivuilla.












