Interviuri

Corey Sanders, Vicepreședinte Senior pentru Produse la CoreWeave – Seria de Interviuri

mm
Adaugă Unite.AI la sursele tale preferate pe Google

Corey Sanders, Vicepreședinte Senior pentru Produse la CoreWeave (CRWV ), conduce strategia și execuția produsului pentru una dintre cele mai rapide platforme cloud axate pe inteligență artificială. El este responsabil pentru scalarea inovației, crearea de soluții personalizate împreună cu clienții și consolidarea poziției CoreWeave pe piața infrastructurii de inteligență artificială. Înainte de a se alătura CoreWeave, Sanders a petrecut două decenii la Microsoft (MSFT ) în roluri de conducere senior, care acopereau ingineria cloud, platformele specifice industriei, strategia de soluții comerciale și parteneriatele întreprinderilor la scară largă, cu o experiență profundă în legătura dintre execuția tehnică și strategia de piață.

CoreWeave este un furnizor de cloud nativ pentru inteligență artificială, construit special pentru calculul de înaltă performanță și încărcături de lucru de inteligență artificială la scară largă. Compania operează o rețea în expansiune rapidă de centre de date în Statele Unite și Europa, oferind infrastructură și software accelerate de GPU, proiectate pentru antrenarea, inferența și utilizarea avansată a calculului. Prin concentrarea asupra arhitecturii cu scop special, mai degrabă decât a cloud-ului cu scop general, CoreWeave a devenit un partener de infrastructură critic pentru laboratoarele de inteligență artificială și întreprinderile care caută performanță, scalabilitate și eficiență la scară.

Ați petrecut peste 20 de ani la Microsoft, lucrând în domeniul ingineriei Windows, strategiei de vânzări cloud și a cloud-ului Microsoft pentru Industrie. Ce v-a învățat această evoluție despre ceea ce stimulează cu adevărat adoptarea la nivel de întreprindere și cum aplicați aceste lecții astăzi la CoreWeave?

Adoptarea la nivel de întreprindere începe cu rezolvarea unei probleme specifice a clientului. Inovația pentru sake-ul inovației nu este de fapt atât de crucială pentru întreprindere. Este vorba despre a te pune în papucii lor pentru a înțelege ce îi deranjează cu adevărat – fie că este vorba de costul suportului, complexitățile operaționale, conectarea cu clienții sau gestionarea echipelor globale și a noilor linii de produse – și apoi oferirea de servicii care să îi ajute. Ei sunt adesea dispuși să fie inovatori în abordarea lor, dar considerația cea mai crucială este să îi ajute să rezolve problema lor. Cel mai frecvent greșeală pe care am văzut-o în proiectarea produsului este să te lași prins în “coolness”-ul unui produs. Deși acest lucru are greutate în spațiul consumatorului, clienții întreprinderilor se preocupă, în final, mult mai mult de utilitate decât de “coolness”.

CoreWeave este descrisă adesea ca oferind infrastructură de inteligență artificială cu scop special. În termeni practici, ce înseamnă “cu scop special” din perspectiva produsului și unde se confruntă platformele cloud cu scop general cu dificultăți la încărcăturile de lucru de inteligență artificială?

Cel mai mare beneficiu al faptului de a fi cu scop special este capacitatea de a se concentra și de a oferi servicii fără a trebui să rezolve pentru fiecare caz de utilizare general. Voi da două exemple: unul în software și unul în hardware.

Pe partea de software, oferta noastră de stocare a obiectelor cu LOTA cache se axează în mod specific pe caching pentru încărcăturile de lucru de inteligență artificială. Aceasta se implementează direct pe nodurile GPU, oferă un punct de terminare S3 pentru aplicație și răspunde la solicitările GPU prin extinderea cache-ului pe mai multe noduri. Acest lucru crește debitul către GPU până la 7 GB/s, mult peste ceea ce oferă cloud-urile cu scop general. Putem realiza acest lucru pentru că facem presupuneri de proiectare în jurul încărcăturilor de lucru specifice de inteligență artificială, împărțirii citirii/scrierii și dispoziției clusterului. Dacă un client ar folosi acest lucru pentru găzduirea unei baze de date sau a unui site de comerț electronic, nu ar avea același impact. Acesta este definiția software-ului cu scop special.

Exemplul din hardware este similar. Având în vedere implementarea noastră extinsă a celor mai recente SKU-uri NVIDIA (NVDA ) – multe dintre acestea necesitând răcire lichidă – CoreWeave a dezvoltat o expertiză specifică și proiectează centre de date pentru a susține aceste nevoi. În contrast cu cloud-urile mai mari care construiesc pentru fungibilitate și apoi trebuie să adauge răcirea lichidă în mod retroactiv, CoreWeave construiește centre de date axate pe inteligență artificială de la zero. Acest lucru duce la costuri mai mici și o disponibilitate mai mare pentru cele mai recente tipuri de SKU.

Mai jos este o imagine a cache-ului LOTA menționat.

Când clienții încep să gândească despre scalarea inteligenței artificiale, mulți cred că au nevoie doar de acces la GPU-uri. Ce realizează ei de obicei că le lipsește odată ce încep să antreneze sau să servească modele la scară?

Având în vedere complexitatea rulării încărcăturilor de lucru pe clusteruri masive de GPU, serviciile din jurul acestora devin adevărații factori de succes. Acest lucru include serviciile evidente, cum ar fi stocarea și rețeaua, dar și serviciile operaționale critice, cum ar fi observabilitatea, orchestrarea și securitatea. Aici CoreWeave strălucește cu a sa ofertă Mission Control. Acesta oferă clienților o conștientizare profundă a sănătății nodului și a timpului de rulare pe întreaga flotă, integrând această cunoaștere direct în motorul de orchestrare. Acest lucru permite clientului să trateze infrastructura nu ca 1.000 de GPU-uri individuale, ci ca o singură entitate de lucru coerentă.

Care sunt principalele priorități de produs pe care le urmăriți în acest moment pentru a îmbunătăți rezultatele clienților, fie că este vorba de performanță, fiabilitate, previzibilitatea costurilor sau experiența dezvoltatorului?

În ceea ce privește platforma de bază, ne concentrăm constant pe performanță, fiabilitate și observabilitate. Trebuie să ne asigurăm că clienții pot rula job-uri într-un mod repetabil și previzibil, folosind în totalitate fiecare TFLOP din fiecare GPU. Dincolo de acest lucru, lucrăm la simplificarea procesului de înscriere pentru clienții care nu sunt familiarizați cu toate clopoțeii și fluierăturile uneltei SLURM (pe care toată lumea o folosește, dar pe care aproape toată lumea o urăște). În cele din urmă, dezvoltăm servicii și modele de facturare suplimentare pentru a face mai ușoară inovarea și începerea de la zero. În acest moment, experimentarea este surprinzător de dificilă din cauza barierelor ridicate la intrare, cum ar fi constrângerile de capacitate, angajamentele pe trei ani și nevoia de experți specializați doar pentru a începe. Vrem să aducem înapoi ușurința inovării pe platforma de inteligență artificială.

Pe măsură ce încărcăturile de lucru de inteligență artificială trec de la antrenament la inferență, cum influențează această tranziție proiectarea infrastructurii și deciziile de parcurs al produsului?

Acest lucru creează oportunități semnificative de a aplica diferențierea existentă a CoreWeave la cerințele de inferență. De exemplu, cache-ul LOTA pe care l-am menționat se axează pe alimentarea GPU-urilor în timpul antrenamentului; cu toate acestea, putem lua aceeași tehnologie, o integra în lucruri cum ar fi KVCache și o transforma într-un diferențiator puternic de inferență. În mod similar, unelte cum ar fi Mission Control devin și mai vitale pentru inferență, deoarece observarea sănătății GPU este crucială pentru rularea aplicațiilor agențice de înaltă disponibilitate.

În următorii unu sau doi ani, ce va defini conducerea pe piața cloud de inteligență artificială și care vor fi capacitățile care vor conta cel mai mult pentru clienți?

Cred că conducerea va fi definită de două lucruri. Primul este livrarea cerințelor de scară în creștere pentru antrenament. Acest lucru va necesita progrese în observabilitate, monitorizarea sănătății și recuperarea automată. Când treci de la sute la zeci de mii de GPU-uri distribuite la nivel global, răspunsul manual la eșecuri este un non-starter.

Al doilea este livrarea serviciilor potrivite pentru inferență și încărcături de lucru agențice. Acest lucru necesită capabilități de implementare globală și modele de afaceri care încurajează experimentarea. Acest model de utilizare a fost cel care a ajutat cloud-ul să crească inițial și a fost pierdut într-o oarecare măsură în era inteligenței artificiale. Trebuie să îl aducem înapoi prin suport de platformă mai bun, capabilități multi-cloud și ușurință în utilizare multi-regiune.

Ați condus anterior inițiative de cloud specifice industriei în domenii precum sănătate, retail, servicii financiare, manufactură și cloud suveran. Care dintre lecțiile din aceste verticale se traduc direct în infrastructura de inteligență artificială și care nu?

Schimbările de generație ale GPU-urilor continuă să introducă noi complexități. Fiecare lansare nouă aduce interconectivitate crescută, memorie mai mare și nevoi de putere mai mari, toate acestea necesitându-ne să reexaminăm presupunerile noastre despre cum sunt conectate nodurile și cum este livrat software-ul. Trebuie să rămânem neîncetați aici pentru a menține poziția noastră de conducere. Pe de altă parte, domeniul care se îmbunătățește cel mai rapid este pur și simplu scala la care clienții pot realiza lucruri; viteza cu care se adaptează la footprints de calcul mai mari este impresionantă.

Pe măsură ce centrele de date și clusterurile de inteligență artificială continuă să se extindă, care sunt provocările operaționale care se dovedesc a fi cele mai greu de rezolvat în prezent și care dintre ele se îmbunătățește cel mai rapid?

Schimbările de generație ale GPU-urilor continuă să creeze complexități noi în proiectare și software. Fiecare lansare de GPU nouă vine cu interconectivitate crescută, memorie mai mare, nevoi de putere mai mari etc., ceea ce necesită reexaminarea presupunerilor despre cum sunt conectate nodurile, cum sunt gestionate rafturile și cum este livrat software-ul. Trebuie să ne concentrăm în continuare pe acest lucru pentru a ne menține poziția de conducere. Cele care se îmbunătățesc cel mai rapid sunt ceea ce clienții pot realiza cu scala în creștere a calculului.

În infrastructura de inteligență artificială, fiabilitatea merge dincolo de timpul de funcționare. Cum definește CoreWeave fiabilitatea și care sunt indicatorii care reflectă cel mai bine succesul din perspectiva clientului?

La scară, cea mai mare considerație pentru un client este pur și simplu să finalizeze job-ul. În operațiuni masive, eșecurile individuale sau încetinirile sunt așteptate. Cheia este cum detectăm și răspundem automat la aceste probleme pentru a ne asigura că job-ul se finalizează în ciuda provocărilor. Acesta este motivul pentru care integrăm Mission Control în servicii de nivel superior, cum ar fi SUNK (Slurm pe Kubernetes). Acest lucru permite clienților să răspundă la eșecuri în mod automat, fără a pierde ore sau săptămâni de muncă. Pentru noi, succesul nu este doar despre timpul de funcționare al nodului; este despre succesul job-ului.

Privind înainte, ce schimbare majoră în infrastructura de inteligență artificială credeți că este încă subapreciată, legată de evoluția hardware-ului, specializarea stivelor, cerințele de suveranitate sau noile modele de implementare?

Cred că apariția învățării prin întărire (RL) ca parte reînnoită a stivei de inteligență artificială este încă subapreciată. Deși nu este un domeniu nou de studiu, a fost în mare măsură umbrit în timpul primei valuri de dezvoltare a LLM. RL face o revenire și va juca un rol vital în facerea serviciilor de inteligență artificială mai receptive la peisajele în schimbare ale utilizatorilor. Din cauza acestui fapt, suntem foarte entuziasmați de oferta noastră de RL fără server pe care o avem astăzi.

Mulțumim pentru acest interviu minunat; cititorii care doresc să afle mai multe despre CoreWeave pot vizita CoreWeave.

Antoine este un lider vizionar și partener fondator al Unite.AI, condus de o pasiune neclintită pentru modelarea și promovarea viitorului inteligenței artificiale și roboticii. Un întreprinzător serial, el crede că inteligența artificială va fi la fel de disruptivă pentru societate ca și electricitatea și este adesea prins vorbind entuziast despre potențialul tehnologiilor disruptive și AGI.

Ca futurist, el este dedicat explorării modului în care aceste inovații vor modela lumea noastră. În plus, el este fondatorul Securities.io, o platformă axată pe investiții în tehnologii de ultimă generație care redefinesc viitorul și reshapă întregi sectoare.