Interviuri
Andrew Feldman, Co-fondator și CEO al Cerebras Systems – Seria de interviuri

Andrew este co-fondator și CEO al Cerebras Systems (CBRS ). El este un antreprenor dedicat să împingă limitele în domeniul calculatoarelor. Înainte de Cerebras, el a co-fondat și a fost CEO al SeaMicro, un pionier al microserverelor eficiente din punct de vedere energetic și cu lățime de bandă ridicată. SeaMicro a fost achiziționat de AMD în 2012 pentru 357 de milioane de dolari. Înainte de SeaMicro, Andrew a fost vicepreședinte al departamentului de management al produselor, marketing și dezvoltare de afaceri la Force10 Networks, care a fost ulterior vândută companiei Dell Computing pentru 800 de milioane de dolari. Înainte de Force10 Networks, Andrew a fost vicepreședinte al departamentului de marketing și dezvoltare corporativă la RiverStone Networks, de la înființarea companiei până la IPO în 2001. Andrew deține o diplomă de licență și un master de la Universitatea Stanford.
Cerebras Systems construiește o nouă clasă de sisteme de calcul, proiectate de la zero pentru scopul singular de a accelera inteligența artificială și de a schimba viitorul muncii cu inteligența artificială.
Ne puteți împărtăși povestea de origine din spatele Cerebras Systems?
Co-fondatorii mei și eu am lucrat împreună la o companie anterioară, SeaMicro (care a fost vândută AMD în 2012 pentru 334 de milioane de dolari). Co-fondatorii mei sunt unii dintre cei mai buni arhitecți și ingineri de calculatoare din industrie – Gary Lauterbach, Sean Lie, JP Fricker și Michael James. Când ne-am reunit din nou în 2015, am scris două lucruri pe o tablă – că vrem să lucrăm împreună și să construim ceva care să transforme industria și să fie în Muzeul de Istorie a Calculatoarelor, care este echivalentul Sălii de Faimă a Calculatoarelor. Am fost onorați când Muzeul de Istorie a Calculatoarelor a recunoscut realizările noastre și a adăugat procesorul WSE-2 la colecția sa anul trecut, citând modul în care a transformat peisajul inteligenței artificiale.
Cerebras Systems este o echipă de pionieri în domeniul arhitecturii calculatoarelor, științei calculatoarelor, cercetării inteligenței artificiale și inginerilor de toate tipurile care iubesc ingineria fără teamă. Misiunea noastră atunci când ne-am unit a fost să construim o nouă clasă de calculatoare pentru a accelera învățarea profundă, care a devenit una dintre cele mai importante sarcini de lucru ale timpului nostru.
Am realizat că învățarea profundă are cerințe computaționale unice, masive și în creștere. Și nu este bine potrivită cu mașinile legacy, cum ar fi unitățile de procesare grafică (GPU), care au fost proiectate fundamental pentru alte lucrări. Ca urmare, inteligența artificială de astăzi este limitată nu de aplicații sau idei, ci de disponibilitatea calculatoarelor. Testarea unei singure ipoteze noi – antrenarea unui model nou – poate dura zile, săptămâni sau chiar luni și poate costa sute de mii de dolari în timp de calcul. Acesta este un obstacol major în calea inovației.
Deci, geneza Cerebras a fost să construim un tip nou de calculator, optimizat exclusiv pentru învățarea profundă, începând de la o foaie de hârtie curată. Pentru a satisface cerințele computaționale enorme ale învățării profunde, am proiectat și fabricat cel mai mare cip construit vreodată – Motorul la scară de wafer (WSE). La crearea primului procesor la scară de wafer din lume, am depășit provocări în proiectare, fabricație și ambalare – toate acestea fiind considerate imposibile pentru întreaga istorie a calculatoarelor de 70 de ani. Fiecare element al WSE este proiectat pentru a permite cercetarea învățării profunde la viteze și scară fără precedent, alimentând cel mai rapid supercalculator cu inteligență artificială din industrie, Cerebras CS-2.
Cu fiecare componentă optimizată pentru munca cu inteligența artificială, CS-2 oferă mai multă putere de calcul la un spațiu și o putere mai mică decât orice alt sistem. Acesta face acest lucru, reducând în același timp radical complexitatea programării, timpul de calcul și timpul până la soluție. În funcție de sarcina de lucru, de la inteligența artificială la HPC, CS-2 oferă sute sau mii de ori mai multă performanță decât alternativele legacy. CS-2 oferă resurse de calcul pentru învățarea profundă echivalente cu sute de GPU, oferind în același timp ușurința în programare, management și implementare a unui dispozitiv unic.
În ultimele luni, Cerebras pare să fie peste tot în știri, ce ne puteți spune despre noul supercalculator cu inteligență artificială Andromeda?
Am anunțat Andromeda în noiembrie anul trecut, și este unul dintre cele mai mari și mai puternice supercalculatoare cu inteligență artificială construite vreodată. Oferind mai mult de 1 Exaflop de calcul cu inteligență artificială și 120 Petaflop de calcul dens, Andromeda are 13,5 milioane de nuclee pe 16 sisteme CS-2 și este singurul supercalculator cu inteligență artificială care a demonstrat o scalare liniară aproape perfectă pentru sarcini de lucru cu modele de limbaj mari. De asemenea, este foarte ușor de utilizat.
Prin intermediul unei scurte introduceri, supercalculatorul cel mai mare de pe Pământ – Frontier – are 8,7 milioane de nuclee. În numărul total de nuclee, Andromeda este de peste o dată și jumătate mai mare. Face un alt tip de lucru, evident, dar acest lucru dă o idee despre amploarea sa: aproape 100 de terabiți de lățime de bandă internă, aproape 20.000 de nuclee AMD Epyc care o alimentează și – în contrast cu supercalculatoarele uriașe care necesită ani pentru a fi puse în funcțiune – am pus Andromeda în funcțiune în trei zile și imediat după aceea, a început să ofere o scalare liniară aproape perfectă a inteligenței artificiale.
Argonne National Labs a fost primul nostru client care a utilizat Andromeda și a aplicat-o la o problemă care rupea clusterul lor de 2.000 de GPU, numit Polaris. Problema consta în rularea unor modele generative foarte mari, GPT-3XL, în timp ce punea întregul genom Covid în fereastra de secvență, astfel încât puteți analiza fiecare gen în contextul întregului genom Covid. Andromeda a rulat o sarcină de lucru genetică unică cu lungimi de secvență lungi (MSL de 10K) pe 1, 2, 4, 8 și 16 noduri, cu o scalare liniară aproape perfectă. Scalarea liniară este printre cele mai dorite caracteristici ale unui cluster mare. Andromeda a oferit o rată de transfer de 15,87X pe 16 sisteme CS-2, comparativ cu un singur sistem CS-2, și o reducere a timpului de antrenare pentru a se potrivi.
Ne puteți spune despre parteneriatul cu Jasper care a fost anunțat la sfârșitul lunii noiembrie și ce înseamnă acesta pentru ambele companii?
Jasper este o companie foarte interesantă. Ei sunt lideri în conținut generativ de inteligență artificială pentru marketing, iar produsele lor sunt utilizate de peste 100.000 de clienți din întreaga lume pentru a scrie copii pentru marketing, reclame, cărți și multe altele. Evident, este un spațiu foarte interesant și în creștere rapidă în acest moment. Anul trecut, am anunțat un parteneriat cu ei pentru a accelera adoptarea și a îmbunătăți acuratețea inteligenței artificiale generative în aplicații enterprise și de consum. Jasper utilizează supercalculatorul nostru Andromeda pentru a antrena modelele sale extrem de computațional intensive într-o fracțiune din timp. Acest lucru va extinde domeniul de aplicare al modelelor de inteligență artificială generativă pentru mase.
Prin puterea supercalculatorului Cerebras Andromeda, Jasper poate avansa dramatic munca cu inteligența artificială, inclusiv antrenarea rețelelor GPT pentru a se potrivi cu ieșirile inteligenței artificiale pentru toate nivelurile de complexitate și granulație a utilizatorului final. Acest lucru îmbunătățește acuratețea contextuală a modelelor generative și va permite Jasper să personalizeze conținutul pentru multiple clase de clienți rapid și ușor.
Parteneriatul nostru permite Jasper să inventeze viitorul inteligenței artificiale generative, făcând lucruri care sunt impracticabile sau pur și simplu imposibile cu infrastructura tradițională și să accelereze potențialul inteligenței artificiale generative, aducând beneficiile sale pentru baza noastră de clienți în creștere rapidă din întreaga lume.
Într-un comunicat de presă recent, National Energy Technology Laboratory și Pittsburgh Supercomputing Center au anunțat prima simulare de dinamică a fluidelor computaționale pe motorul la scară de wafer Cerebras. Ne puteți descrie ce este exact un motor la scară de wafer și cum funcționează?
Motorul nostru Wafer-Scale Engine (WSE) este procesorul revoluționar de inteligență artificială pentru sistemul nostru de calculatoare pentru învățarea profundă, CS-2. În contrast cu procesoarele legacy, generale, WSE a fost construit de la zero pentru a accelera învățarea profundă: are 850.000 de nuclee optimizate pentru operațiuni de tensori rare, o memorie de bandă largă masivă pe cip și interconectări de ordinul de mărime mai rapide decât ceea ce ar putea realiza un cluster tradițional. În total, oferă resurse de calcul pentru învățarea profundă echivalente cu un cluster de mașini legacy, ușor de programat ca un nod unic – reducând radical complexitatea programării, timpul de calcul și timpul până la soluție.
Al doilea nostru motor WSE-2, care alimentează sistemul nostru CS-2, poate rezolva probleme extrem de rapid. Destul de rapid pentru a permite modele cu înaltă fidelitate și în timp real ale sistemelor inginerești de interes. Acesta este un exemplu rar de “scalare puternică”, care este utilizarea paralelismului pentru a reduce timpul de rezolvare a unei probleme cu o dimensiune fixă.
Și acesta este ceea ce National Energy Technology Laboratory și Pittsburgh Supercomputing Center îl utilizează. Am anunțat recent niște rezultate foarte interesante ale unei simulații de dinamică a fluidelor computaționale, formată din aproximativ 200 de milioane de celule, la rate aproape în timp real. Acest videoclip arată simularea de înaltă rezoluție a convecției Rayleigh-Bénard, care apare atunci când un strat de fluid este încălzit de la partea inferioară și răcit de la partea superioară. Aceste fluxuri de fluid termice sunt peste tot în jurul nostru – de la zilele vântoase, la furtunile de zăpadă de pe lac, la mișcarea curentului de magmă din centrul Pământului și la mișcarea plasmei în Soare. Așa cum spune naratorul, nu este doar frumusețea vizuală a simulării care este importantă: este viteza cu care putem calcula acest lucru. Pentru prima dată, utilizând Motorul nostru la scară de wafer, NETL poate manipula o grilă de aproape 200 de milioane de celule în timp real.
Ce tip de date este simulat?
Sarcina de lucru testată a fost fluxurile de fluid termic, cunoscute și sub numele de convecție naturală, care este o aplicație a dinamicii fluidelor computaționale (CFD). Fluxurile de fluid apar în mod natural peste tot în jurul nostru – de la zilele vântoase, la furtunile de zăpadă de pe lac, la mișcarea plăcilor tectonice. Această simulare, formată din aproximativ 200 de milioane de celule, se concentrează pe un fenomen cunoscut sub numele de “convecție Rayleigh-Bénard”, care apare atunci când un fluid este încălzit de la partea inferioară și răcit de la partea superioară. În natură, acest fenomen poate duce la evenimente meteorologice severe, cum ar fi downburst-urile, microburst-urile și derecho-urile. De asemenea, este responsabil pentru mișcarea magmei în centrul Pământului și pentru mișcarea plasmei în Soare.
În noiembrie 2022, NETL a introdus un nou API de modelare a ecuațiilor de câmp, alimentat de sistemul CS-2, care a fost de până la 470 de ori mai rapid decât ceea ce era posibil pe supercalculatorul Joule al NETL. Acest lucru înseamnă că poate oferi viteze dincolo de ceea ce pot obține clusterurile de orice număr de CPU sau GPU. Utilizând un API Python simplu care permite procesarea la scară de wafer pentru o mare parte a științei computaționale, WFA oferă câștiguri de performanță și utilizabilitate care nu pot fi obținute pe computere și supercalculatoare convenționale – de fapt, a depășit OpenFOAM pe supercalculatorul Joule 2.0 al NETL cu peste două ordine de mărime în timpul până la soluție.
Deoarece API-ul WFA este atât de simplu, rezultatele au fost obținute în doar câteva săptămâni și continuă colaborarea strânsă între NETL, PSC și Cerebras Systems.
Prin transformarea vitezei dinamicii fluidelor computaționale (care a fost întotdeauna o sarcină lentă și offline) pe WSE, putem deschide o mulțime de noi cazuri de utilizare în timp real pentru acest lucru și multe alte aplicații HPC de bază. Scopul nostru este ca, prin furnizarea de mai multă putere de calcul, clienții noștri să poată efectua mai multe experimente și să inventeze o știință mai bună. Directorul laboratorului NETL, Brian Anderson, ne-a spus că acest lucru va accelera drastic și va îmbunătăți procesul de proiectare pentru unele proiecte foarte mari pe care NETL le lucrează pentru a mitigă schimbările climatice și a asigura un viitor energetic sigur – proiecte cum ar fi sechestrarea carbonului și producția de hidrogen albastru.
Cerebras este în mod constant mai performant decât concurența atunci când vine vorba de lansarea de supercalculatoare, care sunt unele dintre provocările din spatele construirii de supercalculatoare de ultimă generație?
Ironia este că una dintre cele mai grele provocări ale inteligenței artificiale mari este nu inteligența artificială însăși. Este calculul distribuit.
Pentru a antrena rețele neuronale de ultimă generație, cercetătorii utilizează adesea sute sau mii de unități de procesare grafică (GPU). Și nu este ușor. Scalarea antrenamentului de modele de limbaj mari pe un cluster de GPU necesită distribuirea unei sarcini de lucru pe mai multe dispozitive mici, gestionarea dimensiunilor de memorie ale dispozitivului și a limitărilor lățimii de bandă a memoriei, precum și gestionarea atentă a suprapunerii și sincronizării comunicațiilor.
Am abordat o abordare complet diferită pentru proiectarea supercalculatoarelor noastre prin dezvoltarea Clusterului la scară de wafer Cerebras și modul de execuție Cerebras Weight Streaming. Cu aceste tehnologii, Cerebras abordează o nouă modalitate de scalare bazată pe trei puncte cheie:
Înlocuirea procesării CPU și GPU prin acceleratoare la scară de wafer, cum ar fi sistemul Cerebras CS-2. Această schimbare reduce numărul de unități de calcul necesare pentru a obține o viteză de calcul acceptabilă.
Pentru a face față provocării dimensiunii modelului, utilizăm o arhitectură de sistem care desparte calculul de stocarea modelului. Un serviciu de calcul bazat pe un cluster de sisteme CS-2 (care oferă o lățime de bandă de calcul suficientă) este strâns legat de un serviciu de memorie (cu o capacitate de memorie mare) care oferă subseturi ale modelului clusterului de calcul la cerere. Ca de obicei, un serviciu de date oferă clusterului de calcul loturi de date de antrenament, după cum este necesar.
Un model inovator pentru programarea și coordonarea antrenamentului pe clusterul CS-2, care utilizează paralelismul dat, antrenamentul strat cu strat cu greutăți rare transmise la cerere și reținerea activărilor în serviciul de calcul.
Există teama că Legea lui Moore se va încheia în curând, câte mai multe ani poate industria să stoarcă și ce tipuri de inovații sunt necesare pentru aceasta?
Cred că întrebarea cu care ne confruntăm toți este dacă Legea lui Moore – așa cum a fost scrisă de Moore – este moartă. Nu mai durează doi ani pentru a obține mai multe tranzistoare. Acum durează patru sau cinci ani. Și aceste tranzistoare nu vin la același preț – vin la prețuri mult mai mari. Deci, întrebarea devine, obținem încă aceleași beneficii ale trecerii de la 7 la 5 la 3 nanometri? Beneficiile sunt mai mici și costă mai mult, și astfel soluțiile devin mai complicate decât simpla placă.
Jack Dongarra, un arhitect de calculatoare de top, a ținut recent o prelegere și a spus: “Am devenit mult mai buni la crearea de FLOP și la crearea de I/O.” Acesta este realmente adevărat. Capacitatea noastră de a muta datele de pe cip este cu mult în urma capacității noastre de a crește performanța pe un cip. La Cerebras, am fost fericiți când a spus acest lucru, deoarece validează decizia noastră de a face un cip mai mare și de a muta mai puține lucruri de pe cip. De asemenea, oferă unele îndrumări pentru modalitățile viitoare de a face sisteme cu cipuri să funcționeze mai bine. Există lucruri de făcut, nu doar pentru a stoarce mai multe FLOP, ci și pentru a muta datele de pe cip pe cip – chiar și de pe un cip foarte mare pe un alt cip foarte mare.
Există altceva pe care ați dori să îl împărtășiți despre Cerebras Systems?
Pentru bine sau pentru rău, oamenii ne pun adesea pe Cerebras în categoria “băieților cu cipul foarte mare”. Am reușit să oferim soluții convingătoare pentru rețele neuronale foarte mari, eliminând astfel nevoia de a face calcul distribuit dureros. Cred că acesta este un domeniu extrem de interesant și în centrul motivului pentru care clienții noștri ne iubesc. Domeniul interesant pentru 2023 va fi cum să facem calcul mare pentru a obține o acuratețe mai mare, utilizând mai puține FLOP.
Lucrul nostru pe sparsitate oferă o abordare extrem de interesantă. Nu facem lucruri care nu ne apropie de linia de sosire, și înmulțirea cu zero este o idee proastă. Vom lansa în curând un articol foarte interesant despre sparsitate, și cred că va fi mai multă muncă pentru a găsi aceste puncte eficiente și pentru a face acest lucru cu mai puțină putere. Și nu doar pentru putere și antrenament; cum putem minimiza costul și puterea utilizate în inferență? Cred că sparsitatea ajută pe ambele fronturi.
Mulțumim pentru aceste răspunsuri detaliate, cititorilor care doresc să afle mai multe despre Cerebras Systems.












