Haastattelut

Andrew Feldman, Cerebras Systemsin perustaja ja toimitusjohtaja – Haastattelusarja

mm
Lisää Unite.AI suosikkilähteisiisi Google-palvelussa

Andrew on Cerebras (CBRS ) Systemsin perustaja ja toimitusjohtaja. Hän on yrittäjä, joka on omistautunut rajojen työntämiseen laskentatilassa. Ennen Cerebrasia hän perusti ja toimi SeaMicro-nimisen energiatehokkaiden, korkean kaistanleveyden mikropiirien edelläkävijän toimitusjohtajana. SeaMicro myytiin AMD:lle vuonna 2012 357 miljoonalla dollarilla. Ennen SeaMicroa Andrew toimi tuotejohtajana, markkinoinnissa ja liiketoimintakehityksessä Force10 Networksissa, joka myytiin myöhemmin Dell Computingille 800 miljoonalla dollarilla. Ennen Force10 Networksia Andrew toimi markkinoinnin ja yrityskehityksen johtajana RiverStone Networksissa yrityksen perustamisesta alkaen ja listautumiseen vuonna 2001. Andrew on suorittanut BA- ja MBA-tutkinnot Stanfordin yliopistossa.

Cerebras Systems on rakentamassa uudenluokkaista tietokonejärjestelmää, joka on suunniteltu alusta alkaen yksinomaan tehostamaan tekoälyä ja muuttamaan tekoälyn tulevaisuutta.

Voitko kertoa Cerebras Systemsin syntytarinan?

Minun perustajakumppanini ja minä kaikki työskentelimme yhdessä edellisessä startup-yrityksessä, jonka minun CTO:ni Gary ja minä perustimme vuonna 2007, nimeltään SeaMicro (joka myytiin AMD:lle vuonna 2012 334 miljoonalla dollarilla). Minun perustajakumppanini ovat johtavia tietokonearkkitehteja ja insinöörejä teollisuudessa – Gary Lauterbach, Sean Lie, JP Fricker ja Michael James. Kun kokoonnimme joukkueen uudelleen vuonna 2015, kirjoitimme kaksi asiaa valkotaululle – halusimme työskennellä yhdessä, ja halusimme rakentaa jotain, joka muuttaisi teollisuuden ja olisi Compute Hall of Famessa. Olimme kunnianhimoisia, kun Computer History Museum tunnusti saavutuksemme ja lisäsi WSE-2-prosessorin kokoelmaansa viime vuonna, mainiten, miten se on muuttanut tekoälyn maiseman.

Cerebras Systems on joukko uranuurtajia tietokonearkkitehteja, tietokoneiden tutkijoita, syvän oppimisen tutkijoita ja insinöörejä, jotka rakastavat pelotonta insinööritaitoa. Kun kokoonnimme, tehtävämme oli rakentaa uudenluokkaista tietokonetta, joka kiihdyttäisi syvää oppimista, josta on tullut yksi tärkeimmistä työkuormista aikamme.

Toteimme, että syvä oppiminen on ainutlaatuinen, massiivinen ja kasvava laskennan vaatimus. Ja se ei ole hyvin sovitettu perinteisiin koneisiin, kuten grafiikkaprosessoreihin (GPU), jotka on suunniteltu perustuu muihin töihin. Tämän seurauksena tekoäly on tänään rajoitettu ei sovelluksista tai ideoista, vaan laskennan saatavuudesta. Uuden hypoteesin testaaminen – uuden mallin koulutus – voi kestää päiviä, viikkoja tai jopa kuukausia ja maksaa satoja tuhansia dollareita laskennan aikana. Se on suuri este innovaatiolle.

Cerebrasin syntymä oli rakentaa uudenlainen tietokone, joka on optimoitu yksinomaan syvälle oppimiseen, alusta alkaen. Toteuttaaksemme syvän oppimisen valtavat laskennan vaatimukset, suunnittelimme ja valmistimme maailman suurimman piirin – Wafer-Scale Engine (WSE). Luomalla maailman ensimmäisen wafer-asteisen prosessorin, voitimme haasteita suunnittelun, valmistuksen ja pakkaamisen alueilla – kaikki, jotka olivat katsottu mahdottomiksi koko 70-vuotisen tietokoneiden historian ajan. Jokainen WSE:n osa on suunniteltu mahdollistamaan syvän oppimisen tutkimusta ennennäkemättömällä nopeudella ja mittakaavalla, voimakkaampaa tekoälyn supertietokonetta, Cerebras CS-2:ta.

CS-2 toimittaa enemmän laskennan suorituskykyä vähemmässä tilassa ja vähemmällä teholla kuin mikään muu järjestelmä. Se tekee tämän vähentämällä radikaalisti ohjelmoinnin monimutkaisuutta, seinäkellon laskennan aikaa ja ratkaisun aikaa. Riippuen työkuormasta, CS-2 toimittaa satoja tai tuhansia kertoja enemmän suorituskykyä kuin perinteiset vaihtoehdot. CS-2 tarjoaa syvän oppimisen laskennan resursseja, jotka vastaavat satoja grafiikkaprosessoreita, tarjoten samalla helppokäyttöisyyden ohjelmoinnissa, hallinnassa ja käyttöönotossa yksittäisen laitteen tavoin.

Viime kuukausien aikana Cerebras on ollut kaikkialla uutisissa, voitko kertoa jotain uudesta Andromeda-tekoälysupertietokoneesta?

Ilmoitimme Andromedasta viime vuoden marraskuussa, ja se on yksi suurimmista ja tehokkaimmista tekoälysupertietokoneista, jotka on koskaan rakennettu. Toimittaen yli 1 Exaflop tekoälyn laskennan ja 120 Petaflops tiheän laskennan, Andromedalla on 13,5 miljoonaa ydintä 16 CS-2-järjestelmässä, ja se on ainoa tekoälysupertietokone, joka on osoittanut lähes täydellisen lineaarisen skaalautuvuuden suurten kielimallien työkuormissa. Se on myös helppo käyttää.

Muistutuksena, maailman suurin supertietokone – Frontier – on 8,7 miljoonalla ydinnellä. Raakaydinlaskennassa Andromeda on yli puolitoista kertaa suurempi. Se tekee toisenlaista työtä, mutta antaa idean mittakaavasta: lähes 100 terabittiä sisäistä kaistanleveyttä, lähes 20 000 AMD Epyc-ydintä ruokkii sitä, ja – toisin kuin jättimäiset supertietokoneet, jotka kestää vuosia pystyttää – pystytimme Andromedan kolmessa päivässä, ja heti sen jälkeen se toimitti lähes täydellisen lineaarisen skaalautuvuuden tekoälylle.

Argonne National Labs oli ensimmäinen asiakkaamme, joka käytti Andromedaa, ja he sovelsivat sitä ongelmaan, joka mursi heidän 2 000 grafiikkaprosessorin klusterinsa Polarisin. Ongelmana oli suorittaa erittäin suuria GPT-3XL-generatiivisia malleja, asettamalla koko Covid-geenin järjestelmään, jotta voitiin analysoida jokainen geeni koko Covid-geenien kontekstissa. Andromeda suoritti ainutlaatuinen geneettisen työkuorman pitkien järjestelmien pituuksilla (MSL 10K) yhden, kahden, neljän, kahdeksan ja 16 solmun kanssa, lähes täydellisellä lineaarisella skaalautuvuudella. Lineaarisella skaalautuvuudella on yksi halutuimmista ominaisuuksista suuressa klusterissa. Andromeda toimitti 15,87-kertaisen läpäisyn 16 CS-2-järjestelmässä verrattuna yhteen CS-2:een, ja vähensi koulutusaikaa.

Voitko kertoa yhteistyöstä Jasperin kanssa, joka paljastettiin marraskuun lopulla, ja mitä se merkitsee molemmille yrityksille?

Jasper on mielenkiintoinen yritys. He ovat johtaja generatiivisessa tekoälysisällössä markkinoinnissa, ja heidän tuotteitaan käytetään yli 100 000 asiakkaalla ympäri maailmaa kirjoittamaan mainoskopiota markkinoinnille, mainoksille, kirjoille ja muille. Se on ilmiselvästi erittäin mielenkiintoinen ja nopeasti kasvava ala tällä hetkellä. Viime vuonna ilmoitimme yhteistyöstä heidän kanssaan kiihdyttääksemme generatiivisen tekoälyn omaksumista ja parantamaan sen tarkkuutta yritys- ja kuluttajasovelluksissa. Jasper käyttää Andromeda-supertietokonetta kouluttamaan erittäin laskennan vaativia mallejaan murto-osaan ajasta. Tämä laajentaa generatiivisten tekoälymallien ulottuvuutta massoihin.

Andromeda-supertietokoneen voimalla Jasper voi dramaattisesti edistää tekoälytyötä, mukaan lukien GPT-verkkojen koulutus sopimaan tekoälytulokset kaikkiin loppukäyttäjien monimutkaisuuden ja yksityiskohtaisuuden tasoille. Tämä parantaa generatiivisten mallien kontekstuaalista tarkkuutta ja mahdollistaa Jasperille sisällön mukauttamisen useille asiakasluokille nopeasti ja helposti.

Yhteistyömme mahdollistaa Jasperille keksimään generatiivisen tekoälyn tulevaisuutta, tekemällä asioita, jotka ovat epämukavia tai yksinkertaisesti mahdottomia perinteisellä infrastruktuurilla, ja kiihdyttääksemme generatiivisen tekoälyn potentiaalia, tuomalla sen hyödyt nopeasti kasvavalle asiakasjemme ympäri maailmaa.

Viimeisimmässä lehdistötiedotteessa National Energy Technology Laboratory ja Pittsburgh Supercomputing Center ilmoittivat ensimmäisen koskaan Computational Fluid Dynamics -simulaation Cerebras Wafer-Scale Engine -moottorilla. Voitko kuvailla, mitä erityisesti on wafer-asteinen moottori ja miten se toimii?

Meidän Wafer-Scale Engine (WSE) on vallankumouksellinen tekoälyprosessori syvän oppimisen tietokonejärjestelmälle, CS-2:lle. Toisin kuin perinteiset, yleiskäyttöiset prosessorit, WSE on rakennettu alusta alkaen kiihdyttämään syvää oppimista: siinä on 850 000 tekoälyoptimoitua ydintä harvojen tensorioperaatioiden laskemiseen, massiivinen korkea kaistanleveys piirin sisäinen muisti ja yhdistäminen, joka on useita kertoja nopeampi kuin perinteinen klusteri voisi koskaan saavuttaa. Kaikki yhdessä antavat sinulle syvän oppimisen laskennan resursseja, jotka vastaavat klusteria perinteisiä koneita, helppo ohjelmoida yksittäisen solmun tavoin – radikaalisti vähentämällä ohjelmoinnin monimutkaisuutta, seinäkellon laskennan aikaa ja ratkaisun aikaa.

Toinen sukupolvi WSE-2, joka pyörittää CS-2-järjestelmää, voi ratkaista ongelmia erittäin nopeasti. Tarpeeksi nopeasti sallimaan reaaliaikaiset, korkean tarkkuuden mallit suunniteltuihin järjestelmiin. Se on harvinainen esimerkki onnistuneesta “vahvasta skaalautumisesta”, joka on rinnakkaisuuden käyttäminen vähentämään ratkaisuaikaa kiinteän kokoisen ongelman kanssa.

Ja se on sitä, mihin National Energy Technology Laboratory ja Pittsburgh Supercomputing Center käyttävät sitä. Meillä on ilmoitettu joitakin erittäin mielenkiintoisia tuloksia Computational Fluid Dynamics (CFD) -simulaatiosta, joka koostuu noin 200 miljoonasta solusta, lähes reaaliajassa. Tämä video näyttää korkean resoluution simulaation Rayleigh-Bénard-konvektiosta, joka tapahtuu, kun fluidikerros lämmitetään alhaalta ja jäähtyy ylhäältä. Nämä termisesti aikaansaadut fluidivirtaukset ovat kaikkialla ympärillämme – tuulisenä päivänä, järven lumimyrskyinä, maan ydintuulivirtauksina ja plasmaliikkeinä auringossa. Kuten kertoja sanoo, se ei ole vain simulaation visuaalinen kauneus, joka on tärkeää: se on nopeus, jolla laskemme sen. Ensimmäistä kertaa WSE:llä NETL pystyy muokkaamaan 200 miljoonan solun ruudukkoa lähes reaaliajassa.

Mikä tyyppiä dataa simuloitiin?

Testattu työkuorma oli termisesti aikaansaadut fluidivirtaukset, myös tunnettu nimellä luonnollinen konvektio, joka on sovellus Computational Fluid Dynamics (CFD):sta. Fluidivirtaukset tapahtuvat luonnostaan kaikkialla ympärillämme — tuulisenä päivänä, järven lumimyrskyinä, maan ydintuulivirtauksina. Tämä simulaatio, joka koostuu noin 200 miljoonasta solusta, keskittyy ilmiöön, jota kutsutaan “Rayleigh-Bénard” -konvektioksi, joka tapahtuu, kun fluidi lämmitetään alhaalta ja jäähtyy ylhäältä. Luonnossa tämä ilmiö voi johtaa vakaviin sääilmiöihin, kuten downbursteihin, microbursteihin ja derechoihin. Se on myös vastuussa maan ydintuulivirtauksista ja plasmaliikkeistä auringossa.

Vuoden 2022 marraskuussa NETL esitteli uuden kenttäyhtälöiden mallintamisrajapinnan, joka perustui CS-2-järjestelmään, joka oli jopa 470 kertaa nopeampi kuin mitä oli mahdollista NETL:n Joule-supertietokoneella. Tämä tarkoittaa, että se voi toimittaa nopeuksia, joita ei voida saavuttaa klustereilla mikään määrä CPU:ita tai GPU:ita. Käyttäen yksinkertaista Python-rajapintaa, joka mahdollistaa wafer-asteisen prosessoinnin suuressa osassa laskennan tieteestä, WFA antaa suorituskyvyn ja käytettävyyden parannukset, joita ei voida saavuttaa perinteisillä tietokoneilla ja supertietokoneilla – se ylitti jopa kaksi kertaa OpenFOAMin NETL:n Joule 2.0 -supertietokoneella ratkaisuaikaa.

WFA-rajapinnan yksinkertaisuuden ansiosta tulokset saavutettiin vain muutamassa viikossa ja jatkavat läheistä yhteistyötä NETL:n, PSC:n ja Cerebras Systemsin välillä.

WSE:n avulla voimme avata uuden, reaaliaikaisen käyttötapauksen tähän ja moneen muuhun ydintärkeään HPC-sovellukseen. Tavoitteemme on, että asiakkaamme voivat suorittaa enemmän kokeita ja keksivät paremman tieteen. NETL:n laboratorion johtaja Brian Anderson on kertonut meille, että tämä vauhdittaa merkittävästi ja parantaa suunnitteluprosessia joillekin suurille hankkeille, joilla NETL työskentelee ilmastonmuutoksen hillitsemiseksi ja turvallisen energiatulevaisuuden mahdollistamiseksi – hankkeista, kuten hiilidioksidin talteenotto ja blue hydrogen -tuotanto.

Cerebras on jatkuvasti ylittänyt kilpailijansa supertietokoneiden julkaisussa, mitkä ovat haasteita rakentaa huipputason supertietokoneita?

Ironisesti yhden suurimman tekoälyhaasteen takana ei ole tekoäly. Se on jakautunut laskenta.

Kouluttaakseen nykyiset huipputason neuroverkkomallit tutkijat usein käyttävät satoja tai tuhansia grafiikkaprosessoreita. Ja se ei ole helppoa. Suurten kielimallien koulutus klusterin yli vaatii työkuorman jakamista useille laitteille, laitteen muistin koon ja muistin kaistanleveyden rajoitusten hallinnan sekä tarkkaa viestintä- ja synkronoinnin ylläpidon.

Olemme lähteneet täysin eri lähestymistavasta suunniteltaessa supertietokoneitamme Cerebras Wafer-Scale Clusterin ja Cerebras Weight Streaming -suoritustilan kehittämisen kautta. Nämä teknologiat antavat Cerebrasille uuden skaalautumistavan, joka perustuu kolmeen tärkeään kohtaan:

Prosessorien ja grafiikkaprosessoreiden korvaaminen wafer-asteisilla kiihdyttimillä, kuten Cerebras CS-2 -järjestelmällä. Tämä muutos vähentää laskennan yksiköiden määrää, jota tarvitaan hyväksyttävän laskennan nopeuden saavuttamiseksi.

Mallin koosta vastaamaan käytämme järjestelmäarkkitehtuuria, joka erottaa laskennan mallin tallennuksesta. Laskentapalvelu, joka perustuu CS-2 -järjestelmien klusteriin (joka tarjoaa riittävän laskennan kaistanleveyden), on tiiviisti kytketty muistipalveluun (jolla on suuri muistikapasiteetti), joka toimittaa mallin osia laskentaan tarpeen mukaan. Kuten yleensä, datapalvelu toimittaa koulutusdataa laskentaan tarpeen mukaan.

Innovatiivinen malli koulutustyön aikatauluttamiseksi ja koordinoimiseksi yli CS-2 -klusterin, joka käyttää data-rinnakkaisuutta, kerros kerran koulutusta harvojen painotusten kanssa virtauskohtaisesti ja säilyttää aktivaatiot laskennassa.

On ollut pelkoja Mooren lakiin liittyen lähes kymmenen vuotta, kuinka monta vuotta teollisuus voi puristaa siitä irti ja mitä innovaatioita tarvitaan tämän saavuttamiseksi?

Luulen, että kaikki kamppailevat kysymyksen kanssa, onko Mooren laki – kuten Moore sen kirjoitti – kuollut. Se ei kestä enää kaksi vuotta saada enemmän transistoreja. Se kestää nyt neljä tai viisi vuotta. Ja ne transistorit eivät tule samalla hinnalla – ne tulevat paljon kalliimmalla. Joten kysymys on, saammeko edelleen samat hyödyt siirtymällä seitsemästä viiteen kolmeen nanometriin. Hyödyt ovat pienemmät, ja ne maksavat enemmän, ja ratkaisut tulevat monimutkaisemmiksi kuin pelkästään piiri.

Jack Dongarra, johtava tietokonearkkitehti, piti puheen ja sanoi: “Olemme parantaneet FLOPsin ja I/O:n tekemistä.” Se on tosiaikaista. Meillä oli ilo, kun hän sanoi sen, koska se vahvistaa päätöstämme valmistaa isompi piiri ja siirtää vähemmän asioita piirin ulkopuolelle. Se antaa myös joitakin ohjeita tulevaisuuden järjestelmien parantamiseen, joissa on piirit. On työtä tehtävänä, ei vain FLOPsin parantamisessa, vaan myös tekniikoissa siirtää ne ja siirtää dataa piiristä toiseen – jopa erittäin suurelta piiriltä toiselle.

Onko mitään muuta, mitä haluaisit jakaa Cerebras Systemsistä?

Parhaan ja huonon puolen, ihmiset usein laittavat Cerebrasin tähän “iso piiri” -luokkaan. Olemme pystyneet tarjoamaan vakuuttavia ratkaisuja erittäin suurille neuroverkkomalleille, mikä on poistanut tarpeen tehdä tuskallista jakautunutta laskentaa. Uskon, että se on erittäin mielenkiintoista ja tekoälyn ytimessä, miksi asiakkaamme rakastavat meitä. Mielenkiintoinen alue vuodelle 2023 on, miten tehdä suurta laskentaa korkeampaan tarkkuuteen vähemmällä FLOPSeilla.

Työmme harvassa antaa erittäin mielenkiintoisen lähestymistavan. Emme tee työtä, joka ei vie meitä kohti maaliviivaa, ja nolla kertaa on huono idea. Julkaismme erittäin mielenkiintoisen paperin harvassa pian, ja luulen, että siellä on enemmän ponnistelua etsimässä näitä tehokkaita pisteitä ja miten päästä niiden luo vähemmällä teholla. Ja ei vain vähemmällä teholla ja koulutuksella; miten vähentää kustannuksia ja tehoa, jota käytetään inferenceissä? Luulen, että harvassa auttaa molemmilla rintamilla.

Kiitos näistä syvistä vastauksista, lukijat, jotka haluavat oppia enemmän, kannattaa vierailla Cerebras Systems -sivustolla.

Antoine on visionäärisellä johtajalla ja Unite.AI:n perustajakumppani, joka on intohimoisesti omistautunut tulevaisuuden älyteknologian ja robotiikan muotoiluun ja edistämiseen. Sarjayrittäjänä hän uskoo, että älyteknologia tulee olemaan yhtä mullistava yhteiskunnalle kuin sähkö, ja hän on usein innostunut puhumaan älyteknologian ja AGI:n mahdollisuuksista.

Hän on tulevaisuudentutkija, joka on omistautunut tutkimiseen, miten nämä innovaatiot muotoilevat maailmaamme. Lisäksi hän on Securities.io:n perustaja, joka on keskittynyt sijoittamiseen älykkäisiin teknologioihin, jotka määrittelevät tulevaisuutta ja muokkaavat koko toimialoja.