Intervjuer
Andrew Feldman, medgrunnlegger og CEO av Cerebras Systems – Intervju-serie

Andrew er medgrunnlegger og CEO av Cerebras Systems (CBRS ). Han er en entreprenør som er dedikert til å PUSHE grensene i datamaskinrommet. Før Cerebras, var han medgrunnlegger og CEO av SeaMicro, en pionér innen energi-effektive, høy-båndbredde mikroservere. SeaMicro ble kjøpt av AMD i 2012 for 357 millioner dollar. Før SeaMicro, var Andrew visepresident for produktledelse, markedsføring og BD i Force10 Networks, som senere ble solgt til Dell Computing for 800 millioner dollar. Før Force10 Networks, var Andrew visepresident for markedsføring og korporativ utvikling i RiverStone Networks fra selskapets opphav til IPO i 2001. Andrew har en BA og en MBA fra Stanford University.
Cerebras Systems bygger en ny klasse av datamaskinsystemer, designet fra grunnen av for det enkelte målet å akselerere AI og endre fremtiden for AI-arbeid.
Kunne du dele opphavsfortellingen bak Cerebras Systems?
Mine medgrunnleggere og jeg arbeidet alle sammen i et tidligere startup som min CTO Gary og jeg startet tilbake i 2007, kalt SeaMicro (som ble solgt til AMD i 2012 for 334 millioner dollar). Mine medgrunnleggere er noen av de ledende datamaskinarkitektene og ingeniørene i industrien – Gary Lauterbach, Sean Lie, JP Fricker og Michael James. Da vi samlet bandet igjen i 2015, skrev vi to ting på en tavle – at vi ville jobbe sammen, og at vi ville bygge noe som ville transformere industrien og være i Computer History Museum, som er det samme som Compute Hall of Fame. Vi ble hedret da Computer History Museum anerkjente våre prestasjoner og la til WSE-2-prosessor i sin samling i fjor, med henvisning til hvordan den har transformert det kunstige intelligens-landskapet.
Cerebras Systems er et team av pionerende datamaskinarkitekter, datavitenskapsmenn, dyptelæring-forskere og ingeniører av alle typer som elsker å gjøre fryktløs ingeniørarbeid. Vår misjon da vi kom sammen var å bygge en ny klasse av datamaskin for å akselerere dyptelæring, som har steget frem som en av de viktigste arbeidsbelastningene i vår tid.
Vi innsett at dyptelæring har unike, massive og voksende beregningskrav. Og det er ikke godt sammenlignbart med legacy-maskiner som grafikkprosessorer (GPUs), som ble grunnleggende designet for annet arbeid. Som et resultat er AI i dag begrenset ikke av applikasjoner eller ideer, men av tilgjengeligheten av beregning. Testing av en enkelt ny hypotese – trening av en ny modell – kan ta dager, uker eller selv måneder og koste hundredtusener av dollar i beregnings tid. Det er en stor hindring for innovasjon.
Så opphavet til Cerebras var å bygge en ny type datamaskin optimalisert eksklusivt for dyptelæring, fra en ren ark. For å møte de enorme beregningskravene til dyptelæring, designet og produserte vi den største chippen noensinne bygget – Wafer-Scale Engine (WSE). I å lage verdens første wafer-skala prosessor, overvant vi utfordringer over design, fabrikasjon og emballasje – alle som hadde blitt ansett som umulige for hele 70-års historien til datamaskiner. Hvert element i WSE er designet for å muliggjøre dyptelæring-forskning i en tidligere uoppnåelig hastighet og skala, og driver industrien raskeste AI-superdatamaskin, Cerebras CS-2.
Med hver komponent optimalisert for AI-arbeid, leverer CS-2 mer beregnings ytelse ved mindre plass og mindre kraft enn noen annen system. Det gjør dette samtidig som det radikalt reduserer programmeringskompleksitet, veggberegningstid og tid til løsning. Avhengig av arbeidsbelastning, fra AI til HPC, leverer CS-2 hundredvis eller tusenvis av ganger mer ytelse enn legacy-alternativer. CS-2 gir dyptelæring-beregningstjenester ekvivalent til hundredvis av GPUs, samtidig som det tilbyr letthet i programmering, ledelse og distribusjon av en enkelt enhet.
Over de siste månedene ser det ut til at Cerebras er overalt i nyheter, hva kan du fortelle oss om den nye Andromeda AI-superdatamaskinen?
Vi kunngjorde Andromeda i november i fjor, og det er en av de største og kraftigste AI-superdatamaskinene noensinne bygget. Den leverer mer enn 1 Exaflop av AI-beregning og 120 Petaflops av tett beregning, og har 13,5 millioner kerner på 16 CS-2-systemer. Det er den eneste AI-superdatamaskinen som noen gang har demonstrert nesten-perfekt lineær skala på store språkmodell-arbeidsbelastninger. Det er også veldig enkelt å bruke.
Som en påminnelse, den største superdatamaskinen på jorden – Frontier – har 8,7 millioner kerner. I raw core-telling er Andromeda mer enn en og en halv gang større. Den gjør annet arbeid, men dette gir en ide om omfanget: nesten 100 terabiter internt båndbredde, nesten 20 000 AMD Epyc-kerner som matet det, og – i motsetning til de gigantiske superdatamaskinene som tar år å sette opp – vi satte Andromeda opp på tre dager og umiddelbart deretter leverte den nesten-perfekt lineær skala av AI.
Argonne National Labs var vår første kunde som brukte Andromeda, og de anvendte den på et problem som brøt deres 2 000 GPU-kluster kalt Polaris. Problemet var å kjøre veldig store, GPT-3XL-generative modeller, mens de plasserte hele Covid-genomet i sekvens-vinduet, så at de kunne analysere hver gen i konteksten av hele Covid-genomet. Andromeda kjørte en unik genetisk arbeidsbelastning med lange sekvenslengder (MSL på 10K) på 1, 2, 4, 8 og 16 noder, med nesten-perfekt lineær skala. Lineær skala er blant de mest ettertrakte egenskapene til en stor kluster. Andromeda leverte 15,87 ganger gjennomstrømming på 16 CS-2-systemer, sammenlignet med en enkelt CS-2, og en reduksjon i trenings tid til å matche.
Kunne du fortelle oss om samarbeidet med Jasper som ble avduket i slutten av november og hva det betyr for begge selskaper?
Jasper er et veldig interessant selskap. De er en leder i generativ AI-innhold for markedsføring, og deres produkter brukes av over 100 000 kunder over hele verden til å skrive kopi for markedsføring, annonser, bøker og mer. Det er åpenbart en veldig spennende og raskt voksende bransje nå. I fjor kunngjorde vi et samarbeid med dem for å akselerere adopsjon og forbedre nøyaktigheten av generativ AI over hele bedrifts- og forbruker-applikasjoner. Jasper bruker vår Andromeda-superdatamaskin til å trene deres usedvanlig beregnings-intensive modeller i en brøkdel av tiden. Dette vil utvide rekkevidden av generative AI-modeller til massene.
Med kraften fra Cerebras Andromeda-superdatamaskin, kan Jasper dramatisk fremme AI-arbeid, inkludert trening av GPT-nettverk for å passe AI-utdata til alle nivåer av slutbruker-kompleksitet og granularitet. Dette forbedrer kontekstuell nøyaktighet av generative modeller og vil enable Jasper til å personalisere innhold over flere klasser av kunder raskt og enkelt.
Vårt samarbeid lar Jasper oppfinne fremtiden for generativ AI, ved å gjøre ting som er upraktiske eller umulige med tradisjonell infrastruktur, og å akselerere potensialet for generativ AI, og bringe dens fordeler til vår raskt voksende kundebase over hele verden.
I en nylig pressemelding, kunngjorde National Energy Technology Laboratory og Pittsburgh Supercomputing Center Pioneer den første noen gang Computational Fluid Dynamics-simulering på Cerebras wafer-skala-motor. Kunne du beskrive hva en wafer-skala-motor er og hvordan den fungerer?
Vår Wafer-Scale Engine (WSE) er den revolusjonære AI-prosessor for vårt dyptelæring-datamaskin-system, CS-2. I motsetning til legacy, generiske prosessorer, ble WSE bygget fra grunnen av for å akselerere dyptelæring: den har 850 000 AI-optimerte kerner for sparse tensor-operasjoner, massive høy-båndbredde på-chip-minne og interconnect ordrer av størrelse raskere enn en tradisjonell kluster kunne muligens oppnå. Alt sammen gir det deg dyptelæring-beregningstjenester ekvivalent til en kluster av legacy-maskiner alle i en enkelt enhet, enkelt å programmere som en enkelt node – radikalt reduserer programmeringskompleksitet, veggberegningstid og tid til løsning.
Vår andre generasjon WSE-2, som driver vårt CS-2-system, kan løse problemer ekstremt raskt. Raskt nok til å tillate sanntids-, høy-fidelitets-modeller av ingeniør-systemer av interesse. Det er et sjeldent eksempel på vellykket “strong scaling”, som er bruk av parallelisme til å redusere løsningstid med en fast størrelse-problem.
Og det er det National Energy Technology Laboratory og Pittsburgh Supercomputing Center bruker det til. Vi kunngjorde nylig noen veldig spennende resultater av en computational fluid dynamics (CFD)-simulering, bestående av omtrent 200 millioner celler, i nesten sanntid. Denne videoen viser en høy-oppløst simulering av Rayleigh-Bénard-konveksjon, som skjer når en fluidlag er varmet fra bunnen og avkjølt fra toppen. Disse termisk-drevne fluid-strømmene er overalt rundt oss – fra vindfulle dager, til lake-effect-snowstorms, til magma-bevegelser i jordens kjerne og plasma-bevegelser i solen. Som fortelleren sier, er det ikke bare den visuelle skjønnheten til simuleringen som er viktig: det er hastigheten vi kan beregne det med. For første gang, ved å bruke vår Wafer-Scale Engine, er NETL i stand til å manipulere en rutenett på nesten 200 millioner celler i nesten sanntid.
Hva type data blir simulert?
Arbeidsbelastningen som ble testet var termisk-drevne fluid-strømmer, også kjent som naturlig konveksjon, som er en applikasjon av computational fluid dynamics (CFD). Fluid-strømmer skjer naturlig overalt rundt oss — fra vindfulle dager, til lake-effect-snowstorms, til tektonisk plate-bevegelser. Denne simuleringen, bestående av omtrent 200 millioner celler, fokuserer på et fenomen kjent som “Rayleigh-Bénard”-konveksjon, som skjer når en fluid er varmet fra bunnen og avkjølt fra toppen. I naturen kan dette fenomenet føre til alvorlige vær-hendelser som nedbrudd, mikrobrudd og derechos. Det er også ansvarlig for magma-bevegelser i jordens kjerne og plasma-bevegelser i solen.
Tilbake i november 2022, introduserte NETL en ny felt-ligning-modellering-API, drevet av CS-2-systemet, som var opptil 470 ganger raskere enn hva som var mulig på NETLs Joule Supercomputer. Dette betyr at det kunne levere hastigheter utover hva enten kluster av noen antall CPUer eller GPUer kunne oppnå. Ved å bruke en enkel Python-API som aktiverer wafer-skala-prosesser for mye av computational science, leverer WFA gevinster i ytelse og brukervennlighet som ikke kunne oppnås på konvensjonelle datamaskiner og superdatamaskiner – faktisk, det overgikk OpenFOAM på NETLs Joule 2.0-superdatamaskin med over to størrelse-ordener i tid til løsning.
Fordi WFA-APIen er så enkel, ble resultater oppnådd på bare noen uker og fortsetter det nære samarbeidet mellom NETL, PSC og Cerebras Systems.
Ved å transformere hastigheten til CFD (som alltid har vært en langsom, off-line-oppgave) på vår WSE, kan vi åpne opp en hel rekke nye, sanntids-brukstilfeller for dette, og mange andre kjerne-HPC-applikasjoner. Vårt mål er at ved å enable mer beregningskraft, kan våre kunder utføre flere eksperimenter og oppfinne bedre vitenskap. NETL-laboratorie-direktør Brian Anderson har fortalt oss at dette vil dramatisk akselerere og forbedre design-prosessen for noen veldig store prosjekter som NETL jobber med rundt å mitigere klimaendringer og enable en sikker energiframtid — prosjekter som karbonfangst og blå hydrogen-produksjon.
Cerebras er konsistent overgående konkurranse når det kommer til å slippe superdatamaskiner, hva er noen av utfordringene bak å bygge state-of-the-art superdatamaskiner?
Ironisk nok, er en av de hardeste utfordringene med stor AI, ikke AI-en selv. Det er den distribuerte beregningen.
For å trene i dagens state-of-the-art neurale nettverk, bruker forskere ofte hundredvis til tusenvis av grafikkprosessorer (GPUs). Og det er ikke enkelt. Å skalerer stor språkmodell-trening over en kluster av GPUer, krever å distribuere en arbeidsbelastning over mange små enheter, håndtere enhet-minnehayde-størrelser og minne-båndbredde-begrensninger, og nøye håndtere kommunikasjon og synkroniserings-overhoder.
Vi har tatt en helt annen tilnærming til å designe våre superdatamaskiner gjennom utviklingen av Cerebras Wafer-Scale Cluster, og Cerebras Weight Streaming-utføringstilstand. Med disse teknologiene, adresserer Cerebras en ny måte å skalerer basert på tre nøkkel-punkter:
Erstatning av CPU- og GPU-prosessorer med wafer-skala-akseleratorer som Cerebras CS-2-systemet. Denne endringen reduserer antallet beregnings-enheter som trengs for å oppnå en akseptabel beregnings-hastighet.
For å møte utfordringen med modell-størrelse, bruker vi en system-arkitektur som skiller beregning fra modell-lagring. En beregnings-tjeneste basert på en kluster av CS-2-systemer (som gir tilstrekkelig beregnings-båndbredde) er tett koblet til en minne-tjeneste (med stor minne-kapasitet) som gir under-sett av modellen til beregnings-klustret på forespørsel. Som vanlig, tjenestegjør en data-tjeneste opp batches av trenings-data til beregnings-tjenesten når som helst.
En innovativ modell for planlegging og koordinering av trenings-arbeid over CS-2-klustret som anvender data-parallellitet, lag-for-lag-trening med sparse vekter strømmet inn på forespørsel, og oppbevaring av aktiver i beregnings-tjenesten.
Det har vært frykt for slutten på Moores lov i nærmere en dekade, hvor mange flere år kan industrien presse inn og hva slags innovasjoner er nødvendige for dette?
Jeg tror spørsmålet vi alle slåss med, er om Moores lov – som skrevet av Moore – er død. Det tar ikke to år å få flere transistorer. Det tar nå fire eller fem år. Og disse transistorer kommer ikke til samme pris – de kommer til en mye høyere pris. Så spørsmålet blir, får vi fortsatt de samme fordelene med å gå fra syv til fem til tre nanometer? Fordelene er mindre og de koster mer, og løsningene blir mer kompliserte enn bare chippen.
Jack Dongarra, en ledende datamaskin-arkitekt, holdt en tale nylig og sa, “Vi har blitt mye bedre til å lage FLOPs og å lage I/O.” Det er virkelig sant. Vår evne til å flytte data av-chip ligger etter vår evne til å øke ytelsen på en chip med en stor mengde. Hos Cerebras var vi glade når han sa det, fordi det validerer vårt valg å lage en større chip og flytte mindre ting av-chip. Det gir også noen veiledning på fremtidige måter å lage systemer med chipper som utfører bedre. Det er arbeid å gjøre, ikke bare å få ut mer FLOPs, men også i teknikker til å flytte dem og å flytte data fra chip til chip — selv fra veldig stor chip til veldig stor chip.
Er det noe annet du ville like å dele om Cerebras Systems?
For bedre eller verre, plasserer folk ofte Cerebras i denne kategorien “de virkelig store chip-guttene”. Vi har vært i stand til å levere overbevisende løsninger for veldig store neurale nettverk, og dermed eliminere behovet for å gjøre smertefull distribuert beregning. Jeg tror det er usedvanlig interessant og i hjertet av hvorfor våre kunder elsker oss. Det interessante domenet for 2023 vil være hvordan å gjøre stor beregning til en høyere nivå av nøyaktighet, ved å bruke færre FLOPs.
Vår arbeid på sparsity gir en ekstremt interessant tilnærming. Vi gjør ikke arbeid som ikke flytter oss mot mål-linjen, og å multiplisere med null er en dårlig idé. Vi vil slippe en veldig interessant artikkel om sparsity snart, og jeg tror det vil være mer fokus på å se hvordan vi kommer til disse effektive punktene, og hvordan vi gjør det for mindre kraft. Og ikke bare for mindre kraft og trening; hvordan vi minimerer kostnaden og kraften brukt i inferens? Jeg tror sparsity hjelper på begge fronter.
Takk for disse dyptgående svarene, lesere som ønsker å lære mer bør besøke Cerebras Systems.












