Interviews

Andrew Feldman, medstifter og CEO af Cerebras Systems – Interview Serie

mm
Føj Unite.AI til dine foretrukne kilder på Google

Andrew er medstifter og CEO af Cerebras Systems (CBRS ). Han er en iværksætter, der er dedikeret til at udvide grænserne i beregningsrummet. Før Cerebras, var han medstifter og CEO af SeaMicro, en pioner inden for energivenlige, høj-båndbredds mikroservere. SeaMicro blev købt af AMD i 2012 for 357 millioner dollars. Før SeaMicro, var Andrew Vice President for Produktledelse, Marketing og Business Development i Force10 Networks, som senere blev solgt til Dell Computing for 800 millioner dollars. Før Force10 Networks, var Andrew Vice President for Marketing og Corporate Development i RiverStone Networks fra virksomhedens grundlæggelse til børsnotering i 2001. Andrew har en BA og en MBA fra Stanford University.

Cerebras Systems bygger en ny klasse af computersystemer, designet fra bunden af med det enlige mål at accelerere AI og ændre fremtiden for AI-arbejde.

Kan du dele historien bag Cerebras Systems?

Mine medstiftere og jeg arbejdede alle sammen i en tidligere startup, som min CTO Gary og jeg startede tilbage i 2007, kaldet SeaMicro (som blev solgt til AMD i 2012 for 334 millioner dollars). Mine medstiftere er nogle af de førende computerarkitekter og ingeniører i branchen – Gary Lauterbach, Sean Lie, JP Fricker og Michael James. Da vi fik bandet sammen igen i 2015, skrev vi to ting på en whiteboard – at vi ville arbejde sammen, og at vi ville bygge noget, der ville transformere branchen og være i Computer History Museum, som er det samme som Compute Hall of Fame. Vi var æret, da Computer History Museum anerkendte vores præstationer og tilføjede WSE-2 processor til sin samling sidste år, med henvisning til, hvordan det har transformeret den kunstige intelligens-landskab.

Cerebras Systems er et team af pionerende computerarkitekter, computerspecialister, deep learning-forskere og ingeniører af alle typer, der elsker at udføre frygtløs ingeniørarbejde. Vores mission, da vi kom sammen, var at bygge en ny klasse af computer til at accelerere deep learning, som er blevet en af de vigtigste arbejdsbyrder i vores tid.

Vi indså, at deep learning har unikke, massive og voksende beregningskrav. Og det er ikke godt matchet af arv-maskiner som grafikprocessorer (GPUs), som var grundlæggende designet til andre formål. Som resultat er AI i dag begrænset ikke af applikationer eller ideer, men af tilgængeligheden af beregning. Test af en enkelt ny hypotese – træning af en ny model – kan tage dage, uger eller endda måneder og koste hundredtusinder af dollars i beregnings tid. Det er en stor forhindring for innovation.

Sådan opstod Cerebras for at bygge en ny type computer, der er optimeret udelukkende til deep learning, fra en ren tavle. For at møde de enorme beregningskrav til deep learning, designede og fremstillede vi den største chip nogensinde bygget – Wafer-Scale Engine (WSE). Ved at skabe verdens første wafer-skala processor, overvandt vi udfordringer på tværs af design, fremstilling og emballage – alle havde været betragtet som umulige i de 70 år, computersystemer har eksisteret. Hvert element i WSE er designet til at muliggøre deep learning-forskning i uhørt hastighed og skala, og driver branchens hurtigste AI-supercomputer, Cerebras CS-2.

Med hver komponent optimeret til AI-arbejde, leverer CS-2 mere beregningsydeevne på mindre plads og mindre strøm end noget andet system. Det gør det, samtidig med at det radikalt reducerer programmeringskompleksitet, vægur-beregningstid og tid til løsning. Afhængigt af arbejdsbyrde, fra AI til HPC, leverer CS-2 hundredvis eller tusindvis af gange mere ydeevne end legacy-alternativer. CS-2 giver deep learning-beregningstilgængelighed svarende til hundredvis af GPUs, samtidig med at det giver den lette programmering, administration og installation af en enkelt enhed.

Over de sidste måneder synes Cerebras at være overalt i nyhederne, hvad kan du fortælle os om den nye Andromeda AI-supercomputer?

Vi annoncerede Andromeda i november sidste år, og det er en af de største og kraftfuldeste AI-supercomputere nogensinde bygget. Den leverer mere end 1 Exaflop af AI-beregning og 120 Petaflops af tæt beregning, og Andromeda har 13,5 millioner kerner på tværs af 16 CS-2 systemer, og det er den eneste AI-supercomputer, der nogensinde har demonstreret næsten perfekt lineær skalerbarhed på store sprogmodeller. Det er også meget let at bruge.

Som en påmindelse, den største supercomputer på jorden – Frontier – har 8,7 millioner kerner. I raw kerneantal er Andromeda mere end en og en halv gang større. Det gør anderledes arbejde, men dette giver en idé om omfanget: næsten 100 terabit internt båndbredde, næsten 20.000 AMD Epyc-kerner, der føder det, og – til forskel fra de kæmpestore supercomputere, der tager år at oprette – vi oprettede Andromeda på tre dage, og straks derefter leverede det næsten perfekt lineær skalerbarhed af AI.

Argonne National Labs var vores første kunde til at bruge Andromeda, og de anvendte det til et problem, der brød deres 2.000 GPU-cluster kaldet Polaris. Problemet var at køre meget store, GPT-3XL generative modeller, mens de satte hele Covid-genomet i sekvensvinduet, så man kunne analysere hver gen i kontekst af hele Covid-genomet. Andromeda kørte en unik genetisk arbejdsbyrde med lange sekvenslængder (MSL på 10K) på tværs af 1, 2, 4, 8 og 16 noder, med næsten perfekt lineær skalerbarhed. Lineær skalerbarhed er blandt de mest efterspurgte egenskaber af en stor cluster. Andromeda leverede 15,87 gange mere gennemløb på tværs af 16 CS-2 systemer sammenlignet med en enkelt CS-2, og en reduktion i træningstid tilsvarende.

Kan du fortælle os om partnerskabet med Jasper, der blev annonceret i slutningen af november, og hvad det betyder for begge virksomheder?

Jasper er en virkelig interessant virksomhed. De er en leder inden for generativ AI-indhold til marketing, og deres produkter bruges af mere end 100.000 kunder verden over til at skrive kopi til marketing, annoncer, bøger og mere. Det er åbenbart en meget spændende og hurtigt voksende branche lige nu. Sidste år annoncerede vi et partnerskab med dem for at accelerere adoption og forbedre nøjagtigheden af generativ AI på tværs af enterprise- og forbrugerapplikationer. Jasper bruger vores Andromeda-supercomputer til at træne deres ekstremt beregningsintensive modeller på en brøkdel af tiden. Dette vil udvide rækkevidden af generative AI-modeller til masserne.

Med kraften fra Cerebras Andromeda-supercomputer kan Jasper dramatisk fremme AI-arbejde, herunder træning af GPT-netværk til at tilpasse AI-outputs til alle niveauer af slutbruger-kompleksitet og granularitet. Dette forbedrer den kontekstuelle nøjagtighed af generative modeller og vil enable Jasper til at personalisere indhold på tværs af multiple kundeklasser hurtigt og let.

Vores partnerskab giver Jasper mulighed for at opfinde fremtiden for generativ AI, ved at gøre ting, der er umulige eller upraktiske med traditionel infrastruktur, og accelerere potentialet for generativ AI, og bringe dens fordele til vores hurtigt voksende kundebase verden over.

I en seneste pressemeddelelse annoncerede National Energy Technology Laboratory og Pittsburgh Supercomputing Center, at de var pionerer i den første nogensinde Computational Fluid Dynamics Simulation på Cerebras wafer-scale engine. Kan du beskrive, hvad en wafer-scale engine er, og hvordan den fungerer?

Vores Wafer-Scale Engine (WSE) er den revolutionerende AI-processor til vores deep learning-computersystem, CS-2. Til forskel fra legacy, generiske processorer, blev WSE bygget fra bunden af for at accelerere deep learning: det har 850.000 AI-optimerede kerner til sparse tensor-operationer, massive høj båndbredde på-chip-hukommelse og interconnect, der er flere størrelsesordener hurtigere end en traditionel cluster kunne opnå. Alt i alt giver det os deep learning-beregningstilgængelighed svarende til en cluster af legacy-maskiner, alle i en enkelt enhed, let at programmere som en enkelt node – radikalt reducerer programmeringskompleksitet, vægur-beregningstid og tid til løsning.

Vores anden generation WSE-2, der driver vores CS-2 system, kan løse problemer ekstremt hurtigt. Hurtigt nok til at tillade realtids-, høj-fidelitetsmodeller af ingeniør-systemer af interesse. Det er et sjældent eksempel på succesfuld “strong scaling”, som er brugen af parallelisme til at reducere løsningstid med et fast størrelsesproblem.

Og det er, hvad National Energy Technology Laboratory og Pittsburgh Supercomputing Center bruger det til. Vi annoncerede nyligt nogle meget spændende resultater af en computational fluid dynamics (CFD) simulation, bestående af omkring 200 millioner celler, i næsten realtid. Denne video viser en højopløsnings-simulation af Rayleigh-Bénard konvektion, som opstår, når en fluidlag er opvarmet fra bunden og afkølet fra toppen. Disse termisk drevne fluidstrømme er alle omkring os – fra blæsende dage til lake-effect snestorme, til magmastrømme i jordens kerne og plasma-bevægelser i solen. Som fortalt i videoen, er det ikke kun den visuelle skønhed af simulationen, der er vigtig: det er hastigheden, vi kan beregne det med. For første gang kan NETL, ved hjælp af vores Wafer-Scale Engine, manipulere en grid på næsten 200 millioner celler i næsten realtid.

Hvad type data simuleres?

Arbejdsbyrden, der blev testet, var termisk drevne fluidstrømme, også kendt som naturlig konvektion, som er en anvendelse af computational fluid dynamics (CFD). Fluidstrømme opstår naturligt alle steder – fra blæsende dage til lake-effect snestorme, til tektonisk pladbevægelse. Denne simulation, bestående af omkring 200 millioner celler, fokuserer på et fænomen kendt som “Rayleigh-Bénard” konvektion, som opstår, når en fluid varmes fra bunden og afkøles fra toppen. I naturen kan dette fænomen føre til alvorlige vejrrelaterede begivenheder som nedbrud, mikrobrud og derechos. Det er også ansvarligt for magmastrømme i jordens kerne og plasma-bevægelser i solen.

Tilbage i november 2022 introducerede NETL en ny felt-ligningsmodellering-API, drevet af CS-2 systemet, som var op til 470 gange hurtigere end hvad der var muligt på NETL’s Joule Supercomputer. Dette betyder, at det kan levere hastigheder ud over hvad enten clusters af enhver antal CPU’er eller GPU’er kan opnå. Ved hjælp af en simpel Python-API, der aktiverer wafer-skala-behandling for meget af computational videnskab, giver WFA gevinster i ydeevne og brugervenlighed, som ikke kunne opnås på konventionelle computere og supercomputere – faktisk overgik det OpenFOAM på NETL’s Joule 2.0 supercomputer med mere end to størrelsesordener i tid til løsning.

Da WFA-API’en er så enkel, blev resultaterne opnået på kun få uger og fortsætter den tætte samarbejde mellem NETL, PSC og Cerebras Systems.

Ved at transformere hastigheden af CFD (som altid har været en langsom, offline-opgave) på vores WSE, kan vi åbne op for en hel række nye, realtidsbrug til dette, og mange andre kerne-HPC-applikationer. Vores mål er, at ved at enable mere beregningskraft, kan vores kunder udføre flere eksperimenter og opfinde bedre videnskab. NETL-laboratoriechef Brian Anderson har fortalt os, at dette vil dramatisk accelerere og forbedre designprocessen for nogle meget store projekter, som NETL arbejder på omkring at afhjælpe klimaforandringer og enable en sikker energifremtid – projekter som carbon-sekvestering og blue hydrogen-produktion.

Cerebras er konsekvent bedre end konkurrenterne, når det kommer til at udgive supercomputere, hvad er nogle af udfordringerne bag at bygge state of the art-supercomputere?

Ironisk nok er en af de største udfordringer for stor AI ikke AI selv. Det er den distribuerede beregning.

For at træne i dagens state of the art-neurale netværk bruger forskere ofte hundredvis til tusindvis af grafikprocessorer (GPUs). Og det er ikke let. At skale stor sprogmodeltræning på tværs af en cluster af GPU’er kræver distribution af en arbejdsbyrde på tværs af mange små enheder, håndtering af enheds-hukommelsesstørrelser og hukommelsesbåndbredde-begrænsninger, og omhyggelig håndtering af kommunikations- og synkroniserings-overhead.

Vi har valgt en helt anden tilgang til at designe vores supercomputere gennem udviklingen af Cerebras Wafer-Scale Cluster og Cerebras Weight Streaming execution mode. Med disse teknologier adresserer Cerebras en ny måde at skale på tre nøglepunkter:

Erstatning af CPU- og GPU-behandling med wafer-skala-acceleratorer som Cerebras CS-2 systemet. Denne ændring reducerer antallet af beregningsenheder, der er nødvendige for at opnå en acceptabel beregningshastighed.

For at møde udfordringen med modelstørrelse, anvender vi en systemarkitektur, der adskiller beregning fra model-lagring. En beregnings-service baseret på en cluster af CS-2 systemer (der giver tilstrækkelig beregningsbåndbredde) er tæt koblet til en hukommelses-service (med stor hukommelseskapacitet), der giver undermængder af modellen til beregningsclusteret påkrævet. Som sædvanligt serverer en data-service op batches af træningsdata til beregnings-servicen, som behøves.

En innovativ model for planlægning og koordinering af træningsarbejde på tværs af CS-2 clusteret, der anvender data-parallellisme, lag-for-lag træning med sparse vægte strømmet påkrævet, og fastholdelse af aktiveringer i beregnings-servicen.

Der har været frygt for slutningen af Moore’s Love i næsten et årti, hvor mange år mere kan branchen presse ud, og hvilke typer innovationer er nødvendige for dette?

Jeg tror, at spørgsmålet, vi alle kæmper med, er, om Moore’s Love – som skrevet af Moore – er død. Det tager ikke to år at få flere transistorer. Det tager nu fire eller fem år. Og disse transistorer kommer ikke til samme pris – de kommer til en meget højere pris. Så spørgsmålet bliver, om vi stadig får de samme fordele ved at gå fra syv til fem til tre nanometer? Fordelene er mindre, og de koster mere, og løsningerne bliver mere komplicerede end bare chippen.

Jack Dongarra, en førende computerarkitekt, gav en tale for nylig og sagde: “Vi er blevet meget bedre til at lave FLOPs og I/O.” Det er virkelig sandt. Vores evne til at flytte data off-chip ligger efter vores evne til at øge ydeevnen på en chip med en stor mængde. Hos Cerebras var vi glade, da han sagde det, fordi det validerer vores beslutning om at lave en større chip og flytte mindre ting off-chip. Det giver også nogle retningslinjer for fremtidige måder at lave systemer med chip, der kan yde bedre. Der er arbejde at gøre, ikke kun ved at udvinde flere FLOPs, men også i teknikker til at flytte dem og flytte data fra chip til chip – selv fra meget store chip til meget store chip.

Er der noget andet, du gerne vil dele om Cerebras Systems?

For bedre eller værre, sætter folk ofte Cerebras i denne kategori af “de virkelig store chip-folk”. Vi har kunnet levere overbevisende løsninger for meget store neurale netværk, og dermed eliminerer behovet for smertefulde distribuerede beregninger. Jeg tror, det er enormt interessant og ligger til hjertet af, hvorfor vores kunder elsker os. Det interessante domæne for 2023 vil være, hvordan man kan gøre stor beregning til en højere niveau af nøjagtighed, ved at bruge færre FLOPs.

Vores arbejde med sparsomhed giver en ekstremt interessant tilgang. Vi gør ikke arbejde, der ikke flytter os mod målstregen, og multiplicere med nul er en dårlig idé. Vi vil snart offentliggøre en meget interessant artikel om sparsomhed, og jeg tror, der vil være mere fokus på, hvordan vi kommer til disse effektive punkter, og hvordan vi gør det for mindre strøm. Og ikke kun for mindre strøm og træning; hvordan vi kan minimere omkostningerne og strømmen, der bruges til slutning? Jeg tror, sparsomhed hjælper på begge fronter.

Tak for disse dybdegående svar. Læsere, der ønsker at lære mere, skal besøge Cerebras Systems.

Antoine er en visionær leder og medstifter af Unite.AI, drevet af en urokkelig passion for at forme og fremme fremtiden for AI og robotteknologi. En serieiværksætter, han tror, at AI vil være lige så omvæltende for samfundet som elektricitet, og han bliver ofte fanget i at tale om potentialet for omvæltende teknologier og AGI.

Som en futurist, er han dedikeret til at udforske, hvordan disse innovationer vil forme vores verden. Derudover er han grundlægger af Securities.io, en platform, der fokuserer på at investere i skarp teknologi, der gendefinerer fremtiden og omformer hele sektorer.