Interviews

Kevin Tubbs, PhD, Vicepræsident for Strategiske Løsninger hos Penguin Computing – Interviewserie

mm
Føj Unite.AI til dine foretrukne kilder på Google

Kevin Tubbs, PhD, er Vicepræsident for Strategiske Løsninger hos Penguin Computing. Penguin Computing designer og leverer brugerdefinerede, agnostiske og komplette løsninger (hardware/software/cloud/tjenester) til at løse komplekse videnskabelige, analytiske og tekniske problemer for i dag Fortune 500-virksomheder, startups, akademiske institutioner og føderale organisationer.

Hvad var det, der oprindeligt tiltrak dig til datalogi?

Mine forældre købte mig en computer, da jeg var meget ung, og jeg har altid haft en interesse og en evne for computere og eksperimenter. Gennem min uddannelse har jeg konsekvent graviteret mod STEM-fag og det har ført mig til at ville være involveret i et mere anvendt felt. Min baggrund er fysik og High Performance Computing (HPC). At have en kærlighed til computere tidligt har gjort, at jeg har kunnet holde datalogi i forgrunden af andre videnskab, matematik eller ingeniørinteresser, som jeg har haft, og det har ført mig til, hvor jeg er i dag.

Penguin Computing samarbejder tæt med Open Compute Project (OCP) – hvad er det præcis?

Siden starten af Open Compute Project (OCP)-bevægelsen har Penguin Computing været en tidlig tilhænger, støtter og en stor bidragsyder til bestræbelserne på at bringe OCP’s fordele til High Performance Computing (HPC) og kunstig intelligens (AI).

OCP’s fokus er at samle en global community af udviklere for at skabe en komplet økosystem af infrastrukturteknologi, der er genopfundet for at være mere effektiv, fleksibel og skalerbar. Penguin Computing tilsluttede sig OCP på grund af de åbne teknologier og ideen om en community. Det, vi har gjort over tid, er sikre, at arven og teknologierne fra traditionel HPC og fremvoksende tendenser i AI og Analytics kan skaleres effektivt – Penguin Computing driver disse ting ind i OCP.

En af fordelene ved OCP er, at det reducerer den samlede ejeromkostning (TCO) – lavere kapitaludgifter takket være fjernelse af alle overflødige elementer og lavere driftsomkostninger på grund af service fra fronten, delt strøm og andre designændringer – hvilket gør OCP-baseret teknologi perfekt til skalaud.

Penguin Computing har flere OCP-produkter, herunder Penguin Computing Tundra Extreme Scale Platform og Penguin Computing Tundra AP. Tundra-platformene er også kompatible med HPC- og AI-arbeidsbyrder.

Tundra AP, den seneste generation af vores højtdense Tundra-supercomputerplatform, kombinerer behandlingskraften fra Intel (INTC ) ® Xeon® Scalable 9200-serieprocessorer med Penguin Computings Relion XO1122eAP-server i en OCP-formfaktor, der leverer en høj tæthed af CPU-kerner pr. rack.

Når det kommer til big data, skal brugerne for at optimere ydelsesniveauerne fjerne flaskehalsene, der langsomer deres adgang til data. Hvordan tilgår Penguin Computing dette problem?

Penguin Computing har udnyttet vores evne til at bruge åbne teknologier og følge med de aktuelle tendenser – en af disse er big data eller væksten i data og data-drevne arbeidsbyrder. Som svar på dette har vi bygget vores Strategiske Løsninger-gruppe op for at løse dette problem direkte.

I løsningen af problemet har vi fundet, at de fleste arbeidsbyrder, selv fra traditionel teknisk beregning, er motiveret til at være mere data-drevne. Som resultat heraf designer Penguin Computing komplette løsninger fra ende til anden ved at forsøge at forstå brugerens arbeidsbyrde. For at skabe en arbeidsbyrde-optimiseret løsning fra ende til anden fokuserer vi på den arbeidsbyrde-optimiserede software-lag, der inkluderer orkestrering og arbeidsbyrde-levering. Essentieligt set har vi brug for at forstå, hvordan brugeren vil anvende infrastrukturen.

Derefter forsøger vi at fokusere på arbeidsbyrde-optimiseret beregningsinfrastruktur. Der er varierende niveauer af data og IO-udfordringer, der lægger pres på beregningsdelen. For eksempel kræver forskellige arbeidsbyrder forskellige kombinationer af accelereret beregningsinfrastruktur fra CPU’er, GPU’er, hukommelsesbåndbredde og netværk, der tillader, at data kan flydes gennem og beregnes på.

Til sidst har vi brug for at finde ud af, hvilke løsninger der vil tillade os at levere data. Vi ser på arbeidsbyrde-optimiserede data-infrastrukturer for at forstå, hvordan arbeidsbyrden interagerer med data, hvad kapacitetskravene er, og IO-mønstre. Når vi har denne information, hjælper det os med at designe en arbeidsbyrde-optimiseret system.

Når vi har allerede information, udnytter vi vores interne ekspertise hos Penguin Computing til at arkitekturere en design og en komplet løsning. Da vi ved, at det er designet fra et performancesynspunkt, har vi brug for at forstå, hvor det er installeret (på stedet, i skyen, på kanten, en kombination af alle, osv.). Det er Penguin Computings tilgang til at levere en optimiseret løsning til data-drevne arbeidsbyrder.

Kunne du diskutere vigtigheden af at bruge en GPU i stedet for en CPU til dyb læring?

En af de største tendenser, jeg har set i forhold til vigtigheden af GPU’er til dyb læring, var skiftet fra at bruge generelle formål GPU’er (GPGPU) som en data-parallelt stykke hardware, der tillod os at accelerere mængden af beregningskerner, der kan løses i en parallel beregning. Dette har været pågående i de sidste ti år.

Jeg deltog i de tidlige faser af GPGPU-programmering, da jeg var i graduate school og tidligt i min karriere. Jeg tror på, at springet i beregningsdensitet, hvor en GPU giver en masse tæt beregning og analytiske kerner på en enhed og tillader os at få mere i en serverplads og kan genbruges til en beregningsmotor, var en rigtig øjenåbner-tendens i HPC- og AI-samfundene.

Men meget af dette afhang af, at vi konverterede og optimerede kode til at køre på GPU’er i stedet for CPU’er. Da vi gjorde al denne arbejde, ventede vi på begrebet om den dræbende app – den applikation eller brugsøjeblik, der virkelig tager af eller er muliggjort af en GPU. For GPGPU-fællesskabet var dyb læring den dræbende applikation, der galvaniserede bestræbelser og udvikling i acceleration af HPC- og AI-arbeidsbyrder.

Over tid var der en genskabelse af AI og maskinlæring (ML), og dyb læring kom i spil. Vi indså, at træning af et neuralt netværk ved hjælp af dyb læring faktisk afbildede meget godt den underliggende design af en GPU. Jeg tror på, at når disse to ting konvergerede, havde vi evnen til at gøre den slags dyb læring, der ikke var mulig tidligere med CPU-processorer, og begrænsede vores evne til at gøre AI både i skala og i praksis.

Når GPU’er kom på plads, gjorde det faktisk genoplivede forsknings- og udviklingssamfundet omkring AI og dyb læring, fordi vi bare ikke havde niveauet af beregning til at gøre det effektivt, og det var ikke demokratiseret. GPU’en giver os mulighed for at levere en tæt beregning, der i sin kerne er designet godt til dyb læring, og bragte det til et niveau af hardware-arkitekturløsninger, der gjorde det lettere at komme til mere forskere og videnskabsmænd. Jeg tror på, at det er en af de store grunde til, at GPU’er er bedre til at studere dyb læring.

Hvad er nogle af de GPU-accelererende beregningsløsninger, der tilbydes af Penguin Computing?

Penguin Computing er for tiden fokuseret på løsninger fra ende til anden, der arbejdes på af vores Strategiske Løsninger-gruppe, især med Penguin Computings AI- og Analytics-praksis. Inden for denne praksis er vi fokuseret på tre overordnede tilgange til GPU-accelererende løsninger.

Først tilbyder vi en referencearkitektur til edge-analytics, hvor vi søger at designe løsninger, der passer i ikke-traditionelle datacentre (udenfor eller nær kanten). Dette kan inkludere Teleco-kantedatacentre, butikslokaler, benzinstationer og mere. Disse er alle inferens-baserede AI-løsninger. Nogle løsninger er rettet mod videoanalytics til kontaktsporing og gestigenkendelse for at bestemme, om nogen vasker hænder eller bærer maske. Disse er anvendelser af komplette løsninger, der inkluderer GPU-accelereret hardware, der er finjusteret til ikke-traditionelle eller kant-installationer, samt software-stakke til at aktivere forskere og slutbrugere til at bruge dem effektivt.

Den næste klasse af Penguin Computing-løsninger er bygget til datacenter- og kerne-AI-træning og inferens-referencearkitekturer. Du kan tænke på at sidde inde i et stort datacenter eller i skyen (Penguin Computing Cloud), hvor nogle af vores kunder udfører storstilet træning ved hjælp af tusinder af GPU’er til at accelerere dyb læring. Vi ser på, hvordan vi kan levere komplette løsninger og referencearkitekturer, der understøtter alle disse software-arbeidsbyrder og containerisering gennem GPU-design og layout, hele vejen gennem data-infrastrukturkravene, der understøtter det.

Den tredje klasse af referencearkitekturer i denne praksis er en kombination af de to foregående. Hvad vi søger i vores tredje referencearkitektur-familie er, hvordan vi kan skabe data-tekstiler og -stier og arbejdsgange til at aktivere kontinuerlig læring, så du kan køre inferens ved hjælp af vores kant-GPU-accelererende løsninger, pushe data til privat eller offentlig sky, fortsætte med at træne på det, og når de nye træningsmodeller er opdateret, pushe det tilbage ud til inferens. På den måde har vi en iterativ cyklus af kontinuerlig læring og AI-modeller.

Penguin Computing har nyligt deployeret en ny supercomputer til LLNL i partnerskab med Intel og CoolIT. Kunne du fortælle os om denne supercomputer og hvad den var designet til?

Magma-supercomputeren, der er deployeret på LLNL, blev erhvervet gennem Commodity Technology Systems (CTS-1)-kontrakten med National Nuclear Security Administration (NNSA) og er en af de første installationer af Intel Xeon Platinum 9200-serieprocessorer med støtte fra CoolIT Systems komplet direkte væskeafkøling og Omni-Path-interconnect.

Finansieret gennem NNSA’s Advanced Simulation & Computing (ASC)-program skal Magma støtte NNSA’s Life Extension Program og bestræbelser, der er kritiske for at sikre sikkerheden, sikkerheden og pålideligheden af nationens kernevåben i fravær af underjordisk test.

Magma-supercomputeren er et HPC-system, der er forbedret med kunstig intelligens, og er en konvergeret platform, der tillader AI at accelerere HPC-modellering. Magma blev rangeret på Top500-listen i juni 2020 og brød ind på top 100, hvor den kom ind på #80.

Under CTS-1-kontrakten har Penguin Computing leveret mere end 22 petaflops af beregningskapacitet til at støtte ASC-programmet på NNSA Tri-Labs of Lawrence Livermore, Los Alamos og Sandia National Laboratories.

Hvad er nogle af de forskellige måder, Penguin Computing støtter kampen mod COVID-19?

I juni 2020 annoncerede Penguin Computing officielt et partnerskab med AMD for at levere HPC-kapaciteter til forskere på tre topuniversiteter i USA – New York University (NYU), Massachusetts Institute of Technology (MIT) og Rice University – for at hjælpe i kampen mod COVID-19.

Penguin Computing samarbejdede direkte med AMD’s COVID-19 HPC Fund for at give forskningsinstitutioner betydelige beregningsressourcer til at accelerere medicinsk forskning på COVID-19 og andre sygdomme. Penguin Computing og AMD samarbejder om at levere en konstellation af lokale og cloud-baserede HPC-løsninger til NYU, MIT og Rice University for at hjælpe med at hæve forskningskapaciteten hos hundredvis af videnskabsmænd, der vil bidrage til en større forståelse af det nye coronavirus.

Drevet af de seneste 2. generations AMD EPYC-processorer og Radeon Instinct MI50 GPU-acceleratorer forventes systemerne, der er doneret til universiteterne, hver at give mere end en petaflop beregningsydeevne. Yderligere fire petaflops af beregningskapacitet vil blive gjort tilgængelige for forskere gennem vores HPC-cloudtjeneste, Penguin Computing On-Demand (POD). Samlet set vil de donerede systemer give forskerne mere end syv petaflops af GPU-accelereret beregningskraft, der kan anvendes til at bekæmpe COVID-19.

De modtagende universiteter forventes at anvende den nye beregningskapacitet på tværs af en række pandemi-relaterede arbeidsbyrder, herunder genetik, vaccineudvikling, transmissionsvidenskab og modellering.

Er der noget andet, du gerne vil dele om Penguin Computing?

I mere end to årtier har Penguin Computing leveret brugerdefinerede, innovative og åbne løsninger til high-performance- og teknisk beregningsverden. Penguin Computings løsninger giver organisationer den agilitet og frihed, de har brug for for at udnytte de seneste teknologier i deres beregningsmiljø. Organisationer kan fokusere deres ressourcer på at levere produkter og ideer til markedet i rekordtid i stedet for på de underliggende teknologier. Penguin Computings bredt udvalg af løsninger til AI/ML/Analytics, HPC, DataOps og cloud-native-teknologier kan tilpasses og kombineres for at møde både nuværende og fremtidige behov og teknologiske ændringer. Penguin Computings professionelle og administrerede tjenester hjælper med integration, implementering og administration af løsninger. Penguin Computings hostingtjenester kan hjælpe med “hvor”-spørgsmålet om beregningsmiljøet ved at give organisationer ejerskabsmuligheder og fleksibiliteten til at køre på stedet, i offentlig eller dedikeret sky, hosted eller som en tjeneste.

Tak for det gode interview, læsere, der ønsker at lære mere, skal besøge Penguin Computing.

Antoine er en visionær leder og medstifter af Unite.AI, drevet af en urokkelig passion for at forme og fremme fremtiden for AI og robotteknologi. En serieiværksætter, han tror, at AI vil være lige så omvæltende for samfundet som elektricitet, og han bliver ofte fanget i at tale om potentialet for omvæltende teknologier og AGI.

Som en futurist, er han dedikeret til at udforske, hvordan disse innovationer vil forme vores verden. Derudover er han grundlægger af Securities.io, en platform, der fokuserer på at investere i skarp teknologi, der gendefinerer fremtiden og omformer hele sektorer.