Intervjuer
Kevin Tubbs, PhD, SVP Strategiske løsninger-gruppe hos Penguin Computing – Intervju-serie

Kevin Tubbs, PhD, er Senior Vice President for Strategiske løsninger-gruppe hos Penguin Computing. Penguin Computing designerer og tilbyr agnostiske, end-to-end-løsninger (hardware/programvare/skytjenester) for å løse komplekse vitenskapelige, analytiske og tekniske problemer som møter dagens Fortune 500-selskaper, startup-selskaper, akademiske institusjoner og føderale organisasjoner.
Hva var det som først tiltalte deg til datavitenskap?
Min mor og far kjøpte meg en datamaskin da jeg var svært ung, og jeg har alltid hatt en interesse og evne for datamaskiner og eksperimentering. Gjennom min utdanning har jeg jevnt gravitetert mot STEM-fag og det har ført meg til å ønske å være involvert i et mer anvendt felt. Min bakgrunn er fysikk og høy-ytelses databehandling (HPC). Å ha en forkjærlighet for datamaskiner tidlig har gjort at jeg har holdt datavitenskap i forkant av andre vitenskapelige, matematiske eller tekniske interesser jeg har hatt, noe som har ført meg til hvor jeg er i dag.
Penguin Computing samarbeider nært med Open Compute Project (OCP) – hva er det nøyaktig?
Siden starten av Open Compute Project (OCP)-bevegelsen har Penguin Computing vært en tidlig tilhenger, støttespiller og stor bidragsyter til å bringe OCPs fordeler til høy-ytelses databehandling (HPC) og kunstig intelligens (AI).
OCPs fokus er å samle en global samfunn av utviklere for å skape en fullstendig økosystem av infrastrukturteknologi som er omtenkt for å være mer effektiv, fleksibel og skalerbar. Penguin Computing gikk med i OCP på grunn av de åpne teknologiene og idéen om et samfunn. Det vi har gjort over tid er å sikre at arven og teknologiene fra tradisjonell HPC og nye trender i AI og Analytics kan skaleres effektivt – Penguin Computing driver disse tingene inn i OCP.
En av fordelene med OCP er at det reduserer den totale eierkostnaden (TCO) – lavere kapitalkostnader takket være fjerning av alle overflødige elementer, og lavere driftskostnader takket være service fra fronten, delt strøm og andre designendringer – noe som gjør OCP-basert teknologi perfekt for skala ut.
Penguin Computing har flere OCP-produkter, inkludert Penguin Computing Tundra Extreme Scale Platform og Penguin Computing Tundra AP. Tundra-plattformene er også kompatible med HPC- og AI-arbeidsbelastninger.
Tundra AP, den nyeste generasjonen av vår høyt tette Tundra-superdatamaskinplattform, kombinerer prosesseringskraften fra Intel (INTC ) Xeon Scalable 9200-serie prosessorer med Penguin Computings Relion XO1122eAP Server i en OCP-formfaktor som leverer en høy tetthet av CPU-kjerner per hyll.
Når det gjelder store data, må brukerne optimalisere ytelsesnivåene ved å fjerne flaskenhalser som sakter ned tilgangen til data. Hvordan nærmer Penguin Computing seg dette problemet?
Penguin Computing har utnyttet vår evne til å bruke åpne teknologier og flytte raskt med nåværende trender – en av dem er store data eller veksten av data og data-drevne arbeidsbelastninger. Som respons på dette har vi bygget ut vår Strategiske løsninger-gruppe for å møte dette problemet direkte.
I møtet med problemet, har vi funnet at de fleste arbeidsbelastninger, selv fra tradisjonell teknisk databehandling, er motivert til å være mer data-drevne. Som resultat har Penguin Computing designet komplette end-to-end-løsninger ved å prøve å forstå brukerens arbeidsbelastning. For å skape en arbeidsbelastnings-optimert end-to-end-løsning, fokuserer vi på den arbeidsbelastnings-optimerte programvarelaget som inkluderer orkestrering og arbeidsbelastningslevering. I realiteten må vi forstå hvordan brukeren vil bruke infrastrukturen.
Deretter prøver vi å fokusere på arbeidsbelastnings-optimert databehandlings-infrastruktur. Det finnes varierende nivåer av data og IO-utfordringer som setter mye press på databehandlings-delen. For eksempel krever forskjellige arbeidsbelastninger forskjellige kombinasjoner av akselerert databehandlings-infrastruktur fra CPU-er, GPU-er, minnehastighet og nettverk som tillater at data flytes gjennom og behandles på.
Til slutt må vi finne ut hva slags løsninger som vil tillate oss å levere dataene. Vi ser på arbeidsbelastnings-optimerte data-infrastrukturer for å forstå hvordan arbeidsbelastningen samhandler med dataene, hva kapasitetskravene er og IO-mønster. Når vi har denne informasjonen, hjelper det oss å designe et arbeidsbelastnings-optimert system.
Når vi har all informasjonen, utnytter vi vår interne ekspertise hos Penguin Computing til å arkitektere en design og en komplet løsning. Vi vet at det er designet fra et ytelsesperspektiv, og vi må forstå hvor det er distribuert (på stedet, sky, kant, kombinasjon av alle, osv.). Dette er Penguin Computings tilnærming til å levere en optimalisert løsning for data-drevne arbeidsbelastninger.
Kunne du diskutere viktigheten av å bruke en GPU i stedet for en CPU for dyp læring?
En av de største trendene jeg har sett i forhold til viktigheten av GPU-er for dyp læring (DL) var bevegelsen mot å bruke generiske GPU-er (GPGPU) som en data-parallell stykke hardware som tillot oss å akselerere mengden databehandling som kan løses i en parallell databehandlings-problem. Dette har pågått i løpet av de siste ti årene.
Jeg deltok i de tidlige fasene av GPGPU-programmering da jeg var i gradskolen og tidlig i min karriere. Jeg tror å ha en stor økning i databehandlings-tetthet, hvor en GPU gir en stor mengde tett databehandling og analytiske kjerne på en enhet og tillater deg å få mer i en server-plass og å kunne gjenbruke noe som opprinnelig var ment for grafikk til en databehandlings-motor, var en virkelig øyneåpner-trend i HPC- og AI-samfunnet.
Imidlertid var mye av dette avhengig av å konvertere og optimalisere kode for å kjøre på GPU-er i stedet for CPU-er. Mens vi gjorde all denne arbeidet, ventet vi på konseptet om den ultimate appen – applikasjonen eller bruksområdet som virkelig tar av eller er muliggjort av en GPU. For GPGPU-samfunnet var DL den ultimate appen som galvaniserte anstrengelser og utvikling i å akselerere HPC- og AI-arbeidsbelastninger.
Over tid var det en gjenoppliving av AI og maskinlæring (ML), og DL kom inn i bildet. Vi innsett at trening av et neuralt nettverk ved hjelp av DL faktisk kartet svært godt over den underliggende designen av en GPU. Jeg tror at når disse to ting konvergerer, har du evnen til å gjøre den type DL som ikke var mulig tidligere med CPU-prosessorer og ultimate begrenset vår evne til å gjøre AI både i skala og i praksis.
Når GPU-er kom inn i bildet, gjorde det faktisk at forsknings- og utviklingssamfunnet rundt AI og DL ble gjenopplivet, fordi du bare ikke hadde nivået av databehandling for å gjøre det effektivt, og det var ikke demokratisert. GPU-en tillater deg å levere en tettere databehandling som i sin kjerne er designet godt for DL og brakte det til et nivå av hårdvararkitektur-løsninger som gjorde det enklere å komme til flere forskere og vitenskapsmenn. Jeg tror at dette er en av de store grunnene til at GPU-er er bedre for å studere DL.
Hva er noen av de GPU-akselererte databehandlings-løsningene som tilbys av Penguin Computing?
Penguin Computing fokuserer for tiden på end-to-end-løsninger som arbeides med av vår Strategiske løsninger-gruppe, spesielt med Penguin Computings AI- og Analytics-praksis. Innenfor denne praksisen fokuserer vi på tre høynivå-tilnærminger til GPU-akselererte løsninger.
Først tilbyr vi en referanse-arkitektur for kant-analyse, hvor vi ser på å designe løsninger som passer i ikke-tradisjonelle data-sentre (ute på kanten eller nær kanten). Dette kan inkludere telekommunikasjonens kant-datacentre, detaljhandelsanlegg og mer. Disse er alle inferens-baserte AI-løsninger. Noen løsninger er rettet mot video-analyse for kontakt-sporing og gest-gjenkjenning for å bestemme om noen vasker hendene eller bærer en maske. Disse er applikasjoner av komplette løsninger som inkluderer GPU-akselerert hardware som er finjustert for ikke-tradisjonelle eller kant-distribusjoner, samt programvare-stakkene for å enable forskere og slutt-brukere til å bruke dem effektivt.
Den neste klassen av Penguin Computing-løsninger er bygget for data-senter og core AI-trening og inferens-referanse-arkitekturer. Du kan tenke på å sitte inne i et stort data-senter eller i skyen (Penguin Computing Cloud) hvor noen av våre kunder gjør stor skala-trening på å bruke tusenvis av GPU-er til å akselerere DL. Vi ser på hvordan vi leverer komplette løsninger og referanse-arkitekturer som støtter alle disse programvare-arbeidsbelastningene og containerisering gjennom GPU-design og layout, hele veien gjennom data-infrastruktur-kravene som støtter det.
Den tredje klassen av referanse-arkitekturer i denne praksisen er en kombinasjon av de to foregående. Hva vi ser på i vår tredje referanse-arkitektur-familie er hvordan vi kan skape data-vev og -stier og -arbeidsflyter for å enable kontinuerlig læring, så du kan kjøre inferens ved hjelp av våre kant-GPU-akselererte løsninger, pushe data til privat eller offentlig sky, fortsette å trene på det, og når de nye trenings-modellene er oppdatert, pushe det tilbake ut til inferens. På denne måten har vi en iterativ syklus av kontinuerlig læring og AI-modeller.
Penguin Computing har nylig deployert en ny superdatamaskin for LLNL i samarbeid med Intel og CoolIT. Kunne du fortelle oss om denne superdatamaskinen og hva den var designet for?
Den Magma-superdatamaskinen, deployert hos LLNL, ble kjøpt gjennom Commodity Technology Systems (CTS-1)-kontrakten med National Nuclear Security Administration (NNSA) og er en av de første deployeringene av Intel Xeon Platinum 9200-serie prosessorer med støtte fra CoolIT Systems komplett direkte væskeavkjøling og Omni-Path-interconnect.
Finansiert gjennom NNSAs Advanced Simulation & Computing (ASC)-program, vil Magma støtte NNSAs Life Extension Program og innsatsene som er kritiske for å sikre sikkerheten, sikkerheten og påliteligheten av nasjonens atomvåpen i fravær av underjordisk testing.
Magma-superdatamaskinen er et HPC-system som er forbedret med kunstig intelligens og er en konvergerende plattform som tillater AI å akselerere HPC-modellering. Magma ble rangert i juni 2020 Top500-listen, og brøt inn i topp 100, kom på #80.
Under CTS-1-kontrakten har Penguin Computing levert over 22 petaflops av databehandlings-kapasitet for å støtte ASC-programmet hos NNSAs Tri-Labs of Lawrence Livermore, Los Alamos og Sandia National Laboratories.
Hva er noen av de forskjellige måtene Penguin Computing støtter kampen mot COVID-19?
I juni 2020 inngikk Penguin Computing et offisielt samarbeid med AMD for å levere HPC-kapasiteter til forskere ved tre topp-universiteter i USA – New York University (NYU), Massachusetts Institute of Technology (MIT) og Rice University – for å hjelpe i kampen mot COVID-19.
Penguin Computing samarbeidet direkte med AMDs COVID-19 HPC-fond for å gi forskningsinstitusjoner betydelige databehandlings-resurser for å akselerere medisinsk forskning på COVID-19 og andre sykdommer. Penguin Computing og AMD samarbeider for å levere en rekke på stedet og sky-baserte HPC-løsninger til NYU, MIT og Rice University for å hjelpe med å heve forsknings-kapasiteten til hundrevis av forskere som vil bidra til en større forståelse av det nye koronaviruset.
Drevet av de nyeste 2. generasjons AMD EPYC-prosessorer og Radeon Instinct MI50 GPU-akseleratorer, er systemene donert til universitetene forventet å levere over en petaflop av databehandlings-ytelse. En ekstra fire petaflops av databehandlings-kapasitet vil bli gjort tilgjengelig for forskere gjennom vår HPC-skytjeneste, Penguin Computing On-Demand (POD). Kombinert vil de donerte systemene gi forskerne over syv petaflops av GPU-akselerert databehandlings-kraft som kan brukes til å bekjempe COVID-19.
De mottagende universitetene forventes å bruke den nye databehandlings-kapasiteten over en rekke pandemi-relaterte arbeidsbelastninger, inkludert genomikk, vaksine-utvikling, overførings-vitenskap og modellering.
Noe annet du ville dele om Penguin Computing?
I løpet av mer enn to tiår har Penguin Computing levert tilpassede, innovative og åpne løsninger til høy-ytelses- og teknisk databehandlings-verden. Penguin Computings løsninger gir organisasjonene den fleksibiliteten og friheten de trenger for å utnytte de nyeste teknologiene i sine databehandlings-miljøer. Organisasjoner kan fokusere sine ressurser på å levere produkter og ideer til markedet på rekord tid i stedet for på de underliggende teknologiene. Penguin Computings bredt spekter av løsninger for AI/ML/Analytics, HPC, DataOps og sky-tjenester kan tilpasses og kombineres for å ikke bare møte nåværende behov, men også raskt tilpasse seg fremtidige behov og teknologiske endringer. Penguin Computings profesjonelle og administrative tjenester hjelper med å integrere, implementere og forvalte løsninger. Penguin Computings hosting-tjenester kan hjelpe med “hvor” i databehandlings-miljøet ved å gi organisasjonene eier-alternativer og fleksibiliteten til å kjøre på stedet, på offentlig eller dedikert sky, vert eller som en tjeneste.
Takk for det flotte intervjuet, lesere som ønsker å lære mer kan besøke Penguin Computing.












