Intervjuer
Kevin Tubbs, PhD, SVP Strategiska lösningar på Penguin Computing – Intervjuer

Kevin Tubbs, PhD, är Senior Vice President för Strategiska lösningar på Penguin Computing. Penguin Computing designar anpassade, agnostiska lösningar från ax till limpa (maskinvara/mjukvara/moln/tjänster) för att lösa komplexa vetenskapliga, analytiska och tekniska problem som stora företag, startup-företag, akademiska institutioner och federala organisationer står inför i dag.
Vad var det som initialt drog dig till datavetenskapens område?
Mina föräldrar köpte en dator åt mig när jag var mycket ung, och jag har alltid haft ett intresse och en fallenhet för datorer och att pyssla. Genom min utbildning drogs jag ständigt till STEM-områden och det ledde till att jag ville engagera mig i ett mer tillämpat område. Min bakgrund är fysik och högpresterande datorer (HPC). Att ha en tidig kärlek till datorer gjorde att jag kunde hålla datavetenskap i fokus för alla andra vetenskaps-, matematik- eller teknikintressen som jag har haft, vilket har lett mig till där jag är i dag.
Penguin Computing samarbetar nära med Open Compute Project (OCP) – vad är det exakt?
Sedan starten av Open Compute Project (OCP) har Penguin Computing varit en tidig anhängare, supporter och stor bidragsgivare till insatserna för att bringa OCP-fördelarna till högpresterande datorer (HPC) och artificiell intelligens (AI).
OCP fokuserar på att samla en global utvecklargemenskap för att skapa en fullständig infrastrukturteknologi som är omformad för att vara mer effektiv, flexibel och skalbar. Penguin Computing gick med i OCP på grund av de öppna teknologierna och idén om en gemenskap. Vad vi har gjort över tiden är att se till att arvet och teknologierna från traditionell HPC och framväxande trender inom AI och analyser kan skalas effektivt – Penguin Computing driver dessa saker in i OCP.
En av fördelarna med OCP är att det sänker den totala ägandekostnaden (TCO) – lägre kapitalkostnader tack vare borttagning av alla yttre element och lägre driftskostnader på grund av service från framsidan, delad effekt och andra designförändringar – vilket gör OCP-baserad teknik perfekt för skalförändring.
Penguin Computing har flera OCP-produkter, inklusive Penguin Computing Tundra Extreme Scale Platform och Penguin Computing Tundra AP. Tundra-plattformarna är också kompatibla med HPC- och AI-arbetsbelastningar.
Tundra AP, den senaste generationen av vår högtäta Tundra-superdatorplattform, kombinerar bearbetningskraften från Intel (INTC ) Xeon Scalable 9200-seriens processorer med Penguin Computings Relion XO1122eAP Server i en OCP-formfaktor som levererar en hög densitet av CPU-kärnor per hylla.
När det gäller stora mängder data, för att optimera prestandanivåerna måste användarna ta bort flaskhalsar som sakta ner deras tillgång till data. Hur närmar sig Penguin Computing detta problem?
Penguin Computing har utnyttjat vår förmåga att använda öppna teknologier och röra sig snabbt med aktuella trender – en av dessa är stora mängder data eller tillväxten av data och data-drivna arbetsbelastningar. Som svar på detta har vi byggt ut vår Strategiska lösningar-grupp för att hantera detta problem direkt.
I vår hantering av problemet har vi funnit att de flesta arbetsbelastningar, även från traditionell teknisk beräkning, är alla motiverade att vara mer data-drivna. Som ett resultat av detta har Penguin Computing designat kompletta lösningar från ax till limpa genom att försöka förstå användarens arbetsbelastning. För att skapa en arbetsbelastnings-optimerad lösning från ax till limpa fokuserar vi på den arbetsbelastnings-optimerade programvarulagret som inkluderar orkestrering och arbetsbelastningsleverans. I princip behöver vi förstå hur användaren kommer att använda infrastrukturen.
Sedan försöker vi fokusera på arbetsbelastnings-optimerad beräkningsinfrastruktur. Det finns varierande nivåer av data och IO-utmaningar som lägger ett stort tryck på beräkningsdelen. Till exempel kräver olika arbetsbelastningar olika kombinationer av accelererad beräkningsinfrastruktur från CPU, GPU, minnesbandbredd och nätverk som tillåter att data flödar genom och beräknas.
Till slut måste vi ta reda på vilka typer av lösningar som kommer att tillåta oss att leverera data. Vi tittar på arbetsbelastnings-optimerad data-infrastruktur för att förstå hur arbetsbelastningen interagerar med data, vilken kapacitet som krävs och IO-mönster. När vi har den informationen hjälper det oss att designa ett arbetsbelastnings-optimerat system.
När vi har all information utnyttjar vi vår interna expertis på Penguin Computing för att arkitektera en design och en komplett lösning. Eftersom det är utformat från ett prestandaperspektiv behöver vi förstå var det distribueras (på plats, moln, kant, kombination av allt, etc.). Det är Penguin Computings tillvägagångssätt för att leverera en optimerad lösning för data-drivna arbetsbelastningar.
Kunde du diskutera vikten av att använda en GPU istället för en CPU för djupinlärning?
En av de största trenderna jag har sett i fråga om vikten av GPU för djupinlärning var övergången från att använda allmänna GPU:er (GPGPU) som en dataparallell enhet som tillät oss att kraftigt accelerera mängden beräkningskärnor som kan levereras för att lösa ett parallellt beräkningsproblem. Detta har pågått under de senaste tio åren.
Jag deltog i de tidiga stadierna av GPGPU-programmering när jag var i forskarutbildning och tidigt i min karriär. Jag tror att ha den där ökningen av beräkningsdensitet, där en GPU tillhandahåller många täta beräknings- och analytikerkärnor på en enhet och tillåter dig att få mer i en server och kunna återanvända något som ursprungligen var tänkt för grafik till en beräkningsmotor, var en verklig ögonöppnare för HPC- och AI-samhällena.
Men mycket av det arbete som vi gjorde var beroende av att konvertera och optimera kod för att köras på GPU istället för CPU. När vi gjorde allt det arbetet väntade vi på konceptet med den “dödande appen” – den applikation eller användningsfall som verkligen tar fart eller aktiveras av en GPU. För GPGPU-gemenskapen var djupinlärning den dödande applikationen som galvaniserade ansträngningar och utveckling för att accelerera HPC- och AI-arbetsbelastningar.
Över tiden var det en återupplivning av AI och maskinlärning, och djupinlärning kom in i bilden. Vi insåg att att träna ett neuronnät med djupinlärning faktiskt kartlade mycket bra över den underliggande designen av en GPU. Jag tror att när dessa två saker konvergerade hade vi möjligheten att göra den typ av djupinlärning som inte tidigare var möjlig med CPU-processorer och som slutligen begränsade vår förmåga att göra AI både i skala och i praktiken.
När GPU:er kom in i bilden aktiverade det faktiskt forsknings- och utvecklingssamhället runt AI och djupinlärning eftersom vi inte hade den nivån av beräkningar för att göra det effektivt och det var inte demokratiserat. GPU:n tillåter oss att leverera en tätare beräkning som i sin kärna är utformad väl för djupinlärning och förde det till en nivå av hårdvarulösningar som gjorde det lättare att komma till fler forskare och vetenskapsmän. Jag tror att det är en av de stora anledningarna till att GPU är bättre för att studera djupinlärning.
Vilka är några av de GPU-accelererade datorlösningarna som erbjuds av Penguin Computing?
Penguin Computing fokuserar för närvarande på lösningar från ax till limpa som arbetas med av vår Strategiska lösningar-grupp, särskilt med Penguin Computings AI- och Analytics-praxis. Inom denna praxis fokuserar vi på tre högnivåtillvägagångssätt för GPU-accelererade lösningar.
För det första erbjuder vi en referensarkitektur för edge-analyser, där vi letar efter att designa lösningar som passar i icke-traditionella datacenter (ute på kanten eller nära kanten). Detta kan inkludera Teleco-edge-datacenter, butikslokaler, bensinstationer och mer. Dessa är alla inferensbaserade AI-lösningar. Vissa lösningar är inriktade på videoanalyser för kontaktspårning och gestigenkänning för att bestämma om någon tvättar sina händer eller bär en mask. Dessa är tillämpningar av kompletta lösningar som inkluderar GPU-accelererad maskinvara som är finjusterad för icke-traditionella eller edge-distributioner samt programvarustacken för att möjliggöra för forskare och slutanvändare att använda dem effektivt.
Nästa klass av Penguin Computings lösningar är byggda för datacenter och kärn-AI-träning och inferens-referensarkitekturer. Du kan tänka dig att sitta inuti ett stort datacenter eller i molnet (Penguin Computing Cloud) där vissa av våra kunder gör stor skala-träning med användning av tusentals GPU för att accelerera djupinlärning. Vi tittar på hur vi levererar kompletta lösningar och referensarkitekturer som stöder alla dessa programvaru-arbetsbelastningar och containrar genom GPU-design och layout, hela vägen genom data-infrastrukturkraven som stöder det.
Den tredje klassen av referensarkitekturer i denna praxis är en kombination av de två föregående. Vad vi letar efter i vår tredje referensarkitektur är hur vi skapar data-tyger och vägar och arbetsflöden för att möjliggöra kontinuerligt lärande så att du kan köra inferens med våra edge-GPU-accelererade lösningar, trycka på den data till privat eller offentligt moln, fortsätta att träna på den och när de nya träningsmodellerna uppdateras, trycka tillbaka ut till inferens. På det sättet har vi en iterativ cykel av kontinuerligt lärande och AI-modeller.
Penguin Computing distribuerade nyligen en ny superdator för LLNL i samarbete med Intel och CoolIT. Kunde du berätta om denna superdator och vad den var designad för?
Superdatorn Magma, distribuerad på LLNL, inköptes genom Commodity Technology Systems (CTS-1)-kontraktet med National Nuclear Security Administration (NNSA) och är en av de första distributionerna av Intel Xeon Platinum 9200-seriens processorer med stöd från CoolIT Systems complete direkt kylnings- och Omni-Path-interconnect.
Finansierad genom NNSA:s Advanced Simulation & Computing (ASC)-program kommer Magma att stödja NNSA:s Life Extension Program och ansträngningar som är avgörande för att säkerställa säkerheten, säkerheten och tillförlitligheten hos nationens kärnvapen i avsaknad av underjordisk testning.
Superdatorn Magma är ett HPC-system som förbättras av artificiell intelligens och är en konvergerad plattform som tillåter AI att accelerera HPC-modellering. Magma rankades i juni 2020 Top500-listan, bröt in i topp 100 och kom in på plats 80.
Under CTS-1-kontraktet har Penguin Computing levererat mer än 22 petaflops av beräkningsförmåga för att stödja ASC-programmet på NNSA Tri-Labs i Lawrence Livermore, Los Alamos och Sandia National Laboratories.
Vilka är några av de olika sätten som Penguin Computing stöder kampen mot COVID-19?
I juni 2020 ingick Penguin Computing officiellt ett partnerskap med AMD för att leverera HPC-förmåga till forskare vid tre toppuniversitet i USA – New York University (NYU), Massachusetts Institute of Technology (MIT) och Rice University – för att hjälpa till i kampen mot COVID-19.
Penguin Computing samarbetade direkt med AMD:s COVID-19 HPC-fond för att tillhandahålla forskningsinstitutioner med betydande beräkningsresurser för att accelerera medicinsk forskning om COVID-19 och andra sjukdomar. Penguin Computing och AMD samarbetar för att leverera en samling av lokala och molnbaserade HPC-lösningar till NYU, MIT och Rice University för att hjälpa till att höja forskningsförmågan hos hundratals forskare som slutligen kommer att bidra till en större förståelse av det nya coronaviruset.
Driven av de senaste 2:a generationens AMD EPYC-processorer och Radeon Instinct MI50 GPU-acceleratorer förväntas systemen som donerats till universiteten var och en leverera över en petaflop av beräkningsprestanda. Ytterligare fyra petaflops av beräkningskapacitet kommer att göras tillgängliga för forskare genom vår HPC-molntjänst, Penguin Computing On-Demand (POD). Kombinerat kommer de donerade systemen att ge forskare mer än sju petaflops av GPU-accelererad beräkningskraft som kan användas för att bekämpa COVID-19.
De mottagande universiteten förväntas använda den nya beräkningskapaciteten över ett antal pandemi-relaterade arbetsbelastningar, inklusive genetik, vaccinutveckling, överföringsvetenskap och modellering.
Finns det något annat du vill dela om Penguin Computing?
Under mer än två decennier har Penguin Computing levererat anpassade, innovativa och öppna lösningar till högpresterande och teknisk datorvärld. Penguin Computings lösningar ger organisationer den agility och frihet de behöver för att utnyttja de senaste teknologierna i sina beräkningsmiljöer. Organisationer kan fokusera sina resurser på att leverera produkter och idéer till marknaden i rekordtid istället för på de underliggande teknologierna. Penguin Computings breda utbud av lösningar för AI/ML/Analytics, HPC, DataOps och molnbaserade teknologier kan anpassas och kombineras för att inte bara passa nuvarande behov, utan också snabbt anpassa sig till framtida behov och teknologiförändringar. Penguin Computings professionella och hanterade tjänster hjälper till med integration, implementering och hantering av lösningar. Penguin Computings värdtjänster kan hjälpa till med “var” i beräkningsmiljön genom att ge organisationer ägandemöjligheter och flexibiliteten att köra på plats, på offentligt eller dedikerat moln, värd eller som en tjänst.
Tack för den underbara intervjun, läsare som vill lära sig mer kan besöka Penguin Computing.












