Interviews
Kevin Tubbs, PhD, SVP Strategic Solutions Group bij Penguin Computing – Interview Series

Kevin Tubbs, PhD, is de Senior Vice President van de Strategic Solutions Group bij Penguin Computing. Penguin Computing ontwerpt op maat gemaakte, agnostische, end-to-end (hardware/software/cloud/diensten) oplossingen om complexe wetenschappelijke, analytische en technische problemen aan te pakken waarmee Fortune 500-bedrijven, start-ups, academische instellingen en federale organisaties te maken hebben.
Wat trok je aanvankelijk aan tot het vakgebied van informatica?
Mijn moeder en vader kochten me een computer toen ik nog heel jong was, en ik heb altijd al interesse gehad in computers en knutselen. Door mijn opleiding ben ik steeds meer naar STEM-velden toegetrokken en dat leidde ertoe dat ik betrokken wilde zijn bij een meer toegepast veld. Mijn achtergrond is natuurkunde en High Performance Computing (HPC). Mijn vroege liefde voor computers stelde me in staat om informatica centraal te stellen in alle andere wetenschappelijke, wiskundige of technische interesses die ik had, wat me uiteindelijk heeft gebracht waar ik nu ben.
Penguin Computing werkt nauw samen met het Open Compute Project (OCP) – wat is dat precies?
Sinds het begin van de Open Compute Project (OCP)-beweging is Penguin Computing een vroege aanhanger, ondersteuner en belangrijke bijdrager aan de inspanning om de voordelen van OCP naar High Performance Computing (HPC) en kunstmatige intelligentie (AI) te brengen.
De focus van OCP is het samenbrengen van een wereldwijde gemeenschap van ontwikkelaars om een volledig ecosysteem van infrastructuurtechnologie te creëren dat opnieuw is bedacht om efficiënter, flexibeler en schaalbaarder te zijn. Penguin Computing sloot zich aan bij OCP vanwege de open technologieën en het idee van een gemeenschap. Wat we in de loop van de tijd hebben gedaan, is ervoor zorgen dat het erfgoed en de technologieën uit traditionele HPC en opkomende trends in AI en Analytics efficiënt kunnen worden geschaald – Penguin Computing drijft die dingen aan in OCP.
Een van de voordelen van OCP is dat het de totale eigendomskosten (TCO) verlaagt – lagere kapitaaluitgaven dankzij het verwijderen van alle luxe-elementen en lagere operationele uitgaven vanwege service vanaf de voorkant, gedeelde stroom en andere ontwerpveranderingen – waardoor OCP-gebaseerde technologie perfect is voor schaaluitbreiding.
Penguin Computing heeft verschillende OCP-producten, waaronder het Penguin Computing Tundra Extreme Scale Platform en het Penguin Computing Tundra AP. De Tundra-platforms zijn ook compatibel met HPC- en AI-werklasten.
Tundra AP, de nieuwste generatie van ons zeer dichte Tundra-supercomputerplatform, combineert de verwerkingskracht van Intel (INTC ) Xeon Scalable 9200-serieprocessors met de Relion XO1122eAP-server van Penguin Computing in een OCP-formfactor die een hoge dichtheid van CPU-kernen per rack levert.
Wanneer het gaat om big data, moeten gebruikers om de prestatieniveaus te optimaliseren, knelpunten verwijderen die de toegang tot gegevens vertragen. Hoe benadert Penguin Computing dit probleem?
Penguin Computing heeft onze mogelijkheid om open technologieën te gebruiken en snel te bewegen met de huidige trends benut – een van die trends is big data of de groei van gegevens en gegevensgestuurde workloads. Als reactie daarop hebben we onze Strategic Solutions Group opgebouwd om dit probleem rechtstreeks aan te pakken.
Bij het aanpakken van het probleem hebben we ontdekt dat de meeste workloads, zelfs van traditionele technische berekeningen, allemaal gemotiveerd zijn om meer gegevensgestuurd te zijn. Als resultaat daarvan ontwerpt Penguin Computing complete end-to-end-oplossingen door te proberen de workload van de gebruiker te begrijpen. Om een workload-geoptimaliseerde end-to-end-oplossing te creëren, richten we ons op de workload-geoptimaliseerde softwarelaag, die orkestratie en workloadlevering omvat. We moeten eigenlijk begrijpen hoe de gebruiker de infrastructuur zal gebruiken.
Vervolgens proberen we ons te concentreren op workload-geoptimaliseerde rekeninfrastructuur. Er zijn verschillende niveaus van gegevens en IO-uitdagingen die veel druk uitoefenen op de rekenkant. Verschillende workloads vereisen bijvoorbeeld verschillende combinaties van versnelde rekeninfrastructuur van CPU’s, GPU’s, geheugengroottes en netwerkverbindingen die het mogelijk maken dat gegevens worden doorgestuurd en berekend.
Tenslotte moeten we uitvinden welke soorten oplossingen het mogelijk zullen maken om die gegevens te leveren. We onderzoeken workload-geoptimaliseerde gegevensinfrastructuur om te begrijpen hoe de workload met de gegevens omgaat, wat de capaciteitsvereisten en IO-patronen zijn. Zodra we die informatie hebben, helpt het ons om een workload-geoptimaliseerd systeem te ontwerpen.
Zodra we alle informatie hebben, benutten we onze interne expertise bij Penguin Computing om een ontwerp en een complete oplossing te maken. Wetend dat het vanuit een prestatieperspectief is ontworpen, moeten we begrijpen waar het wordt geïmplementeerd (op locatie, in de cloud, aan de rand, een combinatie van alles, enz.). Dat is de aanpak van Penguin Computing om een geoptimaliseerde oplossing voor gegevensgestuurde workloads te leveren.
Kunt u discussiëren over het belang van het gebruik van een GPU in plaats van een CPU voor diepe lering?
Een van de grootste trends die ik heb gezien met betrekking tot het belang van GPU’s voor diepe lering (DL) was de overstap van het gebruik van algemene GPU’s (GPGPU) als een gegevensparallelle hardware die het mogelijk maakte om de hoeveelheid berekeningen die kunnen worden uitgevoerd aanzienlijk te versnellen. Dit is al tien jaar gaande.
Ik nam deel aan de vroege stadia van GPGPU-programmeren toen ik aan de universiteit was en vroeg in mijn carrière. Ik geloof dat de sprong in berekeningsdichtheid, waarbij een GPU een grote hoeveelheid dichte berekeningen en analytische kernen op een apparaat levert en het mogelijk maakt om meer in een serversruimte te krijgen en in staat te zijn om iets dat oorspronkelijk voor grafische doeleinden was bedoeld, om te zetten in een rekenmotor, een echte openbaring was in de HPC- en AI-gemeenschappen.
Maar veel van die afhankelijkheden waren afhankelijk van het converteren en optimaliseren van code om op GPU’s in plaats van CPU’s te draaien. Terwijl we al die werkzaamheden deden, wachtten we op het concept van de killer-app – de applicatie of het gebruik dat echt van de grond komt of mogelijk wordt gemaakt door een GPU. Voor de GPGPU-gemeenschap was DL die killer-app die inspanningen en ontwikkelingen versnelde om HPC- en AI-workloads te versnellen.
Na verloop van tijd was er een opleving van AI en machine learning (ML), en DL kwam in beeld. We realiseerden ons dat het trainen van een neurale netwerk met DL eigenlijk heel goed paste bij de onderliggende ontwerp van een GPU. Ik geloof dat zodra die twee dingen samenvielen, je de mogelijkheid hebt om het soort DL te doen dat eerder niet mogelijk was met CPU-processors en uiteindelijk onze mogelijkheid om AI te doen, zowel in schaal als in de praktijk, beperkte.
Zodra GPU’s op hun plaats stonden, gaf het eigenlijk een nieuwe impuls aan de onderzoeks- en ontwikkelingsgemeenschap rond AI en DL, omdat je gewoon niet het niveau van berekeningen had om het efficiënt te doen en het was niet gedemocratiseerd. De GPU maakt het mogelijk om een dichtere berekening te leveren die in wezen is ontworpen voor DL en bracht het naar een niveau van hardware-oplossingen die het gemakkelijker maakten om meer onderzoekers en wetenschappers te bereiken. Ik geloof dat dat een van de belangrijkste redenen is waarom GPU’s beter zijn voor het bestuderen van DL.
Wat zijn enkele van de GPU-geaccelereerde rekenoplossingen die door Penguin Computing worden aangeboden?
Penguin Computing richt zich momenteel op end-to-end-oplossingen die worden ontwikkeld door onze Strategic Solutions Group, met name met de AI- en Analytics-praktijk van Penguin Computing. Binnen deze praktijk richten we ons op drie hoog niveau benaderingen van GPU-geaccelereerde oplossingen.
Als eerste bieden we een referentiearchitectuur voor edge-analyse, waarbij we proberen oplossingen te ontwerpen die passen in niet-traditionele datacenters (aan de rand of nabij de rand). Dit kan Teleco-edge-datacenters, retailfaciliteiten, benzinepompen en meer omvatten. Deze zijn allemaal inferentie-gebaseerde AI-oplossingen. Sommige oplossingen zijn gericht op video-analyse voor contact tracing en gebarenherkenning om te bepalen of iemand zijn handen wast of een masker draagt. Dit zijn toepassingen van complete oplossingen die GPU-geaccelereerde hardware omvatten die is afgestemd op niet-traditionele of edge-implementaties, evenals de software-stacks om onderzoekers en eindgebruikers in staat te stellen ze effectief te gebruiken.
De volgende klasse van Penguin Computing-oplossingen is ontwikkeld voor datacenter- en core-AI-training en inferentie-referentiearchitecturen. U kunt denken aan het zitten in een groot datacenter of in de cloud (Penguin Computing Cloud), waar sommige van onze klanten grote schaaltrainingen uitvoeren met duizenden GPU’s om DL te versnellen. We kijken naar hoe we complete oplossingen en referentiearchitecturen kunnen leveren die alle software-workloads en containerisatie via GPU-ontwerp en -lay-out ondersteunen, allemaal de way door de gegevensinfrastructuurvereisten die het ondersteunen.
De derde klasse van referentiearchitecturen in deze praktijk is een combinatie van de voorgaande twee. Wat we zoeken in onze derde referentiearchitectuur is hoe we data-stoffen en -paden en -workflows kunnen creëren om continue lering te ermöglichen, zodat u inferentie kunt uitvoeren met onze edge-GPU-geaccelereerde oplossingen, die gegevens naar privé- of openbare cloud kunt pushen, verder kunt trainen en wanneer de nieuwe trainingsmodellen worden bijgewerkt, terug kunt pushen naar inferentie. Op deze manier hebben we een iteratieve cyclus van continue lering en AI-modellen.
Penguin Computing heeft onlangs een nieuwe supercomputer geïmplementeerd voor LLNL in samenwerking met Intel en CoolIT. Kunt u ons vertellen over deze supercomputer en waarvoor hij is ontworpen?
De Magma-supercomputer, geïmplementeerd bij LLNL, is verworven via het Commodity Technology Systems (CTS-1)-contract met de National Nuclear Security Administration (NNSA) en is een van de eerste implementaties van Intel Xeon Platinum 9200-serieprocessors met ondersteuning van CoolIT Systems complete directe vloeistofkoeling en Omni-Path-interconnect.
Gefinancierd via het Advanced Simulation & Computing (ASC)-programma van de NNSA, zal Magma de Life Extension Program en inspanningen ondersteunen die cruciaal zijn voor het waarborgen van de veiligheid, beveiliging en betrouwbaarheid van de nucleaire wapens van het land in afwezigheid van ondergrondse tests.
De Magma-supercomputer is een HPC-systeem dat is verbeterd met kunstmatige intelligentie en is een geconvergeerd platform dat AI mogelijk maakt om HPC-modellering te versnellen. Magma werd gerangschikt in de Top500-lijst van juni 2020, waarin het de top 100 bereikte en op nummer 80 eindigde.
Onder het CTS-1-contract heeft Penguin Computing meer dan 22 petaflops aan rekenkracht geleverd om het ASC-programma te ondersteunen bij de NNSA Tri-Labs van Lawrence Livermore, Los Alamos en Sandia National Laboratories.
Wat zijn enkele van de verschillende manieren waarop Penguin Computing de strijd tegen COVID-19 ondersteunt?
In juni 2020 sloot Penguin Computing zich officieel aan bij AMD om HPC-mogelijkheden te leveren aan onderzoekers aan drie topuniversiteiten in de VS – New York University (NYU), Massachusetts Institute of Technology (MIT) en Rice University – om te helpen in de strijd tegen COVID-19.
Penguin Computing sloot zich rechtstreeks aan bij het COVID-19 HPC-fonds van AMD om onderzoeksinstellingen significante rekenbronnen te bieden om medisch onderzoek naar COVID-19 en andere ziekten te versnellen. Penguin Computing en AMD werken samen om een constellatie van on-premises en cloud-gebaseerde HPC-oplossingen te leveren aan NYU, MIT en Rice University om de onderzoeks capaciteiten van honderden wetenschappers te verhogen die uiteindelijk zullen bijdragen aan een beter begrip van het nieuwe coronavirus.
Aangedreven door de nieuwste 2e generatie AMD EPYC-processors en Radeon Instinct MI50 GPU-versnellers, zullen de aan de universiteiten geschonken systemen elk meer dan een petaflop aan rekenprestaties bieden. Een extra vier petaflops aan reken capaciteit zal beschikbaar worden gesteld aan onderzoekers via onze HPC-cloudservice, Penguin Computing On-Demand (POD). Samen zullen de geschonken systemen onderzoekers meer dan zeven petaflops aan GPU-geaccelereerde rekenkracht bieden die kan worden toegepast om COVID-19 te bestrijden.
De ontvangeruniversiteiten zullen de nieuwe reken capaciteit verwachten te gebruiken voor een reeks pandemie-gerelateerde workloads, waaronder genomics, vaccinontwikkeling, transmissiewetenschap en modellering.
Is er nog iets anders dat u over Penguin Computing wilt delen?
Al meer dan twee decennia levert Penguin Computing op maat gemaakte, innovatieve en open oplossingen voor de high performance- en technische rekenwereld. De oplossingen van Penguin Computing geven organisaties de flexibiliteit en vrijheid die ze nodig hebben om de nieuwste technologieën in hun rekenomgevingen te benutten. Organisaties kunnen hun middelen richten op het leveren van producten en ideeën aan de markt in recordtijd, in plaats van op de onderliggende technologieën. De brede range aan oplossingen van Penguin Computing voor AI/ML/Analytics, HPC, DataOps en cloud-native technologieën kan worden aangepast en gecombineerd om niet alleen aan de huidige behoeften te voldoen, maar ook om snel aan toekomstige behoeften en technologische veranderingen aan te passen. De professionele en beheerde diensten van Penguin Computing helpen bij het integreren, implementeren en beheren van oplossingen. De hostingdiensten van Penguin Computing kunnen helpen bij de “waar” van de rekenomgeving door organisaties eigendomsopties en flexibiliteit te bieden om on-premises, op publieke of dedicated cloud, gehost of als service te draaien.
Bedankt voor het geweldige interview, lezers die meer willen leren, moeten Penguin Computing bezoeken.












