Rozhovory
Kevin Tubbs, PhD, SVP Strategic Solutions Group at Penguin Computing – Rozhovorová série

Kevin Tubbs, PhD, je senior viceprezident pro strategické řešení ve společnosti Penguin Computing. Penguin Computing navrhuje a dodává agnostické, komplexní řešení (hardware, software, cloud, služby) pro řešení složitých vědeckých, analytických a inženýrských problémů, kterým čelí dnešní společnosti Fortune 500, startupy, akademické instituce a federální organizace.
Co vás původně přitáhlo k oboru počítačové vědy?
Moi rodiče mi koupili počítač, když jsem byl velmi mladý, a vždy jsem měl zájem a talent pro počítače a experimentování. Během svého vzdělávání jsem se neustále pohyboval ve směru STEM oborů a to mě vedlo k tomu, aby jsem se chtěl zapojit do aplikovaného oboru. Můj背景 je fyzika a High Performance Computing (HPC). Má láska k počítačům mě vedla k tomu, aby jsem udržel počítačovou vědu v popředí všech ostatních vědeckých, matematických a inženýrských zájmů, které jsem měl, a to mě vedlo tam, kde jsem dnes.
Penguin Computing úzce spolupracuje s Open Compute Project (OCP) – co to přesně je?
Od začátku hnutí Open Compute Project (OCP) je Penguin Computing jedním z prvních adoptérů, podporovatelů a hlavních přispěvatelů do úsilí o přinesení výhod OCP do High Performance Computing (HPC) a umělé inteligence (AI).
Cílem OCP je spojit globální komunitu vývojářů, aby vytvořili plnou ekosystém infrastrukturní technologie, která je reimagineována, aby byla efektivnější, flexibilnější a škálovatelnější. Penguin Computing se připojil k OCP kvůli otevřeným technologiím a myšlence komunity. To, co jsme udělali v průběhu času, je zajistit, aby se dědictví a technologie z tradičního HPC a vznikajících trendů v AI a Analytice mohly efektivně škálovat – Penguin Computing tyto věci zavádí do OCP.
Jedním z výhod OCP je, že snižuje celkové náklady na vlastnictví (TCO) – nižší kapitálové výdaje díky odstranění všech zbytečných prvků a nižší provozní výdaje díky službám z přední strany, sdílené energii a jiným změnám designu – což dělá OCP-založenou technologii ideální pro škálování.
Penguin Computing má několik OCP produktů, včetně Penguin Computing Tundra Extreme Scale Platform a Penguin Computing Tundra AP. Platformy Tundra jsou také kompatibilní s HPC a AI workloady.
Tundra AP, nejnovější generace naší vysoce hustotní superpočítačové platformy Tundra, kombinuje zpracování Intel (INTC ) ® Xeon® Scalable 9200 série procesorů s Penguin Computingovým serverem Relion XO1122eAP v OCP formátu, který poskytuje vysokou hustotu CPU jader na rack.
Když se jedná o velké údaje, aby se optimalizovaly úrovně výkonu, uživatelé potřebují odstranit úzká místa, která zpomalují jejich přístup k údajům. Jak Penguin Computing řeší tento problém?
Penguin Computing využil svou schopnost používat otevřené technologie a rychle se přizpůsobovat současným trendům – jedním z nich je velký objem dat nebo růst dat a datově řízených workloads. Na odpověď na tento problém jsme vyvinuli naši Strategickou skupinu řešení, aby se touto otázkou zabývala přímo.
Při řešení problému jsme zjistili, že většina workloads, dokonce z tradičního technického výpočtu, je motivována k tomu, aby byla více datově řízená. V důsledku toho navrhuje Penguin Computing kompletní konečné řešení tím, že se snaží pochopit uživatelský workload. Abychom vytvořili optimalizované konečné řešení, zaměřujeme se na optimalizovanou softwarovou vrstvu, která zahrnuje orchestraci a doručování workloads. Základní je pochopit, jak uživatel využije infrastrukturu.
Dále se snažíme soustředit na optimalizovanou výpočetní infrastrukturu. Existují různé úrovně dat a IO výzev, které vytvářejí velký tlak na výpočetní část. Například různé workloady vyžadují různé kombinace urychlené výpočetní infrastruktury z CPU, GPU, šířky pásma paměti a sítě, která umožňuje, aby data byla přenesena a spočítána.
Nakonec musíme zjistit, jaké druhy řešení umožní doručit ta data. Zkoumáme optimalizovanou datovou infrastrukturu, abychom pochopili, jak se workload interaguje s daty, jaké jsou kapacitní požadavky a IO vzorce. Jakmile máme tyto informace, pomáhají nám navrhnout optimalizovaný systém.
Jakmile máme všechny informace, využíváme naše interní odborné znalosti v Penguin Computing k navržení designu a kompletního řešení. Vědíce, že je navržen z hlediska výkonu, musíme pochopit, kde je nasazen (v místním prostředí, cloudu, edge, kombinaci všech, atd.). To je přístup Penguin Computing k dodání optimalizovaného řešení pro datově řízené workloady.
Můžete diskutovat o důležitosti používání GPU místo CPU pro hluboké učení?
Jedním z největších trendů, které jsem viděl v souvislosti s důležitostí GPU pro hluboké učení, byla změna směrem k používání obecných GPU (GPGPU) jako datově paralelního kusu hardwaru, který umožňuje urychlit množství výpočetních jader, které lze použít k řešení paralelního výpočetního problému. To se děje již deset let.
Účastnil jsem se raných fází programování GPGPU, když jsem byl na vysoké škole a na počátku své kariéry. Věřím, že mít takový skok ve výpočetní hustotě, kde GPU poskytuje mnoho hustých výpočtů a analytických jader na zařízení a umožňuje vám umístit více v serverovém prostoru a být schopni repurporovat něco, co bylo původně určeno pro grafiku na výpočetní stroj, byl skutečný otevřený trend v HPC a AI komunitách.
Avšak většina z toho závisela na konverzi a optimalizaci kódu pro běh na GPU místo CPU. Jak jsme dělali tu práci, čekali jsme na koncept zabijácké aplikace – aplikace nebo použití, které skutečně využijí GPU. Pro GPGPU komunitu bylo hluboké učení tou aplikací, která galvanizovala úsilí a vývoj urychlení HPC a AI workloads.
Časem došlo k oživení AI a strojového učení, a hluboké učení se stalo relevantním. Zjistili jsme, že trénování neuronové sítě pomocí hlubokého učení skutečně dobře odpovídá základnímu designu GPU. Věřím, že jednou, co tyto dvě věci konvergovaly, máte schopnost dělat takové hluboké učení, které nebylo možné dříve pomocí CPU procesorů a nakonec omezovalo naši schopnost dělat AI ve velkém měřítku a v praxi.
Jakmile se GPU dostaly do hry, skutečně oživila výzkumnou a vývojářskou komunitu kolem AI a hlubokého učení, protože jste prostě neměli úroveň výpočtu, aby jste to mohli dělat efektivně a nebylo to demokratizováno. GPU skutečně umožňuje doručit hustší výpočet, který je ve své podstatě navržen dobře pro hluboké učení a přinesl to na úroveň hardwarových řešení, která usnadňují přístup více výzkumníkům a vědcům. Věřím, že to je jeden z největších důvodů, proč jsou GPU lepší pro studium hlubokého učení.
Jaké jsou některé z GPU-urychlených výpočetních řešení, která nabízí Penguin Computing?
Penguin Computing se目前 soustředí na komplexní řešení, která jsou vyvíjena naší Strategickou skupinou řešení, zejména v rámci naší AI a Analytika Praxe. V rámci této praxe se soustředíme na tři hlavní přístupy k GPU-urychleným řešením.
První je referenční architektura pro edge analytiku, kde navrhuje řešení, která se hodí do netradičních datových center (na okraji nebo poblíž okraje). To může zahrnovat telekomunikační edge datové centrum, prodejní zařízení, čerpací stanice a další. Tyto jsou všechny inference-založené AI řešení. Některé řešení jsou zaměřena na video analytiku pro kontaktování a rozpoznávání gest, aby se určilo, zda někdo umývá ruce nebo nosí masku. Tyto jsou aplikace kompletních řešení, která zahrnují GPU-urychlený hardware, který je optimalizován pro netradiční nebo edge nasazení, stejně jako softwarové stohy, které umožňují výzkumníkům a konečným uživatelům je efektivně využívat.
Další třída řešení Penguin Computing je postavena pro datové centrum a jádro AI tréninku a inferencí referenční architektury. Můžete si to představit jako umístění uvnitř velkého datového centra nebo v cloudu (Penguin Computing Cloud), kde někteří z našich zákazníků dělají velké školení pomocí tisíců GPU pro urychlení hlubokého učení. Zkoumáme, jak dodávat kompletní řešení a referenční architektury, které podporují všechny tyto softwarové workloady a kontejnerizaci prostřednictvím GPU designu a rozložení, všechny cesty až po datové infrastrukturní požadavky, které je podporují.
Třetí třída referenčních architektur v této praxi je kombinací předchozích dvou. Co hledáme v naší třetí referenční architektuře je, jak vytvořit datové tkaniny a cesty a pracovní postupy, aby ermögňovaly kontinuální učení, aby jste mohli spustit inferenci pomocí našich edge GPU-urychlených řešení, poslat ta data do privátního nebo veřejného cloudu, pokračovat ve školení a jakmile jsou nové školicí modely aktualizovány, poslat je zpět do inferencí. Tímto způsobem máme iterativní cyklus kontinuálního učení a AI modelů.
Penguin Computing nedávno nasadil nový superpočítač pro LLNL ve spolupráci s Intel a CoolIT. Můžete nám říci o tomto superpočítači a pro co byl navržen?
Superpočítač Magma, nasazený v LLNL, byl pořízen prostřednictvím smlouvy Commodity Technology Systems (CTS-1) s National Nuclear Security Administration (NNSA) a je jedním z prvních nasazení Intel Xeon Platinum 9200 série procesorů s podporou CoolIT Systems kompletní direct liquid chlazení a Omni-Path interconnect.
Financován prostřednictvím programu NNSA Advanced Simulation & Computing (ASC), Magma bude podporovat program Life Extension Program a úsilí kritická pro zajištění bezpečnosti, bezpečnosti a spolehlivosti jaderných zbraní v nepřítomnosti podzemního testování.
Superpočítač Magma je HPC systém, který je vylepšen umělou inteligencí a je konvergovaný platformou, která umožňuje urychlení HPC modelování pomocí AI. Magma se umístil v červnovém seznamu Top500 v roce 2020, když se dostal do první stovky, na 80. místo.
V rámci smlouvy CTS-1 dodal Penguin Computing více než 22 petaflops výpočetní kapacity pro podporu programu ASC v NNSA Tri-Labs of Lawrence Livermore, Los Alamos a Sandia National Laboratories.
Jaké jsou některé z různých způsobů, kterými Penguin Computing podporuje boj proti COVID-19?
V červnu 2020 se Penguin Computing oficiálně spojil s AMD, aby dodal HPC kapacity výzkumníkům na třech předních univerzitách ve Spojených státech – New York University (NYU), Massachusetts Institute of Technology (MIT) a Rice University – aby pomohl v boji proti COVID-19.
Penguin Computing se spojil přímo s AMD COVID-19 HPC Fondem, aby poskytl výzkumným institucím významné výpočetní zdroje pro urychlení lékařského výzkumu na COVID-19 a další nemoci. Penguin Computing a AMD spolupracují na dodání souboru on-premises a cloud-based HPC řešení NYU, MIT a Rice University, aby zvýšily výzkumné kapacity stovek vědců, kteří nakonec přispějí k lepšímu pochopení nového koronaviru.
Systémy poháněné nejnovějšími 2. generacemi AMD EPYC procesorů a Radeon Instinct MI50 GPU akcelerátory, které byly darovány univerzitám, by měly poskytnout více než jeden petaflops výpočetního výkonu. Další čtyři petaflops výpočetní kapacity budou k dispozici výzkumníkům prostřednictvím naší HPC cloud služby, Penguin Computing On-Demand (POD). Společně budou systémy dodané výzkumníkům poskytovat více než sedm petaflops GPU-urychlené výpočetní síly, které lze použít k boji proti COVID-19.
Univerzity, které obdržely dar, pravděpodobně využijí novou výpočetní kapacitu napříč řadou pandemických souvisejících workloads, včetně genomiky, vývoje vakcín, přenosové vědy a modelování.
Ještě něco, co byste rádi sdíleli o Penguin Computing?
Already více než dvě desetiletí dodává Penguin Computing přizpůsobená, inovativní a otevřená řešení do světa high-performance a technického výpočtu. Řešení Penguin Computing poskytují organizacím agilitu a svobodu, aby mohly využít nejnovější technologie ve svých výpočetních prostředích. Organizace mohou soustředit své zdroje na dodání produktů a nápadů na trh v rekordním čase, místo aby se soustředily na základní technologie. Široká škála řešení Penguin Computing pro AI/ML/Analytiku, HPC, DataOps a cloud-native technologie může být přizpůsobena a kombinována, aby nejenom splňovala současné potřeby, ale také aby se rychle adaptovala na budoucí potřeby a technologické změny. Profesionální a spravované služby Penguin Computing pomáhají s integrací, implementací a správou řešení. Služby hostingových služeb Penguin Computing mohou pomoci s „kde“ výpočetního prostředí, poskytují organizacím možnosti vlastnictví a flexibilitu pro běh v místním prostředí, na veřejném nebo vyhrazeném cloudu, hostingu nebo jako službu.
Děkuji za skvělý rozhovor, čtenáři, kteří chtějí se dozvědět více, by měli navštívit Penguin Computing.












