Interviuri
Kevin Tubbs, PhD, SVP Grupului de Soluții Strategice la Penguin Computing – Seria de Interviuri

Kevin Tubbs, PhD, este Vicepreședinte Senior al Grupului de Soluții Strategice la Penguin Computing. Penguin Computing proiectează soluții personalizate, agnostice, de la capăt la capăt (hardware, software, cloud, servicii) pentru a rezolva problemele științifice, analitice și de inginerie complexe cu care se confruntă companiile Fortune 500, startup-urile, instituțiile academice și organizațiile federale de astăzi.
Ce v-a atras inițial în domeniul științei calculatoarelor?
Părinții mei mi-au cumpărat un calculator când eram foarte tânăr, și am avut întotdeauna un interes și o înclinație pentru calculatoare și pentru a experimenta. Prin educația mea, am fost atras constant de domeniile STEM și asta m-a determinat să vreau să fiu implicat într-un domeniu mai aplicat. Fundalul meu este fizică și Calcul cu Performanță Înaltă (HPC). Având o dragoste pentru calculatoare de la început, mi-a permis să păstrez știința calculatoarelor în fruntea oricărui alt interes științific, matematic sau de inginerie pe care l-am avut, ceea ce m-a condus unde sunt astăzi.
Penguin Computing lucrează îndeaproape cu Proiectul Open Compute (OCP) – ce este exact?
De la începutul mișcării Open Compute Project (OCP), Penguin Computing a fost un adoptator timpuriu, susținător și contributor major la efortul de a aduce beneficiile OCP în Calculul cu Performanță Înaltă (HPC) și inteligență artificială (AI).
Focusul OCP este de a aduna o comunitate globală de dezvoltatori pentru a crea un ecosistem complet de tehnologie de infrastructură reimaginat pentru a fi mai eficient, flexibil și scalabil. Penguin Computing s-a alăturat OCP din cauza tehnologiilor deschise și a ideii de comunitate. Ce am făcut de-a lungul timpului a fost să ne asigurăm că moștenirea și tehnologiile din HPC tradițional și tendințele emergente în AI și Analitică pot fi scalate eficient – Penguin Computing conduce aceste lucruri în OCP.
Unul dintre beneficiile OCP este că reduce costul total de proprietate (TCO) – cheltuieli de capital mai mici, datorită eliminării tuturor elementelor de vanitate, și cheltuieli de operare mai mici datorită serviciului de la fața locului, putere partajată și alte modificări de proiectare – ceea ce face tehnologia OCP perfectă pentru scalare.
Penguin Computing are mai multe produse OCP, inclusiv Platforma Extreme Scale Tundra și Tundra AP de la Penguin Computing. Platformele Tundra sunt, de asemenea, compatibile cu HPC și AI.
Tundra AP, cea mai recentă generație a platformei noastre de supercalculatoare Tundra, combină puterea de procesare a procesoarelor Intel (INTC ) Xeon Scalable 9200 cu serverul Relion XO1122eAP de la Penguin Computing într-un factor de formă OCP care oferă o densitate ridicată de nuclee CPU pe raft.
Când vine vorba de date mari, pentru a optimiza nivelurile de performanță, utilizatorii trebuie să elimine blocajele care încetinesc accesul la date. Cum abordează Penguin Computing această problemă?
Penguin Computing și-a valorificat capacitatea de a utiliza tehnologii deschise și de a se deplasa rapid cu tendințele actuale – una dintre acestea fiind datele mari sau creșterea datelor și a sarcinilor de lucru bazate pe date. Ca răspuns la aceasta, am construit Grupul nostru de Soluții Strategice pentru a aborda această problemă direct.
În abordarea problemei, am constatat că majoritatea sarcinilor de lucru, chiar și din calculul tehnic tradițional, sunt motivate să fie mai bazate pe date. Ca urmare, Penguin Computing proiectează soluții complete de la capăt la capăt, încercând să înțeleagă sarcina de lucru a utilizatorului. Pentru a crea o soluție optimizată de la capăt la capăt, ne concentrăm pe stratul de software optimizat pentru sarcină de lucru, care include orchestrarea și livrarea sarcinii de lucru. Esențial, trebuie să înțelegem cum utilizatorul va face uz de infrastructură.
Următorul pas este să ne concentrăm pe infrastructura de calcul optimizată pentru sarcină de lucru. Există niveluri diferite de date și provocări IO care pun o presiune mare pe partea de calcul. De exemplu, sarcini de lucru diferite necesită combinații diferite de infrastructură de calcul accelerată de la CPU, GPU, lățime de bandă de memorie și rețea care permite ca datele să fie transmise și calculate.
În final, trebuie să determinăm ce tipuri de soluții ne vor permite să livrăm aceste date. Examinăm infrastructura de date optimizată pentru sarcină de lucru pentru a înțelege cum sarcina de lucru interacționează cu datele, ce sunt cerințele de capacitate și modelele IO. Odată ce avem aceste informații, ne ajută să proiectăm un sistem optimizat.
Odată ce avem toate informațiile, valorificăm expertiza noastră internă de la Penguin Computing pentru a proiecta o soluție completă. Știind că este proiectat din perspectiva performanței, trebuie să înțelegem unde este implementat (în loc, în cloud, la margine, o combinație a tuturor, etc.). Acesta este modul în care Penguin Computing abordează livrarea unei soluții optimizate pentru sarcini de lucru bazate pe date.
Ar putea să discutați despre importanța utilizării unui GPU în locul unui CPU pentru învățarea profundă?
Una dintre cele mai mari tendințe pe care le-am observat în legătură cu importanța GPU-urilor pentru învățarea profundă (DL) a fost mutarea de la utilizarea GPU-urilor generale (GPGPU) ca piesă de hardware paralelă care ne-a permis să accelerăm masiv cantitatea de calcul pe care o putem livra pentru a rezolva o problemă de calcul paralel. Acest lucru s-a întâmplat în ultimii zece ani.
Am participat la etapele inițiale ale programării GPGPU când eram la școala doctorală și la începutul carierei mele. Cred că având un salt în densitatea de calcul, unde un GPU oferă multe nuclee de calcul și analitică pe un dispozitiv și ne permite să obținem mai multe într-un spațiu de server și putând să repurtez ceva care a fost inițial destinat graficii către un motor de calcul a fost o tendință reală în comunitățile HPC și AI.
Însă, mult din acest lucru s-a bazat pe convertirea și optimizarea codului pentru a rula pe GPU-uri în loc de CPU. Pe măsură ce am făcut toată această muncă, am așteptat conceptul de aplicația ucigătoare – aplicația sau cazul de utilizare care să ia realmente avânt sau să fie facilitat de un GPU. Pentru comunitatea GPGPU, DL a fost acea aplicație care a galvanizat eforturile și dezvoltarea în accelerarea sarcinilor de lucru HPC și AI.
De-a lungul timpului, a existat o renaștere a inteligenței artificiale și a învățării automate (ML), și DL a intrat în joc. Am realizat că antrenarea unei rețele neuronale utilizând DL se potrivea foarte bine cu proiectarea subiacentă a unui GPU. Cred că odată ce aceste două lucruri s-au convergent, aveți capacitatea de a face DL care nu a fost posibilă anterior prin procesoare CPU și, în cele din urmă, ne-a limitat capacitatea de a face AI atât la scară, cât și în practică.
Odată ce GPU-urile au intrat în scenă, au reenergizat realmente comunitatea de cercetare și dezvoltare din jurul inteligenței artificiale și DL, deoarece nu aveam nivelul de calcul necesar pentru a face acest lucru eficient și nu era democratizat. GPU-ul ne permite să livrăm un calcul mai dens, care la bază este proiectat bine pentru DL și l-a adus la un nivel de soluții de arhitectură hardware care a făcut mai ușor pentru mai mulți cercetători și oameni de știință să ajungă la el. Cred că acesta este unul dintre motivele pentru care GPU-urile sunt mai bune pentru studiul DL.
Care sunt unele dintre soluțiile de calcul accelerate de GPU oferite de Penguin Computing?
Penguin Computing se concentrează în prezent pe soluții de la capăt la capăt, lucrate de Grupul nostru de Soluții Strategice, în special cu Practica noastră de AI și Analitică. În cadrul acestei practici, ne concentrăm pe trei abordări de nivel înalt pentru soluții accelerate de GPU.
În primul rând, oferim o arhitectură de referință pentru analiza de margine, unde căutăm să proiectăm soluții care se potrivesc în centre de date neconvenționale (la margine sau aproape de margine). Acest lucru poate include centre de date de margine de telecomunicații, facilități comerciale, stații de benzină și multe altele. Acestea sunt toate soluții de AI bazate pe inferență. Unele soluții sunt destinate analizei video pentru urmărirea contactelor și recunoașterea gesturilor pentru a determina dacă cineva se spală pe mâini sau poartă o mască. Acestea sunt aplicații de soluții complete care includ hardware accelerate de GPU, finisate pentru implementări neconvenționale sau de margine, precum și stivile de software pentru a permite cercetătorilor și utilizatorilor finali să le utilizeze eficient.
Următoarea clasă de soluții Penguin Computing este construită pentru arhitecturi de referință de antrenare și inferență AI în centre de date și nucleul cloud. Puteți gândi despre așezarea într-un centru de date de mari dimensiuni sau în cloud (Cloud-ul Penguin Computing), unde unii dintre clienții noștri fac antrenarea la scară largă utilizând mii de GPU pentru a accelera DL. Ne uităm la modul în care livrăm soluții complete și arhitecturi de referință care susțin toate aceste sarcini de lucru software și containerizare prin proiectarea și layout-ul GPU, pe tot parcursul cerințelor de infrastructură de date care o susțin.
Cea de-a treia clasă de arhitecturi de referință în această practică este o combinație a celor două anterioare. Ceea ce căutăm în a treia noastră arhitectură de referință este cum putem crea țesături de date și căi și fluxuri de lucru pentru a permite învățarea continuă, astfel încât să putem rula inferență utilizând soluțiile noastre accelerate de GPU de margine, să trimitem datele către cloud privat sau public, să continuăm să antrenăm și, pe măsură ce noile modele de antrenare sunt actualizate, să le trimitem înapoi către inferență. Acest mod, avem un ciclu iterativ de învățare continuă și modele AI.
Penguin Computing a implementat recent un supercalculator nou pentru LLNL, în parteneriat cu Intel și CoolIT. Ne puteți spune despre acest supercalculator și pentru ce a fost proiectat?
Supercalculatorul Magma, implementat la LLNL, a fost achiziționat prin contractul Commodity Technology Systems (CTS-1) cu Administrația Națională de Securitate Nucleară (NNSA) și este una dintre primele implementări ale procesoarelor Intel Xeon Platinum 9200 cu suport de la CoolIT Systems pentru răcire lichidă directă și interconectare Omni-Path.
Finanțat prin programul Advanced Simulation & Computing (ASC) al NNSA, Magma va susține programul de prelungire a duratei de viață și eforturile critice pentru a asigura siguranța, securitatea și fiabilitatea armelor nucleare ale națiunii în absența testelor subterane.
Supercalculatorul Magma este un sistem HPC care este îmbunătățit de inteligență artificială și este o platformă convergentă care permite AI să accelereze modelarea HPC. Magma a fost clasat în lista Top500 din iunie 2020, intrând în top 100, la locul #80.
Sub contractul CTS-1, Penguin Computing a livrat peste 22 de petaflopuri de capacitate de calcul pentru a susține programul ASC la laboratoarele triunghiului NNSA de la Lawrence Livermore, Los Alamos și Sandia National Laboratories.
Care sunt unele dintre modurile în care Penguin Computing sprijină lupta împotriva COVID-19?
În iunie 2020, Penguin Computing s-a asociat oficial cu AMD pentru a livra capacități HPC cercetătorilor de la trei universități de top din SUA – New York University (NYU), Massachusetts Institute of Technology (MIT) și Rice University – pentru a ajuta în lupta împotriva COVID-19.
Penguin Computing s-a asociat direct cu fondul HPC COVID-19 al AMD pentru a furniza instituțiilor de cercetare resurse de calcul semnificative pentru a accelera cercetarea medicală pe COVID-19 și alte boli. Penguin Computing și AMD colaborează pentru a livra o constelație de soluții HPC bazate pe premisă și cloud către NYU, MIT și Rice University pentru a ajuta la îmbunătățirea capacităților de cercetare ale sute de oameni de știință care vor contribui, în cele din urmă, la o înțelegere mai bună a coronavirusului nou.
Pe baza procesoarelor AMD EPYC de a doua generație și a acceleratorilor GPU Radeon Instinct MI50, sistemele donate universităților sunt așteptate să ofere peste un petaflop de performanță de calcul. O capacitate de calcul suplimentară de patru petaflopuri va fi pusă la dispoziția cercetătorilor prin serviciul nostru de cloud HPC, Penguin Computing On-Demand (POD). Împreună, sistemele donate vor oferi cercetătorilor peste șapte petaflopuri de putere de calcul accelerată de GPU care pot fi aplicate pentru a lupta împotriva COVID-19.
Universitățile beneficiare sunt așteptate să utilizeze noua capacitate de calcul pentru o varietate de sarcini de lucru legate de pandemie, incluzând genomica, dezvoltarea de vaccinuri, știința transmiterii și modelarea.
Altceva ați dori să împărtășiți despre Penguin Computing?
Pentru mai mult de două decenii, Penguin Computing a livrat soluții personalizate, inovatoare și deschise lumii calculului cu performanță ridicată și tehnic. Soluțiile Penguin Computing oferă organizațiilor agilitatea și libertatea de a valorifica cele mai recente tehnologii în mediile lor de calcul. Organizațiile pot concentra resursele lor pe livrarea de produse și idei pe piață în timp record, în loc de a se concentra pe tehnologiile subiacente. Gama largă de soluții Penguin Computing pentru AI/ML/Analitică, HPC, DataOps și tehnologii cloud native poate fi personalizată și combinată pentru a se potrivi nevoilor actuale, dar și pentru a se adapta rapid la nevoile și schimbările tehnologice viitoare. Serviciile profesionale și gestionate de la Penguin Computing ajută la integrarea, implementarea și gestionarea soluțiilor. Serviciile de găzduire ale Penguin Computing pot ajuta la “unde” din mediul de calcul, oferind organizațiilor opțiuni de proprietate și flexibilitatea de a rula în loc, în cloud public sau dedicat, găzduit sau ca serviciu.
Mulțumim pentru acest interviu, cititorii care doresc să afle mai multe despre Penguin Computing ar trebui să viziteze Penguin Computing.












