Wywiady
Kevin Tubbs, PhD, Wiceprezes Strategic Solutions Group w firmie Penguin Computing – Seria wywiadów

Kevin Tubbs, PhD, jest Wiceprezesem Strategic Solutions Group w firmie Penguin Computing. Penguin Computing projektuje i dostarcza rozwiązania agnostyczne, kompleksowe (sprzęt/oprogramowanie/chmura/usługi), aby rozwiązać złożone problemy naukowe, analityczne i inżynierskie, z którymi mierzą się dzisiejsze firmy z listy Fortune 500, startupy, instytucje akademickie i organizacje rządowe.
Czym było to, co początkowo przyciągnęło Cię do dziedziny informatyki?
Moi rodzice kupili mi komputer, gdy byłem bardzo młody, i zawsze miałem zainteresowanie i talent do komputerów i majsterkowania. Przez moją edukację stale zmierzałem w kierunku dziedzin STEM i to doprowadziło mnie do chęci zaangażowania się w dziedzinę bardziej aplikacyjną. Moje tło to fizyka i obliczenia wysokowydajne (HPC). Posiadanie miłości do komputerów od wczesnego okresu pozwoliło mi utrzymać informatykę na czele innych zainteresowań naukowych, matematycznych lub inżynierskich, co doprowadziło mnie do miejsca, w którym jestem dzisiaj.
Penguin Computing współpracuje ściśle z Open Compute Project (OCP) – co to dokładnie?
Od początku ruchu Open Compute Project (OCP), Penguin Computing był wczesnym adoptorem, zwolennikiem i głównym współpracownikiem w wysiłkach, aby przynieść korzyści OCP do obliczeń wysokowydajnych (HPC) i sztucznej inteligencji (AI).
Celem OCP jest zjednoczenie globalnej społeczności deweloperów w celu stworzenia pełnego ekosystemu technologii infrastrukturalnej, przemyślanego, aby być bardziej wydajnym, elastycznym i skalowalnym. Penguin Computing dołączył do OCP ze względu na otwarte technologie i ideę społeczności. To, co zrobiliśmy przez czas, to upewnienie, że dziedzictwo i technologie z tradycyjnych HPC i pojawiających się trendów w AI i analityce mogą skalować wydajnie – Penguin Computing napędza te rzeczy do OCP.
Jednym z korzyści OCP jest to, że obniża całkowity koszt posiadania (TCO) – niższe wydatki kapitałowe, dzięki usunięciu wszystkich elementów wanitywnych, i niższe wydatki operacyjne dzięki obsłudze z przodu, współdzielonej mocy i innych zmian projektowych – co sprawia, że technologia oparta na OCP jest idealna do skalowania.
Penguin Computing ma kilka produktów OCP, w tym platformę Penguin Computing Tundra Extreme Scale i platformę Penguin Computing Tundra AP. Platformy Tundra są również kompatybilne z obciążeniami HPC i AI.
Platforma Tundra AP, najnowsza generacja naszej bardzo gęstej platformy superkomputerowej Tundra, łączy moc obliczeniową procesorów Intel (INTC ) ® Xeon® Scalable 9200 series z serwerem Relion XO1122eAP firmy Penguin Computing w formacie OCP, który dostarcza wysoką gęstość rdzeni CPU na stojak.
Gdy chodzi o duże dane, aby zoptymalizować poziomy wydajności, użytkownicy muszą usunąć wąskie gardła, które spowalniają ich dostęp do danych. Jak Penguin Computing podchodzi do tego problemu?
Penguin Computing wykorzystał swoją zdolność do korzystania z otwartych technologii i szybkiego podążania za bieżącymi trendami – jednym z nich jest duże dane lub wzrost danych i obciążeń opartych na danych. W odpowiedzi na to, zbudowaliśmy naszą Strategic Solutions Group, aby rozwiązać ten problem bezpośrednio.
Przy rozwiązywaniu problemu, stwierdziliśmy, że większość obciążeń, nawet z tradycyjnych obliczeń technicznych, jest zmotywowana do tego, aby być bardziej ukierunkowana na dane. W związku z tym, Penguin Computing projektuje kompletne, końcowe rozwiązania, starając się zrozumieć obciążenie użytkownika. Aby stworzyć zoptymalizowane, końcowe rozwiązanie, koncentrujemy się na warstwie oprogramowania zoptymalizowanej pod kątem obciążenia, która obejmuje orchestrację i dostarczanie obciążeń. Podstawowo, musimy zrozumieć, w jaki sposób użytkownik będzie korzystał z infrastruktury.
Następnie, starujemy się skoncentrować na zoptymalizowanej infrastrukturze obliczeniowej. Istnieją różne poziomy danych i wyzwań wejścia/wyjścia, które nakładają dużą presję na część obliczeniową. Na przykład, różne obciążenia wymagają różnych kombinacji przyspieszonej infrastruktury obliczeniowej od CPU, GPU, przepustowości pamięci i sieci, co pozwala na przepływ danych i ich obliczanie.
W końcu, musimy ustalić, jakie rozwiązania pozwolą nam dostarczyć te dane. Badamy zoptymalizowaną infrastrukturę danych, aby zrozumieć, w jaki sposób obciążenie wchodzi w interakcję z danymi, jakie są wymagania dotyczące pojemności i wzorce wejścia/wyjścia. Gdy tylko uzyskamy te informacje, pomaga nam to w zaprojektowaniu zoptymalizowanego systemu.
Gdy już będziemy mieli wszystkie informacje, wykorzystujemy naszą wewnętrzną ekspertyzę w Penguin Computing, aby zaprojektować i stworzyć kompletne rozwiązanie. Wiedząc, że jest ono zaprojektowane z perspektywy wydajności, musimy zrozumieć, gdzie jest wdrożone (lokalnie, w chmurze, na krawędzi, połączenie wszystkich, itp.). To jest podejście Penguin Computing do dostarczania zoptymalizowanego rozwiązania dla obciążeń opartych na danych.
Czy mógłbyś omówić znaczenie korzystania z GPU zamiast CPU w przypadku głębokiego uczenia?
Jednym z największych trendów, których byłem świadkiem w odniesieniu do znaczenia GPU dla głębokiego uczenia, było przeniesienie z korzystania z ogólnych GPU (GPGPU) jako części sprzętu umożliwiającej równoległe przetwarzanie, co pozwoliło nam znacznie przyspieszyć ilość rdzeni obliczeniowych, które można dostarczyć do rozwiązania problemu obliczeniowego. To trwało przez ostatnie dziesięć lat.
Brałem udział w wczesnych etapach programowania GPGPU, gdy byłem na studiach i na początku swojej kariery. Uważam, że posiadanie skoku w gęstości obliczeniowej, gdzie GPU dostarcza dużą gęstość obliczeniową i analityczną na urządzeniu, i pozwala na umieszczenie większej ilości w przestrzeni serwerowej, a także możliwość ponownego wykorzystania czegoś, co pierwotnie było przeznaczone do grafiki, jako silnika obliczeniowego, było prawdziwym otwarciem trendu w społeczności HPC i AI.
Jednak wiele z tego polegało na konwersji i optymalizacji kodu, aby mógł działać na GPU zamiast CPU. Podczas wykonywania tej pracy, czekaliśmy na pojęcie aplikacji zabójcy – aplikacji lub przypadku użycia, który naprawdę się rozpocznie lub zostanie włączony przez GPU. Dla społeczności GPGPU, głębokie uczenie było tym przypadkiem użycia, który zjednoczył wysiłki i rozwój w przyspieszaniu obciążeń HPC i AI.
W miarę upływu czasu, nastąpił odrodzenie AI i uczenia maszynowego, a głębokie uczenie się pojawiło. Zrozumieliśmy, że szkolenie sieci neuronowej przy użyciu głębokiego uczenia się naprawdę dobrze odpowiada podstawowemu projektowi GPU. Uważam, że gdy te dwie rzeczy zbiegły się, mieliśmy możliwość wykonywania rodzajów głębokiego uczenia, które wcześniej nie było możliwe dzięki procesorom CPU i ostatecznie ograniczało naszą zdolność do wykonywania AI w skali i w praktyce.
Gdy tylko GPU pojawiły się, to naprawdę zainspirowały społeczność badawczo-rozwojową wokół AI i głębokiego uczenia, ponieważ po prostu nie mieliśmy poziomu obliczeniowego, aby to zrobić wydajnie, i nie było to udostępnione. GPU naprawdę pozwalają na dostarczanie gęstego obliczeniowego, który jest dobrze zaprojektowany dla głębokiego uczenia i przyniósł to do poziomu rozwiązań architektury sprzętu, które ułatwiły dostęp do większej liczby badaczy i naukowców. Uważam, że to jeden z głównych powodów, dla których GPU są lepsze do badania głębokiego uczenia.
Jakie są niektóre z rozwiązań obliczeniowych przyspieszonych przez GPU, oferowanych przez Penguin Computing?
Penguin Computing jest obecnie skupiony na końcowych rozwiązaniach, nad którymi pracuje nasza Strategic Solutions Group, szczególnie z praktyką AI i analityki Penguin Computing. W ramach tej praktyki koncentrujemy się na trzech głównych podejściach do rozwiązań przyspieszonych przez GPU.
Po pierwsze, oferujemy architekturę referencyjną dla analityki krawędzi, gdzie projektujemy rozwiązania, które pasują do niekonwencjonalnych centrów danych (na krawędzi lub w pobliżu krawędzi). Może to obejmować centra danych Teleco Edge, obiekty handlowe, stacje benzynowe i wiele innych. Są to wszystkie rozwiązania oparte na inferencji AI. Niektóre rozwiązania są ukierunkowane na analitykę wideo dla śledzenia kontaktów i rozpoznawania gestów w celu ustalenia, czy ktoś myje ręce lub nosi maskę. Są to aplikacje kompletnych rozwiązań, które obejmują sprzęt przyspieszony przez GPU, dostrojony do wdrożeń na krawędzi, a także stosy oprogramowania, które umożliwiają badaczom i użytkownikom końcowym skuteczne korzystanie z nich.
Kolejna klasa rozwiązań Penguin Computing jest budowana dla centrów danych i rdzenia szkolenia AI oraz architektur referencyjnych do wnioskowania. Można by pomyśleć o tym, że siedzi się wewnątrz dużego centrum danych lub w chmurze (chmura Penguin Computing), gdzie niektórzy z naszych klientów wykonują duże szkolenia, wykorzystując tysiące GPU do przyspieszenia głębokiego uczenia. Spójrzmy, jak dostarczamy kompletne rozwiązania i architektury referencyjne, które obsługują wszystkie te obciążenia oprogramowania i konteneryzację za pomocą projektu GPU i układu, aż do wymagań infrastruktury danych, które ją obsługują.
Trzecia klasa architektur referencyjnych w tej praktyce jest połączeniem dwóch poprzednich. To, czego szukamy w naszej trzeciej rodzinie architektur referencyjnych, to jak stworzyć tkaniny danych i ścieżki oraz przepływy pracy, aby umożliwić ciągłe uczenie, tak aby można było uruchamiać inferencję przy użyciu naszych rozwiązań przyspieszonych przez GPU na krawędzi, przesunąć te dane do chmury prywatnej lub publicznej, kontynuować szkolenie, a gdy nowe modele szkoleniowe są aktualizowane, przesunąć je z powrotem do inferencji. W ten sposób mamy iteracyjny cykl ciągłego uczenia i modeli AI.
Penguin Computing niedawno wdrożył nowy superkomputer dla LLNL we współpracy z Intel i CoolIT. Czy mógłbyś opowiedzieć nam o tym superkomputerze i czym był on zaprojektowany?
Superkomputer Magma, wdrożony w LLNL, został zakupiony za pomocą kontraktu Commodity Technology Systems (CTS-1) z National Nuclear Security Administration (NNSA) i jest jednym z pierwszych wdrożeń procesorów Intel Xeon Platinum 9200 series z obsługą CoolIT Systems complete direct liquid cooling i Omni-Path interconnect.
Sfinansowany przez program Advanced Simulation & Computing (ASC) NNSA, Magma będzie wspierał program Life Extension Program i wysiłki krytyczne dla zapewnienia bezpieczeństwa, bezpieczeństwa i niezawodności amerykańskich broni jądrowych w przypadku braku testów podziemnych.
Superkomputer Magma jest systemem HPC, który jest wspomagany przez sztuczną inteligencję i jest zintegrowaną platformą, która umożliwia przyspieszenie modelowania HPC przez AI. Magma został sklasyfikowany na liście Top500 w czerwcu 2020 roku, zajmując 80. miejsce.
W ramach kontraktu CTS-1, Penguin Computing dostarczył ponad 22 petaflops możliwości obliczeniowych, aby wesprzeć program ASC w laboratoriach Tri-Labs of Lawrence Livermore, Los Alamos i Sandia National Laboratories.
Jakie są niektóre z różnych sposobów, w jakie Penguin Computing wspiera walkę z COVID-19?
We wrześniu 2020 roku, Penguin Computing oficjalnie współpracował z AMD, aby dostarczyć możliwości HPC badaczom w trzech najlepszych uniwersytetach w USA – New York University (NYU), Massachusetts Institute of Technology (MIT) i Rice University – aby pomóc w walce z COVID-19.
Penguin Computing współpracował bezpośrednio z funduszem AMD COVID-19 HPC, aby dostarczyć instytucjom badawczym znaczne zasoby obliczeniowe, aby przyspieszyć badania medyczne na temat COVID-19 i innych chorób. Penguin Computing i AMD współpracują, aby dostarczyć zestaw rozwiązań HPC opartych na miejscu i w chmurze, aby pomóc w podniesieniu możliwości badawczych setek naukowców, którzy w końcu będą przyczyniać się do lepszego zrozumienia koronawirusa.
Urządzenia te, wyposażone w najnowsze procesory 2. generacji AMD EPYC i przyspieszacze GPU Radeon Instinct MI50, każde są zaprojektowane do dostarczania ponad jednego petaflopsa wydajności obliczeniowej. Dodatkowe cztery petaflopsy pojemności obliczeniowej będą dostępne dla badaczy za pomocą naszej usługi chmury HPC, Penguin Computing On-Demand (POD). W połączeniu, systemy darowane badaczom zapewnią im ponad siedem petaflopsów mocy obliczeniowej przyspieszanej przez GPU, które mogą być stosowane do walki z COVID-19.
Uniwersytety, które otrzymały te systemy, będą wykorzystywać nową pojemność obliczeniową w różnych przypadkach użycia związanych z pandemią, w tym genomika, rozwój szczepionek, nauka o transmisji i modelowanie.
Czy jest coś jeszcze, co chciałbyś podzielić się na temat Penguin Computing?
Przez ponad dwie dekady, Penguin Computing dostarczał rozwiązania niestandardowe, innowacyjne i otwarte dla świata obliczeń wysokowydajnych i technicznych. Rozwiązania Penguin Computing dają organizacjom elastyczność i wolność, której potrzebują, aby wykorzystywać najnowsze technologie w swoich środowiskach obliczeniowych. Organizacje mogą skoncentrować swoje zasoby na dostarczaniu produktów i pomysłów na rynek w rekordowym czasie, zamiast koncentrować się na podstawowych technologiach. Rozległy zakres rozwiązań Penguin Computing dla AI/ML/Analityki, HPC, DataOps i technologii natywnych dla chmury może być dostosowany i połączony, aby nie tylko spełniać bieżące potrzeby, ale także szybko adaptować się do przyszłych potrzeb i zmian technologicznych. Usługi profesjonalne i zarządzane Penguin Computing pomagają w integrowaniu, wdrażaniu i zarządzaniu rozwiązaniami. Usługi hostingowe Penguin Computing mogą pomóc w „gdzie” środowiska obliczeniowego, dając organizacjom opcje własności i elastyczność, aby działać lokalnie, w chmurze publicznej lub dedykowanej, hostowanej lub jako usługę.
Dziękujemy za wspaniały wywiad, czytelnicy, którzy chcą dowiedzieć się więcej, powinni odwiedzić Penguin Computing.












