Інтерв’ю
Кевін Таббс, PhD, СВП Стратегічних Рішень Групи в Penguin Computing – Серія Інтерв’ю

Кевін Таббс, PhD, є Старшим Віце-Президентом Стратегічних Рішень Групи в Penguin Computing. Penguin Computing створює індивідуальні, агностичні, комплексні рішення (апаратне забезпечення/програмне забезпечення/хмарні служби) для вирішення складних наукових, аналітичних та інженерних проблем, з якими стикаються компанії Fortune 500, стартапи, академічні установи та федеральні організації.
Що спочатку привернуло вас до галузі комп’ютерних наук?
Мої батьки купили мені комп’ютер, коли мені було дуже мало, і я завжди мав інтерес і талант до комп’ютерів та експериментів. Під час навчання я постійно схилявся до STEM-областей, що призвело мене до бажання займатися більш прикладною галуззю. Моя освіта – фізика та високопродуктивні обчислення (HPC). Моя любов до комп’ютерів з раннього віку дозволила мені тримати комп’ютерні науки на передньому плані будь-якого іншого наукового, математичного чи інженерного інтересу, який у мене був, що привело мене до того, де я зараз знаходжуся.
Penguin Computing працює у тісній співпраці з Open Compute Project (OCP) – що це саме?
Від початку руху Open Compute Project (OCP) Penguin Computing був одним із перших хто підтримав та зробив значний внесок у зусилля з привнесення переваг OCP до високопродуктивних обчислень (HPC) та штучного інтелекту (AI).
Фокус OCP полягає у об’єднанні глобальної спільноти розробників для створення повного екосистеми інфраструктурної технології, переосмисленої для більшої ефективності, гнучкості та масштабованості. Penguin Computing приєднався до OCP через відкриті технології та ідею спільноти. Що ми робили з часом, так це забезпечували те, що спадщина та технології традиційних HPC та нових тенденцій у AI та аналітиці можуть бути ефективно масштабовані – Penguin Computing рухає ці речі в OCP.
Однією з переваг OCP є те, що воно знижує загальні витрати на володіння (TCO) – нижчі капітальні витрати завдяки видаленню всіх елементів марності, та нижчі операційні витрати завдяки обслуговуванню з передньої частини, спільній потужності та іншим змінам дизайну – що робить технологію OCP ідеальною для масштабування.
Penguin Computing має кілька продуктів OCP, включаючи платформу Penguin Computing Tundra Extreme Scale та платформу Penguin Computing Tundra AP. Платформи Tundra також сумісні з HPC та AI-навантаженнями.
Tundra AP, останнє покоління нашої високої щільності платформи суперкомп’ютерів Tundra, поєднує потужність процесорів Intel (INTC ) ® Xeon® Scalable 9200 серії з сервером Relion XO1122eAP від Penguin Computing у форматі OCP, який забезпечує високу щільність ядер CPU на стійці.
Як щодо великих даних, щоб оптимізувати рівні продуктивності користувачам потрібно видалити вузькі місця, які сповільнюють їхній доступ до даних. Як підходить до цього проблеми Penguin Computing?
Penguin Computing використав свою здатність використовувати відкриті технології та швидко рухатися з поточними тенденціями – однією з яких є великі дані чи зростання даних та даних, керованих навантаженнями. У відповідь на це ми побудували нашу Стратегічну Рішення Групу для вирішення цієї проблеми безпосередньо.
При вирішенні цієї проблеми ми виявили, що більшість навантажень, навіть з традиційних технічних обчислень, мотивовані бути більш даних, керованими. Як результат, Penguin Computing проектує повні комплексні рішення, намагаючись зрозуміти навантаження користувача. Для створення оптимального рішення з урахуванням навантаження ми фокусуємося на програмному шарі, оптимізованому для навантаження, який включає оркестрацію та доставку навантаження. По суті, нам потрібно зрозуміти, як користувач буде використовувати інфраструктуру.
Далі ми намагаємося зосередитися на інфраструктурі обчислень, оптимізованій для навантаження. Є різні рівні даних та IO-викликів, які створюють великий тиск на частину обчислень. Наприклад, різні навантаження вимагають різних комбінацій прискорених обчислювальних інфраструктур від CPU, GPU, пропускної здатності пам’яті та мережі, яка дозволяє цим даним бути переданими та обчислюватися.
Нарешті, нам потрібно визначити, які рішення дозволять нам доставити ці дані. Ми розглядаємо інфраструктуру даних, оптимізовану для навантаження, щоб зрозуміти, як навантаження взаємодіє з даними, які є вимогами до місткості та шаблонами IO. Як тільки ми маємо цю інформацію, вона допомагає нам проектувати систему, оптимізовану для навантаження.
Як тільки ми маємо всю інформацію, ми використовуємо наш внутрішній досвід у Penguin Computing для архітектури дизайну та повного рішення. Знаючи, що воно спроектовано з точки зору продуктивності, нам потрібно зрозуміти, де воно розгортається (на місці, в хмарі, на краю, комбінація всіх тощо). Це підхід Penguin Computing до доставки оптимізованого рішення для даних, керованих навантаженнями.
Чи можете ви обговорити важливість використання GPU замість CPU для глибокого навчання?
Однією з найбільших тенденцій, яку я бачив щодо важливості GPU для глибокого навчання (DL), було переміщення від використання загальних GPU (GPGPU) як даних паралельних апаратних засобів, які дозволяють нам сильно прискорити кількість обчислювальних ядер, які можна доставити для вирішення паралельної обчислювальної проблеми. Це відбувається протягом останніх десяти років.
Я брав участь у ранніх стадіях програмування GPGPU, коли я був у аспірантурі та на початку своєї кар’єри. Я вважаю, що такий стрибок у щільності обчислень, де GPU забезпечує велику щільність обчислень та аналітичних ядер на пристрої, і дозволяє вам отримати більше в серверному просторі, і бути в змозі перепрофілювати щось, що спочатку було призначено для графіки, у комп’ютерний двигун, був справжнім відкриттям у сфері HPC та AI.
Однак, значна частина цієї роботи залежала від конвертації та оптимізації коду для виконання на GPU замість CPU. Коли ми робили всю цю роботу, ми чекали на концепцію вирішального застосунку – застосунку або випадку використання, який справді запускається або уможливлюється GPU. Для спільноти GPGPU глибоке навчання було тим вирішальним застосунком, який галванізував зусилля та розвиток у прискоренні HPC та AI-навантажень.
З часом відбулося відродження AI та машинного навчання (ML), і глибоке навчання стало актуальним. Ми зрозуміли, що навчання нейронної мережі за допомогою глибокого навчання фактично добре対応ало основній конструкції GPU. Я вважаю, що коли ці дві речі збіглися, у вас з’явилася можливість робити глибоке навчання, яке раніше було неможливим завдяки процесорам CPU, і в кінцевому підсумку обмежувало нашу здатність робити AI як у масштабі, так і на практиці.
Як тільки GPU зайняли своє місце, це фактично відновило дослідницьку та розробницьку спільноту навколо AI та глибокого навчання, оскільки у вас просто не було рівня обчислень для ефективного виконання, і це не було демократизовано. GPU дозволяє доставляти щільніше обчислення, яке за своєю суттю добре підходить для глибокого навчання, і привнесло це до рівня апаратних рішень, які зробили його легшим для більшої кількості дослідників та вчених. Я вважаю, що це одна з найбільших причин, чому GPU кращі для вивчення глибокого навчання.
Які існують GPU-прискорювані обчислювальні рішення, які пропонуються компанією Penguin Computing?
Penguin Computing зараз зосереджується на комплексних рішеннях, які розробляються нашою Стратегічною Рішення Групою, особливо з практикою AI та аналітики Penguin Computing. У цій практиці ми зосереджені на трьох високих підходах до GPU-прискорюваних рішень.
По-перше, ми пропонуємо архітектуру для аналітики на краю, де ми намагаємося проектувати рішення, які підходять для некласичних центрів даних (на краю або біля краю). Це можуть бути центри даних телекомунікацій, роздрібні приміщення, бензозаправні станції тощо. Це всі висновкові AI-рішення. Деякі рішення орієнтовані на відеоаналітику для контактної трасування та розпізнавання жестів для визначення того, чи миє людина руки чи носить маску. Це застосування комплексних рішень, які включають GPU-прискорювані апаратні засоби, які налаштовані для некласичних або країв розгортань, а також програмні стеки для того, щоб дозволити дослідникам та кінцевим користувачам використовувати їх ефективно.
Наступний клас рішень Penguin Computing побудований для центрів даних та основної архітектури навчання та висновку AI. Ви можете подумати про те, щоб сидіти всередині великомасштабного центру даних або в хмарі (хмара Penguin Computing), де деякі з наших клієнтів роблять великомасштабне навчання, використовуючи тисячі GPU для прискорення глибокого навчання. Ми розглядаємо, як ми доставляємо комплексні рішення та архітектури, які підтримують всі ці програмні навантаження та контейнеризацію через дизайн GPU та макет, весь шлях до вимог до інфраструктури даних, які підтримують це.
Третій клас архітектур у цій практиці є комбінацією двох попередніх. Що ми шукаємо в нашій третій архітектурній родині, так це як ми створюємо тканини даних та шляхи та робочі процеси для того, щоб дозволити безперервне навчання, так що ви можете запускати висновок, використовуючи наші GPU-прискорювані рішення на краю, 推ити ці дані до приватної або публічної хмари, продовжувати навчання на них, і як тільки оновлюються нові навчальні моделі,推ити їх назад до висновку. Таким чином ми маємо ітеративний цикл безперервного навчання та моделей AI.
Penguin Computing нещодавно розгорнув новий суперкомп’ютер для LLNL у партнерстві з Intel та CoolIT. Чи можете ви розповісти нам про цей суперкомп’ютер і для чого він був спроектований?
Суперкомп’ютер Magma, розгорнутий в LLNL, був придбаний через контракт Commodity Technology Systems (CTS-1) з Національним управлінням ядерної безпеки (NNSA) і є одним з перших розгортань процесорів Intel Xeon Platinum 9200 серії з підтримкою системи прямого液кольного охолодження CoolIT Systems та інтерконекту Omni-Path.
Фінансований через програму NNSA Advanced Simulation & Computing (ASC), Magma буде підтримувати програму NNSA Life Extension та зусилля, критичні для забезпечення безпеки, безпеки та надійності ядерної зброї країни в умовах відсутності підземних випробувань.
Суперкомп’ютер Magma є системою HPC, яка посилена штучним інтелектом і є злитою платформою, яка дозволяє AI прискорювати HPC-моделювання. Magma був включений до списку Top500 у червні 2020 року, зайнявши 80-е місце.
Під контрактом CTS-1 Penguin Computing доставив понад 22 петафлопс обчислювальної потужності для підтримки програми ASC в лабораторіях NNSA Tri-Labs у Lawrence Livermore, Los Alamos та Sandia Національних лабораторіях.
Які різні способи, якими Penguin Computing підтримує боротьбу з COVID-19?
У червні 2020 року Penguin Computing офіційно співпрацював з AMD, щоб доставити можливості HPC дослідникам у трьох провідних університетах США – Нью-Йоркському університеті (NYU), Масачусетському технологічному інституті (MIT) та Райсівському університеті – для боротьби з COVID-19.
Penguin Computing співпрацював безпосередньо з фондом AMD COVID-19 HPC, щоб доставити дослідницьким інститутам значні обчислювальні ресурси для прискорення медичних досліджень щодо COVID-19 та інших захворювань. Penguin Computing та AMD співпрацюють для доставки сузір’я локальних та хмарних рішень HPC університетам NYU, MIT та Райсу, щоб допомогти підвищити дослідницькі можливості сотень вчених, які в кінцевому підсумку внесуть свій внесок у краще розуміння нового коронавірусу.
Системи, пожертвувані університетом, кожна з яких оснащена процесорами 2-го покоління AMD EPYC та прискорювачами GPU Radeon Instinct MI50, повинні доставити понад один петафлоп обчислювальної продуктивності. Додаткові чотири петафлопси обчислювальної потужності будуть доступні дослідникам через нашу хмарну службу HPC, Penguin Computing On-Demand (POD). Комбіновані системи доставлять дослідникам понад сім петафлопс GPU-прискорюваної обчислювальної потужності, яку можна застосувати для боротьби з COVID-19.
Університети-отримувачі повинні використовувати нову обчислювальну потужність для різних навантажень, пов’язаних з пандемією, включаючи геноміку, розробку вакцин, науку про передачу та моделювання.
Чи є ще щось, що ви хотіли б поділитися про Penguin Computing?
Більше двох десятиліть Penguin Computing доставляє індивідуальні, інноваційні та відкриті рішення світу високопродуктивних та технічних обчислень. Рішення Penguin Computing надають організаціям гнучкість та свободу, яких їм потрібно для використання останніх технологій у своїх обчислювальних середовищах. Організації можуть зосередити свої ресурси на доставці продуктів та ідей на ринок за рекордний час, а не на основі технологій. Широкий спектр рішень Penguin Computing для AI/ML/Аналітики, HPC, DataOps та хмарних технологій можна налаштувати та комбінувати, щоб не тільки задовольнити поточні потреби, а й швидко адаптуватися до майбутніх потреб та змін технологій. Професійні та керовані послуги Penguin Computing допомагають з інтеграцією, впровадженням та управлінням рішеннями. Послуги хостингу Penguin Computing можуть допомогти з “де” обчислювального середовища, надаючи організаціям варіанти власності та гнучкість для запуску на місці, в публічній або приватній хмарі, хостингу або як сервісу.
Дякую за велике інтерв’ю, читачам, які бажають дізнатися більше, слід відвідати Penguin Computing.












