Интервью
Кевин Таббс, PhD, старший вице-президент по стратегическим решениям в Penguin Computing – Серия интервью

Кевин Таббс, PhD, является старшим вице-президентом по стратегическим решениям в Penguin Computing. Penguin Computing проектирует индивидуальные, агностические решения от конца до конца (аппаратное/программное/облачное/услуги), чтобы решить сложные научные, аналитические и инженерные проблемы, с которыми сталкиваются сегодня компании из списка Fortune 500, стартапы, академические учреждения и федеральные организации.
Что изначально привлекло вас к области информатики?
Мои мама и папа купили мне компьютер, когда мне было очень мало, и у меня всегда был интерес и талант к компьютерам и экспериментам. Через моё образование я постоянно тяготел к STEM-областям и это привело меня к желанию участвовать в более прикладной области. Моя специальность – физика и высокопроизводительные вычисления (HPC). Имея любовь к компьютерам с раннего возраста, я смог сохранить информатику на переднем плане любого другого научного, математического или инженерного интереса, который у меня был, что привело меня к тому, где я нахожусь сегодня.
Penguin Computing тесно сотрудничает с проектом Open Compute (OCP) – что это именно?
С момента начала движения Open Compute Project (OCP), Penguin Computing стал одним из первых сторонников, поддерживающих и крупных участников усилий по привнесению преимуществ OCP в высокопроизводительные вычисления (HPC) и искусственный интеллект (AI).
Фокус OCP заключается в объединении глобального сообщества разработчиков для создания полной экосистемы технологий инфраструктуры, переосмысленной для большей эффективности, гибкости и масштабируемости. Penguin Computing присоединился к OCP из-за открытых технологий и идеи сообщества. То, что мы сделали за это время, – это обеспечение того, что наследие и технологии из традиционного HPC и новых тенденций в AI и аналитике могут масштабироваться эффективно – Penguin Computing стимулирует эти вещи в OCP.
Одним из преимуществ OCP является то, что оно снижает общую стоимость владения (TCO) – более низкие капитальные расходы благодаря удалению всех элементов ванильности, и более низкие эксплуатационные расходы благодаря обслуживанию с передней части, общей мощности и другим изменениям конструкции – что делает технологию на основе OCP идеальной для масштабирования.
Penguin Computing имеет несколько продуктов OCP, включая платформу Penguin Computing Tundra Extreme Scale и Penguin Computing Tundra AP. Платформы Tundra также совместимы с рабочими нагрузками HPC и AI.
Tundra AP, последнее поколение нашей высокоплотной платформы суперкомпьютеров Tundra, сочетает вычислительную мощность процессоров Intel (INTC ) Xeon Scalable 9200 серии с сервером Relion XO1122eAP от Penguin Computing в форм-факторе OCP, который обеспечивает высокую плотность ядер CPU на стойку.
Когда речь идет о больших данных, чтобы оптимизировать уровни производительности, пользователям необходимо удалить узкие места, которые замедляют доступ к данным. Как Penguin Computing подходит к этой проблеме?
Penguin Computing использовал нашу способность использовать открытые технологии и быстро двигаться в соответствии с текущими тенденциями – одной из которых является большие данные или рост данных и данных, управляемых рабочими нагрузками. В ответ на это мы построили нашу стратегическую группу решений, чтобы решить эту проблему напрямую.
При решении проблемы мы обнаружили, что большинство рабочих нагрузок, даже из традиционных технических вычислений, мотивированы быть более данными. В результате Penguin Computing проектирует полные решения от конца до конца, пытаясь понять рабочую нагрузку пользователя. Чтобы создать решение, оптимизированное для рабочей нагрузки, мы фокусируемся на слое программного обеспечения, оптимизированном для рабочей нагрузки, который включает оркестровку и доставку рабочей нагрузки. По сути, нам нужно понять, как пользователь будет использовать инфраструктуру.
Далее мы пытаемся сосредоточиться на инфраструктуре вычислений, оптимизированной для рабочей нагрузки. Существуют различные уровни данных и проблем IO, которые оказывают большое давление на часть вычислений. Например, разные рабочие нагрузки требуют разных комбинаций ускоренной инфраструктуры вычислений от CPU, GPU, пропускной способности памяти и сетей, которые позволяют этим данным быть переданными и вычисленными.
Наконец, нам нужно выяснить, какие решения позволят нам доставить эти данные. Мы анализируем инфраструктуру данных, оптимизированную для рабочей нагрузки, чтобы понять, как рабочая нагрузка взаимодействует с данными, какие требования к емкости и шаблоны IO. Как только мы получаем эту информацию, она помогает нам спроектировать систему, оптимизированную для рабочей нагрузки.
Как только мы получаем всю информацию, мы используем наш внутренний опыт в Penguin Computing, чтобы спроектировать и создать полное решение. Зная, что оно спроектировано с точки зрения производительности, нам нужно понять, где оно развернуто (в помещении, в облаке, на краю, в комбинации всех и т. д.). Это подход Penguin Computing к доставке оптимизированного решения для данных, управляемых рабочими нагрузками.
Можете ли вы обсудить важность использования GPU вместо CPU для глубокого обучения?
Одним из самых больших тенденций, которые я видел в отношении важности GPU для глубокого обучения (DL), было движение от использования общих GPU (GPGPU) как параллельного фрагмента аппаратного обеспечения, которое позволяло нам сильно ускорить количество ядер вычислений, которые можно доставить для решения параллельной вычислительной проблемы. Это происходит в течение последних десяти лет.
Я участвовал в ранних стадиях программирования GPGPU, когда я был в аспирантуре и ранее в своей карьере. Я считаю, что наличие этого скачка в плотности вычислений, где GPU обеспечивает много плотных вычислений и аналитических ядер на устройстве, и позволяет вам получить больше в серверном пространстве, и возможность перепрофилировать что-то, что изначально было предназначено для графики в вычислительный двигатель, было真正щим откровением в HPC и, в конечном итоге, в сообществах AI.
Однако многое из этого зависело от конвертации и оптимизации кода для запуска на GPU вместо CPU. Когда мы сделали всю эту работу, мы ждали концепции убийственного приложения – приложения или случая использования, который действительно взлетает или становится возможным благодаря GPU. Для сообщества GPGPU DL было тем убийственным приложением, которое галvanized усилия и разработку в ускорении рабочих нагрузок HPC и AI.
Со временем произошло возрождение AI и машинного обучения (ML), и DL вошло в игру. Мы осознали, что обучение нейронной сети с помощью DL фактически очень хорошо соответствовало основной конструкции GPU. Я считаю, что как только эти две вещи сойдутся, у вас появляется возможность делать те виды DL, которые ранее были невозможны благодаря процессорам CPU и в конечном итоге ограничивали нашу способность делать AI как в масштабе, так и на практике.
Как только GPU появились, они фактически возродили исследовательское и разработочное сообщество вокруг AI и DL, потому что вы просто не имели уровня вычислений, чтобы сделать это эффективно, и это не было демократизировано. GPU действительно позволяет вам доставить более плотные вычисления, которые по своей сути хорошо спроектированы для DL и привели это к уровню аппаратных решений, которые сделали его проще для получения исследователями и учеными. Я считаю, что это одна из главных причин, почему GPU лучше для изучения DL.
Какие GPU-ускоренные вычислительные решения предлагает Penguin Computing?
Penguin Computing в настоящее время фокусируется на решениях от конца до конца, которые разрабатываются нашей стратегической группой решений, особенно с практикой AI и аналитики Penguin Computing. В рамках этой практики мы фокусируемся на трех высокоуровневых подходах к GPU-ускоренным решениям.
Первым является эталонная архитектура для аналитики на краю, где мы пытаемся спроектировать решения, которые подходят для нетрадиционных центров данных (на краю или gần краем). Это может включать телекоммуникационные центры данных на краю, розничные объекты, бензоколонки и многое другое. Эти решения основаны на выводе AI. Некоторые решения предназначены для видеоаналитики для отслеживания контактов и распознавания жестов, чтобы определить, моет ли кто-то руки или носит ли маску. Это применения полных решений, которые включают GPU-ускоренное аппаратное обеспечение, которое настроено для нетрадиционных или краевых развертываний, а также программные стеки, которые позволяют исследователям и конечным пользователям использовать их эффективно.
Следующий класс решений Penguin Computing предназначен для центра данных и основной архитектуры обучения и вывода AI. Вы можете подумать о том, чтобы сидеть внутри большого центра данных или в облаке (облачном сервисе Penguin Computing), где некоторые из наших клиентов выполняют крупномасштабное обучение, используя тысячи GPU для ускорения DL. Мы анализируем, как мы доставляем полные решения и эталонные архитектуры, которые поддерживают все эти программные рабочие нагрузки и контейнеризацию через проектирование GPU и планировку, все до требований к инфраструктуре данных, которые поддерживают это.
Третий класс эталонных архитектур в этой практике представляет собой комбинацию двух предыдущих. То, что мы ищем в нашей третьей семье эталонных архитектур, – это как мы создаем ткани и пути данных и рабочие процессы, чтобы включить непрерывное обучение, так что вы можете запускать вывод, используя наши решения GPU-ускоренного края, передавать эти данные в частное или публичное облако, продолжать обучение на них, и как только новые модели обучения обновляются, передавать их обратно на вывод. Таким образом, у нас есть итеративный цикл непрерывного обучения и моделей AI.
Penguin Computing недавно развернул новый суперкомпьютер для LLNL в партнерстве с Intel и CoolIT. Можете ли вы рассказать нам об этом суперкомпьютере и для чего он был спроектирован?
Суперкомпьютер Magma, развернутый в LLNL, был получен через контракт Commodity Technology Systems (CTS-1) с Национальным управлением ядерной безопасности (NNSA) и является одним из первых развертываний процессоров Intel Xeon Platinum 9200 серии с поддержкой системы полного жидкостного охлаждения CoolIT и интерконнекта Omni-Path.
Финансируемый через программу NNSA Advanced Simulation & Computing (ASC), Magma будет поддерживать программу NNSA Life Extension и усилия, критически важные для обеспечения безопасности, безопасности и надежности ядерного оружия страны в отсутствие подземных испытаний.
Суперкомпьютер Magma – это система HPC, которая усиливается искусственным интеллектом и является слиянием платформы, которая позволяет AI ускорять моделирование HPC. Magma был включен в список Top500 в июне 2020 года, войдя в число ста лучших, заняв 80-е место.
По контракту CTS-1 Penguin Computing доставил более 22 петафлопс вычислительной мощности для поддержки программы ASC в лабораториях NNSA Tri-Labs в Лоуренс-Ливерморе, Лос-Аламосе и Сандии.
Какими способами Penguin Computing поддерживает борьбу с COVID-19?
В июне 2020 года Penguin Computing официально сотрудничал с AMD, чтобы доставить возможности HPC исследователям в трех лучших университетах США – Нью-Йоркском университете (NYU), Массачусетском технологическом институте (MIT) и Университете Райса – чтобы помочь в борьбе с COVID-19.
Penguin Computing сотрудничал напрямую с фондом HPC AMD для COVID-19, чтобы предоставить исследовательским учреждениям значительные вычислительные ресурсы для ускорения медицинских исследований по COVID-19 и другим заболеваниям. Penguin Computing и AMD сотрудничают, чтобы доставить созвездие решений HPC на месте и в облаке исследовательским учреждениям в NYU, MIT и Университете Райса, чтобы помочь повысить исследовательские возможности сотен ученых, которые в конечном итоге внесут свой вклад в более глубокое понимание нового коронавируса.
Решения, предоставленные университетам, включают процессоры 2-го поколения AMD EPYC и ускорители GPU Radeon Instinct MI50, которые, как ожидается, обеспечат более одного петафлопса производительности вычислений. Дополнительные четыре петафлопса вычислительной мощности будут доступны исследователям через наш облачный сервис HPC, Penguin Computing On-Demand (POD). В совокупности пожертвованные системы обеспечат исследователям более семи петафлопс GPU-ускоренной вычислительной мощности, которая может быть применена для борьбы с COVID-19.
Университеты-реципиенты, как ожидается, будут использовать новую вычислительную мощность на различных pandemic-реляционных рабочих нагрузках, включая геномику, разработку вакцин, науку о передаче и моделирование.
Есть ли что-то еще, что вы хотели бы поделиться о Penguin Computing?
Более двух десятилетий Penguin Computing доставляет индивидуальные, инновационные и открытые решения миру высокопроизводительных и технических вычислений. Решения Penguin Computing предоставляют организациям гибкость и свободу, которые им необходимы для использования последних технологий в своих вычислительных средах. Организации могут сосредоточить свои ресурсы на доставке продуктов и идей на рынок в рекордные сроки, вместо того, чтобы заниматься основными технологиями. Широкий спектр решений Penguin Computing для AI/ML/Analytics, HPC, DataOps и облачных технологий может быть настроен и объединен, чтобы соответствовать не только текущим потребностям, но и быстро адаптироваться к будущим потребностям и изменениям технологий. Профессиональные и управляемые услуги Penguin Computing помогают с интеграцией, реализацией и управлением решениями. Услуги хостинга Penguin Computing могут помочь с “где” вычислительной среды, предоставляя организациям варианты собственности и гибкость для запуска на месте, в публичном или выделенном облаке, хостинге или в качестве сервиса.
Спасибо за отличное интервью, читателям, которые хотят узнать больше, следует посетить Penguin Computing.












