インタビュー
ケビン・タブス、Ph.D.、ペンギン・コンピューティングの戦略ソリューション グループのシニア・バイス・プレジデント – インタビュー・シリーズ

ケビン・タブス、Ph.D.は、ペンギン・コンピューティングの戦略ソリューション グループのシニア・バイス・プレジデントです。ペンギン・コンピューティングは、フォーチュン 500 社、スタートアップ、学術機関、連邦機関が直面している複雑な科学的、分析的、エンジニアリングの問題を解決するための、ハードウェア、ソフトウェア、クラウド、サービスを含む、エンドツーエンドのソリューションをカスタム設計しています。
コンピューター科学の分野に最初に惹かれたのは何ですか?
私の母と父は、私が非常に若い時にコンピューターを買ってくれました。私は常にコンピューターと工作に対する興味と才能を持っていました。教育を通じて、私は一貫して STEM フィールドに惹かれ、より応用的な分野に関わるようになりました。私の背景は物理学と高性能コンピューティング (HPC) です。コンピューターに対する早期の愛は、私が他の科学、数学、エンジニアリングの関心よりもコンピューター科学を優先することを可能にしました。これが私を現在の立場に導いてくれました。
ペンギン・コンピューティングは Open Compute Project (OCP) と密接に協力しています。OCP とは何ですか?
Open Compute Project (OCP) の開始以来、ペンギン・コンピューティングは OCP の早期採用者、サポーター、主要貢献者として、高性能コンピューティング (HPC) と人工知能 (AI) に OCP の利点をもたらす取り組みに参加しています。
OCP の焦点は、インフラストラクチャ技術の完全なエコシステムを作成するために、開発者を世界中から集めることです。このエコシステムは、効率、柔軟性、スケーラビリティを高めるために再設計されています。ペンギン・コンピューティングは、OCP に参加しました。なぜなら、OCP にはオープン技術とコミュニティのアイデアがあるからです。私たちが時間の経過とともに行ったことは、伝統的な HPC と AI、分析の新しいトレンドが効率的にスケールできるようにすることです。ペンギン・コンピューティングは、これらの要素を OCP に導入しています。
OCP の利点の 1 つは、所有コスト (TCO) を低減することです。資本支出の削減は、すべての贅沢な要素を削除することで実現し、運用コストの削減は、フロントからのサービス、共有電力、その他の設計変更により実現します。これにより、OCP ベースのテクノロジーはスケールアウトに最適化されます。
ペンギン・コンピューティングには、ペンギン・コンピューティング・タンドラ・エクストリーム・スケール・プラットフォームやペンギン・コンピューティング・タンドラ AP などの OCP 製品があります。タンドラ プラットフォームは、HPC と AI ワークロードにも互換性があります。
タンドラ AP は、私たちの高密度タンドラ・スーパーコンピューティング・プラットフォームの最新世代で、Intel (INTC ) Xeon Scalable 9200 シリーズ プロセッサとペンギン・コンピューティングの Relion XO1122eAP サーバー を組み合わせて、OCP フォーム ファクタで CPU コアの高密度を提供します。
ビッグデータの場合、パフォーマンス レベルを最適化するために、ユーザーはデータへのアクセスを遅くするボトルネックを除去する必要があります。ペンギン・コンピューティングはこの問題にどのように取り組んでいますか?
ペンギン・コンピューティングは、オープン技術を活用し、現在のトレンドに迅速に対応する能力を活用して、ビッグデータまたはデータ駆動型ワークロードの成長に対応しています。対策として、私たちはビッグデータの問題に対処するために戦略ソリューション グループを構築しました。
問題に対処する際に、私たちは、ほとんどのワークロードが、伝統的なテクニカル コンピューティングからも、データ駆動型であることを発見しました。したがって、ペンギン・コンピューティングは、ユーザーのワークロードを理解することで、エンドツーエンドのソリューションを設計します。ワークロード最適化されたエンドツーエンド ソリューションを作成するには、ワークロード最適化されたソフトウェア レイヤー、つまりオーケストレーションとワークロード配信に焦点を当てます。基本的に、インフラストラクチャをどのように使用するかを理解する必要があります。
次に、ワークロード最適化されたコンピューティング インフラストラクチャに焦点を当てます。さまざまなデータと IO の課題があり、コンピューティング部分に多大な圧力がかかります。たとえば、さまざまなワークロードでは、CPU、GPU、メモリ帯域幅、データを流し込むことができるネットワークなどの異なる加速コンピューティング インフラストラクチャの組み合わせが必要です。
最後に、どのようなソリューションがデータを提供できるかを判断する必要があります。ワークロード最適化されたデータ インフラストラクチャを調べ、ワークロードがデータとどのように相互作用するか、容量要件、IO パターンを理解します。情報を入手すると、ワークロード最適化されたシステムを設計するのに役立ちます。
すべての情報を活用して、ペンギン・コンピューティングの内部の専門知識を活用して、設計と完全なソリューションをアーキテクチャします。パフォーマンスの観点から設計されていることを理解し、どこにデプロイされているか (オンプレミス、クラウド、エッジ、すべての組み合わせなど) を理解する必要があります。これがペンギン・コンピューティングがデータ駆動型ワークロードの最適化されたソリューションを提供するアプローチです。
ディープラーニングの場合、CPU ではなく GPU を使用することの重要性について説明してください。
ディープラーニング (DL) に関して、GPU の重要性について見た最大のトレンドの 1 つは、汎用 GPU (GPGPU) を使用して、データ並列のハードウェア ピースを提供し、並列コンピューティング問題を解決するために大量のコンピューティング コアを提供できるようになったことです。これは過去 10 年間に起こっています。
私は大学院生およびキャリアの初期に GPGPU プログラミングの初期段階に参加しました。コンピューティング密度の向上、GPU がデバイスに大量のコンピューティング コアと分析コアを提供し、サーバー空間により多くのコアを配置できること、グラフィックス用に設計されたものをコンピューティング エンジンに転用できることが、HPC および AI コミュニティで実際に起こった大きなトレンドでした。
しかし、その多くは、コードを CPU ではなく GPU で実行するように変換および最適化することに依赖していました。私たちがその作業をすべて行ったとき、キラー アプリケーション、つまり実際に起爆するアプリケーションまたはユースケースの概念を待っていました。GPGPU コミュニティにとって、DL はそのキラー アプリケーションでした。これが HPC および AI ワークロードの加速の取り組みと開発を促進しました。
時間の経過とともに、AI とマシンラーニング (ML) が再浮上し、DL が現れました。私たちは、ニューラル ネットワークを使用した DL が、GPU の基礎設計と実際に非常に適合していることを発見しました。私は、これら 2 つの要素が収束したときに、CPU プロセッサによって制限されていたスケールと実践で AI を実行する能力が実現したと思います。
GPU が導入されると、AI と DL の研究開発コミュニティが再び活性化しました。なぜなら、以前は効率的に実行するために必要なコンピューティング レベルがなかったからです。GPU は、DL に適したハードウェア アーキテクチャ ソリューションを提供し、研究者や科学者にそれを提供することを容易にしました。私は、これが GPU が DL にとって優れている理由の 1 つであると思います。
ペンギン・コンピューティングが提供する GPU アクセラレーション コンピューティング ソリューションについて説明してください。
ペンギン・コンピューティングは、戦略ソリューション グループによって行われているエンドツーエンド ソリューションに重点を置いています。特に、ペンギン・コンピューティングの AI および分析プラクティスに焦点を当てています。このプラクティスでは、GPU アクセラレーション ソリューションに 3 つのハイレベル アプローチに焦点を当てています。
まず、エッジ分析のためのリファレンス アーキテクチャを提供しています。ここでは、非伝統的なデータセンター (エッジまたは近辺) に適したソリューションを設計しようとしています。これには、テレコム エッジ データセンター、店舗、ガソリンスタンドなどが含まれます。これらはすべて推論ベースの AI ソリューションです。ソリューションのいくつかは、ビデオ分析 (接触追跡、ジェスチャー認識、手洗い、仮面着用の確認) に対して使用されます。これらは、エッジまたは非伝統的なデプロイに最適化された GPU アクセラレーション ハードウェアと、研究者やエンドユーザーがそれらを効果的に使用できるソフトウェア スタックを含む、完全なソリューションの例です。
ペンギン・コンピューティングのソリューションの次のクラスは、データセンターとコア AI トレーニングおよび推論のリファレンス アーキテクチャを構築するものです。ここでは、大規模なデータセンター内またはクラウド (ペンギン・コンピューティング クラウド) において、DL を加速するために数千の GPU を使用して大規模なトレーニングを行っている顧客を想定しています。私たちは、ソフトウェア ワークロードとコンテナ化をサポートする GPU デザインとレイアウトを通じて、完全なソリューションとリファレンス アーキテクチャを提供する方法を検討しています。
このプラクティスにおける 3 番目のリファレンス アーキテクチャ ファミリーは、前述の 2 つのソリューションの組み合わせです。私たちが探しているのは、連続的な学習を可能にするデータ ファブリック、パス、ワークフローを作成する方法です。エッジの GPU アクセラレーション ソリューションを使用して推論を実行し、データをプライベートまたはパブリック クラウドにプッシュし、そこでトレーニングを続行し、新しいトレーニング モデルが更新されると、推論に戻します。これにより、連続的な学習と AI モデルのイテレーティブなサイクルが実現します。
ペンギン・コンピューティングは最近、インテルと CoolIT のパートナーシップで LLNL に新しいスーパーコンピューターを導入しました。詳細についてお話しください。
LLNL に導入されたマグマ・スーパーコンピューターは、国立核安全保障局 (NNSA) の Commodity Technology Systems (CTS-1) 契約を通じて調達され、Intel Xeon Platinum 9200 シリーズ プロセッサと CoolIT Systems の完全な直接冷却、および Omni-Path インターコネクトを搭載した最初の導入の 1 つです。
NNSA の Advanced Simulation & Computing (ASC) プログラムを通じて資金提供されたマグマは、NNSA の Life Extension Program と、地下核実験のない状況での国の核兵器の安全性、セキュリティ、信頼性を確保するための取り組みをサポートするために使用されます。
マグマ・スーパーコンピューターは、AI で強化された HPC システムであり、AI を使用して HPC モデリングを加速できる統合プラットフォームです。マグマは、2020 年 6 月の Top500 リストでトップ 100 にランクインし、80 位でした。
CTS-1 契約の下で、ペンギン・コンピューティングは、NNSA の ASC プログラムをサポートするために、ローレンス・リバモア国立研究所、ロスアラモス国立研究所、サンディア国立研究所の 3 つの NNSA Tri-Labs に、22 ペタフロップス以上のコンピューティング能力を提供しました。
ペンギン・コンピューティングは、COVID-19 に対する闘いにどのように貢献していますか?
2020 年 6 月、ペンギン・コンピューティングは、米国の 3 つのトップ大学 (ニューヨーク大学 (NYU)、マサチューセッツ工科大学 (MIT)、ライス大学) の研究者に HPC 能力を提供するために、AMD と正式にパートナーシップを結び、COVID-19 に対する闘いに貢献しています。
ペンギン・コンピューティングは、AMD の COVID-19 HPC ファンドと直接パートナーシップを結び、COVID-19 およびその他の疾患に関する医療研究を加速するために、研究機関に重要なコンピューティング リソースを提供しています。ペンギン・コンピューティングと AMD は、NYU、MIT、ライス大学の研究者が最終的に新型コロナウイルスの理解に貢献する百数十人の科学者たちの研究能力を高めるために、オンプレミスとクラウドベースの HPC ソリューションのコンステレーションを提供するために協力しています。
2 世代目の AMD EPYC プロセッサと Radeon Instinct MI50 GPU アクセラレータを搭載したシステムは、それぞれ 1 ペタフロップス以上のコンピューティング パフォーマンスを提供する予定です。さらに、ペンギン・コンピューティングの HPC クラウド サービス、Penguin Computing On-Demand (POD) を通じて、研究者に 4 ペタフロップス以上のコンピューティング能力が提供されます。合計で、研究者は COVID-19 に対抗するために 7 ペタフロップス以上の GPU アクセラレーション コンピューティング パワーを利用できるようになります。
受け取った大学は、ゲノミクス、ワクチン開発、伝染病学、モデリングなどのパンデミック関連ワークロードに新しいコンピューティング能力を活用する予定です。
ペンギン・コンピューティングについてさらに共有したいことがありますか?
20 年以上にわたり、ペンギン・コンピューティングは、高性能コンピューティングとテクニカル コンピューティングの世界に、カスタム、革新的な、オープンなソリューションを提供してきました。ペンギン・コンピューティングのソリューションは、組織がコンピューティング環境で最新のテクノロジーを活用するために必要な敏捷性と自由度を提供します。組織は、基盤となるテクノロジーではなく、製品やアイデアを市場に迅速に提供することにリソースを集中できます。ペンギン・コンピューティングの AI/ML/Analytics、HPC、DataOps、クラウド ネイティブ テクノロジーの幅広いソリューションは、現在のニーズに合わせてカスタマイズおよび組み合わせることができ、将来のニーズやテクノロジーの変化にも迅速に対応できます。ペンギン・コンピューティングのプロフェッショナルおよびマネージド サービスは、ソリューションの統合、実装、管理を支援します。ペンギン・コンピューティングのホスティング サービスは、コンピューティング環境の「どこ」について、所有権の選択肢と、オンプレミス、パブリック クラウド、専用クラウド、ホスティング、またはサービスとしての提供を実行する柔軟性を提供します。
素晴らしいインタビュー、詳しく知りたい読者は ペンギン・コンピューティング を訪問してください。












