Röportajlar

Kevin Tubbs, PhD, Penguin Computing Stratejik Çözümler Grubu SVP’si – Röportaj Serisi

mm
Unite.AI sitesini Google'daki tercih ettiğiniz kaynaklara ekleyin

Kevin Tubbs, PhD, Penguin Computing’in Stratejik Çözümler Grubu’nun Başkan Yardımcısıdır. Penguin Computing, Fortune 500 şirketleri, startup’lar, akademik kurumlar ve federal organizasyonların karşılaştığı karmaşık bilimsel, analitik ve mühendislik sorunlarını çözmek için tarafsız, uçtan uca (donanım/yazılım/bulut/hizmetler) çözümler tasarlar.

Siz bilgisayar bilimi alanına ilk olarak neler çekti?

Annem ve babam bana çok gençken bir bilgisayar aldıkları için ve ben her zaman bilgisayarlar ve düzenleme ile ilgileniyorum. Eğitimim boyunca sürekli olarak STEM alanlarına yöneldim ve bu da beni daha uygulamalı bir alana yönlendirdi. Fizik ve Yüksek Performanslı Bilgisayarlar (HPC) alanında geçmişim var. Bilgisayarları erken yaşta sevmem, diğer bilim, matematik veya mühendislik ilgi alanlarımdan önce bilgisayar bilimini öne çıkarmamı sağladı ve bu da beni bugüne getirdi.

Penguin Computing, Open Compute Project (OCP) ile yakın çalışıyor – bu tam olarak nedir?

Open Compute Project (OCP) hareketinin başlangıcından bu yana, Penguin Computing bir erken benimseyen, destekleyici ve OCP’nin High Performance Computing (HPC) ve yapay zeka (AI) alanlarına getirdiği faydaları sağlamak için büyük bir katkıda bulundu.

OCP’nin odak noktası, altyapı teknolojisinin daha verimli, esnek ve ölçeklenebilir olması için geliştiricileri bir araya getirmektir. Penguin Computing, OCP’ye Open teknolojileri ve topluluk fikri nedeniyle katıldı. Zaman içinde, geleneksel HPC ve AI’de ortaya çıkan trendleri verimli bir şekilde ölçeklendirmek için çalışıyoruz – Penguin Computing bu konularda OCP’ye yön veriyor.

OCP’nin avantajlarından biri, toplam sahip olma maliyetini (TCO) düşürmesidir – sermaye harcamalarını azaltır, tüm görsel öğelerin kaldırılması sayesinde işletme giderlerini düşürür ve hizmetin önünden, paylaşılan güç kaynakları ve diğer tasarım değişiklikleri sayesinde daha düşük işletme giderleri sağlar – bu da OCP tabanlı teknolojinin ölçeklendirilmesi için ideal hale getirir.

Penguin Computing, OCP ürünleri arasında Penguin Computing Tundra Extreme Scale Platform ve Penguin Computing Tundra AP bulunur. Tundra platformları ayrıca HPC ve AI iş yükleri ile uyumludur.

Tundra AP, yüksek yoğunluklu Tundra süper bilgisayar platformumuzun son neslidir ve Intel (INTC ) ® Xeon® Scalable 9200 serisi işlemcilerin işleme gücünü, Penguin Computing’in Relion XO1122eAP Sunucusu ile birleştirir ve OCP form faktöründe yüksek bir CPU çekirdeği yoğunluğu sağlar.

Büyük veri söz konusu olduğunda, performans seviyelerini optimize etmek için kullanıcıların veri erişimini yavaşlatan engelleri kaldırmaları gerekir. Penguin Computing bu sorunu nasıl ele alır?

Penguin Computing, Open teknolojileri kullanma ve güncel trendlere hızlı bir şekilde uyum sağlama yeteneğini kullanarak büyük veri veya veri büyümesiyle ilgili sorunlara çözüm getirmek için Stratejik Çözümler Grubunu oluşturdu.

Sorunu ele alırken, geleneksel teknik hesaplamadan gelen většu iş yüklerinin veri odaklı olma eğiliminde olduğunu gördük. Bu nedenle, Penguin Computing, kullanıcıların iş yükünü anlamaya çalışarak uçtan uca çözümler tasarlar. İş yükü odaklı bir uçtan uca çözüm oluşturmak için, iş yükü odaklı yazılım katmanına odaklanıyoruz – bu, orkestrasyon ve iş yükü teslimini içerir. Aslında, altyapıyı nasıl kullanacaklarını anlamamız gerekir.

Sonra, iş yükü odaklı hesaplama altyapısına odaklanıyoruz. Farklı iş yükleri, CPU’lar, GPU’lar, bellek bant genişliği ve veri işlenmesine olanak tanıyan ağlar gibi farklı veri ve IO zorlukları yaratır.

Son olarak, veriyi teslim etmemize olanak tanıyan çözümleri bulmamız gerekir. İş yükü odaklı veri altyapilerine bakarak, iş yükünün veriyle nasıl etkileşime girdiğini, kapasite gereksinimlerini ve IO modellerini anlarız. Bu bilgiyi aldıktan sonra, bir iş yükü odaklı sistem tasarlamamıza yardımcı olur.

Tüm bu bilgileri aldıktan sonra, Penguin Computing’in iç uzmanlığını kullanarak bir tasarım ve tam bir çözüm oluştururuz. Performans açısından tasarlandığını bildiğimiz için, nerede dağıtıldığını anlamamız gerekir (yerinde, bulut, kenar, tümünün bir kombinasyonu vb.). Bu, Penguin Computing’in veri odaklı iş yükleri için optimize edilmiş bir çözüm sunma yaklaşımıdır.

Derin öğrenme için CPU yerine GPU kullanmanın önemini tartışabilir misiniz?

Derin öğrenme (DL) için GPU’ların önemini gören en büyük trendlerden biri, genel amaçlı GPU’ların (GPGPU) veri paralel bir parçası olarak kullanılması ve büyük ölçekli paralel hesaplamaları çözmek için sunulan hesaplama çekirdeklerinin sayısını büyük ölçüde hızlandırmasıydı.

Lisansüstü eğitimim sırasında ve kariyerimin başlangıcında GPGPU programlamasının erken aşamalarında yer aldım. Hesap yoğunluğundaki bu atılım, bir GPU’da yoğun hesaplama ve analitik çekirdekler sunması ve sunucu alanında daha fazla şeyin yapılabilmesi, HPC ve AI toplulukları için gerçek bir trenddi.

Ancak bu, kodun GPU’larda çalışması için dönüştürülmesi ve optimize edilmesi gerekti. Tüm bu çalışmaları yaptığımız sırada, öldürücü bir uygulama bekliyorduk – GPU’ları kullanarak gerçekten ortaya çıkacak veya mümkün hale gelecek bir uygulama veya kullanım durumu. GPGPU topluluğu için DL, bu uygulamaydı ve HPC ve AI iş yüklerinin hızlandırılmasına yönelik çabaları ve gelişmeleri canlandırdı.

Zaman içinde, AI ve makine öğrenimi (ML) yeniden canlandı ve DL ortaya çıktı. Bir sinir ağını DL kullanarak eğitmenin, bir GPU’nun alt yapısına çok iyi uyduğunu fark ettik. CPU işlemcilerinin sınırlarını aşarak büyük ölçekli ve pratikte AI yapmamızı sağlayan şey, GPU’nun ortaya çıkmasıydı.

GPU’lar ortaya çıktığında, AI ve DL araştırmaları ve geliştirmeleri için bir canlanma yaşandı, çünkü previously sadece CPU’larda mümkün olan hesaplamaları yapabiliyorduk ve bu da AI’nin daha geniş bir researcher ve bilim insanı kitlesine ulaşmasını sağladı.

Penguin Computing’in sunduğu GPU hızlandırılmış hesaplama çözümlerinden bazıları nelerdir?

Penguin Computing, Stratejik Çözümler Grubunun çalıştığı uçtan uca çözümler üzerinde odaklanıyor, özellikle de Penguin Computing’in AI ve Analytics Uygulaması üzerinde. Bu uygulama içinde, üç yüksek düzeyde GPU hızlandırılmış çözüm yaklaşımına odaklanıyoruz.

İlki, kenar analitiği için referans mimarileri sunuyoruz, burada geleneksel olmayan veri merkezlerinde (kenarda veya kenarın yakınında) çözümler tasarlıyoruz. Bunlar, Telekomünikasyon kenar veri merkezleri, perakende tesisleri, benzin istasyonları ve daha fazlasını içerebilir. Bunlar, video analizi için temas takibi ve el yıkama veya maske takma gibi jestleri tanıma için kullanılan tüm çıkarım tabanlı AI çözümleridir.

Sonraki çözüm sınıfımız, veri merkezi ve çekirdek AI eğitimi ve çıkarımı için referans mimarilerini içerir. Büyük ölçekli bir veri merkezinde veya bulutta (Penguin Computing Bulut) binlerce GPU kullanarak büyük ölçekli eğitim yapan müşterilerimiz için tam çözümler ve referans mimarileri sunuyoruz.

Üçüncü referans mimari ailesi, önceki iki çözümün bir kombinasyonudur. Bu üçüncü referans mimarisinde, sürekli öğrenmeyi ermögleyen veri kumaşları, yolları ve iş akışlarını nasıl yaratabileceğimizi arıyoruz, böylece kenar GPU hızlandırılmış çözümlerimiz kullanarak çıkarım yapabilir, veriyi özel veya kamu bulutuna gönderebilir, orada eğitebilir ve yeni eğitim modelleri güncellendikçe bunları geri kenara gönderebiliriz.

Penguin Computing, LLNL için Intel ve CoolIT ile birlikte yeni bir süper bilgisayar dağıttı. Bize bu süper bilgisayar hakkında bilgi verebilir misiniz?

LLNL’de dağıtılan Magma Süper Bilgisayarı, Ulusal Güvenlik İdaresi (NNSA) ile Commodity Technology Systems (CTS-1) sözleşmesi kapsamında satın alındı ve Intel Xeon Platinum 9200 serisi işlemcileri ile CoolIT Systems’in tam direkt sıvı soğutma ve Omni-Path bağlantısı ile donatılmış ilk dağıtımlarından biridir.

NNSA’nın İleri Simülasyon ve Hesaplama (ASC) programı tarafından finanse edilen Magma, NNSA’nın Yaşam Uzatma Programı ve yeraltı testlerinin absenceinde ülkenin nükleer silahlarının güvenliğini, güvenliğini ve güvenilirliğini sağlamak için kritik olan çabaları destekleyecektir.

Magma Süper Bilgisayarı, AI tarafından hızlandırılan bir HPC sistemidir ve AI’yi HPC modellemesini hızlandırmasına olanak tanıyan bir birleşik platformdur. Magma, Haziran 2020’de Top500 listesinde 80. sıraya yükseldi.

CTS-1 sözleşmesi altında, Penguin Computing, NNSA Tri-Labs’teki Lawrence Livermore, Los Alamos ve Sandia Ulusal Laboratuvarları’nda ASC programını desteklemek için 22 petaflop’tan fazla hesaplama kapasitesi sağladı.

Penguin Computing, COVID-19’a karşı mücadelede nasıl destek oluyor?

Haziran 2020’de, Penguin Computing resmi olarak AMD ile birlikte ABD’deki üç üst düzey üniversiteye – New York Üniversitesi (NYU), Massachusetts Teknoloji Enstitüsü (MIT) ve Rice Üniversitesi’ne – COVID-19’a karşı mücadele için araştırma kurumlarına önemli hesaplama kaynakları sağlamak için ortaklık kurdu.

Penguin Computing, AMD’nin COVID-19 HPC Fonu ile birlikte çalışarak, COVID-19 ve diğer hastalıklar hakkında tıbbi araştırmaları hızlandırmak için araştırma kurumlarına önemli hesaplama kaynakları sağlamayı amaçlıyor. Penguin Computing ve AMD, NYU, MIT ve Rice Üniversitesi’ne, yüzlerce bilim insanının katkıda bulunacağı ve nihayetinde yeni koronavirüsün daha iyi anlaşılmasına katkıda bulunacak bir dizi hesaplama kaynağı sunmak için iş birliği yapıyor.

2. nesil AMD EPYC işlemcileri ve Radeon Instinct MI50 GPU hızlandırıcıları ile çalışan sistemler, her biri bir petaflop’un üzerinde hesaplama performansı sunacak. Penguin Computing’in Hesaplama Bulut hizmeti, POD, aracılığıyla dört petaflop daha hesaplama kapasitesi sağlanacak. Birlikte, bu sistemler, COVID-19’a karşı mücadele için GPU hızlandırılmış hesaplama gücünü sağlayan yedi petaflop’un üzerinde hesaplama kapasitesi sunacak.

Alıcı üniversiteler, yeni hesaplama kapasitesini, genetik, aşı geliştirme, bulaşma bilimi ve modelleme gibi pandemi ile ilgili çeşitli iş yükleri için kullanacaklar.

Penguin Computing hakkında paylaşmak istediğiniz başka bir şey var mı?

20 yılı aşkın bir süredir, Penguin Computing, yüksek performanslı ve teknik hesaplama dünyasına özel, yenilikçi ve açık çözümler sunuyor. Penguin Computing çözümleri, organizasyonların compute ortamlarında son teknolojileri kullanmak için gereken esnekliği ve özgürlüğü sağlıyor. Organizasyonlar, ürün ve fikirlerini rekor sürede piyasaya sürmek için kaynaklarını odaklayabiliyorlar, altta yatan teknolojiler yerine. Penguin Computing’in AI/ML/Analytics, HPC, DataOps ve Bulut yerel teknolojileri için geniş çözüm yelpazesi, mevcut ve gelecekteki ihtiyaçlara uyacak şekilde özelleştirilebilir ve birleştirilebilir. Penguin Computing Profesyonel ve Yönetilen Hizmetleri, entegrasyon, uygulama ve yönetim konularında yardımcı oluyor. Penguin Computing Barındırma Hizmetleri, compute ortamının “nerede” kısmında organizasyonlara sahip olma seçenekleri ve esneklik sunuyor, böylece organizasyonlar, yerinde, kamu veya adanmış bulut, barındırılan veya hizmet olarak çalıştırabiliyorlar.

Harika röportaj için teşekkür ederiz, daha fazla bilgi öğrenmek isteyen okuyucular Penguin Computing sitesini ziyaret edebilir.

Antoine, Unite.AI'nin vizyoner lideri ve kurucu ortağı, AI ve robotik geleceğini şekillendirmeye ve tanıtmaya yönelik sarsılmaz bir tutkuya sahiptir. Bir seri girişimci olarak, AI'nin toplum için elektrik kadar yıkıcı olacağına inanmaktadır ve sık sık yıkıcı teknolojiler ve AGI'nin potansiyeli hakkında konuşmaktadır.

Bir gelecekçi olarak, bu yeniliklerin dünyamızı nasıl şekillendireceğini keşfetmeye adanmıştır. Ayrıca, Securities.io kurucusudur, bu platform geleceği yeniden tanımlayan ve tüm sektörleri yeniden şekillendiren teknolojilere yatırım yapmayı hedeflemektedir.