Düşünce Liderleri

Daha Hızlı AI’nin Sırrı Daha Fazla GPU Değil, Akıllı Ağ Oluşturmadır

mm
Unite.AI sitesini Google'daki tercih ettiğiniz kaynaklara ekleyin

AI, sağlık, finans, imalat ve perakende dahil olmak üzere çeşitli endüstrilerde mümkün olanın sınırlarını yeniden tanımlıyor. Ancak vaat edilen potansiyelle birlikte, devasa altyapı talepleri de getiriyor.

Dünya çapındaki organizasyonlar, AI eğitimini ve çıkarımı hızlandırmak için hiç görülmemiş bir ölçekte GPU’lara yatırım yapıyor. 2028 yılına kadar, Gartner tahmin ediyor ki, üretken AI IT harcamaları 1 trilyon doları aşacak. Hyperion Research tahmin ediyor ki, genel HPC pazarı harcamaları aynı dönemde 100 milyar doları aşacak. Ancak, en son hızlandırıcıları yatırıma rağmen, birçok CIO, boşta kalan GPU’ları görüyor, kullanım oranı %35 veya daha düşük seviyelerde kalıyor. Bu, yalnızca düşük performansla sonuçlanmıyor, aynı zamanda boşa harcanan enerji ve şişirilmiş maliyetlere de yol açıyor.

Çoğu AI projesi dururken, bunun nedeni GPU veya hesaplama gücünün eksikliği değil, ağın takip edememesidir ve bu da büyük ölçekli AI için yeni bir tasarım yaklaşımı gerektirir.

Ağ Tıkanıklıklarının Gizli Maliyeti

Ağlar, veriyi GPU’ları sürekli olarak meşgul edecek şekilde yeterince hızlı besleyemezse, organizasyonlar birkaç kritik etkiye maruz kalır:

  • Ağ tıkanıklıkları nedeniyle underutilized GPU’lar ve CPU’lar: GPU’lar, büyük ölçüde paralel hesaplama için tasarlanmıştır, ancak yalnızca verinin teslim edildiği hızda işlem yapabilirler. Ağ dokusu takip edemezse, GPU’lar veri beklerken boşta kalır ve hesaplama yapmaz. CPU’lar da durur, çünkü görevleri koordine eder ve veriyi işleme hattı boyunca taşır, bu da düşük kullanım oranıyla sonuçlanır, pahalı donanım mevcutken.
  • Verimsiz ağdan dolayı tutarlı çıkarım performansı: Ağ verimsizlikleri, düzensiz veri akışlarına neden olur, bu da GPU’ların tam hız ve boşta kalma durumları arasında dalgalanmasına neden olur. Bu, AI uygulamalarının üretiminde felç olabilecek öngörülemez çıkarım performansı üretir.
  • Uzun eğitim döngüleri, zamanında pazara sürülmesini geciktirir: AI modellerini eğitmek, sunucular, GPU’lar ve depolama arasında büyük veri kümelerini taşımak gerektirir. Ağ tıkanıklıkları bu süreci boğar, bu da GPU’ların eğitim için daha az zaman harcamasına ve daha fazla zaman beklemesine neden olur. Bu, doğrudan ürün geliştirme ve dağıtım zamanlamalarını yavaşlatır.
  • Artan güç ve operasyonel maliyetler: Boşta olsalar bile, GPU’lar ve çevre altyapısı önemli miktarda güç tüketir. Ağ verimsizlikleri nedeniyle underutilized olan GPU’lar, organizasyonların yüksek güç kullanımını ödemelerine neden olur, ancak orantılı performans alamazlar. Operasyonel maliyetler artar, çünkü tesisler zirve güç ve soğutma yüklerini desteklemek zorundadır, ancak hesaplamalı verimlilik suni olarak kısıtlanır.

Şirketler daha fazla GPU yatırabilir, ancak ağ iyileştirmeleri olmadan, yalnızca bu tıkanıklıkları ve verimsizlikleri artıracaktır.

Ağ Hızlandırıcı olarak: Bir Paradigma Değişimi

Çözüm, ağ mimarisini tamamen yeniden düşünmeyi gerektirir. Ağ hızlandırıcı olarak kullanılan bir model, geleneksel HPC ve AI performansı hakkında düşünme şeklimizi değiştirir ve yeni yetenekler kilidini açar.

GPU’lar ve CPU’lar ekleyerek hesaplama gücüne odaklanmak yerine, “ağ hızlandırıcı” yaklaşımı, ara bağlantılı dokuyu performans çarpanı olarak ele alır. Sonuç olarak, ağ yüksek yoğunluklu hesaplama için daha iyi destek sağlayabilir, tıkanıklıkları ortadan kaldırarak, hesaplama taleplerini karşılayarak ve donanım yatırımlarını doğru boyuta getirerek ROI’yi hızlandırabilir. Hesaplamayı yavaşlatmadan daha fazla hesaplamayı sağlayan ağ, organizasyonların daha büyük iş yüklerini daha az alanda çalıştırmasına, sonuçları daha hızlı almasına ve fazla donanım için fazla harcama yapmamasına olanak tanır.

‘Ağ Hızlandırıcı’ Modelinin Nasıl Çalıştığı

Bu model nasıl çalışır, böylece organizasyonlar ağlarını pasif veri taşıyıcıdan aktif hesaplamayı sağlayan bir araç haline getirebilir ve faydaları gerçekleştirebilir? Geleneksel ağların eksik olduğu dört ana yetenek sağlar:

  • Donanım seviyesinde garantili teslim: Geleneksel ağlar, CPU’lar ve GPU’lar için paket izleme, yeniden iletim ve yeniden sıralama yükünü getirir. Bu, eğitim veya çıkarım için harcanabilecek hesaplama döngülerini tüketir. Donanım seviyesinde teslimat garantili bir ağ dokusuyla, bu görevler hesaplama düğümlerinden uzaklaştırılır, bu da azaltılmış CPU ve GPU yükü, öngörülebilir ve tutarlı performans ve programlama ve küme düzenlemenin basitleştirilmesini sağlar.
  • Akıllı dinamik yönlendirme: Geleneksel yönlendirme, sabit veya optimum olmayan yollara dayanır, bu da ağın bazı kısımlarının underutilized veya tıkanıklıklar oluşturmasına neden olabilir. Akıllı yönlendirme, tüm kullanılabilir yolları trafik akışını optimize etmek için dinamik olarak kullanır. Daha yüksek bant genişliği, trafik dengelenmesi ve daha düşük gecikme sağlar ve ağ trafiğinin otomatik olarak bağlantı veya düğme arızalarına yeniden yönlendirilmesini sağlar. Bu, boşta kalma süresini azaltır ve GPU’ları sürekli olarak veri ile besler.
  • Bağlantı seviyesinde otomatik yeniden iletim: Paketler kaybolur veya bozulursa, standart ağlar, paketlerin algılanması ve yeniden iletimi için hesaplama katmanına güvenir, bu da önemli gecikme getirir ve hesaplama akışını bozar. Ağ dokusunda yerleşik bağlantı seviyesinde otomatik yeniden iletim yetenekleri, ağın kendisinde yeniden iletimi işler. Paket kaybı, hesaplama düğümleri için neredeyse şeffaf olurken, yerel olarak bağlantıda yeniden iletim yapılması, ağ yığınının tamamında değil, yalnızca bağlantıda gecikme etkisini azaltır. Ayrıca, karmaşık uygulama düzeyinde hata işleme ihtiyacını ortadan kaldırır. Otomatik yeniden iletim özellikleri, özellikle binlerce GPU boyunca ölçeklenirken, kesintisiz ve verimli dağıtılmış hesaplama sağlar.
  • Ağ içi hesaplama: Geleneksel ağ dokuları esas olarak veri taşır, ağ içi hesaplama, ağın bir işleyici olarak davranmasını ve belirli işlemleri doğrudan dokuda gerçekleştirmesini sağlar. NVIDIA SHARP, bir örnektir – bu, ağ anahtarları üzerinde azaltma yapılmasına izin verir. Bu, dağıtılmış işlemleri hızlandırır, çünkü veri ağ üzerinden ilerlerken toplanır, ve verimliliği artırır, çünkü hesaplama düğümleri toplama görevlerinden kurtarılır, eğitim ve simülasyon için daha fazla döngü bırakır.

Bu yetenekler birlikte, “ağ önderliğindeki hesaplama”nın, bir sonraki nesil AI ve HPC ortamlarını ölçeklendirme için temel oluşturur. Ağ merkezli bir yaklaşım, somut getiriler sağlar: veri açlığı ortadan kaldırarak daha yüksek GPU kullanımı, eğitim döngülerini azaltarak ve çıkarım performansını stabilize ederek daha hızlı zamanlama, geliştirilmiş kaynak verimliliği ve daha düşük toplam sahip olma maliyeti.

Gerçek Ağ Gücünü Keşfet

Büyük ölçekli AI, yalnızca bir hesaplama problemi değil, ağın merkezinde olduğu bir sistem düzeyinde mühendislik zorluğudur. Ağ hızlandırıcı olarak kullanmak, hesaplamayı çarpan bir güç haline getirir, böylece HPC ve AI veri merkezleri, performansını feda etmeden yoğunluğu artırabilir. ROI’yi daha hızlı teslim eder, mevcut altyapının maksimum değerini çıkararak daha fazla silikon yatırımı yapmadan önce.

Ağ tıkanıklıklarını ortadan kaldırarak, kullanımı artırarak ve öngörülebilir performans sunarak, daha akıllı ağ oluşturma, daha üretken AI ekiplerine, GPU altyapısına daha iyi ROI’ye, daha hızlı zamanlama, inovasyon ve pazar liderliğine olanak tanır. Organizasyonlara, ağın gerçekten ne olabileceğini keşfetmelerine ve AI’nin gücünü yeni yollarla kullanmalarına izin verir.

Nishant Lodha, Cornelis Networks'te AI ağ oluşumunun kıdemli müdürüdür. Cornelis'e katılmadan önce Nishant, Intel Corporation ve Marvell'de müdür seviyesinde rollerde bulunmuştur. Veri merkezi ağ oluşturma, depolama ve hesaplama teknolojilerinde 25 yılı aşkın deneyime sahiptir ve ürün pazarlaması, çözümler ve teknik pazarlama ile ağ mühendisliği rollerini kapsayan görevlerde bulunmuştur. Silikon Vadisi'nde bulunmaktadır.