Liderzy opinii

Sekret szybszego AI nie tkwi w większej ilości GPU, ale w inteligentniejszej sieci

mm
Dodaj Unite.AI do preferowanych źródeł w Google

AI zmienia to, co jest możliwe w różnych branżach, w tym w ochronie zdrowia, finansach, produkcji i handlu detalicznym. Ale wraz z obietnicą ogromnych możliwości, AI niesie również ogromne wymagania infrastrukturalne.

Organizacje na całym świecie inwestują w GPU w niezwykłym tempie, aby przyspieszyć szkolenie i inferencję AI. Do 2028 roku Gartner przewiduje, że wydatki na IT związane z AI generatywnymi przekroczą 1 bilion dolarów. Hyperion Research prognozuje, że całkowite wydatki na rynek HPC przekroczą 100 miliardów dolarów w tym samym czasie. Mimo to, pomimo inwestowania w najnowocześniejsze przyspieszacze, wielu dyrektorów IT nadal obserwuje, jak GPU są nieaktywne, z wykorzystaniem na poziomie 35% lub niższym. To nie tylko powoduje niską wydajność, ale także marnowanie energii i zwiększone koszty.

Podczas gdy wiele projektów AI jest wstrzymanych, nie jest to spowodowane brakiem GPU lub mocy obliczeniowej, ale tym, że sieć nie może nadążyć, co wymaga nowego podejścia do projektowania AI w skali.

Ukryty koszt wąskich gardeł sieciowych

Gdy sieci nie mogą dostarczyć danych wystarczająco szybko, aby utrzymać GPU w stałej pracy, organizacje doświadczają kilku krytycznych skutków:

  • Niewykorzystane GPU i CPU z powodu wąskich gardeł transferu danych: GPU są zaprojektowane do masowo równoległych obliczeń, ale mogą przetwarzać dane tylko tak szybko, jak są dostarczane. Jeśli tkanina sieciowa nie może nadążyć, GPU siedzą bezczynnie, czekając na dane zamiast wykonywać obliczenia. Procesory CPU mogą również zwolnić, ponieważ koordynują zadania i przenoszą dane przez potok, co skutkuje niskim wykorzystaniem, pomimo dostępności drogiego sprzętu.
  • Niespójna wydajność inferencji z powodu nieefektywnej sieci: Nieefektywność sieci tworzy nierównomierne przepływy danych, powodując, że GPU wahają się między pełną prędkością a stanem bezczynności. To powoduje nieprzewidywalną wydajność inferencji, która może sparaliżować aplikacje AI w produkcji.
  • Dłuższe cykle szkolenia, opóźniające czas wprowadzenia na rynek: Szkolenie modeli AI wymaga przenoszenia ogromnych zbiorów danych między serwerami, GPU i pamięcią. Wąskie gardła sieciowe hamują ten proces, więc GPU spędzają mniej czasu na szkoleniu i więcej czasu na oczekiwaniu. To bezpośrednio spowalnia rozwój produktu i harmonogramy wdrożenia.
  • Rosnące koszty energii i eksploatacji: Nawet gdy są bezczynne, GPU i otaczająca infrastruktura nadal zużywają znaczną ilość energii. Jeśli GPU są niewykorzystane z powodu nieefektywności sieci, organizacje płacą za wysokie zużycie energii bez proporcjonalnej wydajności. Koszty eksploatacji rosną, ponieważ obiekty muszą wspierać obciążenia szczytowe i chłodzenie, nawet jeśli przepływ obliczeniowy jest sztucznie ograniczony.

Przedsiębiorstwa mogą nadal wydawać pieniądze na więcej GPU, ale bez odpowiednich ulepszeń sieci, tylko nasilą te wąskie gardła i nieefektywności.

Sieć jako przyspieszacz: Zmiana paradygmatu

Rozwiązanie wymaga całkowitego przemyślenia architektury sieci. Wprowadzenie modelu, który wykorzystuje sieć jako przyspieszacz, odwraca tradycyjne myślenie o wydajności HPC i AI, odblokowując nowe możliwości.

Zamiast koncentrować się głównie na dodawaniu większej ilości obliczeń za pomocą GPU i CPU, podejście “sieć jako przyspieszacz” traktuje tkaninę łączącą jako mnożnik wydajności. W efekcie sieć może lepiej wspierać obliczenia o wysokiej gęstości i przyspieszać zwrot z inwestycji, eliminując wąskie gardła, skalując się w celu spełnienia wymagań obliczeniowych i dostosowując inwestycje w sprzęt. Dzięki umożliwieniu większych obciążeń bez spowolnień, organizacje mogą uruchamiać większe zadania w mniejszej przestrzeni, uzyskać wyniki szybciej i uniknąć nadmiernych wydatków na dodatkowy sprzęt.

Jak działa model “sieć jako przyspieszacz”

Jak więc działa ten model, aby organizacje mogły przekształcić swoją sieć z biernego przenoszenia danych w aktywny katalizator obliczeń i zacząć korzystać z korzyści? Dzięki czterem kluczowym możliwościom, których brakuje tradycyjnym sieciom:

  • Gwarantowana dostawa na poziomie sprzętu: Tradycyjne sieci obciążają CPU i GPU nadzorem pakietów, ponowną transmisją i ponownym ustalaniem kolejności. To zużywa cykle obliczeniowe, które mogłyby być poświęcone na szkolenie lub inferencję. Z tkaniną sieciową, która gwarantuje dostawę na poziomie sprzętu, te zadania są przenoszone poza węzły obliczeniowe, w wyniku czego maleje obciążenie CPU i GPU, zapewnia się przewidywalna i spójna wydajność oraz skalowalność, która upraszcza programowanie i orchestrację klastra.
  • Inteligentna dynamiczna trasowanie: Konwencjonalne trasowanie opiera się na stałych lub podoptymalnych ścieżkach, co może pozostawić części sieci niewykorzystane lub utworzyć wąskie gardła, gdzie ogromne ilości danych są przesyłane jednocześnie. Inteligentne trasowanie dynamicznie wykorzystuje wszystkie dostępne ścieżki, aby zoptymalizować przepływ ruchu. Umożliwia wyższy przepływ dzięki wielu aktywnym trasom, równoważącym ruch, niższą latencję dzięki optymalnemu wyborowi ścieżki oraz poprawioną odporność na awarie, ponieważ ruch sieciowy automatycznie przekierowuje się wokół awarii łącza lub węzła. To redukuje czas bezczynności i utrzymuje GPU w pełnym zakresie danych.
  • Auto-ponowna transmisja na poziomie łącza: Gdy pakiety są tracone lub uszkodzone, standardowe sieci polegają na warstwie obliczeniowej, aby wykryć i ponownie przesłać je, co wprowadza znaczną latencję i przerywa przepływ obliczeniowy. Tkanina z wbudowanymi, auto-ponownymi transmisjami na poziomie łącza obsługuje ponowne transmisje wewnątrz samej sieci. Umożliwia prawie przezroczystą niezawodność, ponieważ utrata pakietów staje się niewidoczna dla węzłów obliczeniowych, podczas gdy wpływ na latencję jest zmniejszony, ponieważ ponowne transmisje występują lokalnie na poziomie łącza, a nie w całej sieci. Eliminuje również potrzebę złożonego obsługiwanie błędów na poziomie aplikacji. Możliwości auto-ponownej transmisji zapewniają nieprzerwane, wydajne obliczenia rozproszone, co jest istotne przy skalowaniu na tysiące GPU.
  • Obliczenia w sieci: Podczas gdy tradycyjne tkaniny sieciowe przenoszą głównie dane, obliczenia w sieci umożliwiają sieci, aby stały się współprzetwarzaniem, wykonując pewne operacje bezpośrednio w tkaninie. NVIDIA SHARP jest przykładem – umożliwia redukcje na samych przełącznikach sieciowych. Umożliwia przyspieszone operacje rozproszone, obniża latencję, ponieważ dane są agregowane, gdy przechodzą przez sieć, oraz zwiększa wydajność, ponieważ węzły obliczeniowe są zwolnione z wykonywania zadań agregacji, pozostawiając więcej cykli na szkolenie i symulację.

Wszystkie te możliwości tworzą “sieć jako przyspieszacz”, który jest podstawą dla skalowania środowisk AI i HPC następnej generacji. Podejście sieciowe zapewnia wymierne korzyści, w tym wyższe wykorzystanie GPU, które eliminuje głód danych, szybszy czas uzyskiwania informacji, który redukuje cykle szkolenia i stabilizuje wydajność inferencji, poprawioną efektywność zasobów oraz niższy całkowity koszt posiadania.

Odkryj prawdziwą moc sieci

AI w skali nie jest tylko problemem obliczeniowym – jest to wyzwanie inżynieryjne na poziomie systemu, z siecią w centrum. Traktowanie sieci jako przyspieszacza zamienia ją w mnożnik wydajności obliczeniowej, pozwalając środowiskom HPC i AI na skalowanie w gęstości bez poświęcania wydajności. Dzięki eliminowaniu wąskich gardeł, zwiększaniu wykorzystania i dostarczaniu przewidywalnej wydajności, inteligentniejsza sieć umożliwia bardziej produktywne zespoły AI, lepszy zwrot z inwestycji w infrastrukturę GPU oraz szybszy czas uzyskiwania informacji, innowacji i przywództwa na rynku. Pozwala organizacjom odkryć, czym może być ich sieć, i wykorzystać moc AI w nowych sposobach.

Poprzez eliminowanie wąskich gardeł, zwiększanie wykorzystania i dostarczanie przewidywalnej wydajności, inteligentniejsza sieć umożliwia bardziej produktywne zespoły AI, lepszy zwrot z inwestycji w infrastrukturę GPU oraz szybszy czas uzyskiwania informacji, innowacji i przywództwa na rynku. Pozwala organizacjom odkryć, czym może być ich sieć, i wykorzystać moc AI w nowych sposobach, zwiększając wykorzystanie, dostarczając przewidywalną wydajność, inteligentniejsze sieci umożliwiają bardziej produktywne zespoły AI, lepszy zwrot z inwestycji w infrastrukturę GPU oraz szybszy czas uzyskiwania informacji, innowacji i przywództwa na rynku, umożliwiając odkrycie prawdziwej mocy sieci.

Nishant Lodha jest starszym dyrektorem ds. sieci AI w firmie Cornelis Networks. Przed dołączeniem do Cornelis, Nishant pełnił stanowiska kierownicze w firmach Intel Corporation i Marvell. Ma ponad 25 lat doświadczenia w dziedzinie sieci danych, magazynowania i technologii obliczeniowych, obejmujących role w marketingu produktów, rozwiązań i marketingu technicznego oraz inżyniera sieci. Jest związany z Doliną Krzemową.