Liderzy opinii

Radząc sobie z dominacją Nvidii: elastyczne strategie rozwoju ML dla graczy spoza wielkiego tech

mm
Dodaj Unite.AI do preferowanych źródeł w Google

Budowanie biznesu wśród dużych graczy nigdy nie było łatwym zadaniem. W 2023 roku konkurencja w sektorze sztucznej inteligencji osiągnęła niezwykłe wysokości, napędzana przez prawdziwe, zaskakujące przełomy. Wydanie przez OpenAI GPT-4, integracja ChatGPT z Bing, uruchomienie przez Google Bard oraz kontrowersyjne “otwarte” Llama 2 Meta. Brzmi to jak długa lista dużych nazw, prawda? Jak ekscytujące to może brzmieć, większość innowacji leży tam, gdzie płyną pieniądze, a konkurencja, z którą muszą się zmierzyć mniejsi gracze, staje się coraz bardziej intensywna z dnia na dzień.

W ciągle ewoluującym krajobrazie branży technologicznej Nvidia (NVDA ) nadal umacnia swoją pozycję jako kluczowy gracz w infrastrukturze sztucznej inteligencji. Podczas konferencji telefonicznej w sprawie sprawozdania finansowego w sierpniu, Jensen Huang, prezes NVIDIA, podkreślił rosnący popyt na procesory Nvidia. Twierdzenie to potwierdzają dane z prezentacji inwestorskiej Nvidia za Q3, które ujawniają imponujący rekord wyników z roku na rok, już od listopada. Tymczasem prognozy Gartnera wskazują na znaczny wzrost wydatków na chipy w ciągu najbliższych czterech lat. Obecnie oprogramowanie Nvidia i procesory nie mają sobie równych, pozostawiając branżę w niepewności, kiedy może pojawić się wiarygodny konkurent.

Niedawne raporty z Bloomberg i Financial Times rzucają światło na negocjacje Samuela Altmana, CEO OpenAI, z inwestorami z Bliskiego Wschodu w celu zainicjowania produkcji chipów, mającej na celu zmniejszenie zależności sektora sztucznej inteligencji od chipów Nvidii. Wyzwanie rzucone Nvidia, której kapitalizacja wynosi prawie 1,5 bln dolarów, może kosztować Altmana między 5 a 7 bln dolarów i potrwać kilka lat.

Niemniej, rozwiązanie problemu efektywności kosztowej modeli ML dla biznesu jest czymś, co firmy muszą zrobić teraz. Dla firm spoza wielkiego techu rozwój efektywnych kosztowo modeli ML jest nie tylko procesem biznesowym, ale także istotną strategią przetrwania. Artykuł ten przedstawia cztery pragmatyczne strategie, które umożliwiają firmom wszystkich rozmiarów rozwój swoich modeli bez konieczności dużych inwestycji w badania i rozwój oraz pozostanie elastycznym, aby uniknąć zależności od dostawców.

Dlaczego Nvidia dominuje na rynku AI

Krótko mówiąc, Nvidia stworzyła idealny model workflow szkolenia, osiągając symbiozę między wysokowydajnymi GPU a własnym oprogramowaniem do szkolenia modeli, powszechnie uznanym toolkitiem CUDA.

CUDA (wprowadzony w 2007 roku) to kompletny toolkit i API do optymalnego wykorzystania procesorów GPU Nvidii. Głównym powodem jego popularności jest jego niezrównana zdolność do przyspieszania złożonych obliczeń matematycznych, niezbędnych dla głębokiego uczenia. Dodatkowo oferuje bogaty ekosystem, taki jak cuDNN dla głębokich sieci neuronowych, zwiększając wydajność i łatwość użycia. Jest niezbędny dla deweloperów ze względu na swoją bezproblemową integrację z głównymi frameworkami głębokiego uczenia, umożliwiając szybki rozwój i iterację modeli.

Połączenie tak solidnego oprogramowania z wydajnym sprzętem okazało się kluczem do zdobycia rynku. Chociaż niektórzy twierdzą, że dominacja Nvidii może być zjawiskiem tymczasowym, trudno jest takie przewidywania robić w obecnej sytuacji.

Ciężka cena dominacji Nvidii

Nvidia mająca przewagę w dziedzinie rozwoju maszynowego uczenia się wywołała wiele obaw, nie tylko w etycznej dziedzinie, ale także w odniesieniu do rosnących dysproporcji w budżetach badawczo-rozwojowych, które są jednym z powodów, dla których wejście na rynek stało się wykładniczo trudniejsze dla mniejszych graczy, a nawet startupów. Dodając do tego spadek zainteresowania inwestorów ze względu na wyższe ryzyko, zadanie pozyskania znacznych inwestycji w badania i rozwój (takich jak te, które ma Nvidia) staje się wręcz niemożliwe, tworząc bardzo nierówny podział.

Jednak ta silna zależność od sprzętu Nvidii nakłada jeszcze większą presję na spójność łańcucha dostaw i otwiera ryzyko zakłóceń oraz zależności od dostawców, redukując elastyczność rynku i zwiększając bariery wejścia na rynek.

Niektórzy gromadzą pieniądze, aby upewnić się, że nie pozostawią użytkowników w trudnej sytuacji. Wszędzie, terminy inżynieryjne takie jak ‘optymalizacja’ i ‘mniejszy rozmiar modelu’ są w modzie, ponieważ firmy starają się zmniejszyć swoje potrzeby GPU, a inwestorzy w tym roku postawili setki milionów dolarów na startupy, których oprogramowanie pomaga firmom radzić sobie z posiadaniem GPU.

Nvidia Chip Shortages Leave AI Startups Scrambling for Computing Power By Paresh Dave

Teraz jest czas, aby przyjąć strategiczne podejście, ponieważ może to być właśnie to, co da Twojemu przedsiębiorstwu szansę prosperować wśród dalekosiężnego wpływu Nvidii na rozwój ML.

Strategie, które mogą przyjąć gracze spoza wielkiego techu wobec dominacji Nvidii:

1. Rozpocznij eksplorację AMD RocM

AMD aktywnie zmniejsza lukę w rozwoju AI w stosunku do Nvidii, co osiągnięto dzięki ciągłemu wsparciu dla Rocm w głównych bibliotekach PyTorch w ciągu ostatniego roku. To ciągłe wysiłek doprowadziło do poprawy kompatybilności i wydajności, szczególnie podkreślonej przez układ MI300, najnowszy wydany produkt AMD. Układ MI300 wykazał solidną wydajność w zadaniach inferencji Large Language Model (LLM), szczególnie wyróżniając się w modelach takich jak LLama-70b. Ten sukces podkreśla znaczne postępy w mocy obliczeniowej i efektywności osiągnięte przez AMD.

2. Znajdź inne alternatywy sprzętowe

Oprócz postępów AMD, Google wprowadził Tensor Processing Units (TPU), specjalistyczny sprzęt zaprojektowany specjalnie do przyspieszania obciążeń maszynowego uczenia się, oferując solidną alternatywę dla szkolenia dużych modeli AI.

Poza tymi gigantami branży, mniejsi, ale wpływowi gracze, tacy jak Graphcore i Cerebras (CBRS ), wniosą znaczący wkład w przestrzeń sprzętu AI. Jednostka przetwarzania inteligentnego (IPU) Graphcore, dostosowana do efektywności w obliczeniach AI, zwróciła uwagę na swój potencjał w zadaniach o wysokiej wydajności, jak to zostało zademonstrowane przez eksperymenty Twittera. Z drugiej strony, Cerebras przesuwa granice ze swoimi zaawansowanymi chipami, podkreślając skalowalność i surową moc obliczeniową dla aplikacji AI.

Wspólne wysiłki tych firm sygnalizują przesunięcie w kierunku bardziej zróżnicowanego ekosystemu sprzętu AI. Ta dywersyfikacja prezentuje słuszne strategie, aby zmniejszyć zależność od Nvidii, zapewniając deweloperom i badaczom szerszy zakres platform do rozwoju AI.

3. Rozpocznij inwestowanie w optymalizację wydajności

Oprócz eksplorowania alternatyw sprzętowych, optymalizacja oprogramowania okazuje się kluczowym czynnikiem w zmniejszaniu wpływu dominacji Nvidii. Wykorzystując efektywne algorytmy, redukując niepotrzebne obliczenia i wdrażając techniki przetwarzania równoległego, gracze spoza wielkiego techu mogą maksymalnie wykorzystać wydajność swoich modeli ML na istniejącym sprzęcie, oferując pragmatyczne podejście do mostowania luki bez wyłącznej zależności od drogich uaktualnień sprzętu.

Przykładem tego podejścia jest technologia AutoNAC firmy Deci Ai. Ta innowacja wykazała możliwość przyspieszenia inferencji modelu o imponujący czynnik 3-10 razy, potwierdzony przez szeroko uznany benchmark MLPerf. Przedstawiając takie postępy, staje się jasne, że optymalizacja oprogramowania może znacznie poprawić efektywność rozwoju ML, prezentując słuszną alternatywę dla złagodzenia wpływu dominacji Nvidii w tej dziedzinie.

4. Rozpocznij współpracę z innymi organizacjami w celu stworzenia zdecentralizowanych klastrów

To podejście współpracy może obejmować wspólne udostępnianie wyników badań, wspólne inwestowanie w alternatywne opcje sprzętowe oraz wspieranie rozwoju nowych technologii ML poprzez projekty open-source. Decentralizując inferencję i wykorzystując rozproszone zasoby obliczeniowe, gracze spoza wielkiego techu mogą wyrównać pole gry i stworzyć bardziej konkurencyjny krajobraz w branży rozwoju ML.

Dziś strategia współdzielenia zasobów obliczeniowych zyskuje na popularności w całej branży technologicznej. Silnik Kubernetes Google (GKE) jest przykładem, wspierając wielodostępność klastrów, umożliwiając efektywny wykorzystanie zasobów i integrację z usługami zewnętrznymi. Tendencja ta jest dalej potwierdzona przez inicjatywy społeczne, takie jak Petals, które oferują rozproszoną sieć do uruchamiania modeli AI, zapewniając dostęp do obliczeń o wysokiej mocy bez znacznych inwestycji. Dodatkowo, platformy takie jak Together.ai zapewniają dostęp do serwerless do szerokiej gamy modeli open-source, upraszczając rozwój i wspierając współpracę. Uwzględnienie takich platform może umożliwić dostęp do zasobów obliczeniowych i współpracy w rozwoju, pomagając zoptymalizować proces rozwoju i zmniejszyć koszty, niezależnie od rozmiaru organizacji.

Podsumowanie

W skali globalnej konieczność powyższych strategii staje się oczywista. Kiedy jeden podmiot dominuje na rynku, hamuje rozwój i utrudnia ustanowienie rozsądnych cen.

Gracze spoza wielkiego techu mogą przeciwdziałać dominacji Nvidii, eksplorując alternatywy takie jak AMD RocM, inwestując w optymalizację wydajności poprzez efektywne algorytmy i techniki przetwarzania równoległego, oraz wspierając współpracę z innymi organizacjami w celu stworzenia zdecentralizowanych klastrów. To promuje bardziej zróżnicowany i konkurencyjny krajobraz w branży sprzętu AI i rozwoju, pozwalając mniejszym graczom mieć głos w przyszłości rozwoju AI.

Te strategie mają na celu zmniejszyć zależność od cen i dostaw Nvidii, zwiększając atrakcyjność inwestycyjną, minimalizując ryzyko spowolnienia rozwoju biznesu wśród konkurencji sprzętowej, oraz wspierając organiczny wzrost w całej branży.

Z ponad 8-letnim doświadczeniem w rozwoju rozwiązań AI i zarządzaniu zespołem w liderach branży, takich jak Meta i VK.com, Sergey posiada solidny rekord innowacji. Jego zaangażowanie w dziedzinie potwierdza również jego wkład w dziedzinie akademickiej, z ponad 6-letnim doświadczeniem w wykładach na najlepszych uczelniach świata, w tym na Lomonosow Moscow State University i Bauman Moscow State Technical University, oraz innych. Z ekspertyzą obejmującą strategię ML, duże dane i operacje w chmurze, wkład Sergeya oparty jest na znaczących osiągnięciach i uznaniu, zarówno w dziedzinie zawodowej, jak i edukacyjnej.