Liderzy opinii
Przyszłość Sztucznej Inteligencji Generatywnej to Krawędź

Pojawienie się ChatGPT i ogólnie Sztucznej Inteligencji Generatywnej jest przełomowym momentem w historii technologii, porównywanym do początku ery Internetu i smartfonów. Sztuczna Inteligencja Generatywna wykazała nieograniczone możliwości w prowadzeniu inteligentnych rozmów, zdawaniu egzaminów, generowaniu złożonych programów/kodu oraz tworzeniu przyciągających wzrok obrazów i filmów. Chociaż procesory GPU uruchamiają większość modeli AI w chmurze – zarówno do szkolenia, jak i inferencji – nie jest to długoterminowe rozwiązanie skalowalne, szczególnie dla inferencji, ze względu na czynniki takie jak koszt, moc, opóźnienie, prywatność i bezpieczeństwo. Ten artykuł omawia każdy z tych czynników wraz z motywującymi przykładami, aby przenieść obciążenia obliczeniowe AI do krawędzi.
Większość aplikacji działa na wysokowydajnych procesorach – albo na urządzeniu (np. smartfonach, komputerach stacjonarnych, laptopach) lub w centrach danych. W miarę wzrostu udziału aplikacji wykorzystujących AI, te procesory z tylko procesorami CPU są niewystarczające. Ponadto gwałtowny wzrost obciążeń Sztucznej Inteligencji Generatywnej powoduje wykładniczy wzrost zapotrzebowania na serwery z AI z drogimi, energochłonnymi procesorami GPU, co z kolei powoduje wzrost kosztów infrastruktury. Te serwery z AI mogą kosztować nawet 7-krotnie więcej niż zwykły serwer, a procesory GPU stanowią 80% tego dodatkowego kosztu.
Dodatkowo, serwer w chmurze zużywa 500W do 2000W, podczas gdy serwer z AI zużywa między 2000W a 8000W – 4-krotnie więcej! Aby obsłużyć te serwery, centra danych potrzebują dodatkowych modułów chłodzących i ulepszeń infrastruktury – co może być nawet wyższe niż inwestycja w obliczenia. Centra danych już teraz zużywają 300 TWh rocznie, prawie 1% całkowitego światowego zużycia energii. Jeśli trendy wdrażania AI będą kontynuowane, to do 2030 roku centra danych mogą zużywać aż 5% światowego zużycia energii. Ponadto, jest bezprecedensowa inwestycja w centra danych Sztucznej Inteligencji Generatywnej. Szacuje się, że centra danych zużyją do 500 miliardów dolarów na wydatki inwestycyjne do 2027 roku, głównie napędzane przez wymagania infrastruktury AI.

Zużycie energii przez centra danych, już 300 TWh, znacznie wzrośnie wraz z wdrożeniem sztucznej inteligencji generatywnej.
Koszt obliczeń AI, a także zużycie energii, będą hamować powszechne wdrożenie Sztucznej Inteligencji Generatywnej. Wyzwania skalowalności można pokonać, przenosząc obciążenia obliczeniowe AI do krawędzi i wykorzystując rozwiązania przetwarzania zoptymalizowane pod kątem obciążeń AI. Z takim podejściem, klient zyskuje również inne korzyści, w tym opóźnienie, prywatność, niezawodność oraz zwiększoną możliwość.
Obliczenia idą za danymi do Krawędzi
Odkąd dekadę temu, kiedy AI wyłoniła się ze świata akademickiego, szkolenie i inferencja modeli AI odbywały się w chmurze/centrum danych. Ponieważ wiele danych jest generowanych i konsumowanych na krawędzi – szczególnie wideo – miało sens przenieść inferencję danych do krawędzi, co poprawiłoby całkowity koszt posiadania (TCO) dla przedsiębiorstw ze względu na zmniejszone koszty sieciowe i obliczeniowe. Podczas gdy koszty inferencji AI w chmurze są powtarzalne, koszt inferencji na krawędzi jest jednorazowym wydatkiem na sprzęt. Podstawowe AI procesory krawędziowe zmniejszają ogólne koszty operacyjne. Jak w przypadku migracji konwencjonalnych obciążeń AI do Krawędzi (np. urządzenia, urządzenia), obciążenia Sztucznej Inteligencji Generatywnej będą podążać tym samym tropem. To przyniesie znaczne oszczędności przedsiębiorstwom i konsumentom.
Przeniesienie do krawędzi w połączeniu z wydajnym przyspieszaczem AI do wykonywania funkcji inferencji dostarcza również innych korzyści. Przede wszystkim jest to opóźnienie. Na przykład w aplikacjach gier, postacie niezależne (NPC) mogą być kontrolowane i rozszerzane przy użyciu sztucznej inteligencji generatywnej. Używając modeli LLM działających na przyspieszaczach AI krawędzi w konsoli gier lub komputerze, gracze mogą nadać tym postaciom określone cele, aby mogły one znacząco uczestniczyć w historii. Niskie opóźnienie z lokalnej inferencji krawędzi pozwoli postaciom NPC na odpowiedź na polecenia i działania graczy w czasie rzeczywistym. To dostarczy bardzo immersyjne doświadczenie gry w sposób ekonomiczny i efektywny pod względem energii.
W aplikacjach takich jak opieka zdrowotna, prywatność i niezawodność są niezwykle ważne (np. ocena pacjenta, zalecenia leków). Dane i powiązane z nimi modele AI muszą być na miejscu, aby chronić dane pacjentów (prywatność), a awarie sieci, które zablokują dostęp do modeli AI w chmurze, mogą być katastrofalne. Urządzenie AI krawędziowe z modelem AI Generatywnej, stworzonym specjalnie dla każdego klienta przedsiębiorstwa – w tym przypadku dostawcy opieki zdrowotnej – może bezproblemowo rozwiązać problemy z prywatnością i niezawodnością, jednocześnie dostarczając niższe opóźnienie i koszty.

Sztuczna Inteligencja Generatywna na urządzeniach krawędziowych zapewni niskie opóźnienie w grach i zachowa dane pacjentów, poprawiając niezawodność w opiece zdrowotnej.
Wiele modeli AI działających w chmurze może mieć nawet bilion parametrów – te modele mogą skutecznie rozwiązywać ogólne pytania. Jednak aplikacje specyficzne dla przedsiębiorstw wymagają, aby modele dostarczały wyniki istotne dla przypadku użycia. Weźmy przykład asystenta opartego na AI Generatywnej, stworzonego do przyjmowania zamówień w restauracji fast food – aby ten system miał płynną interakcję z klientem, podstawowy model AI musi być przeszkolony na menu restauracji, znając również alergeny i składniki. Rozmiar modelu można zoptymalizować, używając nadzbiornika Dużego Modelu Językowego (LLM), aby przeszkolić stosunkowo mały model LLM o 10-30 miliardach parametrów, a następnie użyć dodatkowego dostrajania z danymi specyficznymi dla klienta. Taki model może dostarczyć wyniki zwiększonej dokładności i możliwości. A ze względu na mniejszy rozmiar modelu, może być skutecznie wdrożony na przyspieszaczach AI krawędzi.
Sztuczna Inteligencja Generatywna zwycięży na Krawędzi
Zawsze będzie potrzeba Sztucznej Inteligencji Generatywnej działającej w chmurze, szczególnie dla aplikacji ogólnego przeznaczenia, takich jak ChatGPT i Claude. Ale gdy chodzi o aplikacje specyficzne dla przedsiębiorstw, takie jak wypełnienie generatywne Adobe Photoshop lub Github Copilot, Sztuczna Inteligencja Generatywna na Krawędzi nie jest tylko przyszłością, ale także teraźniejszością. Przyspieszacze AI stworzone specjalnie dla tego celu są kluczem do tego. especially for general-purpose applications like ChatGPT and Claude. But when it comes to enterprise specific applications, such as Adobe Photoshop’s generative fill or Github copilot, Generative AI at Edge is not only the future, it’s also the present. Purpose-built AI accelerators are the key to making this possible.












