Liderzy opinii

Ulepszanie Inferencji AI: Zaawansowane Techniki i Najlepsze Praktyki

mm
Dodaj Unite.AI do preferowanych źródeł w Google

W przypadku aplikacji AI w czasie rzeczywistym, takich jak samochody bezzałogowe lub monitoring zdrowia, nawet dodatkowa sekunda do przetworzenia wejścia może mieć poważne konsekwencje. Aplikacje AI w czasie rzeczywistym wymagają niezawodnych procesorów GPU i mocy obliczeniowej, co było bardzo drogie i ograniczające dla wielu aplikacji – do teraz.

Przyjmując optymalny proces inferencji, firmy mogą nie tylko maksymalizować wydajność AI, ale także zmniejszyć zużycie energii i koszty operacyjne (o 90%); poprawić prywatność i bezpieczeństwo; oraz nawet poprawić satysfakcję klientów.

Typowe problemy z inferencją

Niektóre z najczęstszych problemów, z którymi spotykają się firmy w zakresie zarządzania wydajnością AI, obejmują niewykorzystane klastry GPU, domyślne ogólne modele i brak wglądu w związane z tym koszty.

Zespoły często przydzielają klastry GPU dla obciążeń szczytowych, ale między 70 a 80 procent czasu są one niewykorzystane z powodu nierównych przepływów pracy.

Ponadto zespoły domyślnie wybierają duże ogólne modele (GPT-4, Claude) nawet dla zadań, które mogą być uruchamiane na mniejszych, tańszych modelach open-source. Powodem jest brak wiedzy i stroma krzywa uczenia się przy budowaniu niestandardowych modeli.

Wreszcie, inżynierowie zwykle nie mają wglądu w rzeczywisty koszt każdego żądania, co prowadzi do wysokich rachunków. Narzędzia takie jak PromptLayer, Helicone mogą pomóc w zapewnieniu tego wglądu.

Brak kontroli nad wyborem modelu, partiami i wykorzystaniem może spowodować, że koszty inferencji wzrosną wykładniczo (o 10 razy), zmarnują zasoby, ograniczą dokładność i pogorszą doświadczenie użytkownika.

Zużycie energii i koszty operacyjne

Uruchamianie większych modeli LLM, takich jak GPT-4, Llama 3 70B lub Mixtral-8x7B, wymaga znacznie więcej mocy na token. Średnio 40 do 50 procent energii zużywanej przez centrum danych zasilają urządzenia komputerowe, a dodatkowe 30 do 40 procent jest poświęcone na chłodzenie urządzeń.

Dlatego dla firmy, która działa przez całą dobę w celu inferencji na dużą skalę, korzystniej jest rozważyć dostawcę na miejscu zamiast dostawcy chmury, aby uniknąć płacenia premii za koszt i zużycie więcej energii.

Prywatność i bezpieczeństwo

Według badania Cisco z 2025 r. dotyczącego ochrony danych, „64% respondentów martwi się o nieumyślne udostępnienie poufnych informacji publicznie lub konkurentom, a prawie połowa przyznaje, że wprowadza dane osobowe pracowników lub niepubliczne do narzędzi GenAI.” To zwiększa ryzyko niezgodności, jeśli dane są nieprawidłowo rejestrowane lub buforowane. Inną okazją do ryzyka jest uruchamianie modeli w różnych organizacjach klientów na wspólnej infrastrukturze; może to prowadzić do naruszeń danych i problemów z wydajnością, a także istnieje ryzyko, że działania jednego użytkownika wpłyną na innych użytkowników. Stąd przedsiębiorstwa zwykle preferują usługi wdrożone w ich chmurze.

Satysfakcja klientów

Gdy odpowiedzi zajmują więcej niż kilka sekund, użytkownicy zwykle odpadają, wspierając starania inżynierów, aby zoptymalizować wszystko pod kątem zerowej latencji. Ponadto aplikacje przedstawiają „przeszkody, takie jak halucynacje i niedokładności, które mogą ograniczyć powszechne wpływy i przyjęcie”, według komunikatu prasowego Gartner.

Korzyści biznesowe z zarządzania tymi problemami

Optymalizacja partii, wybór odpowiednich modeli (np. przełączenie z Llama 70B lub zamkniętych modeli, takich jak GPT, na Gemma 2B, gdzie jest to możliwe) i poprawa wykorzystania GPU mogą obciąć rachunki za inferencję o 60 do 80 procent. Używanie narzędzi, takich jak vLLM, może pomóc, podobnie jak przełączenie na model serwerowy oparty na płatności za korzystanie z chmury dla spiętego przepływu pracy.

Weźmy na przykład Cleanlab. Cleanlab uruchomił Model Języka Godnego Zaufania (TLM), aby dodać wynik godny zaufania do każdej odpowiedzi LLM. Został zaprojektowany do wysokiej jakości danych wyjściowych i zwiększonej niezawodności, co jest kluczowe dla aplikacji przedsiębiorstw, aby zapobiec niekontrolowanym halucynacjom. Przed Inferless Cleanlabs doświadczył zwiększonych kosztów GPU, ponieważ GPU działały nawet wtedy, gdy nie były aktywnie używane. Ich problemy były typowe dla tradycyjnych dostawców chmury GPU: wysoka latencja, niewydajne zarządzanie kosztami i skomplikowane środowisko do zarządzania. Z serwerową inferencją obcięli koszty o 90 procent, utrzymując poziom wydajności. Co więcej, uruchomili się w ciągu dwóch tygodni bez dodatkowych kosztów nakładów inżynieryjnych.

Optymalizacja architektury modelu

Modele podstawowe, takie jak GPT i Claude, są często szkolone pod kątem ogólności, a nie wydajności lub konkretnych zadań. Nie dostosowując modeli open-source do konkretnych przypadków użycia, firmy marnują pamięć i czas obliczeniowy dla zadań, które nie wymagają tej skali.

Nowe chipy GPU, takie jak H100, są szybkie i wydajne. Są one szczególnie ważne podczas uruchamiania dużych operacji, takich jak generowanie wideo lub zadania związane z AI. Więcej rdzeni CUDA zwiększa prędkość przetwarzania, przewyższając mniejsze GPU; rdzenie tensorowe NVIDIA (NVDA ) są zaprojektowane do przyspieszania tych zadań na dużą skalę.

Pamięć GPU jest również ważna w optymalizacji architektury modelu, ponieważ duże modele AI wymagają znacznej ilości miejsca. Ta dodatkowa pamięć umożliwia GPU uruchamianie większych modeli bez kompromisów w zakresie prędkości. Odwrotnie, wydajność mniejszych GPU z mniejszą pamięcią VRAM cierpi, ponieważ przenoszą dane do wolniejszej pamięci RAM.

Kilka korzyści z optymalizacji architektury modelu obejmuje oszczędność czasu i pieniędzy. Po pierwsze, przełączenie z gęstego transformatora na warianty zoptymalizowane pod kątem LoRA lub FlashAttention może zredukować czas odpowiedzi o 200-400 milisekund na zapytanie, co jest kluczowe w czatach i grach, na przykład. Dodatkowo kwantyfikowane modele (takie jak 4-bitowe lub 8-bitowe) wymagają mniej pamięci VRAM i działają szybciej na tańszych GPU.

W długiej perspektywie optymalizacja architektury modelu oszczędza pieniądze na inferencję, ponieważ zoptymalizowane modele mogą działać na mniejszych chipach.

Optymalizacja architektury modelu obejmuje następujące kroki:

  • Kwantyzacja — redukcja precyzji (FP32 → INT4/INT8), oszczędność pamięci i przyspieszenie czasu obliczeń
  • Pruning — usuwanie mniej przydatnych wag lub warstw (uporządkowanych lub nieuporządkowanych)
  • Destylacja — szkolenie mniejszego „uczniowskiego” modelu, aby naśladować dane wyjściowe większego modelu

Kompresja rozmiaru modelu

Mniejsze modele oznaczają szybszą inferencję i mniej kosztowną infrastrukturę. Duże modele (13B+, 70B+) wymagają drogich GPU (A100, H100), dużej pamięci VRAM i więcej mocy. Kompresja ich umożliwia uruchamianie na tańszym sprzęcie, takim jak A10 lub T4, z znacznie mniejszą latencją.

Kompresja modelu jest również kluczowa dla uruchamiania na urządzeniu (telefony, przeglądarki, IoT) inferencji, ponieważ mniejsze modele umożliwiają obsługę większej liczby jednoczesnych żądań bez skalowania infrastruktury. W czacie z ponad 1000 jednoczesnymi użytkownikami przejście z modelu 13B do skompresowanego modelu 7B pozwoliło jednej grupie na obsługę ponad dwukrotnie większej liczby użytkowników na GPU bez spadku wydajności.

Wykorzystanie specjalistycznego sprzętu

Procesory CPU ogólnego przeznaczenia nie są zaprojektowane do operacji tensorowych. Specjalistyczny sprzęt, taki jak NVIDIA A100, H100, Google TPUs lub AWS Inferentia, może zapewnić szybszą inferencję (o 10-100 razy) dla LLM z lepszą wydajnością energetyczną. Obcinanie nawet 100 milisekund na żądanie może mieć znaczenie przy przetwarzaniu milionów żądań dziennie.

Rozważmy ten hipotetyczny przykład:

Zespół uruchamia LLaMA-13B na standardowych GPU A10 dla swojego wewnętrznego systemu RAG. Latencja wynosi około 1,9 sekundy, a nie mogą one partii z powodu limitów pamięci VRAM. Przechodzą więc na H100 z TensorRT-LLM, włączają FP8 i zoptymalizowany jądro uwagi, zwiększając rozmiar partii z 8 do 64. Wynikiem jest obcinanie latencji do 400 milisekund z pięciokrotnym wzrostem przepływności.
W rezultacie mogą obsłużyć pięciokrotnie więcej żądań na tym samym budżecie i uwolnić inżynierów od nawigowania wokół wąskich gardeł infrastruktury.

Ocena opcji wdrożeniowych

Różne procesy wymagają różnych infrastruktur; czatbota z 10 użytkownikami i wyszukiwarki obsługującej milion zapytań dziennie mają różne potrzeby. Wszystko-in-one (np. AWS Sagemaker) lub DIY serwery GPU bez oceny wskaźników kosztów i wydajności prowadzi do marnowania pieniędzy i złego doświadczenia użytkownika. Należy zauważyć, że jeśli wcześnie zobowiążesz się do zamkniętego dostawcy chmury, późniejsze przeniesienie rozwiązania będzie bolesne. Jednak wczesna ocena z modelem pay-as-you-go daje opcje w przyszłości.

Ocena obejmuje następujące kroki:

  • Pomiar latencji modelu i kosztów na platformach: Uruchom testy A/B na AWS, Azure, lokalnych klastrach GPU lub narzędziach serwerowych, aby odtworzyć.
  • Pomiar wydajności startu: Jest to szczególnie ważne dla serwerowych lub wyzwalanych zdarzeniami obciążeń, ponieważ modele są ładowane szybciej.
  • Ocena obserwowalności i limitów skalowania: Ocena dostępnych metryk i identyfikacja maksymalnych zapytań na sekundę przed degradacją.
  • Sprawdzenie obsługi zgodności: Określenie, czy można egzekwować reguły danych związane z geolokalizacją lub rejestrować dzienniki.
  • Oszacowanie całkowitego kosztu posiadania. Powinno to obejmować godziny GPU, pamięć, przepustowość i nakłady na zespoły.

Podsumowanie

Inferencja umożliwia firmom optymalizację wydajności AI, obniżenie zużycia energii i kosztów, utrzymanie prywatności i bezpieczeństwa oraz utrzymanie zadowolenia klientów.

Aishwarya Goel jest współzałożycielem i dyrektorem generalnym Inferless, platformy serwerless z funkcjami stanowymi, która pomaga deweloperom wdrażać niestandardowe i otwarte modele z niskimi czasami rozruchu i wydajnym skalowaniem.