Modele i platformy AI

Naukowcy tworzą alternatywę dla GPU

mm
Dodaj Unite.AI do preferowanych źródeł w Google

Naukowcy komputerowi z Rice University, wraz z współpracownikami z Intel (INTC ), opracowali bardziej efektywną alternatywę dla GPU. Nowy algorytm nosi nazwę “silnik głębokiego uczenia się o podlinearnej złożoności” (SLIDE), a używa ogólnego procesora centralnego (CPU) bez specjalistycznego sprzętu przyspieszającego.

Wyniki zostały przedstawione w Austin Convention Center, który organizuje konferencję systemów uczenia maszynowego MLSys.

Jednym z największych wyzwań w dziedzinie sztucznej inteligencji (AI) są specjalistyczne urządzenia przyspieszające, takie jak procesory graficzne (GPU). Przed nowymi odkryciami uważano, że aby przyspieszyć technologie głębokiego uczenia, konieczne jest użycie specjalistycznego sprzętu przyspieszającego.

Wiele firm przykłada dużą wagę do inwestowania w GPU i specjalistyczny sprzęt do głębokiego uczenia, który jest odpowiedzialny za takie technologie, jak asystenci cyfrowi, rozpoznawanie twarzy i systemy rekomendacji produktów. Jedną z takich firm jest Nvidia (NVDA ), która tworzy procesory graficzne Tesla (TSLA ) V100 Tensor Core. Nvidia niedawno zgłosiła 41% wzrost przychodów w czwartym kwartale w porównaniu z zeszłym rokiem.

Rozwój SLIDE otwiera całkowicie nowe możliwości.

Anshumali Shrivastava jest adiunktem w Szkole Inżynierskiej Rice i pomógł wynaleźć SLIDE wraz ze studentami Beidi Chen i Tharun Medini.

“Nasze testy pokazują, że SLIDE jest pierwszą inteligentną implementacją algorytmiczną głębokiego uczenia na CPU, która może przewyższyć sprzętowe przyspieszanie GPU w przypadku zbiorów danych rekomendacji na dużą skalę z dużymi, w pełni połączonymi architekturami”, powiedział Shrivastava.

SLIDE pokonuje wyzwanie GPU dzięki całkowicie odmiennemu podejściu do głębokiego uczenia. Obecnie standardową techniką szkolenia sieci neuronowych jest “wsteczna propagacja”, która wymaga mnożenia macierzy. To obciążenie wymaga użycia GPU, więc naukowcy zmienili szkolenie sieci neuronowej, aby mogło być rozwiązane za pomocą tabel skrótowych.

To nowe podejście znacznie redukuje obciążenie obliczeniowe dla SLIDE. Bieżąca najlepsza platforma GPU, którą firmy takie jak Amazon (AMZN ) i Google (GOOGL ) używają do chmury głębokiego uczenia, składa się z ośmiu Tesla V100, a cena wynosi około 100 000 dolarów.

“Mamy jeden w laboratorium, a w naszym teście wzięliśmy obciążenie, które jest idealne dla V100, z ponad 100 milionami parametrów w dużych, w pełni połączonych sieciach, które mieszczą się w pamięci GPU”, powiedział Shrivastava. “Uczono go z najlepszym (oprogramowaniem) dostępnym, Google TensorFlow, i zajęło to 3,5 godziny.

“Następnie pokazaliśmy, że nasz nowy algorytm może przeprowadzić szkolenie w ciągu jednej godziny, nie na GPU, ale na 44-rdzeniowym procesorze Xeon”, kontynuował.

Skrótowanie jest rodzajem metody indeksowania danych wynalezionym w latach 90. dla wyszukiwania internetowego. Metody numeryczne są używane do zakodowania dużych ilości informacji jako ciągu cyfr, zwanego skrótem. Skróty są wykorzystywane do tworzenia tabel, które mogą być szybko wyszukiwane.

“Nie miałoby to sensu wdrożyć naszego algorytmu w TensorFlow lub PyTorch, ponieważ pierwszą rzeczą, którą chcą zrobić, jest przekształcenie tego, co robisz, w problem mnożenia macierzy”, powiedział Chen. “To jest dokładnie to, czego chcieliśmy uniknąć. Więc napisaliśmy własny kod C++ od podstaw”.

Według Shrivastavy największą zaletą SLIDE jest to, że jest równoległy do danych.

“Przez równoległość do danych mam na myśli, że jeśli mam dwa przypadki danych, które chcę przeszkolić, powiedzmy, jeden to obraz kota, a drugi to autobus, to prawdopodobnie aktywują różne neurony, a SLIDE może je aktualizować lub szkolić niezależnie”, powiedział. “To jest znacznie lepsze wykorzystanie równoległości dla CPU”.

“Odwrotną stroną, w porównaniu z GPU, jest to, że wymagamy dużej ilości pamięci”, powiedział. “Istnieje hierarchia pamięci podręcznej w pamięci głównej, a jeśli nie będziemy ostrożni, możemy napotkać problem zwany kasowaniem pamięci podręcznej, w którym występuje wiele nieudanych odczytów pamięci”.

SLIDE otworzył drzwi do nowych sposobów wdrażania głębokiego uczenia, a Shrivastava uważa, że to dopiero początek.

“Tylko dotknęliśmy powierzchni”, powiedział. “Jest jeszcze wiele rzeczy, które możemy zrobić, aby zoptymalizować. Nie użyliśmy wektorowania, na przykład, lub wbudowanych przyspieszaczy w CPU, takich jak Intel Deep Learning Boost. Jest wiele innych sztuczek, które możemy wykorzystać, aby to uczynić jeszcze szybszym”.

Alex McFarland jest dziennikarzem i pisarzem zajmującym się sztuczną inteligencją, który bada najnowsze rozwoje w dziedzinie sztucznej inteligencji. Współpracował z licznymi startupami i wydawnictwami związanymi z sztuczną inteligencją na całym świecie.