Modele i platformy AI
Nauka Całkowicie Na Urządzeniu Jest Bardziej Dostępna Dzięki Nowej Technice Szkoleniowej

Zespół badaczy z MIT i MIT-IBM Watson AI Lab opracował nową technikę, która umożliwia szkolenie na urządzeniu przy użyciu mniej niż kwartał megabajta pamięci. Nowy rozwój jest imponującym osiągnięciem, ponieważ inne rozwiązania szkoleniowe zwykle wymagają więcej niż 500 megabajtów pamięci, co przekracza 256-kilobajtową pojemność większości mikrokontrolerów.
Szkolenie modelu machine learning na inteligentnym urządzeniu krawędzi pozwala mu dostosować się do nowych danych i lepiej przewidywać. Jak jednak powiedziano, proces szkolenia zwykle wymaga dużej ilości pamięci, więc często jest prowadzony na komputerach w centrum danych przed wdrożeniem modelu na urządzeniu. Ten proces jest znacznie droższy i budzi obawy dotyczące prywatności w porównaniu z nową techniką opracowaną przez zespół.
Badacze opracowali algorytmy i ramy w taki sposób, aby zmniejszyć ilość obliczeń potrzebnych do szkolenia modelu, co sprawia, że proces jest szybszy i bardziej wydajny pamięciowo. Technika ta może pomóc w szkoleniu modelu machine learning na mikrokontrolerze w zaledwie kilka minut.
Nowa technika również pomaga w kwestiach prywatności, ponieważ przechowuje dane na urządzeniu, co jest ważne, gdy są zaangażowane dane wrażliwe. Równocześnie ramy poprawiają dokładność modelu w porównaniu z innymi podejściami.
Song Han jest associate profesorem w Departamencie Inżynierii Elektrycznej i Nauk Komputerowych (EECS), członkiem MIT-IBM Watson AI Lab i seniorem autorem artykułu badawczego.
“Nasze badanie umożliwia urządzeniom IoT nie tylko wykonywanie inferencji, ale także ciągłe aktualizowanie modeli AI do nowo zebranych danych, otwierając drogę do nauki całkowicie na urządzeniu”, powiedział Han. „Niskie wykorzystanie zasobów sprawia, że głębokie uczenie się staje się bardziej dostępne i może mieć szerszy zasięg, szczególnie dla urządzeń krawędzi o niskim zużyciu mocy.”
Artykuł zawiera współautorów i doktorantów Ji Lin i Ligeng Zhu, a także postdoktorantów Wei-Ming Chen i Wei-Chen Wang. Zawiera również Chuang Gan, głównego członka personelu badawczego w MIT-IBM Watson AI Lab.
Udoskonalenie Procesu Szkolenia
Aby uczynić proces szkolenia bardziej wydajnym i mniej wymagającym pamięci, zespół oparł się na dwóch rozwiązaniach algorytmicznych. Pierwsze z nich to tzw. rzadka aktualizacja, która wykorzystuje algorytm, który identyfikuje najważniejsze wagi do aktualizacji podczas każdej rundy szkolenia. Algorytm zamarza wagi jeden po drugim, aż dokładność spadnie poniżej pewnego progu, w którym to momencie zatrzymuje się. Pozostałe wagi są następnie aktualizowane, a aktywacje odpowiadające zamrożonym wagom nie muszą być przechowywane w pamięci.
“Aktualizacja całego modelu jest bardzo kosztowna, ponieważ jest wiele aktywacji, więc ludzie tendencję mają aktualizować tylko ostatnią warstwę, ale jak można się spodziewać, to szkodzi dokładności”, powiedział Han. „W naszej metodzie selektywnie aktualizujemy te ważne wagi i upewniamy się, że dokładność jest w pełni zachowana.”
Drugie rozwiązanie opracowane przez zespół dotyczy kwantyzacji szkolenia i uproszczenia wag. Algorytm najpierw zaokrągla wagi do zaledwie ośmiu bitów za pomocą procesu kwantyzacji, który również zmniejsza ilość pamięci potrzebnej do szkolenia i inferencji, przy czym inferencja jest procesem stosowania modelu do zestawu danych i generowania przewidywania. Następnie algorytm opiera się na technice zwanej kwantyzacją z uwzględnieniem skalowania (QAS), która działa jak mnożnik do dostosowania stosunku między wagą a gradientem. Pomaga to uniknąć spadku dokładności, który mógłby wyniknąć z kwantyzacji szkolenia.
Badacze opracowali system zwany małym silnikiem szkoleniowym, który uruchamia innowacje algorytmiczne na prostym mikrokontrolerze bez systemu operacyjnego. Aby wykonać więcej pracy na etapie kompilacji, przed wdrożeniem modelu na urządzeniu krawędzi, system zmienia kolejność kroków w procesie szkolenia.
“Wprowadzamy wiele obliczeń, takich jak auto-różniczkowanie i optymalizacja grafu, do czasu kompilacji. Agresywnie również przycinamy redundancje operatorów, aby wspierać rzadkie aktualizacje. Raz na czasie wykonywania, mamy znacznie mniej pracy do wykonania na urządzeniu”, mówi Han.
Bardzo Wydajna Technika
Podczas gdy tradycyjne techniki zaprojektowane do lekkiego szkolenia zwykle wymagałyby około 300 do 600 megabajtów pamięci, optymalizacja zespołu wymagała tylko 157 kilobajtów, aby szkolić model machine learning na mikrokontrolerze.
Ramę przetestowano, szkoląc model widzenia komputerowego do wykrywania ludzi na obrazach, i nauczył się wykonywać to zadanie w zaledwie 10 minut. Metoda była również w stanie szkolić model ponad 20 razy szybciej niż inne metody.
Badacze będą teraz starać się zastosować te techniki do modeli językowych i różnych typów danych. Chcą również wykorzystać tę zdobytą wiedzę, aby zmniejszyć większe modele bez utraty dokładności, co mogłoby również pomóc w zmniejszeniu śladu węglowego szkolenia dużych modeli machine learning.












