Unghiul lui Anderson
Cum să țineți smartphone-urile cool atunci când rulează modele de învățare automată

Cercetătorii de la Universitatea din Austin și Carnegie Mellon au propus o nouă metodă de a rula modele de învățare automată computațional costisitoare pe dispozitive mobile, cum ar fi smartphone-urile, și pe dispozitive de margine cu putere redusă, fără a declanșa reducerea termică – un mecanism de protecție comun în dispozitivele profesionale și de consum, proiectat pentru a reduce temperatura dispozitivului gazdă prin încetinirea performanței sale, până când se obțin din nou temperaturi de operare acceptabile.
Noile abordări ar putea ajuta la rularea unor modele de învățare automată mai complexe pentru inferență și diverse alte tipuri de sarcini fără a pune în pericol stabilitatea, de exemplu, a smartphone-ului gazdă.
Idea centrală este de a utiliza rețele dinamice, în care greutățile unui model pot fi accesate atât de o versiune “joasă presiune” cât și de o versiune “intensitate completă” a modelului local de învățare automată.
În cazurile în care operațiunea modelului local de învățare automată ar trebui să determine o creștere critică a temperaturii dispozitivului, modelul ar trebui să comute dinamic la un model mai puțin solicitant până când temperatura este stabilizată și apoi să revină la versiunea completă.

Sarcinile de test au constat într-un job de clasificare a imaginilor și o sarcină de inferență naturală a limbajului (QNLI) – ambele fiind operațiuni care ar putea implica aplicații mobile de inteligență artificială. Sursă: https://arxiv.org/pdf/2206.10849.pdf
Cercetătorii au efectuat teste de concept pentru modele de viziune computerizată și procesare a limbajului natural (NLP) pe un smartphone Honor V30 Pro din 2019 și pe un Raspberry Pi 4B 4GB.
Rezultatele (pentru smartphone) arată în imaginea de mai jos temperatura dispozitivului gazdă crescând și scăzând odată cu utilizarea. Linile roșii reprezintă un model care rulează fără comutare dinamică.

Deși rezultatele pot părea foarte asemănătoare, ele nu sunt: ceea ce determină temperatura să oscileze pentru liniile albastre (adică utilizând metoda nouă) este comutarea între versiuni mai simple și mai complexe ale modelului. În niciun moment al operațiunii, reducerea termică nu este declanșată.
Ceea ce determină temperatura să crească și să scadă în cazul liniilor roșii este angajarea automată a reducerii termice în dispozitiv, care încetinește operațiunea modelului și crește latența sa.
În ceea ce privește utilizabilitatea modelului, putem vedea în imaginea de mai jos că latența pentru modelul neatins este semnificativ mai mare în timp ce este termic redus:

În același timp, imaginea de mai sus arată aproape nicio variație în latență pentru modelul gestionat de comutarea dinamică, care rămâne răspunzător pe tot parcursul.
Pentru utilizatorul final, o latență ridicată poate însemna o creștere a timpului de așteptare, ceea ce poate duce la abandonarea unei sarcini și nemulțumire cu aplicația care o găzduiește.
În cazul sistemelor NLP (în loc de viziune computerizată), timpii de răspuns ridicați pot fi și mai neliniștitori, deoarece sarcinile pot depinde de răspunsuri prompte (cum ar fi auto-traducere sau utilități pentru a ajuta utilizatorii cu dizabilități).
Pentru aplicații cu adevărat critice din punct de vedere al timpului – cum ar fi realitatea virtuală în timp real / realitatea augmentată – o latență ridicată ar putea, în esență, distruge utilitatea modelului.
Cercetătorii afirmă:
‘Susținem că reducerea termică reprezintă o amenințare gravă pentru aplicațiile mobile de învățare automată care sunt critice din punct de vedere al latenței. De exemplu, în timpul renderizării vizuale în timp real pentru streaming video sau jocuri, o creștere bruscă a latenței de procesare pe cadru va avea un efect negativ semnificativ asupra experienței utilizatorului. De asemenea, sistemele de operare mobile moderne oferă adesea servicii și aplicații speciale pentru persoanele cu deficiențe de vedere, cum ar fi VoiceOver pe iOS și TalkBack pe Android. ‘
‘Utilizatorul interacționează de obicei cu telefoanele mobile prin intermediul vorbirii, așa că calitatea acestor servicii depinde foarte mult de răspunsul sau latența aplicației.’

Grafice care demonstrează performanța BERT w50 d50 neatinsă (roșu) și ajutată de comutarea dinamică (albastră). Observați uniformitatea latenței în comutarea dinamică (albastră).
Articolul este intitulat articolul și este o colaborare între doi cercetători de la UoA; unul de la Carnegie Mellon; și unul reprezentând ambele instituții.
Inteligență Artificială Mobilă pe bază de CPU
Deși comutarea dinamică și arhitecturile multiscale sunt o zonă de studiu stabilită și activă, majoritatea inițiativelor s-au concentrat pe dispozitive de calcul de înaltă performanță, iar efortul actual este împărțit între optimizarea intensă a rețelelor neuronale locale (adică bazate pe dispozitiv) și îmbunătățirea hardware-ului mobil dedicat.
Testele efectuate de cercetători au fost realizate pe procesoare CPU și nu pe procesoare GPU. În ciuda creșterii interesului pentru a utiliza resursele locale GPU în aplicații de învățare automată mobilă (și chiar antrenarea direct pe dispozitive mobile, ceea ce ar putea îmbunătăți calitatea modelului final), procesoarele GPU consumă în general mai multă putere, un factor critic în efortul inteligenței artificiale de a fi independentă (de servicii cloud) și utilă într-un dispozitiv cu resurse limitate.
Testarea Compartirii Greutăților
Rețelele testate pentru proiect au fost rețele subțiri și DynaBERT, reprezentând, respectiv, o sarcină de viziune computerizată și o sarcină bazată pe limbaj natural.
Deși au existat diverse inițiative de a crea iterații ale BERT care să ruleze eficient și economic pe dispozitive mobile, unele dintre aceste încercări au fost criticate ca fiind soluții ocolite, iar cercetătorii noului articol observă că utilizarea BERT în spațiul mobil este o provocare și că ‘modelele BERT în general sunt prea intensiv computațional pentru telefoanele mobile’.
DynaBERT este o inițiativă chineză de a optimiza cadrul puternic NLP/NLU al Google în contextul unui mediu sărac în resurse; dar chiar și această implementare a BERT, cercetătorii au descoperit, a fost foarte solicitantă.
În ciuda acestor fapte, pe ambele dispozitive, smartphone și Raspberry PI, autorii au efectuat două experimente. În experimentul de viziune computerizată, o imagine aleasă aleatoriu a fost procesată continuu și repetitiv în ResNet50 ca o sarcină de clasificare și a putut rula stabil și fără a declanșa reducerea termică pe întreaga durată a experimentului.
Articolul afirmă:
‘Deși poate sacrifica o anumită precizie, comutarea dinamică propusă are o viteză de inferență mai rapidă. Cel mai important, abordarea noastră de comutare dinamică se bucură de o inferență consistentă.’

Rularea ResNet50 neatinsă și cu comutarea dinamică între Slimmable ResNet50 x1.0 și versiunea x0.25 pe o sarcină de clasificare a imaginilor continuă, timp de 60 de minute.
Pentru testele NLP, autorii au setat experimentul să comute între cele mai mici două modele din suita DynaBERT, dar au descoperit că la 1,4X latență, BERT reduce la aproximativ 70°. Ei au setat, prin urmare, comutarea la jos să aibă loc atunci când temperatura de operare a atins 65°.
Experimentul BERT a implicat rularea continuă a instalării pe o pereche de întrebare și răspuns din setul de date ONLI al GLUE.
Schimburile de latență și precizie au fost mai severe cu sarcina ambițioasă BERT decât pentru implementarea de viziune computerizată, iar precizia a venit la un preț mai mare al nevoii de a controla temperatura dispozitivului, pentru a evita reducerea termică:

Latență vs precizie pentru experimentele cercetătorilor în cele două sarcini.
Autorii observă:
‘Comutarea dinamică, în general, nu poate preveni modelele BERT să nu fie reduse termic, din cauza intensității computaționale uriașe a modelului. Cu toate acestea, sub anumite limitări, comutarea dinamică poate fi încă utilă atunci când se implementează modele BERT pe telefoane mobile.’
Autorii au descoperit că modelele BERT determină temperatura CPU a telefonului Honor V30 să crească la 80° în mai puțin de 32 de secunde și vor declanșa reducerea termică în mai puțin de șase minute de activitate. Prin urmare, autorii au utilizat doar modele BERT cu jumătate de lățime.
Experimentele au fost repetate pe configurația Raspberry PI, iar tehnica a fost capabilă și în acest mediu să prevină declanșarea reducerii termice. Cu toate acestea, autorii observă că Raspberry PI nu funcționează sub aceleași constrângeri termice extreme ca un smartphone încărcat strâns, și par să fi adăugat această serie de experimente ca o demonstrație suplimentară a eficacității metodei în medii de procesare modest echipate.
Publicat pentru prima dată pe 23 iunie 2022.












