Andersonin kulma
Miten pitää älypuhelimen jäähtyvässä, kun se suorittaa koneoppimismalleja

Tutkijat Austinin yliopistosta ja Carnegie Mellonista ovat ehdottaneet uutta tapaa suorittaa laskennallisesti vaativia koneoppimismalleja mobiililaitteissa, kuten älypuhelimissa, ja matalatehoisissa laitteissa, ilman että laite joutuu termisen rajoituksen – yleinen suojamekanismi ammattilaisten ja kuluttajien laitteissa, joka on suunniteltu alentamaan laitteen lämpötilaa hidastamalla sen suorituskykyä, kunnes hyväksyttävät käyttölämpötilat saavutetaan uudelleen.
Uusi lähestymistapa voisi auttaa monimutkaisempien ML-mallien suorittamisessa ja erilaisissa tehtävissä ilman, että se uhkaa esimerkiksi isännän älypuhelimen vakautta.
Keskeinen idea on käyttää dynaamisia verkkoja, joissa mallin painot voidaan käyttää sekä “matalapaineisen” että “täysitehoisen” paikallisen koneoppimismallin versiolla.
Tapauksissa, joissa paikallisen koneoppimismallin toiminnan pitäisi aiheuttaa laitteen lämpötilan kriittinen nousu, malli vaihtaa dynaamisesti vähemmän vaativaan malliin, kunnes lämpötila stabiloituu, ja sitten vaihtaa takaisin täysiveroiseen versioon.

Kokeelliset tehtävät koostuivat kuvien luokittelutehtävistä ja kysymys-vastaus luonnollisen kielen inference (QNLI) tehtävistä – molemmat ovat tyypillisiä mobiili-ai-sovelluksia. Lähde: https://arxiv.org/pdf/2206.10849.pdf
Tutkijat suorittivat kokeelliset testit tietokoneen näön ja luonnollisen kielen prosessoinnin (NLP) malleille 2019 Honor V30 Pro -älypuhelimella ja Raspberry Pi 4B 4GB:llä.
Tuloksista (älypuhelimen osalta) voidaan nähdä kuvassa laitteen lämpötilan nousevan ja laskevan käytön aikana. Punaiset viivat edustavat mallia, jota suoritetaan ilman Dynaamista vaihtoa.

Vaikka tulokset voivat näyttää melko samanlaisilta, ne eivät ole: se, mikä aiheuttaa lämpötilan aaltoilevan sinisissä viivoissa (ts. uuden paperin menetelmällä) on vaihto yksinkertaisempien ja monimutkaisempien malliversioiden välillä. Missään vaiheessa toimintaa termistä rajoitusta ei koskaan laukaista.
Se, mikä aiheuttaa lämpötilan nousevan ja laskevan punaisissa viivoissa, on laitteen automaattinen termisen rajoituksen käynnistäminen, joka hidastaa mallin toimintaa ja lisää viivettä.
Toiminnan kannalta voidaan nähdä kuvassa, että viive mallissa, jota ei ohjata, on merkittävästi suurempi, kun se on termisessä rajoituksessa:

Samaan aikaan yllä oleva kuva osoittaa, että viive mallissa, jota ohjataan dynaamisella vaihdolla, on lähes muuttumaton ja pysyy vastaanotettavissa koko ajan.
Käyttäjän näkökulmasta korkea viive voi tarkoittaa pidentynyttä odotusaikaa, mikä voi johtaa tehtävän hylkäämiseen ja tyytymättömyyteen sovellukseen, joka isännöi sitä.
Luonnollisen kielen prosessoinnissa (NLP) järjestelmissä korkeat vastausajat voivat olla vielä epämukavampia, koska tehtävät voivat riippua nopeasta vastauksesta (kuten automaattisesta käännöksestä tai sovelluksista, jotka auttavat vammaisia käyttäjiä).
Todella aikakriittisissä sovelluksissa – kuten reaaliaikaisissa VR/AR-sovelluksissa – korkea viive voisi tehokkaasti tuhota mallin ydinominaisuuden.
Tutkijat toteavat:
‘Väitämme, että termisen rajoituksen aiheuttama uhka on vakava latency-kriittisille mobiilimallille. Esimerkiksi reaaliaikaisen visuaalisen renderöinnin aikana videovirtaukselle tai pelille yhtäkkinen prosessointivälien nousu voi olla merkittävä negatiivinen vaikutus käyttökokemukseen. Lisäksi modernit mobiililaitteiden käyttöjärjestelmät tarjoavat usein erityisiä palveluita ja sovelluksia näkövammaisille henkilöille, kuten VoiceOver iOS: ssä ja TalkBack Androidissa.
‘Käyttäjä vuorovaikuttaa yleensä mobiililaitteiden kanssa luottamalla täysin puhetta, joten näiden palveluiden laatu on erittäin riippuvainen sovelluksen reagointiajasta tai viiveestä.’

Kaaviot, jotka osoittavat BERT w50 d50: n suorituskyvyn avuttomana (punainen) ja dynaamisella vaihdolla (sininen). Huomaa viiveen tasaisuus dynaamisessa vaihdossa (sininen).
Artikkeli on otsikoitu Play It Cool: Dynamic Shifting Estää Termisen Rajoituksen, ja se on yhteistyö kahden tutkijan välillä UoA: sta; yksi Carnegie Mellonista; ja yksi, joka edustaa molempia laitoksia.
Suoritinperusteinen Mobiili AI
Vaikka dynaaminen vaihto ja moniskaalaiset arkkitehtuurit ovat vakiintunut ja aktiivinen tutkimusalue, useimmat aloitteet ovat keskittyneet korkeampien laskentalaitteiden pariin, ja nykyinen ponnistelu on jaettu voimakkaan paikallisten (ts. laitteistopohjaisen) neuroverkkojen optimoinnin ja omistettujen mobiililaitteiden parantamisen välillä.
Tutkijoiden suorittamat kokeet tehtiin suorittimella eikä GPU: lla. Vaikka kasvava kiinnostus hyödyntää paikallisia GPU-ressursseja mobiilien koneoppimissovelluksissa (jopa koulutus suoraan mobiililaitteissa, mikä voi parantaa lopullisen mallin laatua), GPU: t käyttävät yleensä enemmän tehoa, mikä on kriittinen tekijä AI: n pyrkimyksessä olla itsenäinen (pilvipalveluista) ja hyödyllinen laitteessa, jolla on rajoitetut resurssit.
Painojen Jakaminen Testauksessa
Verkot, jotka testattiin hankkeessa, olivat slimmable-verkkoja ja DynaBERTiä, jotka edustavat tietokoneen näön ja luonnollisen kielen prosessoinnin tehtäviä.
Vaikka on ollut useita aloitteita tehdä BERTin iteroinnit, jotka voivat toimia tehokkaasti ja taloudellisesti mobiililaitteissa, jotkut näistä yrityksistä on kritisoitu monimutkaisiksi kierrettäviksi, ja tutkijat uudesta paperista toteavat, että BERTin käyttäminen mobiilissa on haaste, ja että “BERT-mallit yleensä ovat liian laskennallisesti vaativia mobiililaitteille”.
DynaBERT on kiinalainen aloite optimoida Googleen voimakas NLP/NLU-kehyksen resursseja vajaan ympäristön kontekstissa; mutta jopa tämä BERTin toteutus, tutkijat löysivät, oli erittäin vaativa.
Tutkijat suorittivat kaksi kokea älypuhelimen ja Raspberry PI -laitteiston kanssa. Kuvatehtävässä yksi satunnaisesti valittu kuva prosessoidaan jatkuvasti ja toistuvasti ResNet50: ssä luokittelutehtävänä, ja se pystyy suorittamaan stabiilisti ja ilman termisen rajoituksen laukaisemista koko kokeen suoritusajan.
Artikkeli toteaa:
‘Vaikka se voi uhrauttaa tarkin tarkkuuden, ehdotettu dynaaminen vaihto tarjoaa nopeamman inference-nopeuden. Ennen kaikkea, dynaaminen vaihtomme nauttii tasaisesta inferencesta.’

Suorittaminen ResNet50: llä avuttomana ja dynaamisella vaihdolla Slimmable ResNet50 x1.0: n ja x0.25 -version välillä jatkuvassa kuvien luokittelutehtävässä kuudenkymmenen minuutin ajan.
NLP-kokeessa tutkijat asettivat kokeen vaihtamaan kahden pienimmän mallin välillä DynaBERT- sarjassa, mutta havaitsivat, että 1,4-kertaisella viiveellä BERT hidastaa noin 70 asteen lämpötilassa. He asettivat siirtymisen tapahtumaan, kun laitteen käyttölämpötila saavutti 65 astetta.
BERT-koe sisälsi jatkuvan suorittamisen kysymys-vastausparilla GLUE: n ONLI-aineistosta.
Viiveen ja tarkkuuden vaihtoehdot olivat vakavampia BERT-tehtävässä kuin tietokoneen näkötehtävässä, ja tarkkuus tuli kustannuksella suuremman lämpötilan valvontatarpeen, jotta voidaan välttää hidastusta:

Viive ja tarkkuus tutkijoiden kokeiden yli kahdessa tehtävässä.
Tutkijat toteavat:
‘Dynaaminen vaihto yleensä ei voi estää BERT-malleja termisestä rajoituksesta sen valtavan laskennallisen intensiteetin vuoksi. Kuitenkin joissakin rajoituksissa dynaaminen vaihto voi edelleen olla hyödyllinen, kun BERT-malleja käytetään mobiililaitteissa.’
Tutkijat löysivät, että BERT-mallit nostavat Honor V30 -puhelimen prosessorin lämpötilan 80 asteeseen alle 32 sekunnissa ja laukaisevat termisen rajoituksen alle kuuden minuutin toiminnan aikana. Sen vuoksi tutkijat käyttivät vain puolikkaan BERT-malleja.
Kokeet toistettiin Raspberry PI -laitteistolla, ja menetelmä pystyi myös tällä alustalla estämään termisen rajoituksen laukaisemisen. Kuitenkin tutkijat toteavat, että Raspberry PI ei toimi samanlaisissa ääritilanteiden lämpöolosuhteissa kuin tiiviisti pakattu älypuhelin, ja he näyttävät lisänneen tämän kokeen sarjan menetelmän tehokkuuden osoittamiseksi kohtuullisesti varustelluissa prosessointiympäristöissä.
Julkaistu ensimmäisen kerran 23. kesäkuuta 2022.












