Andersons vinkel

Sådan holder du smartphones køle, når de kører maskinelæringmodeller

mm
Føj Unite.AI til dine foretrukne kilder på Google
Source image: 'Young man holding the new Samsung Galaxy S20 Ultra', by Jonas Leupe, Unsplash - https://unsplash.com/photos/wK-elt11pF0

Forskere fra University of Austin og Carnegie Mellon har foreslået en ny måde at køre beregningskrævende maskinelæringmodeller på mobile enheder som smartphones og på lavere-udstyrede edge-enheder, uden at udløse termisk begrænsning – en almindelig beskyttelsesmekanisme i professionelle og forbrugerenheder, designet til at sænke temperaturen på værtenheden ved at sænke dens ydeevne, indtil acceptabelt driftstemperatur igen opnås.

Den nye tilgang kunne hjælpe mere komplekse ML-modeller til at køre inference og forskellige andre typer opgaver uden at true stabiliteten af, for eksempel, værtsmartphone.

Den centrale idé er at bruge dynamske netværk, hvor vægtene af en model kan adganges af både en ‘lavtryks’- og ‘fuldintensitets’-version af den lokale maskinelæringmodel.

I tilfælde, hvor drift af den lokale installation af en maskinelæringmodel skal få temperaturen på enheden til at stige kritisk, vil modellen dynamisk skifte til en mindre krævende model, indtil temperaturen er stabiliseret, og derefter skifte tilbage til den fuldstændige version.

Testopgaverne bestod af et billedeklassificeringsjob og et spørgsmål-svar natur-sprog-inferens (QNLI)-opgave – begge typer operationer, der sandsynligvis involverer mobile AI-applikationer. Kilde: https://arxiv.org/pdf/2206.10849.pdf

Testopgaverne bestod af et billedeklassificeringsjob og et spørgsmål-svar natur-sprog-inferens (QNLI)-opgave – begge typer operationer, der sandsynligvis involverer mobile AI-applikationer. Kilde: https://arxiv.org/pdf/2206.10849.pdf

Forskerne udførte proof-of-concept-test for computer vision og Natural Language Processing (NLP)-modeller på en 2019 Honor V30 Pro-smartphone og en Raspberry Pi 4B 4GB.

Fra resultaterne (for smartphone), kan vi se på billedet nedenfor, at temperaturen på værtenheden stiger og falder med brug. De røde linjer repræsenterer en model, der kører uden Dynamic Shifting.

Selvom resultaterne måske ser ret ens ud, er de ikke: det, der får temperaturen til at bølge for de blå linjer (dvs. ved hjælp af den nye papers metode), er skiftet frem og tilbage mellem simplere og mere komplekse modelversioner. I intet øjeblik under drift udløses termisk begrænsning nogensinde.

Det, der får temperaturen til at stige og falde i tilfældet af de røde linjer, er den automatiske aktivering af termisk begrænsning i enheden, som sænker modellens ydeevne og øger dens latency.

I forhold til, hvor brugervenligt modellen er, kan vi se på billedet nedenfor, at latencen for den uhjulpede model er betydeligt højere, mens den er termisk begrænset:

Samtidig viser billedet ovenfor næsten ingen variation i latency for modellen, der er styret af Dynamic Shifting, som forbliver responsiv hele tiden.

For slutbrugeren kan høj latency betyde øget ventetid, hvilket kan føre til opgivelse af en opgave og utilfredshed med appen, der hoster den.

I tilfælde af NLP (i stedet for computer vision)-systemer kan høje responstider være endnu mere foruroligende, da opgaverne kan afhænge af prompt respons (såsom auto-oversættelse eller hjælpemidler til handicappede brugere).

For virkelig tidskritiske applikationer – såsom real-time VR/AR – ville høj latency effektivt dræbe modellens kernefunktionalitet.

Forskerne fastslår:

‘Vi argumenterer for, at termisk begrænsning udgør en alvorlig trussel mod mobile ML-applikationer, der er latency-kritiske. For eksempel under real-time visuel rendering til video-streaming eller gaming vil en pludselig stigning i proces-latency per frame have en betydelig negativ effekt på brugeroplevelsen. Desuden tilbyder moderne mobile operativsystemer ofte særlige tjenester og applikationer til syns-hæmmede personer, såsom VoiceOver på iOS og TalkBack på Android. ‘

‘Brugeren interagerer typisk med mobile telefoner ved at stole fuldstændigt på tale, så kvaliteten af disse tjenester er højt afhængig af applikationens respons eller latency.’

Graf, der viser præstationen af BERT w50 d50 uhjulpet og hjulpet af Dynamic Shifting. Bemærk ligevægten i latency i Dynamic Shifting (blå).

Graf, der viser præstationen af BERT w50 d50 uhjulpet (rød) og hjulpet af Dynamic Shifting (blå). Bemærk ligevægten i latency i Dynamic Shifting (blå).

Den artikel er titlen Play It Cool: Dynamic Shifting Forebygger Termisk Begrænsning, og er et samarbejde mellem to forskere fra UoA; en fra Carnegie Mellon; og en, der repræsenterer begge institutioner.

CPU-baseret Mobile AI

Selvom Dynamic Shifting og multi-skala-arkitekturer er et etableret og aktivt forskningsområde, har de fleste initiativer koncentreret sig om højere-end-array af beregningsenheder, og fokus på nuværende tidspunkt er fordelt mellem intens optimering af lokale (dvs. enhedsbaserede) neurale netværk, normalt til formålet med inference snarere end træning, og forbedring af dedikeret mobil hardware.

Testene, der blev udført af forskerne, blev gennemført på CPU-snipsler i stedet for GPU-chips. Trods voksende interesse i at udnytte lokale GPU-resourcer i mobile maskinelæring-applikationer (og endda træning direkte på mobile enheder, hvilket kunne forbedre kvaliteten af den endelige model), trækker GPU’er normalt mere strøm, en kritisk faktor i AI’s forsøg på at være uafhængig (af cloud-tjenester) og nyttig i en enhed med begrænsede ressourcer.

Test af Vægtsdeling

De netværk, der blev testet for projektet, var slimme netværk og DynaBERT, der repræsenterer henholdsvis en computer vision og en NLP-baseret opgave.

Selvom der har været forskellige initiativer for at gøre iterationer af BERT, der kan køre effektivt og økonomisk på mobile enheder, har nogle af forsøgene været kritiseret som omstændelige løsninger, og forskerne bag den nye artikel bemærker, at brug af BERT i den mobile rum er en udfordring, og at ‘BERT-modeller generelt er for beregningsintensive for mobile telefoner’.

DynaBERT er en kinesisk initiativ for at optimere Google’s kraftfulde NLP/NLU-ramme i konteksten af en ressource-fattig miljø; men selv denne implementering af BERT fandt forskerne meget krævende.

Ikke desto mindre kørte forfatterne to eksperimenter på både smartphone og Raspberry PI-enhed, og teknikken kunne også i den sidstnævnte miljø forhindre udløsning af termisk begrænsning. Forskerne bemærker dog, at Raspberry PI ikke opererer under de samme ekstreme termiske begrænsninger som en tætpakket smartphone, og synes at have tilføjet denne række af eksperimenter som en yderligere demonstration af metodens effektivitet i beskedent udstyrede processormiljøer.

Artiklen fastslår:

‘Selvom det måske ofrer nogen præcision, har den foreslåede Dynamic Shifting en hurtigere inferenshastighed. Mest vigtigt, vores Dynamic Shifting-tilgang nyder en konsekvent inferens.’

Kørsel af ResNet50 uhjulpet og med Dynamic Shifting mellem Slimmable ResNet50 x1.0 og x0.25-version på en kontinuert billedeklassificeringsopgave i 60 minutter.

Kørsel af ResNet50 uhjulpet og med Dynamic Shifting mellem Slimmable ResNet50 x1.0 og x0.25-version på en kontinuert billedeklassificeringsopgave i 60 minutter.

For NLP-testerne satte forfatterne eksperimentet til at skifte mellem de to mindste modeller i DynaBERT-suitten, men fandt, at ved 1,4 gange latency, BERT begrænser ved omkring 70°. De satte derfor ned-skift til at ske, når den operative temperatur nåede 65°.

BERT-eksperimentet bestod i at lade installationen køre inference kontinuerligt på et spørgsmål-svar-par fra GLUE’s ONLI-dataset.

Latency- og præcisionstrade-off’er var mere alvorlige med den ambitiøse BERT-opgave end for computer vision-implementeringen, og præcision kom på bekostning af et større behov for at kontrollere enhedens temperatur for at undgå begrænsning:

Latency vs. præcision for forskernes eksperimenter over de to sektorer.

Latency vs. præcision for forskernes eksperimenter over de to sektorer.

Forfatterne bemærker:

‘Dynamic Shifting kan generelt ikke forhindre BERT-modeller i termisk begrænsning på grund af modellens enorme beregningsintensitet. Dog kan dynamisk skift under visse begrænsninger stadig være nyttigt, når BERT-modeller deployes på mobile telefoner.’

Forfatterne fandt, at BERT-modeller får Honor V30-telefonens CPU-temperatur til at stige til 80° på under 32 sekunder, og vil udløse termisk begrænsning på under seks minutters aktivitet. Derfor brugte forfatterne kun halv-bredde BERT-modeller.

Eksperimenterne blev gentaget på Raspberry PI-opstillingen, og teknikken kunne også i den miljø forhindre udløsning af termisk begrænsning. Forskerne bemærker dog, at Raspberry PI ikke opererer under de samme ekstreme termiske begrænsninger som en tætpakket smartphone, og synes at have tilføjet denne række af eksperimenter som en yderligere demonstration af metodens effektivitet i beskedent udstyrede processormiljøer.

 

Først udgivet 23. juni 2022.

Forfatter til maskinlæringsartikler, domæneekspert i menneskesynssyntese. Tidligere leder af forskningsindhold på Metaphysic.ai, indtil opløsningen i DNEG's Brahma.ai.
Portfolio site: martinanderson.ai
Kontakt: martin@martinanderson.ai