Andersons vinkel

Hvordan holde smarttelefoner kjølige når de kjører maskinlæringsmodeller

mm
Legg til Unite.AI blant dine foretrukne kilder på Google
Source image: 'Young man holding the new Samsung Galaxy S20 Ultra', by Jonas Leupe, Unsplash - https://unsplash.com/photos/wK-elt11pF0

Forskere fra University of Austin og Carnegie Mellon har foreslått en ny måte å kjøre datamaskinintensive maskinlæringsmodeller på mobile enheter som smarttelefoner, og på lavereeffektive kanter, uten å utløse termisk begrensning – en vanlig beskyttelsesmekanisme i profesjonelle og forbrukerenheter, designet for å senke temperaturen på vertsenheten ved å senke ytelsen, til akseptable driftstemperaturer igjen.

Den nye tilnærmingen kan hjelpe mer komplekse ML-modeller å kjøre inferens og forskjellige andre typer oppgaver uten å true stabiliteten til, for eksempel, vertssmarttelefonen.

Den sentrale ideen er å bruke dynamske nettverk, hvor vektene i en modell kan aksesseres av både en ‘lavtrykks’- og ‘fullintensitets’-versjon av den lokale maskinlæringsmodellen.

I tilfeller hvor drift av den lokale installasjonen av en maskinlæringsmodell skulle føre til at temperaturen på enheten stiger kritisk, ville modellen dynamisk bytte til en mindre krevende modell til temperaturen er stabilisert, og deretter bytte tilbake til fullstendig versjon.

Testoppgavene bestod av et bildeklassifiseringsoppdrag og et spørsmål-svar naturlig språkinferens (QNLI)-oppdrag – begge typen operasjon som sannsynligvis engasjerer mobile AI-applikasjoner. Kilde: https://arxiv.org/pdf/2206.10849.pdf

Testoppgavene bestod av et bildeklassifiseringsoppdrag og et spørsmål-svar naturlig språkinferens (QNLI)-oppdrag – begge typen operasjon som sannsynligvis engasjerer mobile AI-applikasjoner. Kilde: https://arxiv.org/pdf/2206.10849.pdf

Forskerne utførte proof-of-concept-tester for datamaskinseende og naturlig språkbehandling (NLP) modeller på en 2019 Honor V30 Pro-smarttelefon og en Raspberry Pi 4B 4GB.

Fra resultater (for smarttelefonen), kan vi se i bildet nedenfor temperaturen på vertsenheten stiger og synker med bruk. De røde linjene representerer en modell som kjører uten Dynamisk Skifting.

Selv om resultater kan se ganske like ut, er de ikke: hva som forårsaker temperaturen å bølge for blå linjene (dvs. ved å bruke den nye papirens metode) er skiftingen frem og tilbake mellom enklere og mer komplekse modellversjoner. På ingen tid i drift utløses termisk begrensning noen gang.

Hva som forårsaker temperaturen å stige og synke i tilfelle røde linjene er den automatiske aktiveringen av termisk begrensning i enheten, som sakter ned modellens drift og øker dens latens.

I forhold til hvor brukervennlig modellen er, kan vi se i bildet nedenfor at latensen for den uhindrede modellen er betydelig høyere mens den termisk begrenses:

På samme tid viser bildet ovenfor nesten ingen variasjon i latens for modellen som styres av Dynamisk Skifting, som forblir responsiv hele tiden.

For sluttbrukeren kan høy latens bety økt ventetid, som kan føre til frafall av en oppgave og misnøye med appen som har den.

I tilfelle NLP (i stedet for datamaskinseende) systemer, kan høye responstider være enda mer forstyrrende, siden oppgavene kan avhenge av rask respons (slik som automatisk oversettelse eller hjelpemidler for funksjonshemmede brukere).

For virkelig tidskritiske applikasjoner – som sanntids VR/AR – ville høy latens i praksis drepe modellens kjernefunksjonalitet.

Forskerne påpeker:

‘Vi hevder at termisk begrensning utgjør en alvorlig trussel mot mobile ML-applikasjoner som er latency-kritiske. For eksempel, under sanntids visuell rendering for videostrømming eller spill, vil en plutselig økning av prosesseringslatens per rame ha en betydelig negativ effekt på brukeropplevelsen. Dessuten tilbyr moderne mobile operativsystemer ofte spesialtjenester og applikasjoner for synshemmede personer, som VoiceOver på iOS og TalkBack på Android. ‘

‘Brukeren samhandler vanligvis med mobile telefoner ved å stole fullstendig på tale, så kvaliteten på disse tjenestene er høyt avhengig av applikasjonens responsivitet eller latens.’

Graf som viser ytelsen til BERT w50 d50 uhindret og hjulpet av Dynamisk Skifting. Merk jevnheten i latens i Dynamisk Skifting (blå).

Graf som viser ytelsen til BERT w50 d50 uhindret (rød) og hjulpet av Dynamisk Skifting (blå). Merk jevnheten i latens i Dynamisk Skifting (blå).

Den papiret heter Play It Cool: Dynamisk Skifting Forhindrer Termisk Begrensning, og er et samarbeid mellom to forskere fra UoA; en fra Carnegie Mellon; og en som representerer begge institusjoner.

CPU-basert mobil AI

Selv om Dynamisk Skifting og multi-skala-arkitekturer er et etablert og aktivt forskningsområde, har de fleste initiativene konsentrert seg om høyereeffektive rekneenheter, og fokusområdet for tiden er delt mellom intens optimering av lokale (dvs. enhetsbaserte) neurale nettverk, vanligvis for formålet med inferens i stedet for trening, og forbedring av dedikert mobil hårdware.

Testene som ble utført av forskerne, ble gjennomført på CPU i stedet for GPU-chip. Til tross for økende interesse for å utnytte lokale GPU-resurser i mobile maskinlæringsapplikasjoner (og selv trening direkte på mobile enheter, som kunne forbedre kvaliteten på den endelige modellen), trekker GPUer vanligvis mer strøm, en kritisk faktor i AI-s forsøk på å være uavhengig (av skytjenester) og nyttig i en enhet med begrensede ressurser.

Testing Vekt-deling

Nettverkene som ble testet for prosjektet, var slimme nettverk og DynaBERT, som representerer henholdsvis en datamaskinseende og en NLP-basert oppgave.

Selv om det har vært forskjellige initiativ for å gjøre iterasjoner av BERT som kan kjøre effektivt og økonomisk på mobile enheter, har noen av forsøkene vært kritisert som omstendelige løsninger, og forskerne i den nye papiren påpeker at bruk av BERT i mobilrommet er en utfordring, og at ‘BERT-modeller generelt er for datamaskinintensive for mobile telefoner’.

DynaBERT er et kinesisk initiativ for å optimere Googles kraftige NLP/NLU-rammeverk i en ressurssvikt-omgivelse; men selv denne implementeringen av BERT, fant forskerne, var svært krevende.

Likevel, på både smarttelefonen og Raspberry PI-enheten, kjørte forfatterne to eksperimenter. I CV-eksperimentet, ble et enkelt, tilfeldig valgt bilde prosessert kontinuerlig og repetitivt i ResNet50 som en klassifiseringsoppgave, og kunne kjøre stabilt og uten å utløse termisk begrensning for hele eksperimentets kjøretid.

Papiret påpeker:

‘Selv om det kan ofre litt nøyaktighet, har den foreslåtte Dynamisk Skifting en raskere inferenshastighet. Viktigst, vår Dynamisk Skifting-tilnærming nyter en konsekvent inferens.’

Kjøring av ResNet50 uhindret og med Dynamisk Skifting mellom Slimmable ResNet50 x1.0 og x0.25-versjonen på en kontinuerlig bildeklassifiseringsoppgave, i seksti minutter.

Kjøring av ResNet50 uhindret og med Dynamisk Skifting mellom Slimmable ResNet50 x1.0 og x0.25-versjonen på en kontinuerlig bildeklassifiseringsoppgave, i seksti minutter.

For NLP-testene, satte forfatterne eksperimentet til å skifte mellom de to minste modellene i DynaBERT-suitten, men fant at ved 1,4X latens, BERT begrenser ved ca. 70°. De satte derfor ned-skiftingen til å skje når driftstemperaturen nådde 65°.

BERT-eksperimentet innebar å la installasjonen kjøre inferens kontinuerlig på et spørsmål-svar-par fra GLUEs ONLI-datasett.

Latens- og nøyaktighets-vekslinger var mer alvorlige med den ambisiøse BERT-oppgaven enn for datamaskinseende-implementeringen, og nøyaktighet kom på bekostning av et mer alvorlig behov for å kontrollere enhetens temperatur, for å unngå begrensning:

Latens mot nøyaktighet for forfatternes eksperimenter over de to sektorene.

Latens mot nøyaktighet for forfatternes eksperimenter over de to sektorene.

Forfatterne påpeker:

‘Dynamisk Skifting kan generelt ikke forhindre BERT-modeller fra termisk begrensning på grunn av modellens enorme datamaskinintensitet. Likevel, under visse begrensninger, kan dynamisk skifting fortsatt være nyttig når BERT-modeller deployeres på mobile telefoner.’

Forfatterne fant at BERT-modeller forårsaker at Honor V30-telefonens CPU-temperatur stiger til 80° på under 32 sekunder, og vil utløse termisk begrensning på under seks minutters aktivitet. Derfor brukte forfatterne bare halvbredds BERT-modeller.

Eksperimentene ble gjentatt på Raspberry PI-oppssettet, og teknikken var også i stand til å forhindre utløsning av termisk begrensning i den omgivelsen. Likevel påpeker forfatterne at Raspberry PI ikke opererer under de samme ekstreme termiske begrensningene som en tett pakket smarttelefon, og synes å ha lagt til denne rekken av eksperimenter som en ytterligere demonstrasjon av metoden effektivitet i beskjedent utstyrte prosesseringsmiljøer.

 

Først publisert 23. juni 2022.

Forfatter innen maskinlæring, domenespesialist i menneskeskapesynthese. Tidligere sjef for forskningsinnhold i Metaphysic.ai, til det ble oppløst i DNEG's Brahma.ai.
Portfolio nettsted: martinanderson.ai
Kontakt: martin@martinanderson.ai