Andersons hoek

Hoe smartphones koel te houden wanneer ze machine learning-modellen uitvoeren

mm
Voeg Unite.AI toe aan je voorkeursbronnen op Google
Source image: 'Young man holding the new Samsung Galaxy S20 Ultra', by Jonas Leupe, Unsplash - https://unsplash.com/photos/wK-elt11pF0

Onderzoekers van de University of Austin en Carnegie Mellon hebben een nieuwe manier voorgesteld om computationeel intensieve machine learning-modellen uit te voeren op mobiele apparaten zoals smartphones en op lagere krachtige edge-apparaten, zonder thermische begrenzing te activeren – een veelvoorkomende beschermingsmechanisme in professionele en consumentenapparaten, ontworpen om de temperatuur van het hostapparaat te verlagen door de prestaties te vertragen, totdat aanvaardbare bedrijfstemperatuur weer wordt bereikt.

De nieuwe benadering kan helpen om complexere ML-modellen uit te voeren voor inferentie en verschillende andere soorten taken zonder de stabiliteit van bijvoorbeeld de hostsmartphone te bedreigen.

Het centrale idee is om dynamiische netwerken te gebruiken, waarbij de gewichten van een model toegankelijk zijn voor zowel een ‘lage druk’ als ‘volle intensiteit’ versie van het lokale machine learning-model.

In gevallen waarin de werking van de lokale installatie van een machine learning-model de temperatuur van het apparaat kritisch zou doen stijgen, zou het model dynamisch overschakelen naar een minder veeleisend model totdat de temperatuur is gestabiliseerd, en vervolgens terugkeren naar de volledige versie.

De testtaken bestonden uit een beeldclassificatieklus en een vraagbeantwoordingsnatuurlijke taalinferentietaken (QNLI) – beide soorten operaties die mobiele AI-toepassingen waarschijnlijk zullen activeren. Bron: https://arxiv.org/pdf/2206.10849.pdf

De testtaken bestonden uit een beeldclassificatieklus en een vraagbeantwoordingsnatuurlijke taalinferentietaken (QNLI) – beide soorten operaties die mobiele AI-toepassingen waarschijnlijk zullen activeren. Bron: https://arxiv.org/pdf/2206.10849.pdf

De onderzoekers voerden proof-of-concepttests uit voor computer vision- en Natural Language Processing (NLP)-modellen op een 2019 Honor V30 Pro-smartphone en een Raspberry Pi 4B 4GB.

Uit de resultaten (voor de smartphone) kunnen we zien in de afbeelding hieronder de temperatuur van het hostapparaat stijgen en dalen met gebruik. De rode lijnen vertegenwoordigen een model dat zonder dynamische schakeling wordt uitgevoerd.

Hoewel de resultaten erg lijken, zijn ze dat niet: wat de temperatuur doet schommelen voor de blauwe lijnen (d.w.z. met behulp van de nieuwe methode van het artikel) is het schakelen heen en weer tussen eenvoudigere en complexere modelversies. Op geen enkel moment tijdens de werking wordt thermische begrenzing ooit geactiveerd.

Wat de temperatuur doet stijgen en dalen in het geval van de rode lijnen is de automatische activering van thermische begrenzing in het apparaat, die de prestaties van het model vertraagt en de latentie verhoogt.

Wat betreft de bruikbaarheid van het model kunnen we zien in de afbeelding hieronder dat de latentie voor het ongeassisteerde model aanzienlijk hoger is terwijl het thermisch wordt begrensd:

Tegelijkertijd toont de afbeelding hierboven bijna geen variatie in latentie voor het model dat wordt beheerd door dynamische schakeling, dat gedurende de hele tijd responsief blijft.

Voor de eindgebruiker kan hoge latentie betekenen dat de wachttijd toeneemt, wat kan leiden tot het afbreken van een taak en ontevredenheid met de app die het host.

In het geval van NLP (in plaats van computer vision)-systemen kunnen hoge responstijden nog verontrustender zijn, omdat taken mogelijk afhankelijk zijn van prompte respons (zoals automatische vertaling of hulpmiddelen voor gehandicapten).

Voor echt tijdgevoelige toepassingen – zoals real-time VR/AR – zou hoge latentie effectief de kernbruikbaarheid van het model doden.

De onderzoekers verklaren:

‘We betogen dat thermische begrenzing een ernstige bedreiging vormt voor mobiele ML-toepassingen die latentiekritisch zijn. Bijvoorbeeld, tijdens real-time visuele rendering voor video-streaming of gaming, zal een plotselinge stijging van de verwerking latentie per frame een aanzienlijk negatief effect hebben op de gebruikerservaring. Bovendien bieden moderne mobiele besturingssystemen vaak speciale diensten en toepassingen voor visueel gehandicapten, zoals VoiceOver op iOS en TalkBack op Android.

‘De gebruiker werkt meestal met mobiele telefoons door volledig te vertrouwen op spraak, dus de kwaliteit van deze diensten is zeer afhankelijk van de responsiviteit of latentie van de toepassing.’

Grafieken die de prestaties van BERT w50 d50 ongeassisteerd en geholpen door dynamische schakeling demonstreren. Let op de gelijkmatigheid van de latentie bij dynamische schakeling (blauw).

Grafieken die de prestaties van BERT w50 d50 ongeassisteerd (rood), en geholpen door dynamische schakeling (blauw) demonstreren. Let op de gelijkmatigheid van de latentie bij dynamische schakeling (blauw).

Het artikel heet Speel het koel: dynamische schakeling voorkomt thermische begrenzing, en is een samenwerking tussen twee onderzoekers van UoA; één van Carnegie Mellon; en één die zowel instellingen vertegenwoordigt.

CPU-gebaseerde mobiele AI

Hoewel dynamische schakeling en multi-schaalarchitecturen een gevestigd en actief onderzoeksgebied zijn, hebben de meeste initiatieven zich geconcentreerd op hogere reeksen van computationele apparaten, en de locus van inspanning op dit moment is verdeeld tussen intense optimalisatie van lokale (d.w.z. apparaatgebaseerde) neurale netwerken, meestal voor doeleinden van inferentie in plaats van training, en de verbetering van toegewijde mobiele hardware.

De tests die door de onderzoekers werden uitgevoerd, werden uitgevoerd op CPU in plaats van GPU-chips. Ondanks groeiend interesse in het benutten van lokale GPU-bronnen in mobiele machine learning-toepassingen (en zelfs direct trainen op mobiele apparaten, wat de kwaliteit van het eindmodel kan verbeteren), trekken GPU’s typisch meer stroom, een kritische factor in AI’s inspanning om onafhankelijk te zijn (van cloudservices) en nuttig te zijn in een apparaat met beperkte middelen.

Testen van gewichtsdelen

De netwerken die voor het project werden getest, waren slanke netwerken en DynaBERT, die respectievelijk een computer vision- en een NLP-gebaseerde taak vertegenwoordigen.

Hoewel er verschillende initiatieven zijn geweest om iteraties van BERT te maken die efficiënt en economisch kunnen worden uitgevoerd op mobiele apparaten, zijn sommige van de pogingen bekritiseerd als omslachtige workarounds, en de onderzoekers van het nieuwe artikel merken op dat het gebruik van BERT in de mobiele ruimte een uitdaging is, en dat ‘BERT-modellen in het algemeen te computationeel intensief zijn voor mobiele telefoons’.

DynaBERT is een Chinese initiatief om Google’s krachtige NLP/NLU-framework te optimaliseren in de context van een omgeving met schaarse middelen; maar zelfs deze implementatie van BERT, ontdekten de onderzoekers, was zeer veeleisend.

Desondanks voerden de auteurs twee experimenten uit op zowel de smartphone als de Raspberry PI-apparaat, en de techniek was in staat om thermische begrenzing te voorkomen in beide omgevingen. De auteurs merken echter op dat de Raspberry PI niet onder dezelfde extreme thermische beperkingen werkt als een strak verpakte smartphone, en lijken deze reeks experimenten te hebben toegevoegd als een verdere demonstratie van de effectiviteit van de methode in matig uitgeruste verwerkomgevingen.

De auteurs vonden dat BERT-modellen de CPU-temperatuur van de Honor V30-telefoon doen stijgen tot 80° in minder dan 32 seconden, en zullen thermische begrenzing activeren in minder dan zes minuten activiteit. Daarom gebruikten de auteurs alleen half-breedte BERT-modellen.

De experimenten werden herhaald op de Raspberry PI-opstelling, en de techniek was in staat om thermische begrenzing te voorkomen in die omgeving. De auteurs merken echter op dat de Raspberry PI niet onder dezelfde extreme thermische beperkingen werkt als een strak verpakte smartphone, en lijken deze reeks experimenten te hebben toegevoegd als een verdere demonstratie van de effectiviteit van de methode in matig uitgeruste verwerkomgevingen.

 

Publicatie voor het eerst op 23 juni 2022.

Schrijver over machine learning, domeinspecialist in humane beeldsynthese. Voormalig hoofd van onderzoeksinhoud bij Metaphysic.ai, tot de opheffing ervan in DNEG's Brahma.ai.
Portfolio site: martinanderson.ai
Contact: martin@martinanderson.ai