Andersonův úhel

Jak udržet chytré telefony chladné, když běží modely strojového učení

mm
Přidejte Unite.AI mezi své preferované zdroje na Google
Source image: 'Young man holding the new Samsung Galaxy S20 Ultra', by Jonas Leupe, Unsplash - https://unsplash.com/photos/wK-elt11pF0

Výzkumníci z University of Austin a Carnegie Mellon navrhli novou metodu pro běh výpočetně náročných modelů strojového učení na mobilních zařízeních, jako jsou chytré telefony, a na zařízení s nižší výpočetní kapacitou, bez aktivace termálního omezení – běžného ochranného mechanismu v profesionálních a spotřebitelských zařízeních, který snižuje teplotu hostitelského zařízení zpomalením jeho výkonu, dokud nejsou znovu dosaženy přijatelné provozní teploty.

Nový přístup by mohl umožnit běh složitějších modelů strojového učení pro inferenci a různé další typy úkolů bez ohrožení stability hostitelského chytrého telefonu.

Centrální myšlenka spočívá v použití dynamických sítí, kde váhy modelu mohou být přístupné jak pro “nízkotlakou”, tak pro “plnou intenzitu” verze místního modelu strojového učení.

V případech, kdy by provoz místního modelu strojového učení měl způsobit kritické zvýšení teploty zařízení, model by se dynamicky přepnul na méně náročnou verzi, dokud teplota nebude stabilizována, a poté by se přepnul zpět na plnou verzi.

Testovací úkoly zahrnovaly klasifikaci obrazů a otázku-odpověď na přirozeném jazykovém inference (QNLI) úkolu – oba typy operací, které pravděpodobně budou využívat mobilní aplikace AI. Zdroj: https://arxiv.org/pdf/2206.10849.pdf

Testovací úkoly zahrnovaly klasifikaci obrazů a otázku-odpověď na přirozeném jazykovém inference (QNLI) úkolu – oba typy operací, které pravděpodobně budou využívat mobilní aplikace AI. Zdroj: https://arxiv.org/pdf/2206.10849.pdf

Výzkumníci provedli testy pro počítačové vidění a modely zpracování přirozeného jazyka (NLP) na chytrém telefonu Honor V30 Pro z roku 2019 a na zařízení Raspberry Pi 4B 4GB.

Z výsledků (pro chytrý telefon) je vidět, jak teplota hostitelského zařízení stoupá a klesá s použitím. Červené čáry představují model, který běží bez dynamického přepínání.

Although výsledky mohou vypadat podobně, nejsou: co způsobuje teplotu, aby se vlnila pro modré čáry (tj. pomocí nové metody), je přepínání mezi jednoduššími a složitějšími verzemi modelu. V žádném okamžiku provozu není aktivováno termální omezení.

Co způsobuje teplotu, aby stoupala a klesala v případě červených čar, je automatické zapnutí termálního omezení v zařízení, které zpomaluje provoz modelu a zvyšuje jeho latenci.

Co se týče použitelnosti modelu, je vidět na obrázku níže, že latence pro neléčený model je podstatně vyšší, zatímco je termálně omezený:

V同 době je vidět na obrázku výše, že latence pro model, který je řízen dynamickým přepínáním, zůstává téměř neměnná a zůstává reaktivní po celou dobu.

Pro konečného uživatele může vysoká latence znamenat prodlouženou čekací dobu, což může způsobit opuštění úkolu a nespokojenost s aplikací, která ho hostí.

V případě NLP (na rozdíl od počítačového vidění) systémů může být vysoká odezva ještě více znepokojivá, protože úkoly mohou záviset na rychlé odpovědi (jako je automatický překlad nebo utility pro pomoc zdravotně postiženým uživatelům).

Pro skutečně časově kritické aplikace – jako je reálné vykreslování VR/AR – by vysoká latence prakticky znemožnila použití modelu.

Výzkumníci uvádějí:

‘Argumentujeme, že termální omezení představuje vážnou hrozbu pro mobilní aplikace strojového učení, které jsou citlivé na latenci. Například během reálného vykreslování videa nebo hraní her by náhlý nárůst zpracovatelské latence na snímek měl podstatný negativní vliv na uživatelský zážitek. Kromě toho moderní mobilní operační systémy často poskytují speciální služby a aplikace pro zrakově postižené osoby, jako je VoiceOver na iOS a TalkBack na Androidu. ‘

‘Uživatel obvykle interaguje s mobilními telefony tím, že se plně spoléhá na řeč, takže kvalita těchto služeb je silně závislá na reaktivitě nebo latenci aplikace.’

Grafy prokazující výkon BERT w50 d50 neléčeného a pomocí dynamického přepínání. Pozoruhodná je rovnoměrnost latence u dynamického přepínání (modrá).

Grafy prokazující výkon BERT w50 d50 neléčeného (červená) a pomocí dynamického přepínání (modrá). Pozoruhodná je rovnoměrnost latence u dynamického přepínání (modrá).

Článek je nazvaný článek a je spoluprací mezi dvěma výzkumníky z UoA; jedním z Carnegie Mellon; a jedním, který zastupuje obě instituce.

Procesorově založené mobilní AI

Ačkoli dynamické přepínání a multi-škálové architektury jsou zavedenou a aktivní oblastí studia, většina iniciativ se soustředila na vyšší-endové pole výpočetních zařízení, a locus úsilí v současné době je rozdělen mezi intenzivní optimalizaci místních (tj. zařízení-založených) neuronových sítí, obvykle pro účely inference spíše než tréninku, a zlepšení věnovaného mobilnímu hardwaru.

Testy provedené výzkumníky byly provedeny na procesorových čipech místo grafických procesorových čipů. Přes rostoucí zájem o využití místních grafických procesorových zdrojů v mobilních aplikacích strojového učení (a dokonce trénink přímo na mobilních zařízeních, které mohou zlepšit kvalitu konečného modelu), grafické procesory obvykle vyžadují více energie, což je kritický faktor v úsilí AI být nezávislým (na cloudových službách) a užitečným v zařízení s omezenými zdroji.

Testování sdílení váhy

Sítě testované pro projekt byly štíhlé sítě a DynaBERT, reprezentující, resp. počítačové vidění a úkol založený na NLP.

Ačkoli existovaly různé iniciativy pro vytvoření iterací BERT, které mohou běžet efektivně a ekonomicky na mobilních zařízeních, některé z těchto pokusů byly kritizovány jako zbytečné obejití, a autoři nového článku uvádějí, že použití BERT v mobilním prostoru je výzvou, a že ‘BERT modely jsou obecně příliš výpočetně náročné pro mobilní telefony’.

DynaBERT je čínská iniciativa pro optimalizaci NLP/NLU frameworku Google do kontextu prostředí s omezenými zdroji; ale i tato implementace BERT, výzkumníci zjistili, byla velmi náročná.

Nicméně, na obou chytrém telefonu a zařízení Raspberry PI, autoři provedli dva experimenty. V experimentu s počítačovým viděním byl zpracován jeden náhodně vybraný obraz kontinuálně a opakovaně v ResNet50 jako klasifikační úkol, a byl schopen běžet stabilně a bez aktivace termálního omezení po celou dobu experimentu.

Článek uvádí:

‘Ačkoli to může obětovat一些 přesnost, navrhovaný dynamický přepínač má rychlejší dobu inference. Nej重要něji, náš dynamický přepínač má konzistentní inference.’

Běžící ResNet50 neléčený a s dynamickým přepínáním mezi Slimmable ResNet50 x1.0 a x0.25 verzí na kontinuální klasifikační úkol, po dobu šedesáti minut.

Běžící ResNet50 neléčený a s dynamickým přepínáním mezi Slimmable ResNet50 x1.0 a x0.25 verzí na kontinuální klasifikační úkol, po dobu šedesáti minut.

Pro testy NLP autoři nastavili experiment na přepínání mezi dvěma nejmenšími modely v sadě DynaBERT, ale zjistili, že při 1,4násobné latenci BERT zpomaluje při teplotě kolem 70°. Proto nastavili přepínání na teplotu 65°.

Experiment s BERT zahrnoval běh inference kontinuálně na otázku-odpověď pár z GLUE’s ONLI datasetu.

Oběti latence a přesnosti byly závažnější u ambiciózního úkolu BERT než u implementace počítačového vidění, a přesnost přišla na úkor vyšší potřeby kontroly teploty zařízení, aby se zabránilo zpomalení:

Latence vs přesnost pro experimenty výzkumníků napříč dvěma sektory úkolů.

Latence vs přesnost pro experimenty výzkumníků napříč dvěma sektory úkolů.

Autoři uvádějí:

‘Dynamické přepínání obecně nemůže zabránit BERT modelům v termálním omezení kvůli enormní výpočetně náročné povaze modelu. Nicméně, pod určitými omezeními, dynamické přepínání může být stále užitečné při nasazování BERT modelů na mobilní telefony.’

Autoři zjistili, že BERT modely způsobují, že teplota chytrého telefonu Honor V30 stoupne na 80° za méně než 32 sekund, a aktivují termální omezení za méně než šest minut aktivity. Proto autoři použili pouze půl-široké BERT modely.

Experimenty byly opakované na zařízení Raspberry PI, a technika byla schopna také v tomto prostředí zabránit aktivaci termálního omezení. Nicméně, autoři uvádějí, že Raspberry PI nepůsobí pod stejnými extrémními termálními omezeními jako hustě zabalený chytrý telefon, a zdá se, že přidali tuto sérii experimentů jako další demonstraci účinnosti metody v prostředí s mírně vybavenými zpracovatelskými prostředky.

 

Poprvé zveřejněno 23. června 2022.

Autor odborných článků o strojovém učení, doménový specialista na syntézu lidského obrazu. Bývalý vedoucí výzkumného obsahu ve společnosti Metaphysic.ai, až do jejího rozpuštění do společnosti DNEG's Brahma.ai.
Portfolio site: martinanderson.ai
Contact: martin@martinanderson.ai