AI-modeller och plattformar
Livslång inlärning på enheten närmare med ny utbildningsteknik

Ett team av forskare vid MIT och MIT-IBM Watson AI Lab har utvecklat en ny teknik som möjliggör utbildning på enheten med mindre än en kvarts megabyte minne. Den nya utvecklingen är en imponerande prestation eftersom andra utbildningslösningar vanligtvis kräver mer än 500 megabyte minne, vilket överstiger den 256-kilobyte kapacitet som de flesta mikrokontroller har.
Genom att utbilda en maskinlärningsmodell på en intelligent enhet kan den anpassa sig till nya data och göra bättre förutsägelser. Det ska dock sägas att utbildningsprocessen vanligtvis kräver mycket minne, så den utförs ofta med datorer i ett datacenter innan modellen distribueras på en enhet. Denna process är betydligt dyrare och väcker integritetsproblem jämfört med den nya tekniken som utvecklats av teamet.
Forskarna utvecklade algoritmerna och ramverket på ett sätt som minskar den mängd beräkningar som behövs för att utbilda en modell, vilket gör processen snabbare och mer minneseffektiv. Tekniken kan hjälpa till att utbilda en maskinlärningsmodell på en mikrokontroller på bara några minuter.
Den nya tekniken hjälper också till med integritet eftersom den håller data på enheten, vilket är viktigt när känsliga data är inblandade. Samtidigt förbättrar ramverket modellens noggrannhet jämfört med andra tillvägagångssätt.
Song Han är en biträdande professor i avdelningen för elektroteknik och datavetenskap (EECS), en medlem i MIT-IBM Watson AI Lab och senior författare till forskningsartikeln.
“Vår studie möjliggör för IoT-enheter att inte bara utföra inferens utan också kontinuerligt uppdatera AI-modellerna med nyinsamlade data, vilket banar väg för livslång inlärning på enheten”, sa Han. “Den låga resursanvändningen gör djupinlärning mer tillgänglig och kan ha en bredare räckvidd, särskilt för lågeffektsgränsenheter.”
Den artikeln innehöll medförfattare och EECS-doktorander Ji Lin och Ligeng Zhu, samt MIT-postdoktorer Wei-Ming Chen och Wei-Chen Wang. Den innehöll också Chuang Gan, en huvudforskningsmedarbetare vid MIT-IBM Watson AI Lab.
Att göra utbildningsprocessen mer effektiv
För att göra utbildningsprocessen mer effektiv och mindre minneskrävande förlitade sig teamet på två algoritmiska lösningar. Den första kallas sparse update, som använder en algoritm som identifierar de viktigaste vikterna att uppdatera under varje utbildningsomgång. Algoritmen fryser vikterna en i taget tills noggrannheten sjunker till en viss tröskel, vid vilken punkt den slutar. De återstående vikterna uppdateras sedan och aktiveringarna som motsvarar de frusna vikterna behöver inte lagras i minnet.
“Att uppdatera hela modellen är mycket dyrt eftersom det finns mycket aktivering, så människor tenderar att bara uppdatera den sista lagern, men som du kan föreställa dig, skadar detta noggrannheten”, sa Han. “För vår metod väljer vi att uppdatera de viktigaste vikterna och ser till att noggrannheten är fullständigt bevarad.”
Den andra lösningen som utvecklats av teamet innefattar kvantiserad utbildning och förenkling av vikterna. En algoritm rundar först av vikterna till bara åtta bitar genom en kvantiseringsprocess som också minskar mängden minne för utbildning och inferens, där inferens är processen att applicera en modell på en dataset och generera en förutsägelse. Algoritmen förlitar sig sedan på en teknik som kallas kvantiseringsmedveten skalning (QAS), som fungerar som en multiplikator för att justera förhållandet mellan vikt och gradient. Detta hjälper till att undvika eventuell förlust av noggrannhet som kan uppstå på grund av kvantiserad utbildning.
Forskarna utvecklade ett system som kallas en liten utbildningsmotor, som kör algoritmiska innovationer på en enkel mikrokontroller som saknar operativsystem. För att slutföra mer arbete i kompileringsskedet, före distributionen av modellen på gränsenheten, ändrar systemet ordningen på stegen i utbildningsprocessen.
“Vi trycker på mycket av beräkningen, som auto-differentiering och grafoptimering, till kompileringstiden. Vi prunar också aggressivt de redundanta operatorerna för att stödja sparse uppdateringar. När vi väl är i drift har vi mycket mindre arbete att göra på enheten”, säger Han.
Högpresterande teknik
Medan traditionella tekniker som är utformade för lätt utbildning vanligtvis skulle behöva runt 300 till 600 megabyte minne, behövde teamets optimering bara 157 kilobyte för att utbilda en maskinlärningsmodell på en mikrokontroller.
Ramverket testades genom att utbilda en datorseende-modell för att upptäcka människor i bilder, och den lärde sig att slutföra denna uppgift på bara 10 minuter. Metoden kunde också utbilda en modell mer än 20 gånger snabbare än andra metoder.
Forskarna kommer nu att försöka tillämpa teknikerna på språkmodeller och olika typer av data. De vill också använda den förvärvade kunskapen för att minska större modeller utan förlust av noggrannhet, vilket också kan hjälpa till att minska den miljöpåverkan som utbildning av stora maskinlärningsmodeller har.












