AI-modeller och plattformar
MoRA: High-Rank Updating fÃķr Parameter-Effektiv Finjustering
PÃĨ grund av dess robusta prestanda och breda tillÃĪmpbarhet jÃĪmfÃķrt med andra metoder ÃĪr LoRA eller Low-Rank Adaption en av de mest populÃĪra PEFT- eller Parameter-Effektiv Finjusteringsmetoderna fÃķr finjustering av ett stort sprÃĨkmodell. LoRA-modellen anvÃĪnder tvÃĨ lÃĨg-rankiga matriser fÃķr att dekomponera och approximera de uppdaterade vikterna i FFT eller Full Fine Tuning, och LoRA-modellen modifierar dessa trÃĪnbara parametrar enligt genom att justera rangen pÃĨ matriserna. Den stÃķrsta fÃķrdelen med att implementera processen ÃĪr att det mÃķjliggÃķr fÃķr LoRA-modellen att slÃĨ samman dessa matriser utan inferensfÃķrdrÃķjning efter finjustering. Dessutom, ÃĪven om senaste stora sprÃĨkmodeller levererar remarkabel prestanda pÃĨ in-context-lÃĪrandeuppgifter, krÃĪver vissa scenarier fortfarande finjustering, och kan delas in i tre typer. Den fÃķrsta typen, instruktionsfinjustering, syftar till att anpassa LLM till slutuppgifter och anvÃĪndarpreferenser utan att fÃķrbÃĪttra kunskapen och fÃķrmÃĨgan hos LLM, en metod som fÃķrenklar processen att hantera varierande uppgifter och komplexa instruktioner. Den andra typen omfattar komplexa resonemangsuppgifter som matematiskt problemlÃķsning. Slutligen ÃĪr den tredje typen kontinuerlig fÃķrtrÃĪning, en metod som fÃķrsÃķker fÃķrbÃĪttra de Ãķvergripande domÃĪnspecifika fÃķrmÃĨgorna hos stora sprÃĨkmodeller.
I den hÃĪr artikeln kommer vi att diskutera om lÃĨg-rank-uppdatering pÃĨverkar prestandan hos LoRA-modellen, eftersom det har observerats att lÃĨg-rank-uppdateringsmekanismen kan hindra fÃķrmÃĨgan hos det stora sprÃĨkmodellen att lÃĪra och komma ihÃĨg ny kunskap. UtifrÃĨn detta kommer vi att diskutera MoRA, en ny metod som uppnÃĨr hÃķg-rank-uppdatering medan den behÃĨller samma antal trÃĪnbara parametrar, genom att anvÃĪnda en kvadratisk matris. FÃķr att uppnÃĨ detta minskar MoRA-modellen indata-dimensionen och Ãķkar utdata-dimensionen fÃķr den kvadratiska matrisen genom att infÃķra motsvarande icke-parametriska operatorer. Dessutom sÃĪkerstÃĪller dessa operatorer att vikten kan slÃĨs samman tillbaka till LLM, vilket gÃķr att MoRA-modellen kan distribueras som LoRA.
Denna artikel syftar till att tÃĪcka MoRA-modellen i detalj, och vi undersÃķker mekanismen, metodiken, arkitekturen i modellen samt dess jÃĪmfÃķrelse med state-of-the-art-modeller. SÃĨ lÃĨt oss komma igÃĨng.
MoRA: High-Rank Updating fÃķr PEFT
Allteftersom storleken och fÃķrmÃĨgan hos sprÃĨkmodellerna Ãķkar, blir PEFT eller Parameter-Effektiv Finjustering en av de mest populÃĪra och effektiva metoderna fÃķr att anpassa LLM till specifika nedstrÃķmsuppgifter. JÃĪmfÃķrt med FFT eller Full Fine Tuning, som uppdaterar alla parametrar, uppdaterar PEFT endast en brÃĨkdel av de totala parametrarna, eftersom det pÃĨ vissa uppgifter kan uppnÃĨ liknande prestanda som FFT genom att uppdatera mindre ÃĪn 1% av de totala parametrarna, vilket minskar minneskraven fÃķr optimeraren avsevÃĪrt samtidigt som det underlÃĪttar lagring och distribution av modeller. Dessutom, bland alla existerande PEFT-metoder, ÃĪr LoRA den mest populÃĪra idag, sÃĪrskilt fÃķr LLM. En av de viktigaste anledningarna till varfÃķr LoRA-metoder levererar bÃĪttre prestanda jÃĪmfÃķrt med PEFT-metoder som adapters eller prompt-tuning ÃĪr att LoRA anvÃĪnder lÃĨg-rankiga matriser fÃķr att uppdatera parametrar, med modellens kontroll fÃķr att slÃĨ samman dessa matriser till de ursprungliga modellparametrarna, utan att lÃĪgga till berÃĪkningskraven under inferens. Ãven om det finns mÃĨnga metoder som fÃķrsÃķker fÃķrbÃĪttra LoRA fÃķr stora sprÃĨkmodeller, fÃķrlitar sig de flesta av dessa modeller pÃĨ GLUE fÃķr att validera deras effektivitet, antingen genom att krÃĪva fÃĨ trÃĪnbara parametrar eller genom att uppnÃĨ bÃĪttre prestanda.
Dessutom visar experiment som utfÃķrts pÃĨ LoRA Ãķver en stor mÃĪngd uppgifter, inklusive kontinuerlig fÃķrtrÃĪning, matematiskt resonemang och instruktionsfinjustering, att ÃĪven om LoRA-baserade modeller visar liknande prestanda Ãķver dessa uppgifter och levererar prestanda pÃĨ instruktionsfinjusteringsuppgifter som ÃĪr jÃĪmfÃķrbara med FFT-baserade metoder, kunde LoRA-baserade modeller inte replikera prestandan pÃĨ kontinuerlig fÃķrtrÃĪning och matematiskt resonemang. En mÃķjlig fÃķrklaring till denna brist pÃĨ prestanda kan vara beroendet av LoRA pÃĨ lÃĨg-rank-uppdatering, eftersom den lÃĨg-rank-uppdateringsmatrisen kan ha svÃĨrt att uppskatta full-rank-uppdateringar i FFT, sÃĪrskilt i minneskrÃĪvande uppgifter som krÃĪver att memorera domÃĪnspecifik kunskap som kontinuerlig fÃķrtrÃĪning. Eftersom rangen pÃĨ den lÃĨg-rank-uppdateringsmatrisen ÃĪr mindre ÃĪn full rang, begrÃĪnsar den fÃķrmÃĨgan att lagra ny information med hjÃĪlp av finjustering. UtifrÃĨn dessa observationer fÃķrsÃķker MoRA maximera rangen i den lÃĨg-rank-uppdateringsmatrisen medan den behÃĨller samma antal trÃĪnbara parametrar, genom att anvÃĪnda en kvadratisk matris istÃĪllet fÃķr att anvÃĪnda lÃĨg-rankiga matriser i traditionella LoRA-baserade modeller.

I ovanstÃĨende bild representerar (a) LoRA och (b) MoRA. W ÃĪr den frusna vikten frÃĨn modellen, M ÃĪr den trÃĪnbara matrisen i MoRA, A och B ÃĪr trÃĪnbara lÃĨg-rankiga matriser i LoRA, och r representerar rangen i LoRA och MoRA. Som det kan observeras, visar MoRA-modellen en stÃķrre kapacitet ÃĪn LoRA-baserade modeller med en stor rang. Dessutom utvecklar MoRA-modellen motsvarande icke-parametriska operatorer fÃķr att minska indata-dimensionen och Ãķka utdata-dimensionen fÃķr den trÃĪnbara matrisen M. Dessutom ger MoRA-modellen flexibiliteten att anvÃĪnda en lÃĨg-rank-uppdateringsmatris fÃķr att ersÃĪtta den trÃĪnbara matrisen M och operatorerna, vilket sÃĪkerstÃĪller att MoRA-metoden kan slÃĨs samman tillbaka till det stora sprÃĨkmodellen som LoRA.

MoRA: Metodik och Arkitektur
Inflytandet av LÃĨg-Rank-Uppdatering
Den viktigaste principen fÃķr LoRA-baserade modeller ÃĪr att uppskatta full-rank-uppdateringar i FFT genom att anvÃĪnda lÃĨg-rank-uppdateringar. Traditionellt, fÃķr en given fÃķrtrÃĪnad parametermatris, anvÃĪnder LoRA tvÃĨ lÃĨg-rankiga matriser fÃķr att berÃĪkna viktsuppdateringen. FÃķr att sÃĪkerstÃĪlla att viktsuppdateringarna ÃĪr 0 nÃĪr trÃĪningen bÃķrjar, initierar LoRA-modellen en av de lÃĨg-rankiga matriserna med en Gaussisk fÃķrdelning medan den andra initieras med 0. Den Ãķvergripande viktsuppdateringen i LoRA visar en lÃĨg rang jÃĪmfÃķrt med finjustering i FFT, ÃĪven om lÃĨg-rank-uppdatering i LoRA levererar prestanda som ÃĪr jÃĪmfÃķrbara med full-rank-uppdatering pÃĨ specifika uppgifter, inklusive instruktionsfinjustering och textklassificering. Dock bÃķrjar prestandan hos LoRA-modellen fÃķrsÃĪmras fÃķr uppgifter som kontinuerlig fÃķrtrÃĪning och komplexa resonemang.
Metodik
Ãven om LLM med in-context-lÃĪrande ÃĪr en betydande prestandafÃķrbÃĪttring jÃĪmfÃķrt med tidigare tillvÃĪgagÃĨngssÃĪtt, finns det fortfarande sammanhang som fÃķrlitar sig pÃĨ finjustering, som i allmÃĪnhet kan delas in i tre kategorier. Det finns LLM som justeras fÃķr instruktioner, genom att anpassa sig till anvÃĪndaruppgifter och preferenser, utan att avsevÃĪrt Ãķka kunskapen och fÃķrmÃĨgan hos LLM, en metod som underlÃĪttar hanteringen av varierande uppgifter och komplexa instruktioner. En annan typ ÃĪr komplexa resonemangsuppgifter som matematiskt problemlÃķsning, fÃķr vilka allmÃĪn instruktionsfinjustering kommer kort nÃĪr det gÃĪller att hantera komplexa symboliska multi-stegs resonemangsuppgifter. De flesta relaterade forskningar syftar till att fÃķrbÃĪttra resonemangsfÃķrmÃĨgan hos LLM, och det krÃĪver antingen att man utformar motsvarande trÃĪningsdata baserat pÃĨ stÃķrre lÃĪrarmodeller, sÃĨsom GPT-4, eller att man omformulerar resonemangsfrÃĨgor lÃĪngs en resonemangsbanan. Den tredje typen, kontinuerlig fÃķrtrÃĪning, ÃĪr utformad fÃķr att fÃķrbÃĪttra de domÃĪnspecifika fÃķrmÃĨgorna hos LLM.
LikvÃĪl, de flesta varianter av LoRA anvÃĪnder nÃĪstan uteslutande GLUE-instruktionsfinjustering eller textklassificeringsuppgifter fÃķr att utvÃĪrdera deras effektivitet i sammanhanget med LLM. Eftersom finjustering fÃķr instruktionsfinjustering krÃĪver de minsta resurserna jÃĪmfÃķrt med andra typer, kan det inte representera en ordentlig jÃĪmfÃķrelse mellan LoRA-varianter. Att lÃĪgga till resonemangsuppgifter fÃķr att utvÃĪrdera deras metoder bÃĪttre har varit en vanlig praxis i senare arbeten. Dock anvÃĪnder vi vanligtvis smÃĨ trÃĪningsuppsÃĪttningar (ÃĪven vid 1M exempel, vilket ÃĪr ganska stort). LLM har svÃĨrt att lÃĪra sig ordentligt resonemang frÃĨn exempel av den hÃĪr storleken.
UtifrÃĨn observationerna frÃĨn inflytandet av lÃĨg-rank-uppdatering, fÃķreslÃĨr MoRA-modellen en ny metod fÃķr att mildra de negativa effekterna av lÃĨg-rank-uppdatering. Den grundlÃĪggande principen fÃķr MoRA-modellen ÃĪr att anvÃĪnda samma trÃĪnbara parametrar i stÃķrsta mÃķjliga utstrÃĪckning fÃķr att uppnÃĨ en hÃķgre rang i den lÃĨg-rank-uppdateringsmatrisen. Efter att ha tagit hÃĪnsyn till de fÃķrtrÃĪnade vikterna, anvÃĪnder LoRA-modellen tvÃĨ lÃĨg-rankiga matriser A och B med totala trÃĪnbara parametrar fÃķr rang r. Dock kan en kvadratisk matris uppnÃĨ den hÃķgsta rangen fÃķr samma antal trÃĪnbara parametrar, och MoRA-modellen uppnÃĨr detta genom att minska indata-dimensionen och Ãķka utdata-dimensionen fÃķr den trÃĪnbara kvadratiska matrisen. Dessutom bÃķr dessa tvÃĨ funktioner vara icke-parametriska operatorer och fÃķrvÃĪntas kÃķras i linjÃĪr tid i fÃķrhÃĨllande till dimensionen.
MoRA: Experiment och Resultat
FÃķr att utvÃĪrdera dess prestanda, utvÃĪrderas MoRA-modellen pÃĨ en stor mÃĪngd uppgifter fÃķr att fÃķrstÃĨ inflytandet av hÃķg-rank-uppdatering pÃĨ tre uppgifter: att komma ihÃĨg UUID-par, finjusteringsuppgifter och fÃķrtrÃĪning.
Att Komma IhÃĨg UUID-par
FÃķr att demonstrera fÃķrbÃĪttringarna i prestanda, jÃĪmfÃķrs MoRA-modellen mot FFT- och LoRA-modellerna pÃĨ att komma ihÃĨg UUID-par. TrÃĪningsfÃķrlusten frÃĨn experimentet ÃĨterspeglas i fÃķljande bild.

Det ÃĪr vÃĪrt att notera att fÃķr samma antal trÃĪnbara parametrar, kan MoRA-modellen ÃķvertrÃĪffa de existerande LoRA-modellerna, vilket indikerar att den har gynnats av den hÃķg-rank-uppdateringsstrategin. Rapporten om tecken-nivÃĨ-trÃĪningsnoggrannhet vid olika trÃĪningssteg sammanfattas i fÃķljande tabell. 
Som det kan observeras, tar MoRA-modellen fÃĪrre trÃĪningssteg fÃķr att komma ihÃĨg UUID-par jÃĪmfÃķrt med LoRA.
Finjusteringsuppgifter
FÃķr att utvÃĪrdera dess prestanda pÃĨ finjusteringsuppgifter, utvÃĪrderas MoRA-modellen pÃĨ tre finjusteringsuppgifter: instruktionsfinjustering, matematiskt resonemang och kontinuerlig fÃķrtrÃĪning, utformade fÃķr stora sprÃĨkmodeller, tillsammans med en hÃķgkvalitativ motsvarande dataset fÃķr bÃĨde MoRA- och LoRA-modellerna. Resultaten av finjusteringsuppgifterna presenteras i fÃķljande tabell.

Som det kan observeras, visar bÃĨde LoRA- och MoRA-modellerna liknande prestanda pÃĨ matematiskt resonemang och instruktionsfinjusteringsuppgifter. Dock ÃķvertrÃĪffar MoRA-modellen LoRA-modellen pÃĨ kontinuerlig fÃķrtrÃĪning fÃķr bÃĨde biomedicinska och finansiella domÃĪner, tack vare den hÃķg-rank-uppdateringsmetoden fÃķr att komma ihÃĨg ny kunskap. Dessutom ÃĪr det viktigt att fÃķrstÃĨ att de tre uppgifterna skiljer sig frÃĨn varandra med olika krav och olika finjusteringsfÃķrmÃĨgor.
FÃķrtrÃĪning
FÃķr att utvÃĪrdera inflytandet av hÃķg-rank-uppdatering pÃĨ den Ãķvergripande prestandan, trÃĪnas transformatorn inom MoRA-modellen frÃĨn scratch pÃĨ C4-datasetet, och prestandan jÃĪmfÃķrs mot LoRA- och ReLoRA-modellerna. FÃķrtrÃĪningsfÃķrlusten tillsammans med den motsvarande komplexiteten pÃĨ C4-datasetet visas i fÃķljande figurer.


Som det kan observeras, levererar MoRA-modellen bÃĪttre prestanda pÃĨ fÃķrtrÃĪningsuppgifter jÃĪmfÃķrt med LoRA- och ReLoRA-modellerna med samma antal trÃĪnbara parametrar.
Dessutom, fÃķr att demonstrera pÃĨverkan av hÃķg-rank-uppdatering pÃĨ rangen av den lÃĨg-rank-uppdateringsmatrisen, analyserar MoRA-modellen spektret av singularvÃĪrden fÃķr den lÃĪrda lÃĨg-rank-uppdateringsmatrisen genom att fÃķrtrÃĪna 250M-modellen, och resultaten visas i fÃķljande bild.

Slutliga Tankar
I den hÃĪr artikeln har vi diskuterat om lÃĨg-rank-uppdatering pÃĨverkar prestandan hos LoRA-modellen, eftersom det har observerats att lÃĨg-rank-uppdateringsmekanismen kan hindra fÃķrmÃĨgan hos det stora sprÃĨkmodellen att lÃĪra och komma ihÃĨg ny kunskap. UtifrÃĨn detta har vi diskuterat MoRA, en ny metod som uppnÃĨr hÃķg-rank-uppdatering medan den behÃĨller samma antal trÃĪnbara parametrar, genom att anvÃĪnda en kvadratisk matris. FÃķr att uppnÃĨ detta minskar MoRA-modellen indata-dimensionen och Ãķkar utdata-dimensionen fÃķr den kvadratiska matrisen genom att infÃķra motsvarande icke-parametriska operatorer. Dessutom sÃĪkerstÃĪller dessa operatorer att vikten kan slÃĨs samman tillbaka till LLM, vilket gÃķr att MoRA-modellen kan distribueras som LoRA.












