AI-mallit ja alustat

LoReFT: Edustusjärkeistys kielen mallien fine-tunauksessa

mm
Lisää Unite.AI suosikkilähteisiisi Google-palvelussa

Parametrien tehokas fine-tuning eli PeFT-menetelmät pyrkivät sovittamaan suuria kielen malleja päivittämällä vain pienen osan saatavilla olevista painoista. Kuitenkin suurin osa olemassa olevasta tulkintatystä on osoittanut, että edustukset koodaavat semanttisesti rikasta tietoa, mikä viittaa siihen, että edustusten muokkaaminen voi olla parempi ja voimakkaampi vaihtoehto. Esikoulutetut suuret mallit ovat usein fine-tune käytettäviksi uusissa domeeneissa ja tehtävissä, ja fine-tuning-prosessin aikana yksittäinen perusmalli voidaan sovittaa moniin tehtäviin, vaikka mallilla on vain vähän domeenin sisäistä dataa. Kuitenkin koko mallin fine-tuning on resursseja kuluttava ja kallis prosessi, erityisesti kielen malleille, joilla on merkittävästi suurempi määrä parametreja ja kokoa.

Parametrien tehokas fine-tuning eli PeFT-menetelmät ehdottavat, että korkeat fine-tuningin kustannukset voidaan ratkaista päivittämällä vain pienen osan saatavilla olevista painoista, prosessi, joka auttaa vähentämään koulutusajan ja muistin käytön lisäksi. Mitä tärkeämpää on, että parametrien tehokkaan fine-tuningin eli PeFT-menetelmien on osoitettu antavan samanlaisen suorituskyvyn kuin fine-tune-menetelmillä useissa käytännön tilanteissa. Adaptaattorit, yleinen PeFT-menetelmien perhe, oppivat muokkauksen, joka voidaan lisätä lisäjoukkoon painoja, jotka toimivat yhdessä jäädytetyn perusmallin kanssa, ja viimeaikaiset adaptaattorit kuten LoRA vähentävät oppimassa painoissa olevien parametreja käyttämällä matalan sijan approksimaatioita täysipainoisten matriisien sijaan adaptaattorien koulutuksessa.

Aiempien töiden osoittanut, että edustusten muokkaaminen voi olla parempi vaihtoehto parametrien tehokkaalle fine-tuningille eli PeFT-menetelmille, tässä artikkelissa puhumme Edustusjärkeistys eli ReFT-menetelmistä, jotka toimivat jäädytetyn mallin kanssa ja oppivat tehtävän mukaisia interventioita piilotettuihin edustuksiin. Tämä artikkeli pyrkii kattamaan ReFT- eli Edustusjärkeistys-kehyksen syvällisesti, ja tutkimme mekanismia, metodologiaa, arkkitehtuuri ja sen vertailua valmiiden kehysten kanssa. Joten aloitetaan.

ReFT: Edustusjärkeistys kielen mallien fine-tunauksessa

Pyrkimyksenä on sovittaa esikoulutettuja kielen malleja uusiin domeeneihin ja tehtäviin, nykyiset kehykset fine-tune usein esikoulutettuja kielen malleja, ja fine-tuning-prosessin toteutuksella yksittäinen perusmalli voidaan sovittaa moniin tehtäviin, vaikka mallilla on vain vähän domeenin sisäistä dataa. Vaikka fine-tuning-prosessi parantaa kokonaisuuden suorituskykyä, se on kallis prosessi, erityisesti kielen malleille, joilla on merkittävästi suurempi määrä parametreja. Ratkaisemaan tämän ongelman ja vähentämään liittyviä kustannuksia, PeFT eli parametrien tehokas fine-tuning -kehykset päivittävät vain pienen osan saatavilla olevista painoista, prosessi, joka vähentää koulutusajan ja muistin käytön lisäksi, ja mahdollistaa PeFT-kehyksille saavuttamaan samanlaisen suorituskyvyn kuin kokonaisen fine-tuningin lähestymistavat käytännön tilanteissa. Adaptaattorit, yleinen PeFT-menetelmien perhe, toimivat oppimalla muokkauksen, joka voidaan lisätä lisäjoukkoon painoja, jotka toimivat yhdessä jäädytetyn perusmallin kanssa, ja viimeaikaiset adaptaattorit kuten LoRA ja QLoRA ovat osoittaneet, että on mahdollista kouluttaa täysipresisio-adaptaattoreita vähennetyssä tarkkuudessa olevien mallien päällä ilman vaikutusta suorituskykyyn.

Tärkeä piirre nykyisistä valmiista parametrien tehokkaan fine-tuningin eli PeFT-kehyksistä on, että ne muokkaavat painoja sen sijaan, että muokkaavat edustuksia. Kuitenkin kehykset, jotka liittyvät tulkintatutkimukseen, ovat osoittaneet, että edustukset koodaavat semanttisesti rikasta tietoa, mikä viittaa siihen, että edustusten muokkaaminen voi olla parempi ja voimakkaampi lähestymistapa kuin painojen päivittäminen. Tämä oletus edustusten muokkaamisesta parempana lähestymistapana on se, mikä muodostaa ReFT- eli Edustusjärkeistys-kehyksen perustan, joka kouluttaa interventioita sen sijaan, että sovittaa mallin painoja, ja mahdollistaa mallille manipuloida pientä osaa kaikista edustuksista pyrkimyksenä ohjata mallin käyttäytymistä ratkaisemaan alirakenteellisia tehtäviä inference-ajan aikana. ReFT- eli Edustusjärkeistys-menetelmät ovat korvaavat painopohjaiset PeFT- eli parametrien tehokkaan fine-tuning -menetelmät. ReFT-lähestymistapa ammentaa inspiraatiota viimeaikaisista malleista, jotka työskentelevät suurten mallien tulkintatutkimuksessa, jotka interventioivat edustuksiin löytääkseen uskolliset kausaaliset mekanismit ja ohjaavat mallin käyttäytymistä inference-ajan aikana, ja voidaan nähdä yleistymänä edustusmuokkausmalleista.

Jatkamalla, toisin kuin kokonainen fine-tuning, PeFT- eli parametrien tehokas fine-tuning -kehykset kouluttavat vain pienen osan mallin parametreja, ja sovittavat mallin alirakenteellisiin tehtäviin. Parametrien tehokas fine-tuning -kehykset voidaan luokitella kolmeen pääluokkaan:

  • Adaptaattoripohjaiset menetelmät: Adaptaattoripohjaiset menetelmät kouluttavat lisämoduleja kuten täysiliitännäisiä kerroksia esikoulutetun mallin jäädytettyjen painojen päällä. Sarjapohjaiset adaptaattorit lisäävät komponentteja monikerroksisen perkulaarin ja suuren kielen mallin huomiokerrosten väliin, kun taas rinnakkaiset adaptaattorit lisäävät moduleja olemassa olevien komponenttien rinnalle. Koska adaptaattorit lisäävät uusia komponentteja, jotka eivät voi helposti yhdistää olemassa oleviin mallin painoihin, ne aiheuttavat lisää kuormitusta inference-ajan aikana.
  • LoRA: LoRA ja sen viimeaikaiset variantit approksimoivat lisäpainoja koulutuksen aikana käyttämällä matalan sijan matriiseja, eivätkä ne vaadi lisäkuormitusta inference-ajan aikana, koska painopäivitykset voidaan yhdistää malliin, ja se on syy, miksi ne ovat nykyisiä vahvimpia PeFT-kehyksiä.
  • Promptipohjaiset menetelmät: Promptipohjaiset menetelmät lisäävät pehmeitä tokeneja, jotka on alustettu satunnaisesti, syötteeseen, ja kouluttavat niiden upotukset pitäen kielen mallin painot jäädytettyinä. Nämä menetelmien tarjoamat suorituskyvyn on usein tyydyttävämpää verrattuna muihin PeFT-lähestymistapoihin, ja ne myös kantavat merkittävän inference-kuormituksen kustannuksen.

Sen sijaan, että päivittäisivät painoja, ReFT-kehykset oppivat interventioita muokata pientä osaa kaikista edustuksista. Lisäksi viimeaikaiset työt edustusinsinööritieteestä ja aktivaatiosteeringistä ovat osoittaneet, että lisäämällä kiinteitä ohjausvektoreita residual-virtaukseen voidaan saavuttaa tietty määrä valvontaa esikoulutetuille suurille mallin generoinneille ilman resursseja kuluttavaa fine-tunia. Muut kehykset ovat osoittaneet, että edustusten muokkaaminen oppimalla skaalauksen ja käännöstoiminnon avulla voidaan yrittää vastata, mutta ei ylittää LoRA-adaptaattorien suorituskykyä laajalla valikoimalla tehtävistä vähemmällä oppimisparametreilla. Lisäksi näiden kehyksien menestyksen laajalla valikoimalla tehtävistä on osoittanut, että esikoulutetuilla kielen malleilla esitetyt edustukset sisältävät rikasta semantiikkaa, vaikka näiden mallien suorituskyky on alisuorittava, mikä johtaa siihen, että PeFT:t jatkavat valmiina lähestymistapana ilman lisäkuormitusta inference-ajan aikana.

ReFT: Metodologia ja Arkkitehtuuri

Pitääkseen tyylin säilyttämisprosessin yksinkertaisena, ReFT-kehykset olettaa transformer-pohjaisen suuren mallin kohdemalliksi, joka pystyy tuottamaan kontekstualisoituneen edustuksen tokenien jonoista. Annettuun jonoista, jossa on n määrä syötteisiä tokeneja, ReFT-kehykset upottavat ensin nämä syötteiset tokenit edustuslistaan, ja m-kerrokset lasketaan edustuslistaa peräkkäin edellisen edustuslistan funktiona. Jokainen piiloutuva edustus on vektori, ja kielen malli käyttää lopullisia piiloutuvia edustuksia tuottaakseen ennusteita. ReFT-kehykset käsittelevät sekä maskattuja kielen malleja että autoregressiivisia kielen malleja. Nyt, lineaarisen edustus hypoteesin mukaan, neuroverkoissa konseptit koodataan lineaaristen alueiden sisällä edustuksissa. Viimeaikaiset mallit ovat löytäneet tämän väitteen todeksi neuroverkkomalleissa, jotka on koulutettu luonnollisella kielellä ja muilla syötteiden jakeluilla.

Lisäksi, tulkintatutkimuksissa, casual-abstraktiokehykset käyttävät vaihtuvia interventioita vahvistamaan neuroverkkokomponenttien roolia toiminnallisesti toteuttaa tietyt käyttäytymiset. Logiikka vaihtuvan interventioon perustuu siihen, että jos joku kiinnittää edustuksen sille, mitä se olisi ollut vastakkaiselle syötteelle, ja tämä interventio vaikuttaa mallin tulokseen johdonmukaisesti tavalla, jossa ReFT-kehykset tekevät väitteitä komponentista, joka tuottaa kyseisen edustuksen, niin komponentti esittää kausaalisen roolin käyttäytymisessä. Vaikka on joitakin menetelmiä, jakautunut vaihtuva interventio on ihanteellinen lähestymistapa testata, koodataanko konsepti lineaarisessa alueessa edustuksessa, kuten lineaarisen edustus hypoteesin väittää. Lisäksi DAS-menetelmää on aiemmin käytetty löytämään lineaarista edustusta kielen malleissa, jotka liittyvät entiteetin ominaisuuksiin, mielipiteisiin, kielellisiin piirteisiin ja matemaattiseen päättelyyn. Kuitenkin useat kokeet ovat osoittaneet, että DAS-menetelmä on erittäin ilmeinen, ja se kykenee löytämään kausaalisesti tehokkaita alueita, vaikka transformer-kielen malli on alustettu satunnaisesti, ja se on vielä oppimatta mitään tehtävän mukaista edustusta, mikä johtaa keskusteluun siitä, onko DAS tehokas ja vastuullinen tulkintatutkimukselle.

DAS-menetelmän ilmeisyys viittaa siihen, että lähestymistapa voi olla ihanteellinen työkalu ohjata kielen mallin käyttäytymistä ja sen työtä kontrollissa ja vastuullisessa editoinnissa. Siksi sovittaakseen kielen malleja alirakenteellisiin tehtäviin, ReFT-kehykset käyttävät jakautunutta vaihtuvaa interventiota luomaan uuden parametrien tehokkaan menetelmän. Lisäksi ReFT-menetelmä on joukko interventioita, ja kehykset pakottavat, että kaikille interventioille, jotka toimivat samalla kerroksella, interventioasemien on oltava erillisiä, ja kaikkien interventiofunktioiden parametreja on pidettävä riippumattomina. Tämän seurauksena ReFT on geneerinen kehykset, joka kattaa interventiot piiloutuvissa edustuksissa mallin eteenpäin kulkevan aikana.

ReFT: Kokeet ja Tulokset

Arvioidakseen suorituskykyään nykyisiin PeFT-kehyksiin verrattuna, ReFT-kehykset suorittavat kokeita neljällä erilaisella luonnollisen kielen prosessoinnin benchmarkilla, ja kattavat yli 20 tietojoukkoa, ja pääasiallinen tavoite on tarjota rikas kuva siitä, miten LoReFT-kehykset suoriutuvat erilaisissa tilanteissa. Lisäksi, kun LoReFT-kehykset on toteutettu käytännössä, kehittäjien on päätettävä, kuinka monta interventiota on opittava, sekä syötteiden asemat ja kerrokset, joille kunkin sovelletaan. Tämän tehtävän suorittamiseksi ReFT-kehykset säätävät neljä hyperparametria.

  1. Interventioasemien määrä, joihin on interventio.
  2. Interventioasemien määrä, joihin on interventio.
  3. Mikä joukko kerroksia interventioon.
  4. Onko interventioparametrit sidottu eri asemien välillä samalla kerroksella.

Tämän seurauksena ReFT-kehykset yksinkertaisivat hyperparametrien etsintätilan, ja varmistavat vain kiinteän lisäkuormituksen, joka ei skaalaa syötteen pituuden mukaan.

Yllä oleva taulukko vertaa LLaMA-7B- ja LLaMA-13B-mallien tarkkuutta nykyisiin PeFT-malleihin kahdeksalla yleissivistävän päättelyn tietojoukossa. Kuten voidaan havaita, LoReFT-malli ylittää nykyiset PeFT-lähestymistavat kohtuullisella marginaalilla, vaikka se on paljon vähemmän parametreja, ja keskimääräinen suorituskyky kolmesta suorituksesta ilmoitetaan eri parametri-siemenillä LoReFT-mallille. Param(%) lasketaan jakamalla koulutettavien parametreja mallin kokonaisparametrien määrällä.

Yllä oleva taulukko tiivistää LLaMA-7B- ja LLaMA-13B-mallien tarkkuuden vertailun nykyisiin PeFT-malleihin neljällä erilaisella laskennallisen päättelyn tietojoukolla, ja kehykset ilmoittavat keskimääräisen suorituskyvyn kolmesta suorituksesta satunnaisilla siemenillä. Kuten voidaan havaita, vaikka LoReFT-mallilla on paljon vähemmän parametreja, se ylittää nykyiset PeFT-kehykset merkittävällä marginaalilla.

Yllä oleva taulukko tiivistää RoBERTa-base- ja RoBERTa-large-mallien tarkkuuden vertailun nykyisiin PeFT-malleihin GLUE-benchmarkilla, ja kehykset ilmoittavat keskimääräisen suorituskyvyn viidestä suorituksesta satunnaisilla siemenillä. Kuten voidaan havaita, vaikka LoReFT-mallilla on paljon vähemmän parametreja, se ylittää nykyiset PeFT-kehykset merkittävällä marginaalilla.

Lopputajat

Tässä artikkelissa olemme puhuneet LoReFT:stä, voimakkaasta vaihtoehdosta nykyisille PeFT-kehyksille, joka saavuttaa vahvan suorituskyvyn useilla benchmarkilla neljältä eri alueelta, ja tarjoaa jopa 50-kertaisen tehokkuuden verrattuna aiempiin valmiisiin PeFT-malleihin. Esikoulutetut suuret mallit ovat usein fine-tune käytettäviksi uusissa domeeneissa ja tehtävissä, ja fine-tuning-prosessin aikana yksittäinen perusmalli voidaan sovittaa moniin tehtäviin, vaikka mallilla on vain vähän domeenin sisäistä dataa. Kuitenkin koko mallin fine-tuning on resursseja kuluttava ja kallis prosessi, erityisesti kielen malleille, joilla on merkittävästi suurempi määrä parametreja ja kokoa. Parametrien tehokas fine-tuning eli PeFT-menetelmät ehdottavat, että korkeat fine-tuningin kustannukset voidaan ratkaista päivittämällä vain pienen osan saatavilla olevista painoista, prosessi, joka vähentää koulutusajan ja muistin käytön lisäksi. Merkittävästi, LoReFT asettaa uuden valmiin suorituskyvyn yleissivistävän päättelyn, ohjeiden seuraamisen ja luonnollisen kielen ymmärtämisen osalta verrattuna vahvimmille PeFT-kehyksille.

Ammattina insinööri, sydämen vuoksi kirjailija. Kunal on tekninen kirjailija, jolla on syvä rakkaus ja ymmärrys AI: sta ja ML: stä, omistautunut yksinkertaistamaan monimutkaisia käsitteitä näissä aloissa hänen viihdyttävän ja informatiivisen dokumentaationsa kautta.