Prompt engineering
LLM-hienosäätö ymmärtäminen: Räätälöinti suurten kielen mallien mukauttamiseksi yksilöllisiin vaatimuksiin

Vuoden 2023 syyskuussa suurten kielen mallien (LLM) maisema on edelleen todistamassa mallien kuten Alpaca, Falcon, Llama 2, GPT-4 ja monien muiden nousua.
LLMien potentiaalin hyödyntämisen tärkeä osa on hienosäätöprosessi, joka on strategia, joka mahdollistaa esikoulutettujen mallien mukauttamisen tiettyihin tehtäviin tarkkuudella. Tämä hienosäätö mahdollistaa mallien sovittamisen yksilöllisiin vaatimuksiin, tarjoten ratkaisuja, jotka ovat sekä innovatiivisia että räätälöityjä yksilöllisiin tarpeisiin.
On kuitenkin tärkeää huomata, että kaikki hienosäätöväylät eivät ole samanarvoisia. Esimerkiksi GPT-4:n hienosäätöominaisuuksiin pääsy edellyttää maksullista tilausta, joka on suhteellisen kalliimpi kuin muut markkinoilla saatavat vaihtoehdot. Toisaalta avoimen lähdekoodin alue on täynnä vaihtoehtoja, jotka tarjoavat helpomman tien suurten kielen mallien voiman hyödyntämiseen. Nämä avoimen lähdekoodin vaihtoehdot demokratisoivat pääsyn edistyneeseen AI-teknologiaan, edistäen innovaatiota ja inklusiivisuutta nopeasti kehittyvässä AI-maailmassa.
Miksi LLM-hienosäätö on tärkeää?
LLM-hienosäätö on enemmän kuin tekninen parannus; se on tärkeä osa LLM-mallien kehittämistä, joka mahdollistaa mallien sovittamisen tiettyihin tehtäviin. Hienosäätö sovittaa esikoulutetut mallit paremmin tiettyihin tietokantoihin, parantaen niiden suorituskykyä tiettyjen tehtävien suorittamisessa ja varmistaa mallien soveltamisen tiettyihin tehtäviin. Se mahdollistaa LLM-mallien sopeutumisen uusiin tietoihin, osoittaen joustavuutta, joka on välttämätöntä AI-sovellusten kasvavassa kiinnostuksessa.
LLM-hienosäätö avaa monia mahdollisuuksia, mahdollistaen mallien menestyksen tiettyjen tehtävien suorittamisessa, kuten mielipideanalyysissä ja lääketieteellisissä kirjallisuuskatsauksissa. Sovittamalla perusmallin tiettyyn käyttötapaan, avaan uusia mahdollisuuksia, parantaen mallin tehokkuutta ja tarkkuutta. Lisäksi se mahdollistaa taloudellisemman järjestelmäresurssien käytön, koska hienosäätö vaatii vähemmän laskentatehoa verrattuna mallin kouluttamiseen alusta alkaen.
Generative AI-elinkaaren hienosäätövaihe, joka on kuvattu alla olevassa kuvassa, on ominaista ohjeiden ja esimerkkien sisällyttämisestä, joissa on askelkohtaiset päättelyohjeet. Tämä lähestymistapa mahdollistaa mallin tuottaa vastauksia, jotka eivät ainoastaan ole relevantteja vaan myös tarkasti ohjeiden mukaisia. Tässä vaiheessa esikoulutetut mallit sovitetaan ratkaisemaan erityisiä tehtäviä ja sovelluksia, käyttäen henkilökohtaisia tietokantoja parantamaan toimintaa.
Yksitehtäväinen hienosäätö
Yksitehtäväinen hienosäätö keskittyy mallin asiantuntemuksen kehittämiseen tiettyyn tehtävään, kuten yhteenvetokirjoittamiseen. Tämä lähestymistapa on erityisen hyödyllinen optimoimassa työvirtoja, jotka sisältävät merkittäviä asiakirjoja tai keskustelunaiheita, kuten oikeudellisia asiakirjoja ja asiakastukipyyntöjä. Huomattavaa on, että tämä hienosäätö voi saavuttaa merkittäviä suorituskyvyn parannuksia suhteellisen pienellä esimerkkijoukolla, joka voi olla 500-1000, verrattuna miljardiin tokeniin, joita käytetään esikoulutusvaiheessa.
LLM-hienosäätö perusteet: Transformer-arkkitehtuuri ja sen ympärillä
LLM-hienosäätö ymmärtäminen alkaa LLM-mallien perusrakenteiden ymmärtämisestä. Näiden mallien ydin on transformer-arkkitehtuuri, joka on neuroverkko, joka käyttää itsehuomio-mekanismeja priorisoimaan sanojen kontekstia niiden läheisyyden sijaan lauseessa. Tämä innovatiivinen lähestymistapa mahdollistaa syvemmän ymmärryksen etäisten suhteiden välillä tokenien välillä syötteenä.
Kun tutkimme transformer-arkkitehtuurin yksityiskohtia, kohtaamme monivaiheisen prosessin, joka alkaa koodauksella. Tässä alkuvaiheessa syöte tokenisoidaan ja luodaan upotusvektorit, jotka edustavat syötettä ja sen sijaintia lauseessa. Seuraavat vaiheet sisältävät joukon laskelmia, jotka käyttävät matriiseja, jotka tunnetaan Kysymys, Arvo ja Avain, johtuen itsehuomioarviosta, joka määrää fokuksen eri osiin lauseessa ja eri tokeneihin.
Hienosäätö on kriittinen vaihe LLM-mallien kehittämisessä, jossa tehdään hienoisia säätöjä saavuttaaksesi toivottuja tuloksia. Tämä vaihe on kuitenkin haasteellinen, mukaan lukien laskennalliset ja tallennusvaatimukset suuren määrän parametrejä käsiteltäessä. Parametrien tehokas hienosäätö (PEFT) tarjoaa tekniikoita vähentääksesi säätettävien parametrejen määrää, yksinkertaistaen koulutusprosessia.
LLM-esikoulutus: Vahvan perustan luominen
LLM-kehityksen alkuvaiheessa esikoulutus on keskeisessä asemassa, jossa ylikoolutetut transformerit toimivat perusrakenteena. Tämä prosessi käsittää luonnollisen kielen mallinnuksen eri tavoilla, kuten bidirectional, autoregressiivisesti tai sekvenssi-sekvenssissä suurissa aineistoissa. Tavoitteena on luoda perusta, jota voidaan myöhemmin hienosäätää tiettyihin tehtäviin esittämällä tehtäväkohtaisia tavoitteita.
Tärkeä trendi tässä alueessa on suurten esikoulutettujen LLM-mallien mittakaavan kasvu, joka mitataan parametrejen määrällä. Empiiriset tiedot osoittavat johdonmukaisesti, että suuremmat mallit ja enemmän dataa johtavat yleensä parempiin suorituskykyyn. Esimerkiksi GPT-3, jolla on 175 miljardia parametriä, on asettanut standardin korkealaatuisen luonnollisen kielen tuottamisessa ja suorittaa laajan valikoiman nollasuorituskykyisiä tehtäviä.
Hienosäätö: Mallin sovittaminen
Esikoulutuksen jälkeen LLM-malli käy hienosäätövaiheen sopeutuakseen tiettyihin tehtäviin. Vaikka esikoulutetuissa LLM-malleissa, kuten GPT-3, on osoitettu lupaavaa suorituskykyä kontekstissä oppimisessa, hienosäätö on edelleen parempi tehtäväkohtaisissa asetelmissa. Yleinen lähestymistapa, jossa kaikki parametrit hienosäätetään, esittää kuitenkin haasteita, kuten suuret laskennalliset ja muistivaatimukset, erityisesti suurten mallien käsittelyssä.
Suurten kielen mallien kohdalla, joilla on yli miljardi parametriä, tehokas GPU-muistin hallinta on ratkaiseva. Yksittäinen mallin parametri, joka on täysin 32-bittisen tarkin, vaatii 4 tavua tilaa, mikä tarkoittaa 4 gigatavun GPU-muistin tarvetta vain yhden miljardin parametrin mallin lataamiseen. Itse koulutusprosessi vaatii vielä enemmän muistia optimoijien tilojen, gradientien ja muiden komponenttien käsittelyyn, mikä voi vaatia jopa 80 gigatavua GPU-muistia mallin tämän koossa.
GPU-muistin rajoitusten kiertämiseksi käytetään kvantisaatiota, joka on tekniikka, joka vähentää mallin parametreiden tarkkuutta, vähentäen muistin tarvetta. Esimerkiksi tarkkuuden muuttaminen 32-bittisestä 16-bittiseen voi puolittaa muistin tarpeen sekä mallin lataamiseen että koulutukseen. Myöhemmin tässä artikkelissa tutustumme QLoraan, joka käyttää kvantisaatiokäsitettä säätöä varten.
PEFT-menetelmien kategoriat
Täysin hienosäätäessä suuria kielen malleja on tärkeää olla laskennallinen asettelu, joka voi käsitellä ei ainoastaan suuria mallipainoja, jotka ovat nyt kasvamassa satojen gigatavujen kokoon, vaan myös hallita muita kriittisiä elementtejä. Nämä sisältävät muistiin varastoinnin optimoijien tiloja, gradientien hallintaa, eteenpäin suoritettavien aktivaatioiden hallintaa ja tilapäisen muistin hallintaa eri koulutusvaiheiden aikana.
Lisäysmenetelmä
Tämä säätömenetelmä voi lisätä esikoulutettuun malliin lisäparametrejä tai kerroksia, keskittyen ainoastaan uusien parametrejen kouluttamiseen. Vaikka se lisää parametrilukumäärää, nämä menetelmät parantavat koulutuksen aikaa ja tilaa. Lisäysmenetelmä on jaettu alaluokkiin:
- Sovitin: Sisällyttää pieniä täysin kytkettyjä verkkoja transformer-alikerrosten jälkeen, joista mainittavia esimerkkejä ovat AdaMix, KronA ja Compactor.
- Pehmeät ohjeet: Hienosäätää mallin osan syöteupotuksia gradientilaskennan avulla, joista merkittäviä esimerkkejä ovat IPT, prefix-tuning ja WARP.
- Muut lisäyslähestymistavat: Sisältävät tekniikoita kuten LeTS, AttentionFusion ja Ladder-Side Tuning.
Valikoivamenetelmä
Valikoivat PEFT:t hienosäätävät rajoitetun määrän ylempiä kerroksia kerrostyypin ja sisäisen mallirakenteen perusteella. Tähän kategoriaan kuuluvat menetelmät kuten BitFit ja LN-säätö, jotka keskittyvät tiettyjen elementtien, kuten mallin harha- ja tietyn rivin, säätöön.
Uudelleenparametrinen menetelmä
Nämä menetelmät käyttävät matalan arvon esityksiä vähentääksesi koulutettavien parametrejen määrää, joista tunnetuin on Low-Rank Adaptation eli LoRA. Tämä menetelmä käyttää yksinkertaista matalan arvon matriisin hajottamista parametrin päivityksen parametrointiin, osoittaen tehokasta hienosäätöä matalan arvon alueilla.
1) LoRA (Low-Rank Adaptation)
LoRA on uraauurtava PEFT-tekniikka, joka esiteltiin Edward J. Hu ja muut vuonna 2021. Se toimii uudelleenparametrisoinnin kategoriassa, jäädyttäen alkuperäiset LLM-painot ja lisäämällä uudet koulutettavat matalan arvon matriisit jokaiseen Transformer-arkkitehtuurin kerrokseen. Tämä lähestymistapa ei ainoastaan vähennä koulutettavien parametrejen määrää vaan myös vähentää koulutuksen aikaa ja laskennallisia resursseja, tarjoaten tehokkaamman vaihtoehdon täydelliselle hienosäätölle.
Ymmärtääksemme LoRA:n mekaniikkaa, on palattava transformer-arkkitehtuuriin, jossa syöte käy tokenisoiduksi ja muutetaan upotusvektoreiksi, jotka kulkevat koodaus- ja/tai dekoodausosuuksien läpi, kohtaamassa itsehuomio- ja eteenpäin suoritettavat verkkorakenteet, joiden painot on esikoulutettu.
LoRA käyttää yksinkertaisen arvon hajottamisen (SVD) käsitettä. SVD jakaa matriisin kolmeen erilliseen matriisiin, joista yksi on diagonaali, joka sisältää yksinkertaiset arvot. Nämä arvot ovat tärkeitä, koska ne mitoittavat eri ulottuvuuksien merkitystä matriiseissa, suuremmat arvot osoittaen suurempaa merkitystä ja pienemmät arvot vähäisempää.
Tämä lähestymistapa mahdollistaa LoRA:lle säilyttää tärkeät ominaisuudet datasta vähentäen ulottuvuuskokoa, optimoimalla hienosäätöprosessia.
LoRA interventioi tähän prosessiin, jäädyttäen kaikki alkuperäiset malliparametrit ja lisäämällä “säätömatrisoiden” parin alkuperäisten painojen rinnalle. Nämä pienemmät matriisit, jotka on merkitty A:na ja B:na, koulutetaan valvotulla oppimisella.
Avainasemassa oleva tekijä tässä strategiassa on “säätö” -parametri (r), joka määrää matalan arvon matriisien koon. Tarkan valinnan “r”:n arvolla voidaan saavuttaa vaikuttavia tuloksia, jopa pienemmällä arvolla, luomalla matalan arvon matriisin, jossa on vähemmän parametreja koulutettavaksi. Tämä strategia on toteutettu tehokkaasti avoimen lähdekoodin kirjastojen avulla, kuten HuggingFace Transformers, joka mahdollistaa LoRA-hienosäätön monissa tehtävissä merkittävällä tehokkuudella.
2) QLoRA: LoRA-tehokkuuden lisääminen
Rakentamalla LoRA:n perustalle, QLoRA vähentää edelleen muistin vaatimusta. Tim Dettmers ja muut esittivät sen vuonna 2023, yhdistämällä matalan arvon sopeutumisen kvantisaatioon, käyttäen 4-bittistä kvantisaatiomuotoa, jota kutsutaan NormaaliFloat tai nf4:ksi. Kvantisaatio on prosessi, jossa siirrytään korkeammasta tiedon esitysmuodosta alempaan, vähemmän tietoa sisältävään muotoon. Tämä lähestymistapa säilyttää 16-bittisen hienosäätömenetelmien tehokkuuden, dekvantisoimalla 4-bittiset painot 16-bittisiksi laskentaoperaatioiden aikana.

Hienosäätömenetelmien vertailu: QLORA parantaa LoRA:ta 4-bittisellä tarkkuudella ja sivuittaisilla optimoijilla muistipiikin hallintaan
QLoRA hyödyntää NumericFloat4 (nf4):ää, kohdistamalla jokaiseen transformer-arkkitehtuurin kerrokseen, ja esittelee kaksoiskvantisaation käsitteen vähentääksesi edelleen muistijalanjälkeä hienosäätöä varten. Tämä saavutetaan kvantisoimalla jo kvantisoituja vakioita, strategia, joka estää tyypillisiä gradientin tarkistusmuistin piikkejä sivuittaisilla optimoijilla ja yhtenäisellä muistinhallinnalla.
Guanaco, joka on QLORA-säätelty kokoonpano, asettaa standardin avoimen lähdekoodin chatbot-ratkaisuissa. Sen suorituskyky on vahvistettu systemaattisilla ihmisten ja automaattisilla arvioilla, korostaa sen johtavaa asemaa ja tehokkuutta alalla.
Guanacon 65B ja 33B versiot, jotka on hienosäätelty OASST1-aineistolla, nousevat merkittäviksi kilpailijoiksi tunnetuille malleille kuten ChatGPT ja jopa GPT-4.
Hienosäätö ihmisen palautteen perusteella vahvistusoppimisella
Ihmisen palautteen perusteella vahvistusoppiminen (RLHF) tulee kuvaan, kun hienosäätetään esikoulutettuja kielen malleja, jotta ne vastaisivat paremmin ihmisten arvoja. Tämä käsite esiteltiin Open AI:ssa vuonna 2017 ja loi perustan parannelle asiakirjamuokkaamiselle ja InstructGPT:n kehittämiselle.
RLHF:n ytimessä on vahvistusoppimisen paradigma, jossa agentti oppii toimimaan ympäristössä suorittamalla toimintoja ja saamalla palkkioita. Se on jatkuva toiminta- ja palautteen silmukka, jossa agentti kannustetaan tekemään valintoja, jotka tuottavat suurimman palkkion.
Siirtäessä tätä kielen mallien maailmaan, agentti on itse malli, toimien tietyn kontekstiruudun ympäristössä ja tehdessä päätöksiä tilan perusteella, joka määritellään nykyisillä tokeneilla kontekstiruudussa. “Toimintatila” kattaa kaikki mahdolliset tokenit, joista malli voi valita, tavoitteena valita tokeni, joka vastaa parhaiten ihmisten preferenssejä.
RLHF-prosessi hyödyntää laajasti ihmisten palautetta kouluttaakseen palkkiomallin. Tämä malli on avainasemassa ohjatessaan esikoulutettua mallia hienosäätöprosessissa, kannustaen sitä tuottamaan tuloksia, jotka ovat paremmin linjassa ihmisten arvojen kanssa. Se on dynaaminen ja iteraatiivinen prosessi, jossa malli oppii sarjan “rollout”-ien kautta, termi, jota käytetään kuvaamaan tilojen ja toimintojen jonoa, joka johtaa palkkioon kielen tuottamisen kontekstissa.
Yksi RLHF:n merkittävimmistä potentiaaleista on sen kyky edistää personointia AI-apureissa, sovittamalla ne yksilöllisten käyttäjien preferenssien mukaan, olipa se heidän huumorintajunsa tai päivittäisten rutiinien mukaan. Se avaa tietä luomiseen AI-järjestelmistä, jotka eivät ainoastaan ole teknisesti päteviä vaan myös tunteellisesti älykkäitä, pystyen ymmärtämään ja reagoimaan hienoihin viittauksiin ihmisten viestinnässä.
Kuitenkin on tärkeää huomata, että RLHF ei ole virheetön ratkaisu. Mallit ovat edelleen alttiina tuottamaan epätoivottuja tuloksia, heijastaen laajan ja usein säätelemättömän ja harhaanjohtavan aineiston, jolla ne on koulutettu.
Johtopäätös
Hienosäätöprosessi, joka on kriittinen vaihe hyödyntäessä suurten kielen mallien (kuten Alpaca, Falcon ja GPT-4) täyttä potentiaalia, on kehittynyt tarkemmaksi ja kohdennetuksi, tarjoten räätälöityjä ratkaisuja laajaan valikoimaan tehtäviä.
Olemme nähneet yksitehtäväisen hienosäätön, joka erikoistuu malleissa tiettyihin rooleihin, ja Parametrien tehokkaan hienosäätömenetelmät (PEFT), kuten LoRA ja QLoRA, jotka pyrkivät tehostamaan koulutusprosessia ja vähentämään kustannuksia. Nämä kehitykset avaavat ovia korkean tason AI-toiminnallisuuksiin laajemmalle yleisölle.
Lisäksi Open AI:n esittelemä Ihmisen palautteen perusteella vahvistusoppiminen (RLHF) on askel kohti luomista AI-järjestelmistä, jotka ymmärtävät ja ovat paremmin linjassa ihmisten arvojen ja preferenssien kanssa, asettaen näin näyttämön AI-apureille, jotka eivät ainoastaan ole älykkäitä vaan myös herkkähermoisia yksilöiden tarpeiden suhteen.
Niin RLHF kuin PEFT toimivat synergisesti parantaakseen suurten kielen mallien toimintaa ja tehokkuutta. Kun yritykset, organisaatiot ja yksilöt pyrkivät integroimaan nämä hienosääteltyjä LLM-malleja toimintoihinsa, he ottavat vastaan tulevaisuuden, jossa AI on enemmän kuin työkalu – se on kumppani, joka ymmärtää ja sopeutuu ihmisten konteksteihin, tarjoten ratkaisuja, jotka ovat sekä innovatiivisia että yksilöllisesti räätälöityjä.























