AI-mallit ja alustat
Suorituskyvyn lisääminen suurilla kielimalleilla monimerkkien ennustamisen avulla
Suuret kielimallit (LLM) kuten GPT, LLaMA ja muut ovat vallanneet maailman hämmästyttävällä kyvyllään ymmärtää ja generoida ihmismäistä tekstiä. Kuitenkin, vaikka heillä on vaikuttavia kykyjä, suurten kielimallien standardimenetelmä, jota kutsutaan “seuraavan merkin ennustamiseksi”, sisältää joitain sisäänrakennettuja rajoituksia.
Seuraavan merkin ennustamisessa malli koulutetaan ennustamaan seuraava sana annetun edeltävän tekstin perusteella. Vaikka tämä lähestymistapa on osoittautunut menestyksekkääksi, se voi johtaa malleihin, jotka kamppailevat pitkän aikavälin riippuvuuksien ja monimutkaisten päättelytehtävien kanssa. Lisäksi opettajavoiman koulutusjärjestelmän ja itsesäätelevän generoinnin ero johtaa suboptimaaliseen suorituskykyyn.
Meta AI:n tutkimuspaperi Gloeckle et al. (2024) esittelee uuden koulutusparadigman nimeltä “monimerkkien ennustaminen“, joka pyrkii ratkaisemaan nämä rajoitukset ja parantamaan suurten kielimallien suorituskykyä. Tässä blogipostauksessa tutustumme syvällisemmin tämän uraauurtavan tutkimuksen ydinaiheisiin, teknisiin yksityiskohtiin ja mahdollisiin vaikutuksiin.
Yksittäisen merkin ennustaminen: Perinteinen lähestymistapa
Ennen kuin tutustumme monimerkkien ennustamisen yksityiskohtiin, on tärkeää ymmärtää perinteinen lähestymistapa, joka on ollut suurten kielimallien koulutuksen perusta vuosia – yksittäisen merkin ennustaminen, jota kutsutaan myös seuraavan merkin ennustamiseksi.
Seuraavan merkin ennustamisen paradigma
Seuraavan merkin ennustamisessa kielimallit koulutetaan ennustamaan seuraava sana annetun edeltävän tekstin perusteella. Muodollisemmin, malli pyrkii maksimoimaan seuraavan merkin xt+1 todennäköisyyden, annettuina edeltävät merkit x1, x2, …, xt. Tämä tehdään yleensä minimoida cross-entropiaa:
L = -Σt log P(xt+1 | x1, x2, …, xt)
Tämä yksinkertainen mutta voimakas koulutusobjektiivi on ollut useiden menestyksekkäiden suurten kielimallien perusta, kuten GPT (Radford et al., 2018), BERT (Devlin et al., 2019) ja niiden variantit.
Opettajavoima ja itsesäätelevä generointi
Seuraavan merkin ennustaminen perustuu koulutustekniikkaan, jota kutsutaan “opettajavoimaksi”, jossa mallille annetaan ground truth jokaiselle tulevalle merkille koulutuksen aikana. Tämä mahdollistaa mallin oppimisen oikeasta kontekstista ja kohdesarjoista, helpottaen vakaampaa ja tehokkaampaa koulutusta.
Kuitenkin johtuu siitä, että malli toimii itsesäätelevällä tavalla generoidessaan yhden merkin kerrallaan edellisten generoityjen merkkien perusteella. Tämä ero opettajavoiman koulutusjärjestelmän ja itsesäätelevän generoinnin välillä voi johtaa potentiaalisiin eroihin ja suboptimaaliseen suorituskykyyn, erityisesti pidempien sarjojen tai monimutkaisten päättelytehtävien osalta.
Seuraavan merkin ennustamisen rajoitukset
Vaikka seuraavan merkin ennustaminen on ollut erittäin menestyksekäs, se sisältää myös joitain sisäänrakennettuja rajoituksia:
- Lyhytaikainen fokus: Koska malli ennustaa vain seuraavan merkin, se voi kamppailla pitkän aikavälin riippuvuuksien ja koko tekstin rakenteen ja koherenssin kanssa, mikä voi johtaa epäjohdonmukaisuuksiin tai epäkoherentteihin generoinneihin.
- Paikallisten mallien kiinniottaminen: Seuraavan merkin ennustamismallit voivat kiinniottaa paikallisia malleja koulutusaineistossa, mikä tekee sen haasteelliseksi yleistää ulkopuolisiin tilanteisiin tai tehtäviin, jotka vaativat abstraktimpaa päättelyä.
- Päättelykyky: Tehtävissä, jotka vaativat monivaiheista päättelyä, algoritmista ajattelua tai monimutkaisia loogisia operaatioita, seuraavan merkin ennustaminen saattaa ei tarjoa riittäviä induktiivisia vinkejä tai edustuksia näiden kykyjen tukemiseksi tehokkaasti.
- Näytedatan tehokkuus: Seuraavan merkin ennustamisen paikallinen luonne saattaa johtaa siihen, että malleja tarvitaan suuremmat koulutusaineistot hankkimaan tarvittava tietämys ja päättelykyky, mikä voi johtaa potentiaalisiin näytedatan tehokkuuden puutteisiin.
Nämä rajoitukset ovat motivoineet tutkijoita tutkimaan vaihtoehtoisia koulutusparadigmoja, kuten monimerkkien ennustamista, joka pyrkii ratkaisemaan joitain näistä puutteista ja lukitsemaan uusia kykyjä suurten kielimallien kehittämiseen.
Vertaamalla perinteistä seuraavan merkin ennustamisen lähestymistapaa uuteen monimerkkien ennustamisen tekniikkaan, lukijat voivat paremmin ymmärtää motivaation ja potentiaaliset hyödyt jälkimmäisestä, luoden pohjan syvemmälle tutkimukselle tästä uraauurtavasta tutkimuksesta.
Mitä on monimerkkien ennustaminen?
Monimerkkien ennustamisen avainidea on kouluttaa kielimallit ennustamaan useita tulevia merkkejä samanaikaisesti, ei vain seuraavaa merkkiä. Nimenomaan koulutuksen aikana malli koulutetaan ennustamaan seuraavat n merkit kussakin koulutusaineiston kohdassa, käyttäen n itsenäisiä ulostuloja, jotka toimivat jaetun mallirungon päällä.
Esimerkiksi 4-merkin ennustamisessa malli koulutetaan ennustamaan seuraavat 4 merkkiä kerran, annettuna edeltävä konteksti. Tämä lähestymistapa rohkaisee mallia capturemaan pidemmän aikavälin riippuvuuksia ja kehittämään paremman ymmärryksen koko tekstin rakenteesta ja koherenssista.
Esimerkki
Jotta ymmärtäisimme paremmin monimerkkien ennustamisen käsitteen, tarkastellaan yksinkertaista esimerkkiä:
“The quick brown fox jumps over the lazy dog.”
Perinteisessä seuraavan merkin ennustamisessa malli koulutetaan ennustamaan seuraava sana annetun edeltävän kontekstin perusteella. Esimerkiksi annettuna konteksti “The quick brown fox jumps over the,” malli koulutetaan ennustamaan seuraavan sanan, “lazy.”
Monimerkkien ennustamisessa malli koulutetaan ennustamaan useita tulevia merkkejä samanaikaisesti. Esimerkiksi asetettaessa n=4, malli koulutetaan ennustamaan seuraavat 4 merkkiä samanaikaisesti. Annettuna sama konteksti “The quick brown fox jumps over the,” malli koulutetaan ennustamaan merkkijonon “lazy dog .” (Huomaa välilyönti “dogin” jälkeen, joka osoittaa lauseen lopun).
Kouluttaessa mallia ennustamaan useita tulevia merkkejä samanaikaisesti, se rohkaisee mallia capturemaan pidemmän aikavälin riippuvuuksia ja kehittämään paremman ymmärryksen koko tekstin rakenteesta ja koherenssista.
Tekniset yksityiskohdat
Kirjoittajat ehdottavat yksinkertaista mutta tehokasta arkkitehtuuria monimerkkien ennustamisen toteuttamiseksi. Malli koostuu jaetusta transformer-rungosta, joka tuottaa latentin edustuksen syötteenä olevasta kontekstista, ja n itsenäisistä transformer-kerroksista (ulostuloista), jotka ennustavat vastaavat tulevat merkit.
Koulutuksen aikana eteen- ja taaksepäin suoritetaan huolellisesti järjestettyä eteen- ja taaksepäin suoritusta vähentämään GPU-muistin käyttöä. Jaettu runko laskee latentin edustuksen, ja sitten jokainen ulostulo suorittaa eteen- ja taaksepäin suorituksensa vuorotellen, kertyen gradientit rungon tasolla. Tämä lähestymistapa välttää kaikkien logiikkojen ja niiden gradienttien materialisoinnin samanaikaisesti, vähentäen huippu-GPU-muistin käyttöä O(nV + d):sta O(V + d):een, missä V on sanastoon koko ja d on latentin edustuksen ulottuvuus.
Muistin tehokas toteutus
Yksi haaste monimerkkien ennustajien kouluttamisessa on vähentää niiden GPU-muistin käyttöä. Koska sanastoon koko (V) on yleensä paljon suurempi kuin latentin edustuksen ulottuvuus (d), logiikot muodostavat GPU-muistin käytön pullonkaulan.
Ratkaisemaan tämän haasteen kirjoittajat ehdottavat muistin teho- toteutusta, joka sopeuttaa eteen- ja taaksepäin suoritusten järjestyksen. Sen sijaan, että materialisoidaan kaikki logiikot ja niiden gradientit samanaikaisesti, toteutus suorittaa eteen- ja taaksepäin suoritukset jokaiselle itsenäiselle ulostulolle vuorotellen, kertyen gradientit rungon tasolla.
Tämä lähestymistapa välttää kaikkien logiikkojen ja niiden gradienttien tallentamisen muistiin samanaikaisesti, vähentäen huippu-GPU-muistin käyttöä O(nV + d):sta O(V + d):een, missä n on ennustettavien tulevien merkkien määrä.
Monimerkkien ennustamisen edut
Tutkimuspaperi esittää useita vakuuttavia monimerkkien ennustamisen etuja suurten kielimallien koulutuksessa:
- Parannettu näytedatan tehokkuus: Kouluttaessa mallia ennustamaan useita tulevia merkkejä samanaikaisesti, monimerkkien ennustaminen ajaa mallia kehittymään paremmaksi näytedatan tehokkuudeksi. Kirjoittajat osoittavat merkittäviä suorituskyvyn parannuksia koodin ymmärtämis- ja generointitehtävissä, malleilla jopa 13B parametreja ratkaisee noin 15% enemmän ongelmia keskimäärin.
- Nopeampi inference: Monimerkkien ennustamisessa koulutetut lisäulostulot voivat hyödyntää itse-speculaatiivista dekoodausta, joka on speculaatiivisen dekoodauksen variantti, joka sallii rinnakkaisen merkin ennustamisen. Tämä johtaa jopa 3-kertaisiin nopeampiin inference-aikoihin laajalla skaalalla eri batch-kokoja, jopa suurten mallien osalta.
- Pitkän aikavälin riippuvuuksien edistäminen: Monimerkkien ennustaminen rohkaisee mallia capturemaan pidemmän aikavälin riippuvuuksia ja malleja aineistossa, mikä on erityisen hyödyllistä tehtävissä, jotka vaativat ymmärtämistä ja päättelyä laajemman kontekstin yli.
- Algoritmisen päättelyn edistäminen: Kirjoittajat esittävät kokeita synthetisissä tehtävissä, jotka osoittavat monimerkkien ennustamismallien ylivoiman kehittää algoritmista päättelykykyjä, erityisesti pienempien mallikokoja osalta.
- Koherenssin ja johdonmukaisuuden edistäminen: Kouluttaessa mallia ennustamaan useita tulevia merkkejä samanaikaisesti, monimerkkien ennustaminen rohkaisee mallia kehittämään koherentteja ja johdonmukaisia edustuksia. Tämä on erityisen hyödyllistä tehtävissä, jotka vaativat pidempien ja koherentimpien tekstien generointia, kuten tarinoiden, artikkeleiden tai ohjeiden luomista.
- Parannettu yleistettävyys: Kirjoittajien kokeet synthetisissä tehtävissä viittaavat siihen, että monimerkkien ennustamismallit osoittavat parempaa yleistettävyyttä, erityisesti ulkopuolisissa tilanteissa. Tämä johtunee mallin kyvystä capturemaan pidemmän aikavälin malleja ja riippuvuuksia, mikä auttaa sitä yleistämään tehokkaammin näkymättömiin tilanteisiin.

Esimerkit ja intuitiot
Jotta antaisimme enemmän intuitioita siitä, miksi monimerkkien ennustaminen toimii niin hyvin, tarkastellaan muutamia esimerkkejä:
- Koodin generointi: Koodin generoinnissa ennustamalla useita merkkejä samanaikaisesti voidaan auttaa mallia ymmärtämään ja generoimaan monimutkaisempia koodirakenteita. Esimerkiksi funktioiden määrittelyssä ennustamalla vain seuraava merkki saattaa ei riitä mallin generoimiseen koko funktiosignatuurista oikein. Monimerkkien ennustamisella malli voidaan kouluttaa ennustamaan useita merkkejä kerran, mikä auttaa sitä capturemaan riippuvuuksia funktio-nimen, parametreiden ja paluutyyppien välillä, johtaen tarkemmpaan ja koherentimpaan koodin generointiin.
- Luonnollisen kielen päättely: Oletetaan, että kielimalli on tehtävänä vastata kysymyksiin, jotka vaativat päättelyä useiden askelten tai tietojen yli. Ennustamalla useita merkkejä samanaikaisesti malli voidaan auttaa capturemaan riippuvuuksia eri päättelyprosessin osien välillä, johtaen koherentimpiin ja tarkemmpiin vastauksiin.
- Pitkän tekstin generointi: Pitkän tekstin generoinnissa, kuten tarinoissa, artikkeleissa tai ohjeissa, ylläpitäminen koherenssia ja johdonmukaisuutta pitkän ajan yli voi olla haasteellista kielimalleille, jotka on koulutettu seuraavan merkin ennustamisella. Monimerkkien ennustaminen rohkaisee mallia kehittämään edustuksia, jotka capturevat koko tekstin rakennetta ja virtaa, mikä johtaa koherentimpiin ja johdonmukaisempiin pitkien tekstien generointiin.
Rajoitukset ja tulevaisuuden suunnat
Vaikka tutkimuksessa esitetyt tulokset ovat vaikuttavia, on joitain rajoituksia ja avoimia kysymyksiä, jotka vaativat lisätutkimusta:
- Optimaalinen merkkiennustus: Tutkimus tutkii eri arvoja n:lle (ennustettavien tulevien merkkien määrä) ja havaitsee, että n=4 toimii hyvin useissa tehtävissä. Optimaalinen n-arvo saattaa kuitenkin riippua tehtävästä, aineistosta ja mallin koosta. Kehittämällä järkeviä menetelmiä optimaalisen n-arvon määrittämiseksi voidaan saavuttaa lisää suorituskyvyn parannuksia.
- Sanastokoko ja tokenisointi: Kirjoittajat huomauttavat, että monimerkkien ennustamismallien sanastokoko ja tokenisointi saattavat poiketa seuraavan merkin ennustamismallien käytännöistä. Tämän tutkiminen voi johtaa parempiin kompromisseihin pakatun sarjan pituuden ja laskennallisen tehokkuuden välillä.
- Lisäennustusmenetelmät: Kirjoittajat ehdottavat, että heidän työnsä voi herättää mielenkiinnon kehittää uusia apuennustusmenetelmiä suurten kielimallien koulutukseen, siirtymällä perinteisestä seuraavan merkin ennustamisesta. Tutkimalla vaihtoehtoisia apuennustusmenetelmiä ja niiden yhdistämistä monimerkkien ennustamisen kanssa voidaan löytää uusia suuntia.
- Teoreettinen ymmärrys: Vaikka tutkimus tarjoaa joitain intuitioita ja empiirisiä todisteita monimerkkien ennustamisen tehokkuudesta, syvempi teoreettinen ymmärrys siitä, miksi ja miten tämä lähestymistapa toimii, olisi arvokasta.
Johtopäätös
Tutkimuspaperi “Parannettu ja nopeampi suurten kielimallien kehitys monimerkkien ennustamisen avulla” Gloeckle et al. (2024) esittelee uuden koulutusparadigman, jolla on potentiaalista parantaa merkittävästi suurten kielimallien suorituskykyä ja kykyjä. Kouluttaessa malleja ennustamaan useita tulevia merkkejä samanaikaisesti, monimerkkien ennustaminen ajaa mallia kehittymään paremmaksi pitkän aikavälin riippuvuuksien, algoritmisen päättelyn kykyjen ja paremman näytedatan tehokkuuden suhteen.
Tekninen toteutus, jonka kirjoittajat ehdottavat, on elegantti ja laskennallisesti tehokas, mikä tekee tämän lähestymistavan soveltamisen mahdolliseksi suurten kielimallien koulutukseen. Lisäksi mahdollisuus hyödyntää itse-speculaatiivista dekoodausta nopeamman inference:n saavuttamiseksi on merkittävä käytännön etu.
Vaikka on edelleen avoimia kysymyksiä ja tutkimuksen kohteita, tämä tutkimus edustaa innostavaa askelta suurten kielimallien kehityksessä. Koska suurten kielimallien vaatimukset kasvavat jatkuvasti, monimerkkien ennustaminen voi tulla tärkeäksi osaksi seuraavan sukupolven näistä voimakkaista tekoälyjärjestelmistä.















