AI-mallit ja alustat

Dekooderipohjaiset suuret kielen mallit: Täydellinen opas

mm
Lisää Unite.AI suosikkilähteisiisi Google-palvelussa

Suuret kielen mallit (LLM) ovat vallanneet luonnollisen kielen prosessoinnin alueen osoittamalla merkittäviä kykyjä tuottaa ihmismäisesti tekstiä, vastata kysymyksiin ja avustaa laajassa valikoimassa kielen liittyvissä tehtävissä. Näiden voimakkaiden mallien ytimessä on dekooderivain transformer-arkkitehtuuri, joka on muunnelma alkuperäisestä transformer-arkkitehtuurista, joka esiteltiin merkittävässä tutkimuksessa “Huomio on kaikki mitä tarvitaan” Vaswani et al.

Tässä kattavassa oppaassa tutkimme dekooderipohjaisten LLMien sisäisiä toimintoja, syventyen perusrakenteisiin, arkkitehtonisiin innovaatioihin ja toteutusyksityiskohtiin, jotka ovat nostaneet nämä mallit NLP-tutkimuksen ja sovellusten eturintamaan.

Transformer-arkkitehtuuri: Muistutus

Ennen kuin syvennymme dekooderipohjaisten LLMien yksityiskohtiin, on tärkeää käydä läpi transformer-arkkitehtuuri, jolle nämä mallit perustuvat. Transformer esitteli uuden lähestymistavan jonojen mallinnukseen, joka perustui ainoastaan huomio-mekanismeihin pitkän aikavälin riippuvuuksien havaitsemiseksi tiedoissa ilman recurrent- tai convolutionaalisia kerroksia.

Transformer-arkkitehtuuri

Transformer-arkkitehtuuri

Alkuperäinen transformer-arkkitehtuuri koostuu kahdesta pääkomponentista: kooderin ja dekooderin. Kooderi prosessoi syötteen ja tuottaa kontekstualisoidun esityksen, jota dekooderi käyttää syötteenä tuottaakseen tulostejonon. Tämä arkkitehtuuri suunniteltiin alun perin konekäännöstehtävien, kuten käännöstehtävien, joissa kooderi prosessoi syötteen lauseen lähdekielessä ja dekooderi tuottaa vastaavan lauseen kohdekielellä.

Itsehuomio: Avain transformerin menestykseen

Transformerin ytimessä on itsehuomio-mekanismi, voimakas tekniikka, joka sallii mallin painottaa ja yhdistää tietoa eri asemista syötteen jonossa. Toisin kuin perinteiset jonomallit, jotka prosessoi syötetokenit järjestyksessä, itsehuomio sallii mallin havaita riippuvuudet minkä tahansa tokenin välillä, riippumatta niiden asemasta jonossa.

Monihaku-huomio

Monihaku-huomio

Itsehuomio-operaatio voidaan jakaa kolmeen päävaiheeseen:

  1. Kysely-, avain- ja arvo-projektiot: Syötteen jono projisoidaan kolmeen erilliseen esitykseen: kyselyyn (Q), avaimiin (K) ja arvoihin (V). Nämä projektiot saadaan kertomalla syöte oppimilla paino-matriiseilla.
  2. Huomio-pistemäärän laskeminen: Kunkin syötteen aseman kohdalla lasketaan huomio-pistemäärät ottamalla pistetulo kyselyvektorin ja kaikkien avainvektorien välillä. Nämä pistemäärät edustavat kunkin aseman merkitystä kohdalla, jota prosessoidaan.
  3. Arvojen painotettu summa: Huomio-pistemäärät normalisoidaan softmax-funktiolla, ja tuloksena olevat huomio-painot käytetään laskemaan arvojen painotettu summa, josta saadaan tuloste-esitys kohdalle.

Monihaku-huomio, itsehuomio-mekanismin variantti, sallii mallin havaita erilaisia suhteita laskemalla huomio-pistemäärät useiden “päiden” yli rinnakkain, kullakin omalla kysely-, avain- ja arvo-projektiollaan.

Arkkitehtuurin variantit ja konfiguraatiot

Vaikka dekooderipohjaisten LLMien perussäännöt pysyvät samana, tutkijat ovat tutkineet erilaisia arkkitehtuurin varianteja ja konfiguraatioita parantamaan suorituskykyä, tehokkuutta ja yleistyskykyä. Tässä osiossa syvennymme erilaisiin arkkitehtuurin valintoihin ja niiden vaikutuksiin.

Arkkitehtuurityypit

Dekooderipohjaiset LLM:t voidaan karkeasti jakaa kolmeen päätyyppiin: kooderi-dekooderi, kausaalinen dekooderi ja etuliite-dekooderi. Kunkin arkkitehtuurityypin ominaisuuksia voidaan havainnollistaa erilaisilla huomio-malleilla.

Kooderi-dekooderi-arkkitehtuuri

Perustuu alkuperäiseen Transformer-malliin, kooderi-dekooderi-arkkitehtuuri koostuu kahdesta pinosta: kooderista ja dekooderista. Kooderi käyttää pinottuja monihaku-huomio-kerroksia koodata syötteen ja tuottaa latenttisia esityksiä. Dekooderi suorittaa ristihuumio-näitä esityksistä tuottaakseen kohdejonon. Vaikka tämä arkkitehtuuri on tehokas useissa NLP-tehtävissä, vain harvat LLM:t, kuten Flan-T5, käyttävät tätä arkkitehtuuria.

Kausaalinen dekooderi-arkkitehtuuri

Kausaalinen dekooderi-arkkitehtuuri sisältää yksisuuntaisen huomio-maskin, joka sallii kunkin syötetoken huomata vain edeltäviä tokenia ja itseään. Sekä syöte- että tulostetokenit prosessoidaan samassa dekooderissa. Merkittävät mallit, kuten GPT-1, GPT-2 ja GPT-3, perustuvat tähän arkkitehtuuriin, ja GPT-3 on osoittanut merkittäviä kykyjä kontekstissä oppimisessa. Monet LLM:t, mukaan lukien OPT, BLOOM ja Gopher, ovat laajasti omaksuneet kausaaliset dekooderit.

Etuliite-dekooderi-arkkitehtuuri

Tunnetaan myös ei-kausaalisena dekooderina, etuliite-dekooderi-arkkitehtuuri muuttaa kausaalisten dekooderien maskausmekanismia sallimaan kaksisuuntaisen huomion etuliite-tokenien yli ja yksisuuntaisen huomion generoituille tokenille. Kuten kooderi-dekooderi-arkkitehtuuri, etuliite-dekooderit voivat koodata etuliite-jonon kaksisuunnaisesti ja ennustaa tulostetokenit itseään toistamalla käyttäen jaettuja parametreja. LLM:t, jotka perustuvat etuliite-dekoodereihin, sisältävät GLM130B:n ja U-PaLM:n.

Kaikki kolme arkkitehtuurityyppiä voidaan laajentaa käyttämällä asiantuntijoiden sekoitus (MoE)-teknologiaa, joka aktivoi harvasti aliverkon neuroverkon painoja kullekin syötteelle. Tämä lähestymistapa on käytössä malleissa, kuten Switch Transformer ja GLaM, ja lisäämällä asiantuntijoiden määrää tai kokonaisparametrien kokoa on havaittu merkittäviä suorituskyvyn parannuksia.

Dekooderi-vain transformer: Omaksuen autoregressiivisen luonteen

Vaikka alkuperäinen transformer-arkkitehtuuri suunniteltiin alun perin jono-jono-tehtävien, kuten konekäännösten, useat NLP-tehtävät, kuten kielen mallinnus ja tekstin generointi, voidaan muotoilla autoregressiivisiksi ongelmiksi, joissa malli generoi yhden tokenin kerrallaan edellisten generoityjen tokenien ehdolla.

Tässä tulee dekooderi-vain transformer, yksinkertaistettu variantti transformer-arkkitehtuurista, joka säilyttää ainoastaan dekooderin komponentin. Tämä arkkitehtuuri on erityisen sovelias autoregressiivisille tehtäville, koska se generoi tulostetokenit yksi kerrallaan hyödyntäen edellisten generoityjen tokenien kontekstia.

Avainero dekooderi-vain transformerin ja alkuperäisen transformer-dekooderin välillä on itsehuomio-mekanismi. Dekooderi-vain asetuksessa itsehuomio-operaatio muutetaan estämään mallin huomio tulevista tokenista, ominaisuus jota kutsutaan kausaalisuudeksi. Tämä saavutetaan tekniikalla, jota kutsutaan “maskattu itsehuomio”, jossa huomio-pistemäärät tuleville asemille asetetaan negatiiviseksi äärettömäksi, käytännössä maskaten ne pois softmax-normalisointivaiheessa.

Dekooderipohjaisten LLMien arkkitehtuurin komponentit

Vaikka itsehuomion ja maskatun itsehuomion perussäännöt säilyvät samana, modernit dekooderipohjaiset LLM:t ovat esittäneet useita arkkitehtuurin innovaatioita parantamaan suorituskykyä, tehokkuutta ja yleistyskykyä. Tutkimme joitakin avainkomponentteja ja tekniikoita, joita käytetään nykyaikaisissa LLM:eissä.

Syötteen esitys

Ennen syötteen jonon prosessointia dekooderipohjaiset LLM:t käyttävät tokenisointi- ja upotusmenetelmiä muuttaakseen raakatekstin numeeriseksi esitykseksi, joka on sovelias mallille.

vektoriupotus

vektoriupotus

Tokenisointi: Tokenisointiprosessi muuttaa syötetekstin tokenien jonoksi, jotka voivat olla sanoja, sub-sanoja tai jopa yksittäisiä merkkejä, riippuen käytetystä tokenisointistrategiasta. Suositeltuja tokenisointitekniikoita LLM:eille ovat Byte-Pair Encoding (BPE), SentencePiece ja WordPiece. Nämä menetelmät pyrkivät löytämään tasapainon sanastojen koosta ja esityksen yksityiskohtaisuudesta, sallien mallin käsitellä harvinaisia tai sanastoon kuulumattomia sanoja tehokkaasti.

Token-upotukset: Tokenisoinnin jälkeen kunkin tokenin kohdalla on tiheä vektoriesitys, jota kutsutaan token-upotukseksi. Nämä upotukset opitaan koulutusprosessin aikana ja ne sisältävät semanttisia ja syntaktisia suhteita tokenien välillä.

Paikalliset upotukset: Transformer-mallit prosessoi koko syötteen jonon yhtä aikaa, ja niillä ei ole sisäistä tokenien asemien käsitettä, kuten recurrent-malleilla. Sisällyttääkseen paikalliset tiedot, paikalliset upotukset lisätään token-upotuksiin, sallien mallin erottaa tokenit niiden asemien perusteella.

Monihaku-huomio-kerrokset

Dekooderipohjaisten LLMien perusrakenteita ovat monihaku-huomio-kerrokset, jotka suorittavat maskatun itsehuomio-operaation, josta olemme aiemmin maininneet. Nämä kerrokset pinotaan useita kertoja, ja kunkin kerroksen tuloste huomataan edellisen kerroksen tulosteena, sallien mallin havaita yhä monimutkaisempia riippuvuuksia ja esityksiä.

Huomio-päät: Kunkin monihaku-huomio-kerroksen koostuu useista “huomio-päistä”, kullakin omalla kysely-, avain- ja arvo-projektiollaan. Tämä sallii mallin huomata eri aspekteja syötteestä samanaikaisesti, havaiten monia suhteita ja malleja.

Residuaalinen yhteys ja kerrosnormalisointi: Helpottamaan syvän verkon koulutusta ja vähentämään häviävän gradientin ongelmaa, dekooderipohjaiset LLM:t käyttävät residuaalisia yhteyksiä ja kerrosnormalisointitekniikoita. Residuaaliset yhteydet lisäävät kerroksen syötteen sen tulosteeseen, sallien gradienttien virtaamisen helpommin takaisin kulkeutumisprosessin aikana. Kerrosnormalisointi auttaa vakauttamaan aktivaatiot ja gradientit, parantaen koulutuksen vakautta ja suorituskykyä.

Etenevät kerrokset

Lisäksi monihaku-huomio-kerroksista, dekooderipohjaiset LLM:t sisältävät etenevät kerrokset, jotka soveltavat yksinkertaista eteenpäin suuntautuvaa neuroverkkoa kunkin aseman kohdalla jonossa. Nämä kerrokset esittävät epälineaarisuuksia ja sallivat mallin oppia monimutkaisempia esityksiä.

Aktivaatiofunktiot: Aktivaatiofunktion valinta etenevissä kerroksissa voi vaikuttaa merkittävästi mallin suorituskykyyn. Vaikka aikaisemmat LLM:t riippuivat laajasti käytetystä ReLU-aktivaatiosta, uudemmilla malleilla on otettu käyttöön monimutkaisempia aktivaatiofunktioita, kuten Gaussian Error Linear Unit (GELU) tai SwiGLU-aktivaatio, jotka ovat osoittaneet parannettua suorituskykyä.

Harsomaton huomio ja tehokkaat transformerit

Vaikka itsehuomio-mekanismi on voimakas, se tulee toisella puolella kuormittavan laskennan monimutkaisuuden kanssa, joka on suoraan verrannollinen jono-pituuteen, mikä tekee siitä laskennallisesti kalliin pitkille jonoille. Ratkaisemaan tämän haasteen on ehdotettu useita tekniikoita vähentämään itsehuomion laskennallista ja muistivaatimusta, sallien tehokkaan pitkien jonojen prosessoinnin.

Harsomaton huomio: Harsomaton huomio -tekniikat, kuten GPT-3-mallissa käytetty, valitsevat tarkkaavaisesti osan asemista syötteen jonossa, sen sijaan, että lasketaan huomio-pistemäärät kaikille asemille. Tämä voi vähentää laskennallista monimutkaisuutta merkittävästi, säilyttäen kohtuullisen suorituskyvyn.

Liukuvan ikkunan huomio: Esitelty Mistral 7B-mallissa, liukuvan ikkunan huomio (SWA) on yksinkertainen mutta tehokas tekniikka, joka rajoittaa kunkin tokenin huomio-ala kiinteään ikkunaan. Tämä lähestymistapa hyödyntää transformer-kerrosten kykyä siirtää tietoa useiden kerrosten läpi, käytännössä lisäämällä huomio-alaa ilman täyden itsehuomion kvadratiivista monimutkaisuutta.

Rullava puskurivirta: Vähentääkseen muistivaatimuksia, erityisesti pitkille jonoille, Mistral 7B-malli käyttää rullavaa puskurivirtaa. Tämä tekniikka tallentaa ja uudelleen käyttää laskettuja avain- ja arvo-vektoreita kiinteään ikkunaan, välttäen turhia laskelmia ja minimoiden muistin käytön.

Ryhmäkysely-huomio: Esitelty LLaMA 2-mallissa, ryhmäkysely-huomio (GQA) on monihaku-huomio-mekanismin variantti, joka jakaa huomio-päät ryhmiin, joista kullakin on yhteinen avain- ja arvo-matriisi. Tämä lähestymistapa tasapainottaa monihaku-huomion tehokkuuden ja standardin itsehuomion suorituskyvyn, tarjoten parannettua laskentaa ja säilyttäen korkealaatuiset tulokset.

Ryhmäkysely-huomio

Ryhmäkysely-huomio

Mallin koko ja skaalaus

Yksi modernien LLMien määritysmerkistä on niiden valtava koko, jossa parametreja on miljardeja tai jopa satoja miljardeja. Mallin koosta lisääminen on ollut avain tekijä saavuttamassa huipputason suorituskykyä, koska suuremmat mallit voivat havaita monimutkaisempia malleja ja suhteita tiedoissa.

Parametrien määrä: Dekooderipohjaisen LLM:n parametrien määrä määräytyy lähinnä upotusulottuvuuden (d_model), huomio-päiden määrän (n_heads), kerrosten määrän (n_layers) ja sanastojen koosta (vocab_size). Esimerkiksi GPT-3-mallissa on 175 miljardia parametreja, joilla d_model = 12288, n_heads = 96, n_layers = 96 ja vocab_size = 50257.

Mallin rinnakkaisuus: Tällaisen massiivisen mallin kouluttaminen ja käyttöönotto edellyttävät merkittäviä laskennallisia resursseja ja erikoistuneita laitteita. Tämän haasteen voittamiseksi on otettu käyttöön mallin rinnakkaisuus -tekniikoita, joissa malli jaetaan useiden GPU:iden tai TPU:iden välille, ja kunkin laitteen osuus laskelmista.

Asiantuntijoiden sekoitus: Toinen lähestymistapa LLMien skaalaamiseen on asiantuntijoiden sekoitus (MoE) -arkkitehtuuri, joka yhdistää useita asiantuntija-malleja, joista kullakin on erikoistunut tietty osa-alue tai tehtävä. Mixtral 8x7B-malli on esimerkki MoE-mallista, joka käyttää Mistral 7B-mallia perusmallinaan ja saavuttaa ylittävän suorituskyvyn säilyttäen laskennan tehokkuuden.

Päätöksen tekeminen ja tekstin generointi

Yksi dekooderipohjaisten LLMien pääasiallisista sovelluksista on tekstin generointi, jossa malli generoi ymmärrettävää ja luonnollisen kuuloista tekstiä annetun syötteen tai kontekstin perusteella.

Autoregressiivinen dekoodaus: Päätöksen tekemisen aikana dekooderipohjaiset LLM:t generoivat tekstiä autoregressiivisesti, ennustamalla yhden tokenin kerrallaan edellisten generoityjen tokenien ehdolla. Tämä prosessi jatkuu, kunnes ennalta määritelty lopetusehto täyttyy, kuten saavutettaessa enimmäispituus tai generoitaan lopetusmerkki.

Näytteiden valintastrategiat: Generoidakseen monipuolista ja realistista tekstiä, voidaan käyttää erilaisia näytteiden valintastrategioita, kuten top-k näytteistystä, top-p näytteistystä (tunnetaan myös ytimenäytteistymisenä) tai lämpötilan skaalausta. Nämä strategiat ohjaavat diversiteetin ja koherenssin välistä tasapainoa generoidussa tekstin sanastossa.

Syötteen suunnittelu: Syötteen laatu ja spesifisyys voivat vaikuttaa merkittävästi generoituun tekstiin. Syötteen suunnittelu, eli tehokkaiden syötteiden luominen, on tullut tärkeäksi osaksi hyödyntämällä LLM:eitä erilaisiin tehtäviin, mahdollistaen käyttäjien ohjata mallin generointiprosessia ja saavuttaa toivottuja tuloksia.

Ihminen silmästä silmään -dekoodaus: Parantamaan generoidun tekstin laatua ja koherenssia, on käytetty tekniikoita, kuten vahvistusoppiminen ihmisten palautteesta (RLHF). Tässä lähestymistavassa ihmiset antavat palautetta mallin generoimasta tekstin laadusta, jota sitten käytetään mallin hienosäätöön, käytännössä kohdistamalla sen ihmisten preferensseihin ja parantamalla sen tuloksia.

Edistysaskeleet ja tulevaisuuden suunnat

Dekooderipohjaisten LLMien alue on kehittymässä nopeasti, ja uudet tutkimukset ja läpimurrot jatkuvasti työntävät näiden mallien rajoja. Tässä on joitakin merkittäviä edistysaskeleita ja potentiaalisia tulevaisuuden suuntia:

Tehokkaat transformer-variantit: Vaikka harsomaton huomio ja liukuvan ikkunan huomio ovat tehneet merkittäviä edistysaskeleita parantamaan dekooderipohjaisten LLMien tehokkuutta, tutkijat etsivät edelleen vaihtoehtoisia transformer-arkkitehtuureja ja huomio-mekanismeja vähentämään laskennallisia vaatimuksia säilyttäen tai parantaen suorituskykyä.

Monimodaaliset LLM:t: Laajentamalla LLMien kykyjä tekstistä muihin modaalisiin, kuten kuvat, ääni tai video, monimodaaliset mallit pyrkivät yhdistämään useita modaalisiin yhteen yhtenäiseen kehykseen. Tämä avaa mielenkiintoisia mahdollisuuksia sovelluksille, kuten kuva-kuvailu, visuaalinen kysymys-vastaus ja multimedia-sisällön generointi.

Ohjattava generointi: Mahdollistamaan hienojakoinen valvonta generoidusta tekstin yllä on haasteellinen mutta tärkeä suunta LLM:eille. Tekniikat, kuten ohjattu tekstin generointi ja syötteen säätö, pyrkivät antamaan käyttäjille enemmän valvontaa generoidun tekstin eri attribuuteista, kuten tyylissä, sävyssä tai tietyissä sisällön vaatimuksissa.

Johtopäätös

Dekooderipohjaiset LLM:t ovat nousseet muodonmuuttajiksi luonnollisen kielen prosessoinnin alalla, työntäen rajoja siitä, mitä on mahdollista kielen generoinnissa ja ymmärtämisessä. Alkuperäisistä juuristaan yksinkertaisena transformer-arkkitehtuurin varianttina, nämä mallit ovat kehittyneet erittäin sofistikoituneiksi ja voimakkaisiksi järjestelmiksi, jotka hyödyntävät edistyneitä tekniikoita ja arkkitehtuurin innovaatioita.

Jatkaessamme dekooderipohjaisten LLMien tutkimista ja kehittämistä, voimme odottaa todistavamme vielä enemmän merkittäviä saavutuksia kielen liittyvissä tehtävissä sekä näiden mallien integroimista laajaan valikoimaan sovelluksiin ja aloihin. On kuitenkin tärkeää osoittaa huomiota eettisiin huolenaiheisiin, selitys haasteisiin ja mahdollisiin harhaanjohtajiin, jotka voivat ilmetä näiden voimakkaiden mallien laajamittaisesta käytöstä.

Pysymällä tutkimuksen eturintamassa, edistämällä avoimia yhteistyömuotoja ja ylläpitämällä vankkaa sitoutumista vastuulliseen tekoälykehitykseen, voimme lukita dekooderipohjaisten LLMien täyden potentiaalin samalla varmistamalla, että ne kehitetään ja käytetään turvallisella, eettisellä ja hyödyllisellä tavalla yhteiskunnalle.

Olen viettänyt viimeiset viisi vuotta uppoutumalla kiinnostavaan koneoppimisen ja syvän oppimisen maailmaan. Minun intohimoni ja asiantuntemukseni ovat johtaneet minun osallistumiseen yli 50:een monipuoliseen ohjelmistosuunnitteluhankkeeseen, joissa on erityisesti painottunut AI/ML. Minun jatkuva uteliaisuuteni on myös ohjannut minun luontaisen kielen prosessoinnin pariin, jota haluan tutkia tarkemmin.