AI-mallit ja alustat
Voimakkain avoimen lähdekoodin LLM tähän asti: Meta LLAMA 3.1-405B
Llama 3.1-405B, jota Meta AI on kehittänyt, edustaa merkittävää edistystaskua avoimen lähdekoodin kielimalleissa. 405 miljardilla parametrillä se on suurin julkisesti saatavilla oleva kielimalli tähän asti, joka kilpailee ja jopa ohittaa joitakin edistyneimpiä omistusmalleja useissa benchmark-kokeissa.
Avainominaisuudet:
- 405 miljardia parametreja
- 128K tokenin kontekstipituus
- Monikielinen tuki (8 kieltä)
- Ohjeistuksen mukainen versio saatavilla
- Avoimen lähdekoodin ja permissiivinen lisenssi
Tällaisen voimallisen mallin julkaisu avoimen lähdekoodin alueella on pelinmuuttaja, joka demokratisoi pääsyn huipputasoisille AI-kapasiteetteille ja edistää innovaatiota koko alalla.
Mallin arkkitehtuuri ja koulutus
Prosessi alkaa syötetekstien muuttamisesta token-muotoon. Nämä token-muodot menevät useiden itsehuomion ja eteenpäin syötettyjen verkkorakenteiden läpi, mikä mahdollistaa mallin havainnoida monimutkaisia suhteita ja riippuvuuksia tekstin sisällä. Autoregressiivinen dekoodausmekanismi luo sitten tulostekstit, mikä täydentää prosessin.

-
Ryhmäkyselyhuomio (GQA)
Llama 3.1 käyttää ryhmäkyselyhuomioita, joka on tärkeä optimointitekniikka, jota ei ole täysin käsitelty aiemmassa vastauksessa. Tutustumme tähän tarkemmin:
Ryhmäkyselyhuomio (GQA) on monipäisen huomion muunnelma, joka pyrkii vähentämään laskennallisia kustannuksia ja muistinkäyttöä inference-ajan aikana, erityisesti pitkissä jonoissa. Llama 3.1 405B -mallissa GQA on toteutettu 8 avain-arvo-pään kanssa.
Tässä on kuinka GQA toimii:
- Sijaan, että jokaisella huomio-päällä olisi omat avain- ja arvo-projektiot, GQA ryhmittelee useita kyselypäitä jaettaviksi samojen avain- ja arvo-päiden kanssa.
- Tämä ryhmittely vähentää merkittävästi avain- ja arvo-projektioiden parametreja, mikä johtaa pienempiin mallikokoihin ja nopeampaan inferenceen.
- Huomio-laskenta voidaan ilmaista seuraavasti:
Huomio(Q, K, V) = softmax(QK^T / sqrt(d_k))VJossa Q on ryhmitelty g ryhmiin, ja K ja V ovat vähemmän päättäjiä kuin Q.
GQA:n hyödyt Llama 3.1 405B -mallissa ovat:
- Vähennetty muistijälki: Vähemmän avain- ja arvo-projektiot tarkoittavat vähemmän muistia, jota tarvitaan mallin parametreja varten.
- Nopeampi inference: Vähemmän laskelmia tarvitaan avain- ja arvo-projektioiden laskemiseen, mikä parantaa inference-nopeutta.
- Säilytetty suorituskyky: Vaikka parametreja on vähennetty, GQA on osoittanut säilyttävänsä vertailukelpoisen suorituskyvyn monissa tehtävissä verrattuna perinteiseen monipäiseen huomioon.
-
Kahden vaiheen esikoulutus laajennetun kontekstin saavuttamiseksi
Artikkeli mainitsee kahden vaiheen esikoulutusprosessin saavuttamiseksi 128K tokenin kontekstiraja. Tämä on tärkeä osa Llama 3.1 405B -mallin kykyjä:
Vaihe 1: Alkuesikoulutus 8K tokenille
- Malli koulutetaan ensin 8K tokenin pituisilla jonoilla.
- Tämä vaihe sallii mallin oppia yleisiä kielitaitoja ja tekstigeneraatiokykyjä.
Vaihe 2: Jatkuva esikoulutus kontekstin laajentamiseksi
- Koulutuksen jälkeen malli jatkaa esikoulutusta kontekstin laajentamiseksi 128K tokeniin.
- Tässä vaiheessa käytetään tarkkaan suunniteltuja koulutusohjelmia, jotta malli voi yleistää pidempiin jonoihin ilman, että se menettää kykyään käsitellä lyhyempiä konteksteja.
-
Monimodaaliset kyvyt
Vaikka edellinen vastaus kosketti monimodaalista, voimme laajentaa sitä, miten Llama 3.1 405B toteuttaa tämän:
Kompositionaalinen lähestymistapa:
- Llama 3.1 405B käyttää erillisiä koodareita eri modaalien (esim. kuvat, puhe) käsittelyyn.
- Nämä koodarit muuttavat eri modaalien syötteen jaettuun upotusavaruuteen, jota kielimalli voi ymmärtää.
Integraatio kielimalliin:
- Näiden erikoistuneiden koodareiden tulokset syötetään sitten pääkielimalliin.
- Tämä mahdollistaa Llama 3.1 405B:lle käsitellä ja ymmärtää eri tyyppisiä dataa samanaikaisesti, mikä mahdollistaa tehtävien suorittamisen, jotka vaativat useita modaalien yhdistämistä.
Ristihuomio-mekanismit:
- Llama 3.1 405B todennäköisesti käyttää ristihuomio-mekanismeja eri modaalien integroimiseen.
- Nämä mekanismit sallivat mallille keskittyä relevanttiin tietoon eri modaalien välillä tekstien generoimisen tai muiden tehtävien suorittamisen aikana.
Llama 3.1 405B:n monimodaaliset kyvyt avaavat monia sovellusmahdollisuuksia, kuten:
- Kuvien kuvailu ja visuaalinen kysymys-vastaus
- Puhe-teksti-transkriptio kontekstualisoidulla ymmärryksellä
- Monimodaalinen päättely, joka yhdistää tekstin, kuvat ja mahdollisesti muita datatyyppiä
Koulutusyksityiskohtia
- Koulutettu yli 15 biljoonalla tokenilla
- Mukautettu GPU-klusteri 39,3M GPU-tunnilla 405B-mallille
- Monikielisen tuen takia monipuolinen aineistojen kokoaminen
Ohjeistuksen mukainen versio kävi läpi lisäkoulutuksen:
- Hienosäätö julkaistuilla ohjeistusaineistoilla
- Yli 25M synteettisesti generoituja esimerkkejä
- Valvottu hienosäätö (SFT) ja Vahvistusoppiminen ihmisten palautteen kanssa (RLHF)
Suorituskykyvertailut
Taulukko vertaa Llama 3.1 405B:ia, Nemotron 4 340B Instructiä, GPT-4 (0125):ää, GPT-4 Omniä ja Claude 3.5 Sonnetia. Tärkeimmät vertailukohteet ovat yleisiä tehtäviä, kuten MMLU ja IFEval, kooditehtäviä, kuten HumanEval ja GSM8K, sekä päättelytehtäviä, kuten ARC Challenge. Jokainen vertailuarvo heijastaa mallin kykyä ymmärtää ja generoida ihmismäistä tekstiä, ratkaista monimutkaisia ongelmia ja suorittaa koodia. Huomionarvoista on, että Llama 3.1 405B ja Claude 3.5 Sonnet menestyvät useissa vertailuissa, osoittaen heidän edistyneitä kykyjään sekä yleisissä että alakohtaisissa tehtävissä.
Tulevaisuuden suunta
Llama 3.1-405B:n julkaisu on todennäköisesti kiihdyttävä innovaatio useilla alueilla:
- Parannetut hienosäätötekniikat erityisille aloille
- Tehtävien kehittäminen tehokkaampiin inference-menetelmiin
- Edistysaskelten tekeminen mallin pakkaamisessa ja tietämysistunnossa
Johtopäätös
Llama 3.1-405B edustaa merkittävää merkkipaaluja avoimen lähdekoodin AI:ssa, tarjoten kykyjä, jotka olivat aiemmin vain suljettujen mallien ominaisuus.
Kun jatkamme tämän mallin voimien tutkimista, on tärkeää lähestyä sen käyttöä vastuullisesti ja eettisesti. Työkalut ja turvallisuusjärjestelmät, jotka malli tarjoaa, antavat kehyksen vastuulliseen käyttöönottamiseen, mutta jatkuva valppaus ja yhteisön yhteistyö ovat avainasemassa varmistaakseen, että tämä voimakas teknologia käytetään yhteiskunnan hyväksi.














