AI-mallit ja alustat

Kaikki mitä tarvitset tietää Llama 3:sta | Voimakkain avoimen lähdekoodin malli | Käsitteistä käyttöön

mm
Lisää Unite.AI suosikkilähteisiisi Google-palvelussa

Meta on julkaissut Llama 3:n, seuraavan sukupolven valmiista avoimen lähdekoodin suuresta kielen mallista (LLM). Rakentamalla edellisen perustalle, Llama 3 pyrkii parantamaan kykyjä, jotka asettivat Llama 2: n merkittäväksi avoimen lähdekoodin kilpailijaksi ChatGPT:lle, kuten kattavassa arvostelussa artikkelissa Llama 2: Syvä sukellus avoimen lähdekoodin haastajaan ChatGPT:lle.

Tässä artikkelissa tarkastelemme Llama 3:n perusksitteitä, tutkimme sen innovatiivista arkkitehtuuria ja koulutusprosessia ja tarjoamme käytännön ohjeita siitä, miten pääset käyttämään ja käyttämään tätä merkittävää mallia vastuullisesti. Olitpa sitten tutkija, kehittäjä tai AI-entusiasti, tämä postaus varustaa sinut tietämyksellä ja resursseilla, joita tarvitset hyödyntämään Llama 3:n voimaa projekteissasi ja sovelluksissasi.

Llaman evoluutio: Llama 2:sta Llama 3:een

Meta:n toimitusjohtaja Mark Zuckerberg ilmoitti Llama 3:n debyytistä, Meta AI:n kehittämästä uusimmasta AI-mallista. Tämä valmiista avoimen lähdekoodin malli on tarkoitus parantaa Meta:n eri tuotteita, mukaan lukien Messengeriä ja Instagramia. Zuckerberg korosti, että Llama 3 asettaa Meta AI:n johtoasemaan kehittyneimpänä vapaasti saatavilla olevana AI-apuna.

Ennen kuin puhumme Llama 3:n yksityiskohtia, käydään lyhyesti läpi sen edeltäjää, Llama 2:ta. Llama 2 esiteltiin vuonna 2022 ja se oli merkittävä merkkipaalu avoimen lähdekoodin LLM-maailmassa, tarjoten voimakkaan ja tehokkaan mallin, jota voitiin suorittaa kuluttajien laitteilla.

Llama 2:lla oli kuitenkin rajoituksia. Käyttäjät ilmoittivat ongelmista, kuten epätodennäköisistä kieltäymisistä (malli kieltäytyi vastaamasta harmittomille kehotuksille), rajoitetusta hyödyllisyydestä ja parantamisen tarpeesta alueilla, kuten päättelyssä ja koodin luonnissa.

Tässä tulee Llama 3: Meta:n vastaus näihin haasteisiin ja yhteisön palautteeseen. Llama 3:n kanssa Meta on pyrkinyt rakentamaan parhaat avoimen lähdekoodin mallit, jotka ovat vertailukelpoisia parhaiden omistajiin kuuluvien mallien kanssa, samalla priorisoiden vastuullisen kehityksen ja käyttöönottoprosessit.

Llama 3: Arkkitehtuuri ja koulutus

Yksi Llama 3:n avaininnovaatioista on sen tokenisaattori, joka sisältää merkittävästi laajennetun sanastonsa 128 256 tokenia (32 000 Llama 2:ssa). Tämä laajempi sanasto mahdollistaa tehokkaamman tekstin koodauksen sekä syötteenä että tulosteena, mikä voi johtaa vahvempiin monikielisiin ja yleisiin suorituskykyön parannuksiin.

Llama 3 sisältää myös Ryhmäkyselyhuomion (GQA), tehokkaan edustamistekniikan, joka parantaa skaalautuvuutta ja auttaa mallia käsittelemään pidempiä konteksteja tehokkaammin. Llama 3:n 8B-versio hyödyntää GQA:ta, kun taas sekä 8B että 70B-mallit voivat käsitellä jonoja jopa 8 192 tokenia.

Koulutusdata ja skaalautuvuus

Llama 3:lle käytetty koulutusdata on tärkeä tekijä sen parantuneessa suorituskyvyssä. Meta on kokoamassa massiivisen tietojoukon yli 15 biljoonaa tokenia julkisesti saatavilla olevista verkkolähteistä, joka on seitsemän kertaa suurempi kuin Llama 2:lle käytetty tietojoukko. Tämä tietojoukko sisältää myös merkittävän osan (yli 5 %) laadukkaita ei-englanninkielisiä tietoja, jotka kattavat yli 30 kieltä, valmistautumisena tuleviin monikielisiin sovelluksiin.

Takuuttaakseen tietojen laadun Meta käytti edistyneitä suodatusmenetelmiä, mukaan lukien heuristiset suodattimet, NSFW-suodattimet, semanttinen deduplikaatio ja tekstin luokittelijat, jotka oli koulutettu Llama 2:lla ennustamaan tietojen laatua. Tiimi suoritti myös laajoja kokeita määrittämään optimaalisen tietojen sekoituksen esikoulutukseen, varmistaen, että Llama 3 suoriutuu hyvin laajasta joukosta tehtäviä, mukaan lukien trivia, STEM, koodaus ja historiallinen tietämys.

Llama 3:n suurimpien mallien koulutus oli myös kriittinen kehityksen osa. Meta kehitti skaalautumislait, jotka mahdollistivat suurimpien mallien suorituskyvyn ennustamisen avaintehtävissä, kuten koodin luonnissa, ennen niiden kouluttamista. Tämä tiedonhallinta ohjasi päätöksiä tietojen sekoituksesta ja laskentaresurssien jakamisesta, mikä johti lopulta tehokkaampaan ja vaikuttavampaan koulutukseen.

Llama 3:n suurimmat mallit koulutettiin kahdella 24 000 GPU:n klusterilla, hyödyntäen yhdistelmää tietoparalleelia, malliparalleelia ja putkiparalleelia -tekniikoita. Meta:n edistynyt koulutuspinosti automaattisesti virheiden havaitsemisen, käsittelyn ja ylläpidon, maksimoimalla GPU-ajankäytön ja lisäämällä koulutuksen tehokkuutta noin kolmella kertaa verrattuna Llama 2:een.

Ohjeistuksen hienosäätö ja suorituskyky

Llama 3:n täysipainoisen potentiaalin lukitsemiseksi chat- ja dialogisovelluksissa Meta innovoi ohjeistuksen hienosäätölähestymistapaansa. Sen menetelmä yhdistää valvottua hienosäätöä (SFT), hylkäysnäytteen, proximaalisen politiikan optimoinnin (PPO) ja suoran etuoikeuden optimoinnin (DPO).

SFT:ssä ja PPO:ssa käytettyjen kehotteiden laatu ja DPO:ssa käytettyjen etuoikeuksien luokittelut olivat ratkaisevia Llama 3:n suorituskyvyn kannalta. Meta:n tiimi valitsi huolellisesti tämän datan ja suoritti useita laadunvarmistuskaistoja inhimillisten annotoijien antamista merkinnöistä.

PPO:n ja DPO:n koulutus etuoikeuksien luokittelulla paransi myös merkittävästi Llama 3:n suorituskykyä päättely- ja koodaus-tehtävissä. Meta totesi, että vaikka malli kamppailee vastaamalla päättelykysymyksiin suoraan, se voi silti tuottaa oikean päättelyjäljen. Etuoikeuksien luokittelun koulutus mahdollisti mallille oppimisen, miten valita oikea vastaus näistä jäljistä.

Arena-tulokset

Tulokset puhuvat puolestaan: Llama 3 ylittää useat saatavilla olevat avoimen lähdekoodin chat-mallit yleisillä teollisuusmittareilla, asettamalla uuden valmiin suorituskyvyn LLM:lle 8B- ja 70B-parametriskaaloissa.

Vastuullinen kehitys ja turvallisuus

Pyrkiessään kehittyneeseen suorituskykyyn Meta priorisoi myös vastuullisen kehityksen ja käyttöönottoprosessien Llama 3:lle. Yritys omaksui järjestelmätasoisella lähestymistavalla, jossa Llama 3 -mallit nähtiin osana laajempaa ekosysteemiä, jossa kehittäjät ovat ohjauskeskuksessa, mahdollistaen heidän suunnitella ja mukauttaa malleja tietyille käyttötarkoituksille ja turvallisuusvaatimuksille.

Meta suoritti laajoja red team -harjoituksia, suoritti vastakkainarvioita ja toteutti turvallisuuden vähentämistekniikoita, jotta vähentäisi jäännösriskiä ohjeistetuissa malleissaan. Yritys kuitenkin myöntää, että jäännösriskit todennäköisesti säilyvät ja suosittelee, että kehittäjien arvioivat nämä riskit sovelluksiinsa liittyvissä yhteyksissä.

Tukemaan vastuullista käyttöönottoa Meta on päivittänyt Vastuullisen käytön oppaan, joka tarjoaa kattavan resurssin kehittäjille, jotta he voivat toteuttaa mallin ja järjestelmätason turvallisuuden parhaiden käytäntöjen sovelluksissaan. Oppaassa käsitellään aiheita, kuten sisällönmoderaatiota, riskien arviointia ja turvallisuustyökalujen, kuten Llama Guard 2 ja Code Shield, käyttöä.

Llama Guard 2, joka perustuu MLCommons-taksonomiaan, on suunniteltu luokittamaan LLM-syötteitä (kehotteita) ja vastauksia, havaitsemalla sisältöä, joka voidaan pitää epäturvalliseksi tai haitallisena. CyberSecEval 2 laajentaa edeltäjänsä lisäämällä toimenpiteitä estämään mallin koodin tulkinnan väärinkäyttöä, hyökkäyssyberTurvallisuuden kykyjä ja herkkyyttä kehotteen hyökkäyksiin.

Code Shield, joka on uusi Llama 3:n mukana, lisää inference-ajan suodattamisen epäturvallista koodia, jota LLM:t tuottavat, vähentäen riskejä, jotka liittyvät epäturvaalliseen koodin ehdotuksiin, koodin tulkinnan väärinkäyttöön ja turvalliseen komentoon.

Llama 3:n käyttäminen

Meta AI:n Llama 3:n julkaisun jälkeen useat avoimen lähdekoodin työkalut on julkaistu paikallista käyttöä varten eri käyttöjärjestelmissä, mukaan lukien Mac, Windows ja Linux. Tässä osiossa käsitellään kolme merkittävää työkalua: Ollama, Open WebUI ja LM Studio, joista jokainen tarjoaa ainutlaatuisia ominaisuuksia Llama 3:n kykyjen hyödyntämiseksi henkilökohtaisilla laitteilla.

Ollama: Ollama on saatavilla Macille, Linuxille ja Windowsille, ja se helpottaa Llama 3:n ja muiden suurten kielen mallien toimintaa henkilökohtaisilla tietokoneilla, jopa vähemmän tehokkailla laitteilla. Se sisältää pakettienhallinnan helposta mallinhallinnasta ja tukee käskyjä alustoittain mallien lataamiseen ja suorittamiseen.

Open WebUI Dockerin kanssa: Tämä työkalu tarjoaa käyttäjäystävällisen, Docker-pohjaisen käyttöliittymän, joka on yhteensopiva Macin, Linuxin ja Windowsin kanssa. Se integroituu sulavasti Ollaman rekisterin malleihin, mahdollistaen käyttäjien käyttää ja vuorovaikuttaa malleja, kuten Llama 3, paikallisessa verkkoliittymässä.

LM Studio: LM Studio on saatavilla Macille, Linuxille ja Windowsille, ja se tukee laajaa valikoimaa malleja ja perustuu llama.cpp-projektiin. Se tarjoaa chat-liittymän ja mahdollistaa suoran vuorovaikutuksen eri mallien, mukaan lukien Llama 3 8B Instruct -mallin, kanssa.

Nämä työkalut varmistavat, että käyttäjät voivat käyttää Llama 3:aa tehokkaasti henkilökohtaisilla laitteilla, sopeutuen erilaisiin teknisiin taitoihin ja vaatimuksiin. Kukin alusta tarjoaa vaiheittaisen prosessin asennukseen ja mallien kanssa työskentelyyn, tehdessä edistyneen AI:n helpommin saataville kehittäjille ja entusiasteille.

Llama 3:n käyttöönotto suurella mittakaavalla

Lisäksi Meta on tarjonnut suoran pääsyn mallipainoihin ja on tehnyt yhteistyötä useiden pilvipalvelujen, malli-API-palvelujen ja laitteistojen kanssa, jotta Llama 3 voidaan ottaa käyttöön sujuvasti suurella mittakaavalla.

Yksi Llama 3:n avainetujen on sen parannettu tokenitehokkuus uuden tokenisaattorin ansiosta. Mittaukset osoittavat, että Llama 3 tarvitsee jopa 15 % vähemmän tokenia verrattuna Llama 2:een, mikä johtaa nopeampaan ja kustannustehokkaampaan inferenceen.

Llama 3:n 8B-versiossa käytetty Grouped Query Attention (GQA) edistää inference-tehokkuuden ylläpitämistä Llama 2:n 7B-versiota vastaavalla tasolla, huolimatta parametrilukumäärän kasvusta.

Mitä odottaa Llama 3:lle?

Vaikka 8B- ja 70B-mallit merkitsevät Llama 3:n julkaisun alkua, Meta on kunnianhimoisia suunnitelmia tulevaisuuden LLM:lle.

Tulevina kuukausina voidaan odottaa uusien kykyjen esittelyä, mukaan lukien monimodaliteetti (kyky prosessoida ja generoida eri tietomuotoja, kuten kuvia ja videoita), monikielisyys (useiden kielten tuki) ja paljon pitemmät kontekstiuudet parantamaan suorituskykyä tehtävissä, jotka vaativat laajaa kontekstia.

Lisäksi Meta aikoo julkaista suurempia mallikokoja, mukaan lukien yli 400 miljardin parametrin mallit, jotka ovat parhaillaan koulutettavina ja näyttävät lupaavia suorituskyky- ja kykytrendejä.

Jotta voidaan edistää alaa, Meta julkaisee myös yksityiskohtaisen tutkimusraportin Llama 3:sta, jakaa löytönsä ja havaintonsa laajemmalle AI-yhteisölle.

Esimakuna tulevasta voidaan mainita, että Meta on jakanut joitakin varhaisia otoksia suurimman LLM-mallinsa suorituskyvystä eri mittareilla. Vaikka nämä tulokset perustuvat varhaiseen checkpointiin ja voivat muuttua, ne antavat jännittävän vilahduksen Llama 3:n tulevasta potentiaalista.

Johtopäätös

Llama 3 edustaa merkittävää merkkipaaluja avoimen lähdekoodin suurten kielen mallien evoluutiossa, työntäen rajoja suorituskyvyn, kykyjen ja vastuullisen kehityksen käytäntöjen osalla. Sen innovatiivisen arkkitehtuurin, massiivisen koulutusaineiston ja viimeisimpien hienosäätötekniikoiden ansiosta Llama 3 asettaa uudet valmiit suorituskyvyn mittarit LLM:lle 8B- ja 70B-parametriskaaloissa.

Llama 3 on kuitenkin enemmän kuin vain voimakas kielen malli; se on todiste Meta:n sitoutumisesta edistämään avointa ja vastuullista AI-ekosysteemiä. Tarjoamalla kattavat resurssit, turvallisuustyökalut ja parhaiden käytäntöjen ohjeet Meta valmistaa kehittäjiä hyödyntämään Llama 3:n täysipainoista potentiaalia vastuullisesti, varmistaen samalla, että käyttöönotto on sovellettavissa heidän tietyille käyttötarkoituksilleen ja yleisöilleen.

Kun Llama 3:n matka jatkuu, uusien kykyjen, mallikokojen ja tutkimustuloksien ollessa näköpiirissä, AI-yhteisö odottaa innostuneena innovatiivisia sovelluksia ja läpimurtoja, jotka varmasti syntyvät tästä merkittävästä LLM:stä.

Olet sitten tutkija, joka työntää luonnonkielen käsittelyn rajoja, kehittäjä, joka rakentaa seuraavan sukupolven älykkäitä sovelluksia, tai AI-entusiasti, joka on utelias viimeisimmistä edistysaskelista, Llama 3 luvaa olla voimakas työkalu arsenaalissasi, avaen uusia ovia ja lukiten avaimen uuden mahdollisuuksien maailmaan.

Olen viettänyt viimeiset viisi vuotta uppoutumalla kiinnostavaan koneoppimisen ja syvän oppimisen maailmaan. Minun intohimoni ja asiantuntemukseni ovat johtaneet minun osallistumiseen yli 50:een monipuoliseen ohjelmistosuunnitteluhankkeeseen, joissa on erityisesti painottunut AI/ML. Minun jatkuva uteliaisuuteni on myös ohjannut minun luontaisen kielen prosessoinnin pariin, jota haluan tutkia tarkemmin.