AI-mallit ja alustat
Esittelyssä Meta Llama 3: Askellus eteenpäin suurten kielen mallien parissa
Generatiivisen tekoälyn alalla Meta jatkaa johtajuuttaan sitoutumalla avoimeen saatavuuteen ja jakamalla edistyneitä suuria kielen mallejaan, Meta AI (Llama) -sarjaa, kehittäjille ja tutkijoille maailmanlaajuisesti. Jatkamalla edistyneitä aloitteitaan Meta esitteli hiljattain Llama-sarjan kolmannen version, Llama 3:n. Tämä uusi versio parantaa merkittävästi Llama 2:a, tarjoamalla useita parannuksia ja asettamalla uudet standardit, jotka haastavat alan kilpailijoita, kuten Google (GOOGL ), Mistral ja Anthropic. Tämä artikkeli tutkii Llama 3:n merkittäviä edistysaskelia ja sitä, miten se vertautuu edeltäjäänsä, Llama 2:een.
Meta Llama -sarja: Eksklusiivisesta avoimeen saatavuuteen ja paranneltuun suorituskykyyn
Meta aloitti Llama-sarjansa vuonna 2022 Llama 1:n julkaisemalla, joka oli malli, jota voitiin käyttää ainoastaan non-kommerSSisissa tarkoituksissa ja joka oli saatavilla vain valituille tutkimuslaitoksille johtuen suurista laskennallisten vaatimusten ja omistajan luonteesta, joka oli ominainen johtaville LLM:ille tuolloin. Vuonna 2023 Llama 2:n julkaisun myötä Meta AI siirtyi kohti suurempaa avoimuutta tarjoamalla mallin ilmaiseksi sekä tutkimus- että kaupallisiin tarkoituksiin. Tämä siirto oli tarkoitettu democratisoimaan pääsyä edistyneisiin generatiivisiin tekoälytekniikoihin, sallien laajemman käyttäjäryhmän, kuten startup-yritysten ja pienempien tutkimusryhmien, innovoida ja kehittää sovelluksia ilman suuria kustannuksia, jotka liittyvät suuriin malleihin. Jatkaen tätä avoimuuden trendiä Meta on esittellyt Llama 3:n, joka keskittyy parantamaan pienempien mallien suorituskykyä eri teollisuusmittareilla.
Esittely Llama 3
Llama 3 on Meta Llama -sarjan toinen sukupolvi, joka tarjoaa sekä esikoulutettuja että ohjeistuksen mukaisesti hienosäädettyjä malleja, joissa on 8B ja 70B parametrejä. Edeltäjien tapaan Llama 3 käyttää vain dekooderin transformer-arkkitehtuuri ja jatkaa itseohjautuvan, itseohjautuvan koulutuksen käytön seuraavien tokenien ennustamiseksi tekstin sekvensseissä. Llama 3 on esikoulutettu tietokannassa, joka on seitsemän kertaa suurempi kuin Llama 2:ssa käytetty, ja sisältää yli 15 biljoonaa tokenia, jotka on poimittu uudelleen kuratusta sekaisin julkaistuista internet-tiedoista. Tämä laaja tietokanta prosessoidaan kahdella 24 000 GPU:lla varustetulla klusterilla. Tietokannan laadun ylläpitämiseksi käytettiin monia data-keskeisiä tekoälytekniikoita, kuten heuristisia ja NSFW-suodattimia, semanttista deduplikaatiota ja tekstin laadun luokittelua. Llama 3 Instruct -malli on merkittävästi parannettu, sisältäen yli 10 miljoonaa ihmisen annotoituja data-näytteitä ja hyödyntäen monia koulutusmenetelmiä, kuten valvottua hienosäätöä (SFT), rejection samplingia, proximaalista politiikan optimointia (PPO) ja suoraa politiikan optimointia (DPO).
Llama 3 vs. Llama 2: Avainparannukset
Llama 3 tarjoaa useita parannuksia Llama 2:een verrattuna, parantaen merkittävästi sen toimintaa ja suorituskykyä:
- Laajennettu sanasto: Llama 3 on laajentanut sanastoaan 128 256 tokeniin, Llama 2:n 32 000 tokenista. Tämä parannus tukee tehokkaampaa tekstin koodausta sekä syötteissä että tulosteissa ja vahvistaa sen monikielisiä ominaisuuksia.
- Pidentynyt kontekstin pituus: Llama 3 -mallit tarjoavat 8 000 tokenin kontekstin pituuden, kaksinkertaistaen Llama 2:n 4 090 tokenia. Tämä parannus mahdollistaa laajemman sisällön käsittelyn, kattaen sekä käyttäjän syötteitä että mallin vastauksia.
- Päivitetty koulutusdata: Llama 3:n koulutusdata on seitsemän kertaa suurempi kuin Llama 2:n, ja se sisältää neljä kertaa enemmän koodia. Se sisältää yli 5 % korkealaatuista, ei-englanninkielistä dataa, joka kattaa yli 30 kieltä, mikä on oleellista monikielisen sovelluksen tukemiseksi. Tämä data käy läpi tiukkoja laadunvalvontamenetelmiä, kuten heuristisia ja NSFW-suodattimia, semanttista deduplikaatiota ja tekstin luokittelua.
- Hienosäädetty ohjeistus ja arviointi: Poiketen Llama 2:sta, Llama 3 käyttää edistyneitä ohjeistusmenetelmiä, kuten valvottua hienosäätöä (SFT), rejection samplingia, proximaalista politiikan optimointia (PPO) ja suoraa politiikan optimointia (DPO). Tämän prosessin tueksi on esitelty uusi laadukas ihmisen arviointisarja, joka koostuu 1 800 syötteestä, jotka kattavat monia käyttötapoja, kuten neuvontaa, aivopuhallusta, luokittelua, koodaamista ja enemmän, varmistaen kattavan arvioinnin ja mallin kykyjen hienosäätöä.
- Edistynyt tekoälyturvallisuus: Llama 3, kuten Llama 2, sisältää tiukat turvallisuusmenetelmät, kuten ohjeistuksen hienosäätöä ja kattavaa red team -menetelmää, jotta voidaan lieventää riskejä, erityisesti kriittisillä aloilla, kuten kyberTurvallisuudessa ja biologisissa uhkatekijöissä. Tämän tueksi Meta on esittellyt myös Llama Guard 2:n, joka on hienosäädetty 8B-versiota Llama 3:sta. Tämä uusi malli parantaa Llama Guard -sarjaa luokittelemalla LLM-syötteitä ja -vastauksia tunnistamaan potentiaalisesti vaarallista sisältöä, mikä tekee siitä ihanteellisen tuotantoympäristöissä.
Llama 3:n saatavuus
Llama 3 -mallit on nyt integroitu Hugging Face -ekosysteemiin, parantaen kehittäjien saatavuutta. Mallit ovat myös saatavilla malli-palveluna tarjoavien alustojen kautta, kuten Perplexity Labs ja Fireworks.ai, sekä pilvi-alustoilla, kuten AWS SageMaker, Azure ML ja Vertex AI. Meta aikoo laajentaa Llama 3:n saatavuutta edelleen, mukaan lukien alustoja, kuten Google Cloud, Kaggle, IBM WatsonX, NVIDIA NIM ja Snowflake. Lisäksi Llama 3:n laitteistotukea laajennetaan käsittämään alustoja, kuten AMD, AWS, Dell, Intel (INTC ), NVIDIA ja Qualcomm.
Tulevat parannukset Llama 3:ssa
Meta on paljastanut, että Llama 3:n nykyinen julkaisu on vain alkuvaihe heidän laajemmassa visiossaan Llama 3:n täydellisestä versiosta. He kehittävät edistyneempää mallia, jossa on yli 400 miljardia parametrejä, joka esittelee uusia ominaisuuksia, kuten monimodaliteetin ja kyvyn käsitellä useita kieliä. Tämä parannettu versio sisältää myös merkittävästi laajennetun konteksti-ikkunan ja parannetun suorituskyvyn.
Yhteenveto
Meta Llama 3 merkitsee merkittävää evoluutiota suurten kielen mallien maisemassa, vie-den sarjan ei ainoastaan kohti suurempaa avoimuutta, vaan myös parantaen sen suorituskykyä olennaisesti. Seitsemän kertaa suuremman koulutusdatan ja ominaisuuksien, kuten laajennetun sanaston ja pidentyneen kontekstin, ansiosta Llama 3 asettaa uudet standardit, jotka haastavat jopa vahvimmat alan kilpailijat.
Tämä kolmas versio jatkaa tekoälytekniikan demokratisoimista tarjoamalla korkean tason ominaisuuksia laajemmalle kehittäjäryhmälle, ja se esittelee myös merkittäviä edistysaskelia turvallisuudessa ja koulutuksen tarkkuudessa. Integroimalla nämä mallit alustoille, kuten Hugging Face, ja laajentamalla saatavuutta suurten pilvi-palvelujen kautta Meta varmistaa, että Llama 3 on yhtä laaja kuin se on voimakas.
Eteenpäin katsoen Meta jatkaa kehittämistä, lupaavan entistä vahvempia ominaisuuksia, kuten monimodaliteettia ja laajempaa kielitukea, asettaen näin Llama 3:n kilpailijaksi muiden suurten tekoälymallien rinnalla. Llama 3 on osoitus Meta:n sitoutumisesta johtamaan tekoälyvallankumousta, tarjoamalla työkaluja, jotka eivät ainoastaan ole helpommin saatavilla, vaan myös merkittävästi edistyneempiä ja turvallisempia globaalille käyttäjäkunnalle.










