AI-mallit ja alustat

Mistral AI: Asettaa uudet mittapuut avoimessa lÃĪhdekoodin tilassa

mm
LisÃĪÃĪ Unite.AI suosikkilÃĪhteisiisi Google-palvelussa

Suuret kielen mallit (LLM) ovat viime aikoina nousseet keskiÃķÃķn, kiitos esimerkiksi ChatGPT:n. Kun Meta esitteli Llama-mallejaan, se herÃĪtti uuden kiinnostuksen avoimia LLM-malleja kohtaan. Tavoitteena on luoda edullisia, avoimia LLM-malleja, jotka ovat yhtÃĪ hyviÃĪ kuin huipputason mallit, kuten GPT-4, mutta ilman kalliita kustannuksia tai monimutkaisuutta.

TÃĪmÃĪ edullisuuden ja tehokkuuden yhdistelmÃĪ avasi uusia mahdollisuuksia tutkijoille ja kehittÃĪjille, ja loi uuden aikakauden teknologisen kehityksen luonnollisen kielen prosessoinnissa.

Viime aikoina generatiivisen tekoÃĪlyn startup-yritykset ovat menestyneet rahoituksessa. YhdessÃĪ kerÃĪsi 20 miljoonaa dollaria, tavoitteenaan muodostaa avoimia tekoÃĪlymalleja. Anthropic kerÃĪsi vaikuttavan 450 miljoonan dollarin sijoituksen, ja Cohere, joka on yhteistyÃķssÃĪ Google (GOOGL ) Cloudin kanssa, kerÃĪsi 270 miljoonaa dollaria kesÃĪkuussa tÃĪnÃĪ vuonna.

Johdanto Mistral 7B:in

mistral AI

Mistral AI, joka on perustettu Pariisiin ja jonka perustajat ovat Google DeepMindin ja Metan entisiÃĪ tyÃķntekijÃķitÃĪ, ilmoitti ensimmÃĪisestÃĪ suuresta kielen mallistaan: Mistral 7B. TÃĪtÃĪ mallia voi ladata kuka tahansa GitHubista tai 13,4-gigatavun torrentin kautta.

TÃĪmÃĪ startup onnistui kerÃĪÃĪmÃĪÃĪn ennÃĪtyksellisen suuren alkurahoituksen ennen kuin heillÃĪ oli tuotetta markkinoilla. Mistral AI:n ensimmÃĪinen malli, jossa on 7 miljardia parametriÃĪ, ylittÃĪÃĪ Llama 2 13B:n suorituskyvyn kaikissa testeissÃĪ ja Llama 1 34B:n useissa mittareissa.

Vertailussa muihin malleihin, kuten Llama 2:een, Mistral 7B tarjoaa samanlaisia tai parempia ominaisuuksia vÃĪhemmÃĪllÃĪ laskennalllisella kuormalla. Perusmallit, kuten GPT-4, voivat saavuttaa enemmÃĪn, mutta ne ovat kalliimpia ja vÃĪhemmÃĪn kÃĪyttÃĪjÃĪystÃĪvÃĪllisiÃĪ, koska ne ovat pÃĪÃĪasiassa saatavilla API:n kautta.

KoodausTehtÃĪvissÃĪ Mistral 7B antaa CodeLlama 7B:lle vastaavan suorituskyvyn. LisÃĪksi se on riittÃĪvÃĪn kompakti, 13,4 GB, juostaakseen standardikoneilla.

LisÃĪksi Mistral 7B Instruct, joka on sÃĪÃĪtelty erityisesti ohjausaineistoille Hugging Facen kanssa, on osoittanut erinomaista suorituskykyÃĪ. Se ylittÃĪÃĪ muita 7B-malleja MT-BenchillÃĪ ja on tasavertainen 13B-keskustelumallejen kanssa.

Suorituskyvyn vertailu

Yksityiskohtaisessa suorituskyvyn analyysissÃĪ Mistral 7B mitattiin Llama 2 -mallien kanssa. Tulokset olivat selvÃĪt: Mistral 7B ylittÃĪÃĪ merkittÃĪvÃĪsti Llama 2 13B:n kaikissa mittareissa. Se vastaa erityisesti Llama 34B:n suorituskykyÃĪ, erityisesti koodi- ja pÃĪÃĪttelymittareissa.

Mittaukset jaettiin useisiin luokkiin, kuten yleinen ÃĪlykkyys, maailman tietÃĪminen, lukemisen ymmÃĪrtÃĪminen, matematiikka ja koodi. Erityisen merkittÃĪvÃĪ havainto oli Mistral 7B:n kustannus-suorituskyky-mittari, jota kutsutaan “vastineen mallikoko”. PÃĪÃĪttely- ja ymmÃĪrtÃĪmisalueilla Mistral 7B osoitti suorituskykyÃĪ, joka vastaa Llama 2 -mallia, joka on kolme kertaa suurempi, mikÃĪ merkitsee mahdollista muistin sÃĪÃĪstÃķÃĪ ja suorituskyvyn parantamista. Kuitenkin tietomittauksissa Mistral 7B oli linjassa Llama 2 13B:n kanssa, mikÃĪ johtunee sen parametrirajoituksista, jotka vaikuttavat tietojen pakkaamiseen.

MikÃĪ tekee Mistral 7B -mallista paremman kuin useimmat muut kielen mallit?

Yksinkertaistamalla huomiomekanismit

Huomiomekanismin yksityiskohdat ovat teknisiÃĪ, mutta perusidea on suhteellisen yksinkertainen. Kuvittele lukemista ja tÃĪrkeiden lauseiden korostamista; tÃĪmÃĪ on vastaavaa, miten huomiomekanismit “korostavat” tai antavat tÃĪrkeyden tiettyihin datakohtiin jÃĪrjestyksessÃĪ.

Kielen mallien kontekstissa nÃĪmÃĪ mekanismit mahdollistavat mallille keskittyÃĪ tÃĪrkeimpiin osiin syÃķteaineistosta, varmistaen, ettÃĪ tuloste on yhtenÃĪinen ja kontekstuaalisesti tarkka.

Standarditransformaatoreissa huomioarvot lasketaan kaavalla

Transformers attention Formula

Transformers Attention Formula

kaavaan liittyy tÃĪrkeÃĪ askel – Q- ja K-matriisin matriisikertolasku. Haaste tÃĪssÃĪ on, ettÃĪ kun jÃĪrjestyksen pituus kasvaa, molemmat matriisit laajenevat vastaavasti, johtaen laskennallisesti vaativaan prosessiin. TÃĪmÃĪ skaalautuvuusongelma on yksi pÃĪÃĪsyy, miksi standarditransformaatort on hitaampi, erityisesti kun kÃĪsitellÃĪÃĪn pitkiÃĪ jÃĪrjestyksiÃĪ.

transformerHuomiomekanismit auttavat malleja keskittymÃĪÃĪn tiettyihin syÃķteaineiston osiin. YleensÃĪ nÃĪmÃĪ mekanismit kÃĪyttÃĪvÃĪt “pÃĪitÃĪ” huomion hallitsemiseen. MitÃĪ enemmÃĪn pÃĪitÃĪ on, sitÃĪ tarkempi huomio, mutta se myÃķs monimutkaistuu ja hidastuu. SyvennÃĪ transformaattoreiden ja huomiomekanismin pariin tÃĪÃĪltÃĪ.

Monikysymyshuomio (MQA) nopeuttaa asioita kÃĪyttÃĪmÃĪllÃĪ yhtÃĪ â€œavain-arvo” -pÃĪitÃĪ, mutta toisinaan uhraa laadun. Nyt voit ihmetellÃĪ, miksi ei yhdistÃĪ MQA:n nopeutta monipÃĪisen huomion laatuun? SiinÃĪ kohtaa tulee Ryhmitelty kysymyshuomio (GQA).

Ryhmitelty kysymyshuomio (GQA)

Grouped-query attention

Ryhmitelty kysymyshuomio

GQA on vÃĪlimuoto. Sen sijaan, ettÃĪ kÃĪytettÃĪisiin vain yhtÃĪ tai useita “avain-arvo” -pÃĪitÃĪ, se ryhmittelee ne. TÃĪllÃĪ tavoin GQA saavuttaa suorituskyvyn, joka on lÃĪhellÃĪ yksityiskohtaista monipÃĪistÃĪ huomiota, mutta MQA:n nopeudella. Malleille, kuten Mistral, tÃĪmÃĪ tarkoittaa tehokasta suorituskykyÃĪ ilman liian suurta laadun uhraamista.

Liukuvan ikkunan huomio (SWA)

longformer transformers sliding window

Liukuvan ikkunan menetelmÃĪ on toinen tapa prosessoida huomiojÃĪrjestyksiÃĪ. TÃĪmÃĪ menetelmÃĪ kÃĪyttÃĪÃĪ kiinteÃĪn kokoista huomioikkunaa kunkin tokenin ympÃĪrillÃĪ jÃĪrjestyksessÃĪ. Useiden kerrosten pinoutuessa tÃĪllainen ikkunallinen huomio antaa lopulta yleiskuvan koko syÃķteaineistosta. TÃĪmÃĪ mekanismi on vastaava kuin konvoluutioneuraaliverkkoihin (CNN) havaittavat reseptorikentÃĪt.

Toisaalta Longformer-mallin “dilatoitu liukuvan ikkunan huomio” laskee vain muutaman -matriisin diagonaaleja. TÃĪmÃĪ muutos johtaa muistiin kÃĪytÃķn kasvamiseen lineaarisesti eikÃĪ neliÃķllisesti, mikÃĪ tekee siitÃĪ tehokkaamman menetelmÃĪn pidempien jÃĪrjestyksien kÃĪsittelyyn.

Mistral AI:n lÃĪpinÃĪkyvyys vs. turvallisuus huolenaiheita hajauttamisessa

Mistral AI korosti ilmoituksessaan lÃĪpinÃĪkyvyyttÃĪ seuraavasti: “Ei temppuja, ei omistaja-aineistoja.” Mutta samalla heidÃĪn ainoa saatavilla oleva malli tÃĪllÃĪ hetkellÃĪ, ‘Mistral-7B-v0.1’, on esikoulutettu perusmalli, joten se voi generoida vastauksen mihin tahansa kysymykseen ilman moderointia, mikÃĪ herÃĪttÃĪÃĪ potentiaalisia turvallisuus huolenaiheita. Vaikka mallit, kuten GPT ja Llama, ovat mekanismeja, jotka havaitsevat, milloin vastata, Mistralin tÃĪysin hajautettu luonne voi olla hyvÃĪksikÃĪytettÃĪvissÃĪ pahantahtoisille toimijoille.

Kuitenkin suurten kielen mallien hajauttaminen on myÃķs ansioita. Vaikka jotkut voivat vÃĪÃĪrinkÃĪyttÃĪÃĪ sitÃĪ, ihmiset voivat hyÃķdyntÃĪÃĪ sen voimaa yhteiskunnalliseen hyvÃĪÃĪn ja tehdÃĪ ÃĪlymystÃĪ kaikkien saataville.

Toimeenpanon joustavuus

Yksi korkeista ominaisuuksista on, ettÃĪ Mistral 7B on saatavilla Apache 2.0 -lisenssillÃĪ. TÃĪmÃĪ tarkoittaa, ettÃĪ siihen ei ole oikeudellisia esteitÃĪ â€“ olit sitten henkilÃķkohtainen kÃĪyttÃĪjÃĪ, suuri yritys tai jopa hallituksen virasto. Sinun tarvitsee vain oikea jÃĪrjestelmÃĪ ajaa sitÃĪ, tai sinun on ehkÃĪ sijoitettava pilviresursseihin.

Vaikka on olemassa muita lisenssejÃĪ, kuten yksinkertaisempi MIT-lisenssi ja yhteisÃķllinen CC BY-SA-4.0, joka edellyttÃĪÃĪ kunnioitusta ja samanlaista lisenssiÃĪ johdannaisille, Apache 2.0 tarjoaa vankkan perustan suurten hankkeiden toteuttamiseen.

Lopputuletukset

Avoimien suurten kielen mallien, kuten Mistral 7B, nousu merkitsee ratkaisevaa muutosta tekoÃĪlyteollisuudessa, ja se tekee korkealaatuiset kielen mallit laajemmin saataville. Mistral AI:n innovatiiviset lÃĪhestymistavat, kuten Ryhmitelty kysymyshuomio ja Liukuvan ikkunan huomio, lupaavat tehokasta suorituskykyÃĪ ilman liian suurta laadun uhraamista.

Vaikka Mistralin hajautettu luonne asettaa tiettyjÃĪ haasteita, sen joustavuus ja avoimen lÃĪhdekoodin lisenssi korostavat mahdollisuuksia tekoÃĪlyn demokratisoimiseksi. Kun maisema kehittyy, fokus siirtyy vÃĪÃĪjÃĪmÃĪttÃĪ tasapainottamaan nÃĪiden mallien voimaa eettisillÃĪ huomioilla ja turvallisuusmekanismeilla.

Mistralin seuraava askel? 7B-malli oli vasta alku. Tiimi aikoo lansia vielÃĪ suurempia malleja pian. Jos nÃĪmÃĪ uudet mallit vastaavat 7B-mallin suorituskykyÃĪ, Mistral voi nousta nopeasti alan johtavaksi toimijaksi, kaiken kaikkiaan ensimmÃĪisen vuoden aikana.

Olen viettÃĪnyt viimeiset viisi vuotta uppoutumalla kiinnostavaan koneoppimisen ja syvÃĪn oppimisen maailmaan. Minun intohimoni ja asiantuntemukseni ovat johtaneet minun osallistumiseen yli 50:een monipuoliseen ohjelmistosuunnitteluhankkeeseen, joissa on erityisesti painottunut AI/ML. Minun jatkuva uteliaisuuteni on myÃķs ohjannut minun luontaisen kielen prosessoinnin pariin, jota haluan tutkia tarkemmin.