AI-mallit ja alustat
Mistral AI: Asettaa uudet mittapuut avoimessa lÃĪhdekoodin tilassa
Suuret kielen mallit (LLM) ovat viime aikoina nousseet keskiÃķÃķn, kiitos esimerkiksi ChatGPT:n. Kun Meta esitteli Llama-mallejaan, se herÃĪtti uuden kiinnostuksen avoimia LLM-malleja kohtaan. Tavoitteena on luoda edullisia, avoimia LLM-malleja, jotka ovat yhtÃĪ hyviÃĪ kuin huipputason mallit, kuten GPT-4, mutta ilman kalliita kustannuksia tai monimutkaisuutta.
TÃĪmÃĪ edullisuuden ja tehokkuuden yhdistelmÃĪ avasi uusia mahdollisuuksia tutkijoille ja kehittÃĪjille, ja loi uuden aikakauden teknologisen kehityksen luonnollisen kielen prosessoinnissa.
Viime aikoina generatiivisen tekoÃĪlyn startup-yritykset ovat menestyneet rahoituksessa. YhdessÃĪ kerÃĪsi 20 miljoonaa dollaria, tavoitteenaan muodostaa avoimia tekoÃĪlymalleja. Anthropic kerÃĪsi vaikuttavan 450 miljoonan dollarin sijoituksen, ja Cohere, joka on yhteistyÃķssÃĪ Google (GOOGL ) Cloudin kanssa, kerÃĪsi 270 miljoonaa dollaria kesÃĪkuussa tÃĪnÃĪ vuonna.
Johdanto Mistral 7B:in
Mistral AI, joka on perustettu Pariisiin ja jonka perustajat ovat Google DeepMindin ja Metan entisiÃĪ tyÃķntekijÃķitÃĪ, ilmoitti ensimmÃĪisestÃĪ suuresta kielen mallistaan: Mistral 7B. TÃĪtÃĪ mallia voi ladata kuka tahansa GitHubista tai 13,4-gigatavun torrentin kautta.
TÃĪmÃĪ startup onnistui kerÃĪÃĪmÃĪÃĪn ennÃĪtyksellisen suuren alkurahoituksen ennen kuin heillÃĪ oli tuotetta markkinoilla. Mistral AI:n ensimmÃĪinen malli, jossa on 7 miljardia parametriÃĪ, ylittÃĪÃĪ Llama 2 13B:n suorituskyvyn kaikissa testeissÃĪ ja Llama 1 34B:n useissa mittareissa.
Vertailussa muihin malleihin, kuten Llama 2:een, Mistral 7B tarjoaa samanlaisia tai parempia ominaisuuksia vÃĪhemmÃĪllÃĪ laskennalllisella kuormalla. Perusmallit, kuten GPT-4, voivat saavuttaa enemmÃĪn, mutta ne ovat kalliimpia ja vÃĪhemmÃĪn kÃĪyttÃĪjÃĪystÃĪvÃĪllisiÃĪ, koska ne ovat pÃĪÃĪasiassa saatavilla API:n kautta.
KoodausTehtÃĪvissÃĪ Mistral 7B antaa CodeLlama 7B:lle vastaavan suorituskyvyn. LisÃĪksi se on riittÃĪvÃĪn kompakti, 13,4 GB, juostaakseen standardikoneilla.
LisÃĪksi Mistral 7B Instruct, joka on sÃĪÃĪtelty erityisesti ohjausaineistoille Hugging Facen kanssa, on osoittanut erinomaista suorituskykyÃĪ. Se ylittÃĪÃĪ muita 7B-malleja MT-BenchillÃĪ ja on tasavertainen 13B-keskustelumallejen kanssa.

Hugging Face Mistral 7B Esimerkki
Suorituskyvyn vertailu
Yksityiskohtaisessa suorituskyvyn analyysissÃĪ Mistral 7B mitattiin Llama 2 -mallien kanssa. Tulokset olivat selvÃĪt: Mistral 7B ylittÃĪÃĪ merkittÃĪvÃĪsti Llama 2 13B:n kaikissa mittareissa. Se vastaa erityisesti Llama 34B:n suorituskykyÃĪ, erityisesti koodi- ja pÃĪÃĪttelymittareissa.
Mittaukset jaettiin useisiin luokkiin, kuten yleinen ÃĪlykkyys, maailman tietÃĪminen, lukemisen ymmÃĪrtÃĪminen, matematiikka ja koodi. Erityisen merkittÃĪvÃĪ havainto oli Mistral 7B:n kustannus-suorituskyky-mittari, jota kutsutaan âvastineen mallikokoâ. PÃĪÃĪttely- ja ymmÃĪrtÃĪmisalueilla Mistral 7B osoitti suorituskykyÃĪ, joka vastaa Llama 2 -mallia, joka on kolme kertaa suurempi, mikÃĪ merkitsee mahdollista muistin sÃĪÃĪstÃķÃĪ ja suorituskyvyn parantamista. Kuitenkin tietomittauksissa Mistral 7B oli linjassa Llama 2 13B:n kanssa, mikÃĪ johtunee sen parametrirajoituksista, jotka vaikuttavat tietojen pakkaamiseen.
MikÃĪ tekee Mistral 7B -mallista paremman kuin useimmat muut kielen mallit?
Yksinkertaistamalla huomiomekanismit
Huomiomekanismin yksityiskohdat ovat teknisiÃĪ, mutta perusidea on suhteellisen yksinkertainen. Kuvittele lukemista ja tÃĪrkeiden lauseiden korostamista; tÃĪmÃĪ on vastaavaa, miten huomiomekanismit âkorostavatâ tai antavat tÃĪrkeyden tiettyihin datakohtiin jÃĪrjestyksessÃĪ.
Kielen mallien kontekstissa nÃĪmÃĪ mekanismit mahdollistavat mallille keskittyÃĪ tÃĪrkeimpiin osiin syÃķteaineistosta, varmistaen, ettÃĪ tuloste on yhtenÃĪinen ja kontekstuaalisesti tarkka.
Standarditransformaatoreissa huomioarvot lasketaan kaavalla
kaavaan liittyy tÃĪrkeÃĪ askel â Q- ja K-matriisin matriisikertolasku. Haaste tÃĪssÃĪ on, ettÃĪ kun jÃĪrjestyksen pituus kasvaa, molemmat matriisit laajenevat vastaavasti, johtaen laskennallisesti vaativaan prosessiin. TÃĪmÃĪ skaalautuvuusongelma on yksi pÃĪÃĪsyy, miksi standarditransformaatort on hitaampi, erityisesti kun kÃĪsitellÃĪÃĪn pitkiÃĪ jÃĪrjestyksiÃĪ.

Monikysymyshuomio (MQA) nopeuttaa asioita kÃĪyttÃĪmÃĪllÃĪ yhtÃĪ âavain-arvoâ -pÃĪitÃĪ, mutta toisinaan uhraa laadun. Nyt voit ihmetellÃĪ, miksi ei yhdistÃĪ MQA:n nopeutta monipÃĪisen huomion laatuun? SiinÃĪ kohtaa tulee Ryhmitelty kysymyshuomio (GQA).
Ryhmitelty kysymyshuomio (GQA)
GQA on vÃĪlimuoto. Sen sijaan, ettÃĪ kÃĪytettÃĪisiin vain yhtÃĪ tai useita âavain-arvoâ -pÃĪitÃĪ, se ryhmittelee ne. TÃĪllÃĪ tavoin GQA saavuttaa suorituskyvyn, joka on lÃĪhellÃĪ yksityiskohtaista monipÃĪistÃĪ huomiota, mutta MQA:n nopeudella. Malleille, kuten Mistral, tÃĪmÃĪ tarkoittaa tehokasta suorituskykyÃĪ ilman liian suurta laadun uhraamista.
Liukuvan ikkunan huomio (SWA)
Liukuvan ikkunan menetelmÃĪ on toinen tapa prosessoida huomiojÃĪrjestyksiÃĪ. TÃĪmÃĪ menetelmÃĪ kÃĪyttÃĪÃĪ kiinteÃĪn kokoista huomioikkunaa kunkin tokenin ympÃĪrillÃĪ jÃĪrjestyksessÃĪ. Useiden kerrosten pinoutuessa tÃĪllainen ikkunallinen huomio antaa lopulta yleiskuvan koko syÃķteaineistosta. TÃĪmÃĪ mekanismi on vastaava kuin konvoluutioneuraaliverkkoihin (CNN) havaittavat reseptorikentÃĪt.
Toisaalta Longformer-mallin âdilatoitu liukuvan ikkunan huomioâ laskee vain muutaman -matriisin diagonaaleja. TÃĪmÃĪ muutos johtaa muistiin kÃĪytÃķn kasvamiseen lineaarisesti eikÃĪ neliÃķllisesti, mikÃĪ tekee siitÃĪ tehokkaamman menetelmÃĪn pidempien jÃĪrjestyksien kÃĪsittelyyn.
Mistral AI:n lÃĪpinÃĪkyvyys vs. turvallisuus huolenaiheita hajauttamisessa
Mistral AI korosti ilmoituksessaan lÃĪpinÃĪkyvyyttÃĪ seuraavasti: âEi temppuja, ei omistaja-aineistoja.â Mutta samalla heidÃĪn ainoa saatavilla oleva malli tÃĪllÃĪ hetkellÃĪ, âMistral-7B-v0.1â, on esikoulutettu perusmalli, joten se voi generoida vastauksen mihin tahansa kysymykseen ilman moderointia, mikÃĪ herÃĪttÃĪÃĪ potentiaalisia turvallisuus huolenaiheita. Vaikka mallit, kuten GPT ja Llama, ovat mekanismeja, jotka havaitsevat, milloin vastata, Mistralin tÃĪysin hajautettu luonne voi olla hyvÃĪksikÃĪytettÃĪvissÃĪ pahantahtoisille toimijoille.
Kuitenkin suurten kielen mallien hajauttaminen on myÃķs ansioita. Vaikka jotkut voivat vÃĪÃĪrinkÃĪyttÃĪÃĪ sitÃĪ, ihmiset voivat hyÃķdyntÃĪÃĪ sen voimaa yhteiskunnalliseen hyvÃĪÃĪn ja tehdÃĪ ÃĪlymystÃĪ kaikkien saataville.
Toimeenpanon joustavuus
Yksi korkeista ominaisuuksista on, ettÃĪ Mistral 7B on saatavilla Apache 2.0 -lisenssillÃĪ. TÃĪmÃĪ tarkoittaa, ettÃĪ siihen ei ole oikeudellisia esteitÃĪ â olit sitten henkilÃķkohtainen kÃĪyttÃĪjÃĪ, suuri yritys tai jopa hallituksen virasto. Sinun tarvitsee vain oikea jÃĪrjestelmÃĪ ajaa sitÃĪ, tai sinun on ehkÃĪ sijoitettava pilviresursseihin.
Vaikka on olemassa muita lisenssejÃĪ, kuten yksinkertaisempi MIT-lisenssi ja yhteisÃķllinen CC BY-SA-4.0, joka edellyttÃĪÃĪ kunnioitusta ja samanlaista lisenssiÃĪ johdannaisille, Apache 2.0 tarjoaa vankkan perustan suurten hankkeiden toteuttamiseen.
Lopputuletukset
Avoimien suurten kielen mallien, kuten Mistral 7B, nousu merkitsee ratkaisevaa muutosta tekoÃĪlyteollisuudessa, ja se tekee korkealaatuiset kielen mallit laajemmin saataville. Mistral AI:n innovatiiviset lÃĪhestymistavat, kuten Ryhmitelty kysymyshuomio ja Liukuvan ikkunan huomio, lupaavat tehokasta suorituskykyÃĪ ilman liian suurta laadun uhraamista.
Vaikka Mistralin hajautettu luonne asettaa tiettyjÃĪ haasteita, sen joustavuus ja avoimen lÃĪhdekoodin lisenssi korostavat mahdollisuuksia tekoÃĪlyn demokratisoimiseksi. Kun maisema kehittyy, fokus siirtyy vÃĪÃĪjÃĪmÃĪttÃĪ tasapainottamaan nÃĪiden mallien voimaa eettisillÃĪ huomioilla ja turvallisuusmekanismeilla.
Mistralin seuraava askel? 7B-malli oli vasta alku. Tiimi aikoo lansia vielÃĪ suurempia malleja pian. Jos nÃĪmÃĪ uudet mallit vastaavat 7B-mallin suorituskykyÃĪ, Mistral voi nousta nopeasti alan johtavaksi toimijaksi, kaiken kaikkiaan ensimmÃĪisen vuoden aikana.

















