AI-mallit ja alustat
Mistral AI:n uusin Mixture of Experts (MoE) 8x7B -malli
joka on Pariisissa sijaitseva avoimen lähdekoodin malliyhtiö, on haastanut normit julkaisemalla viimeisimmän suuren kielen mallinsa (LLM), MoE 8x7B, yksinkertaisen torrent-linkin kautta. Tämä poikkeaa Google :n perinteisestä lähestymistavasta heidän Gemini-julkaisunsa kanssa, herättäen keskustelua ja innostusta tekoäly-yhteisössä.
Mistral AI:n julkaisustrategia on aina ollut epäperinteinen. Usein jättämällä tavalliset seurat, kuten tutkimukset, blogit tai lehdistötiedotteet, heidän strategiansa on ollut ainutlaatuinen ja tehokas kiinnittämään tekoäly-yhteisön huomion.
Viimeaikaisesti yritys saavutti merkittävän $2 miljardin arvon seurauksena rahoituskierrokselta, jota johti Andreessen Horowitz. Tämä rahoituskierros oli historiallinen, asettamalla ennätyksen 118 miljoonan dollarin siemenrahastona, Euroopan historian suurimpana. Rahoituskierroksen menestyksen lisäksi Mistral AI on ollut aktiivisesti mukana keskusteluissa EU:n tekoälylain suhteen, puolustamalla vähennettyä sääntelyä avoimen lähdekoodin tekoälyssä.
Miksi MoE 8x7B herättää huomiota
Kuvattu “GPT-4:n pienennetyksi”, Mixtral 8x7B käyttää Mixture of Experts (MoE) -kehystä, jossa on kahdeksan asiantuntijaa. Jokaisella asiantuntijalla on 111 miljardia parametriä, yhdistettynä 55 miljardin jaettuun huomioon kiinnittämisparametriin, mikä antaa yhteensä 166 miljardia parametriä mallille. Tämä suunnitteluratkaisu on merkittävä, koska se mahdollistaa vain kahden asiantuntijan osallistumisen jokaisen tokenin inferenceen, korostamalla siirtymistä tehokkaampiin ja kohdennettuihin tekoälyprosesseihin.
Yksi Mixtralin keskeisistä ominaisuuksista on sen kyky hallita laajaa 32 000 tokenin kontekstia, tarjoamalla runsaasti tilaa monimutkaisten tehtävien käsittelyyn. Mallin monikieliset ominaisuudet sisältävät vahvan tuen englannin, ranskan, italian, saksan ja espanjan kielille, palvelemalla maailmanlaajuista kehittäjäyhteisöä.
Mixtralin esikoulutus käyttää avoimen verkon dataa, yhdistäen asiantuntijoiden ja reitittimien samanaikaista koulutusta. Tämä menetelmä varmistaa, että malli ei ole vain laaja parametriavaruudessaan, vaan myös hienosäädetty avoimen datan nuansseihin, jolle se on altistunut.

Mixtral 8x7B saavuttaa vaikuttavan tuloksen
Mixtral 8x7B ylittää LLaMA 2 70B:n ja kilpailee GPT-3.5:n kanssa, erityisesti merkittävästi MBPP-tehtävässä, jossa se saavuttaa 60,7 prosentin onnistumisprosentin, joka on merkittävästi korkeampi kuin sen vertailukohdissa. Jopa tiukassa MT-Bench-kokeessa, joka on suunniteltu ohjeiden mukaisille malleille, Mixtral 8x7B saavuttaa vaikuttavan tuloksen, lähes vastaavan GPT-3.5:n tuloksen.
Mixture of Experts (MoE) -kehysteen ymmärtäminen
Mixture of Experts (MoE) -malli, joka on saavuttanut viimeaikaisen huomion sen sisällyttämisen ansiosta valtavirtaisten kielimallien pariin, kuten Mistral AI:n MoE 8x7B, on itse asiassa juurtunut perustavaan konseptiin, joka ulottuu useita vuosia taaksepäin. Tarkastellaan tämän idean alkuperää kautta merkittävän tutkimuksen.
MoE-konsepti
Mixture of Experts (MoE) edustaa paradigman muutosta neuroverkkoarkkitehtuuriin. Toisin kuin perinteiset mallit, jotka käyttävät yhtenäistä, homogeenista verkkoa kaikenlaisen datan prosessointiin, MoE ottaa käyttöön erikoistuneemman ja modulaarisen lähestymistavan. Se koostuu useista “asiantuntija”-verkoista, joista jokainen on suunniteltu käsittelemään tietynlaisia dataa tai tehtäviä, ja niiden yllä on “porteista” verkko, joka dynaamisesti ohjaa syötteen dataa sopivimpaan asiantuntijaan.

Mixture of Experts (MoE) -kerros kiinnitetty kielen malliin (Lähde)
Yllä oleva kuva esittää yleiskatsauksen MoE-kerroksen sisällöstä kielen mallissa. Sen ydin koostuu useista eteenpäin suuntautuvista aliverkoista, jotka kutsutaan “asiantuntijoiksi”, ja joista jokainen voi erikoistua eri datan osuuksien prosessointiin. Porteista verkko, joka on korostettu diagrammissa, määrittää, mitkä asiantuntijat osallistuvat syötteen käsittelyyn. Tämä ehdollinen aktivaatio sallii verkon merkittävästi lisätä kapasiteettia ilman, että laskenta vaatimukset kasvavat vastaavasti.
MoE-kerroksen toiminnallisuus
Käytännössä porteista verkko arvioi syötteen (merkitty G(x) diagrammissa) ja valitsee niukka joukon asiantuntijoita sen prosessointiin. Tämä valinta on ohjattu porteista verkon tuloksilla, joka määrittää jokaisen asiantuntijan “äänestys”- tai osallistumisen lopputulokseen. Esimerkiksi, kuten diagrammissa näkyy, vain kaksi asiantuntijaa voidaan valita jokaisen tietyn syöte-tokenin laskemiseen, tehden prosessin tehokkaaksi keskittämällä laskentaresursseja, missä ne ovat eniten tarpeen.

Transformer-Encoder MoE-kerroksilla (Lähde)
Toinen yllä oleva kuva esittää perinteisen Transformer-encoderin ja sen vastineen, johon on lisätty MoE-kerros. Transformer-arkkitehtuuri, joka on laajalti tunnettu tehtävien tehokkuudesta, koostuu itsestään ja eteenpäin suuntautuvista kerroksista, pinottuna peräkkäin. MoE-kerrosten lisääminen korvaa joitakin näistä eteenpäin suuntautuvista kerroksista, mahdollistaen mallin skaalautumisen kapasiteetin suhteen tehokkaammin.
Laajennetussa mallissa MoE-kerrokset on jaettu useiden laitteiden välille, esittäen malliparallelin lähestymistavan. Tämä on kriittistä, kun skaalataan hyvin suuriin malleihin, koska se sallii laskennan ja muistin vaatimusten jakamisen useiden laitteiden, kuten GPUjen tai TPUjen, ryhmän kesken. Tämä jakaminen on olennainen suurten, useiden miljardien parametreja sisältävien mallien kouluttamiseksi ja käyttöönottoon tehokkaasti, kuten näkyy mallejen kouluttamisessa, joissa on satoja miljardeja tai jopa yli biljoona parametriä suurilla laskentaympäristöissä.
Hajainen MoE-lähestymistapa ohjeiden koulutuksella LLM:ssä
“Hajainen Mixture-of-Experts (MoE) skaalautuvaa kielimallia varten” -niminen tutkimusartikkeli esittelee innovatiivisen lähestymistavan parantaa suuria kielimalleja (LLM) integroimalla Mixture of Experts -arkkitehtuuri ohjeiden koulutusmenetelmiin.
Se korostaa yleistä haasteita, jossa MoE-mallit jäävät jälkeen tiheisiin malleihin verrattuna, kun ne on hienosäädetty tiettyihin tehtäviin, johtuen eroista yleisen esikoulutuksen ja tehtäväkohtaisen hienosäätelyn välillä.
Ohjeiden koulutus on koulutusmenetelmä, jossa malleja parannetaan seuraamaan luonnollisen kielen ohjeita, tehden niistä tehtävän suorituskyvyn parantamista. Tutkimus osoittaa, että MoE-mallit näyttävät merkittävää parannusta, kun ne yhdistetään ohjeiden koulutukseen, enemmän kuin tiheät vastineensa. Tämä menetelmä kohdistaa mallin esikoulutetut edustukset seuraamaan ohjeita tehokkaammin, johtaa merkittäviin suorituskyvyn parannuksiin.
Tutkijat suorittivat tutkimuksia kolmessa kokeellisessa asetelmassa, osoittaen, että MoE-mallit aluksi jäävät jälkeen suorassa tehtäväkohtaisessa hienosäätelyssä. Kuitenkin, kun ohjeiden koulutusta sovelletaan, MoE-mallit menestyvät, erityisesti kun ne täydennetään tehtäväkohtaisella hienosäätelyllä. Tämä osoittaa, että ohjeiden koulutus on olennainen askel MoE-mallien menestykseksi tiheiden mallejen yläpuolella tehtävissä.
Se esittelee myös FLAN-MOE32B-mallin, joka osoittaa näiden konseptien onnistuneen soveltamisen. Merkittävästi, se ylittää FLAN-PALM62B:n, tiheän mallin, benchmark-tehtävissä, käyttäen vain kolmanneksen laskentaresursseja. Tämä osoittaa hajaisen MoE-mallien ja ohjeiden koulutuksen yhdistämisen potentiaalin asettaa uudet standardit LLM:n tehokkuudelle ja suorituskyvylle.
Mixture of Experts -mallien soveltaminen todellisissa tilanteissa
MoE-mallien monikäyttöisyys tekee niistä ihanteellisia useille sovelluksille:
- Luonnollinen kielen prosessointi (NLP): MoE-mallit voivat käsitellä ihmisen kielen nuansseja ja monimutkaisuuksia tehokkaammin, tehden niistä ihanteellisia edistyneille NLP-tehtäville.
- Kuvan ja videon prosessointi: Tehtävissä, jotka vaativat korkearesoluutioista prosessointia, MoE voi hallita eri kuvien tai videoframejen osia, parantaen sekä laadun että prosessoinnin nopeutta.
- Mukautuvat tekoälyratkaisut: Liiketoiminnat ja tutkijat voivat räätälöidä MoE-malleja tiettyihin tehtäviin, johtaen kohdennettuihin ja tehokkaisiin tekoälyratkaisuihin.
Haasteet ja huomioon otettavat seikat
Vaikka MoE-mallit tarjoavat useita etuja, ne esittävät myös ainutlaatuisia haasteita:
- Monimutkaisuus koulutuksessa ja säätössä: MoE-mallien hajautettu luonne voi monimutkaistaa koulutusprosessin, vaatien huolellista tasapainotusta ja säätöä asiantuntijoita ja porteista verkkoa koskien.
- Resurssien hallinta: Laskentaresurssien tehokas hallinta useiden asiantuntijoiden kesken on olennainen MoE-mallien hyödyntämiseksi.
MoE-kerrosten sisällyttäminen neuroverkkoihin, erityisesti kielimallien alalla, tarjoaa polun skaalata malleja aiemmin laskennallisten rajoitusten vuoksi mahdottomiin kokoihin. MoE-kerrosten mahdollistama ehdollinen laskenta sallii resurssien tehokkaamman jakamisen, mahdollistaen suurempien ja kykykkäämpien mallien kouluttamisen. Kun jatkamme vaatimusten asettamista tekoälyjärjestelmiiltämme, arkkitehtuureja kuten MoE-varustettu Transformer tulevat todennäköisesti olemaan standardi monimutkaisten, suurten tehtävien käsittelyyn eri alueilla.













