AI-mallit ja alustat
Monikieliset LLM:t: Siirtyminen Englannin Ylittämisestä
Microsoftin tutkimuksen mukaan noin 88% maailman kielistä, joita puhuu 1,2 miljardia ihmistä, ei ole pääsyä Large Language Modelsiin (LLM). Tämä johtuu siitä, että useimmat LLM:t ovat englanninkielisiä, eli ne on rakennettu pääosin englanninkielisistä tiedoista ja englanninkielisille. Tämä englannin kielen valta-asema vallitsee myös LLM-kehityksessä ja on johtanut digitaaliseen kieliin perustuvaan aukkoon, joka voi jättää useimmat ihmiset LLM:n hyödyistä. Ratkaisuksi tähän ongelmaan tarvitaan LLM, joka voidaan kouluttaa eri kielillä ja suorittaa tehtäviä eri kielillä. Tässä astuu monikieliset LLM:t!
Mitä ovat monikieliset LLM:t?
Monikielinen LLM voi ymmärtää ja luoda tekstiä useilla kielillä. Ne on koulutettu tietokannoissa, jotka sisältävät eri kieliä, ja ne voivat suorittaa eri tehtäviä useilla kielillä käyttäjän ohjeiden mukaan.
Monikielisen LLM:n sovellukset ovat valtavat, mukaan lukien kirjallisuuden kääntäminen paikallisiin murteisiin, reaaliaikainen monikielinen viestintä, monikielinen sisällön luominen jne. Ne auttaisivat kaikkia pääsemään tietoihin ja viestimään helposti, riippumatta kielestä.
Lisäksi monikieliset LLM:t ovat ratkaisseet haasteita, kuten kulttuuristen nuanssien ja kontekstin puutetta, koulutusdatan rajoituksia ja tiedon mahdollista menetystä käännöksessä.
Miten monikieliset LLM:t toimivat?
Monikielisen LLM:n rakentaminen edellyttää tarkkaa valmistelua tasapainotetusta tekstikorpuksista eri kielillä ja sopivan arkkitehtuurin ja koulutustekniikan valintaa mallin koulutukseen, mieluiten Transformer-mallia, joka on täydellinen monikieliselle oppimiselle.

Lähde: Kuva tekijältä
Yksi tekniikka on jakaa sisälsiä, jotka sisältävät sanojen semanttisen merkityksen eri kielillä. Tämä mahdollistaa LLM:n oppia kunkin kielen samankaltaisuuksia ja eroja, mikä mahdollistaa kielen ymmärtämisen paremmin.
Tämä tieto myös mahdollistaa LLM:n sopeutumisen eri kielellisiin tehtäviin, kuten kääntämiseen, eri tyylilajeihin jne. Toinen käytetty tekniikka on cross-lingual transfer learning, jossa malli on esikoulutettu suurella monikielisellä tietokannalla ennen kuin se on hienosäädetty tiettyihin tehtäviin.
Tämä kaksivaiheinen prosessi varmistaa, että malli on vahva monikielisen kielen ymmärtäminen, mikä tekee siitä sopeutuvan eri sovelluksiin.
Esimerkkejä monikielisistä LLM:stä

Lähde: Ruder.io
On olemassa useita merkittäviä esimerkkejä monikielisistä LLM:stä, joista jokainen palvelee tiettyjä kielellisiä tarpeita ja kulttuurisia konteksteja. Tarkastellaan joitakin niistä:
1. BLOOM
BLOOM on avoimen pääsyn monikielinen LLM, joka priorisoi monia kieliä ja saatavuutta. 176 miljardin parametrin kanssa BLOOM voi suorittaa tehtäviä 46 luonnollisella kielellä ja 13 ohjelmointikielellä, mikä tekee siitä yhden suurimmista ja monipuolisimmista LLM:stä.
BLOOM:n avoimen lähdekoodin luonne mahdollistaa tutkijoille, kehittäjille ja kieliyhteisöille hyödyntää sen kykyjä ja osallistua sen parantamiseen.
2. YAYI 2
YAYI 2 on avoimen lähdekoodin LLM, joka on suunniteltu erityisesti aasialaisille kielille, ottaen huomioon alueen monimuotoisuuden ja kulttuuriset nuanssit. Se on koulutettu alusta lähtien monikielisellä tietokannalla, joka sisältää 16 aasialaista kieltä ja 2,65 biljoonaa suodatettua tokenia.
Tämä tekee mallista paremman tuloksen, joka vastaa tiettyjen kielten ja kulttuurien erityistarpeita.
3. PolyLM
PolyLM on avoimen lähdekoodin “monikielinen” LLM, joka keskittyy ratkaisemaan vähävaraisilla kielillä olevia haasteita tarjoamalla sopeutumiskykyjä. Se on koulutettu tietokannasta, joka sisältää noin 640 miljardia tokenia, ja se on saatavilla kahdessa mallikokoisessa versiossa: 1,7B ja 13B. PolyLM osaa yli 16 eri kieltä.
Se mahdollistaa malleja, jotka on koulutettu vähävaraisilla kielillä, sopeutumaan malleihin, jotka on koulutettu runsaammin varustetuilla kielillä, ja se tekee LLM:stä hyödyllisemmän eri kielitilanteissa ja tehtävissä.
4. XGLM
XGLM, joka on 7,5 miljardin parametrin malli, on monikielinen LLM, joka on koulutettu tietokannasta, joka kattaa monipuolisen joukon yli 20 kieltä käyttäen vähäshot-oppimistekniikkaa. Se on osa suurten monikielisten LLM-mallien perhettä, jotka on koulutettu massiivisella tietokannalla tekstiä ja koodia.
Se pyrkii kattamaan useita kieli täysin, mikä on syynä siihen, että se keskittyy inklusiivisuuteen ja kielelliseen monimuotoisuuteen. XGLM osoittaa potentiaalia rakentaa malleja, jotka palvelevat eri kielten yhteisöjen tarpeita.
5. mT5
mT5 (massiivisesti monikielinen Teksti-teksti-siirtymä-Transformer) on kehitetty Google (GOOGL ) AI:lla. Se on koulutettu common crawl -tietokannasta, ja se on monikielinen LLM, joka pystyy käsittelemään 101 kieltä, aina laajasti puhuttuja kieliä kuten espanjaa ja kiinaa aina vähemmän resursseja saaneisiin kielisiin kuten baskiin ja quechuaan.
Se on myös erittäin hyvä monikielisissä tehtävissä, kuten kääntämisessä, yhteenvetossa, kysymys-vastaus-järjestelmissä jne.
Onko yleinen LLM mahdollinen?
Kielen neutraalin LLM:n käsite, joka pystyy ymmärtämään ja luomaan kieltä ilman ennakkoasenteita mihinkään tiettyyn kieleen, on mielenkiintoinen.
Vaikka todella yleisen LLM:n kehittäminen on vielä kaukana, nykyiset monikieliset LLM:t ovat osoittaneet merkittävää menestystä. Kun ne on kehitetty täysin, ne voivat palvella vähävaraisten kielten ja monimuotoisten yhteisöjen tarpeita.
Esimerkiksi tutkimus osoittaa, että useimmat monikieliset LLM:t voivat helposti siirtää tietoa resursseja runsaammin varustetusta kielestä vähävaraisten kielien kielelle ilman tehtävän mukaista koulutusdataa.
Lisäksi mallit kuten YAYI ja BLOOM, jotka keskittyvät tiettyihin kielisiin ja yhteisöihin, ovat osoittaneet kielen keskeisten lähestymistapojen potentiaalia edistääkseen kehitystä ja inklusiivisuutta.
Rakentaaaksesi yleisen LLM:n tai parantaaksesi nykyisiä monikielisiä LLM:iä, yksilöiden ja organisaatioiden on tehtävä seuraavaa:
- Kerätä äidinkielisiä puhujia yhteisöjen osallistumiseen ja kielten tietokantojen kuraattoriksi.
- Tukea yhteisöjen avoimen lähdekoodin osallistumista ja rahoitusta monikieliseen tutkimukseen ja kehitykseen.
Monikielisen LLM:n haasteet
Vaikka yleisten monikielisten LLM:ien käsite on lupaava, ne kohtaavat myös useita haasteita, jotka on ratkaistava ennen kuin niistä voidaan hyötyä:
1. Datamäärä
Monikieliset mallit vaativat suuremman sanaston edustamaan tokenia useilla kielillä kuin yksikieliset mallit, mutta monilla kielillä ei ole suuria tietokantoja. Tämä tekee niiden kouluttamisen haasteelliseksi.
2. Datatarkkuuden huolenaiheita
Monikielisen LLM:n tulosten tarkkuuden ja kulttuurisen sopivuuden varmistaminen on merkittävä huolenaihe. Malleja on koulutettava ja hienosäädetty tarkkaan kielen ja kulttuuristen nuanssien huomioon ottaen, jotta voidaan välttää ennakkoasenteita ja epätarkkuuksia.
3. Resurssirajoitukset
Monikielisen mallin kouluttaminen ja suorittaminen vaativat merkittäviä laskentaresursseja, kuten voimakkaita GPU:ita (esim. NVIDIA A100 GPU). Korkea kustannus aiheuttaa haasteita, erityisesti vähävaraisten kielten ja yhteisöjen kohdalla, joilla on rajoitettu pääsy laskentainfrastruktuuriin.
4. Mallin arkkitehtuuri
Mallin arkkitehtuurin sopeuttaminen eri kielten rakenteiden ja monimuotoisuuden mukaisesti on jatkuva haaste. Malleja on kyettävä käsittelemään kieliä, joilla on erilaiset sanajärjestykset, morfologiset variatiot ja kirjaimet, samalla ylläpitäen suorituskykyä ja tehokkuutta.
5. Arvioinnin monimuotoisuus
Monikielisen LLM:n suorituskyvyn arvioiminen englannin kielen mittareiden ulottuvilla on kriittinen sen todellisen tehokkuuden mittaamiseksi. Se edellyttää kulttuuristen nuanssien, kielellisten erityispiirteiden ja alan mukaisien vaatimusten huomioon ottamista.
Monikieliset LLM:t voivat murtaa kielimuurit, antaa vähävaraisten kielten valtaa ja helpottaa viestintää monimuotoisissa yhteisöissä.
Älä missaa uusimpia uutisia ja analyysejä tekoälystä ja koneoppimisesta – vieraile unite.ai:ssa tänään.












