AI-modellen en platforms
De staat van meertalige LLM’s: verder gaan dan het Engels
Volgens onderzoek van Microsoft (MSFT ) heeft ongeveer 88% van de talen ter wereld, gesproken door 1,2 miljard mensen, geen toegang tot Large Language Models (LLM’s). Dit komt doordat de meeste LLM’s gericht zijn op het Engels, d.w.z. ze zijn voornamelijk gebouwd met Engelse gegevens en voor Engelssprekenden. Deze dominantie van het Engels komt ook voor in de ontwikkeling van LLM’s en heeft geresulteerd in een digitale taalkloof, waardoor mogelijk de meeste mensen worden uitgesloten van de voordelen van LLM’s. Om dit probleem voor LLM’s op te lossen, is een LLM nodig die kan worden getraind in verschillende talen en taken kan uitvoeren in verschillende talen. Kom binnen in meertalige LLM’s!
Wat zijn meertalige LLM’s?
Een meertalige LLM kan tekst begrijpen en genereren in meerdere talen. Ze worden getraind op datasets die verschillende talen bevatten en kunnen verschillende taken uitvoeren in meer dan één taal op basis van een gebruikersprompt.
Meertalige LLM-toepassingen zijn enorm, ze omvatten het vertalen van literatuur naar lokale dialecten, real-time meertalige communicatie, meertalige inhoudscreatie, enz. Ze zouden iedereen in staat stellen om gemakkelijk toegang te krijgen tot informatie en met elkaar te communiceren, ongeacht hun taal.
Bovendien lossen meertalige LLM’s uitdagingen op, zoals het gebrek aan culturele nuances en context, beperkingen van trainingsgegevens en het potentieel verlies van kennis tijdens vertaling.
Hoe werken meertalige LLM’s?
Het bouwen van een meertalige LLM omvat het zorgvuldig voorbereiden van een evenwichtig corpus van tekst in verschillende talen en het selecteren van een geschikte architectuur en trainingsmethode voor het trainen van het model, bij voorkeur een Transformer-model, dat perfect is voor meertalig leren.

Bron: Afbeelding door auteur
Een techniek is het delen van embeddings, die de semantische betekenis van woorden in verschillende talen vastleggen. Dit maakt het mogelijk voor de LLM om de overeenkomsten en verschillen van elke taal te leren, waardoor het beter in staat is om de verschillende talen te begrijpen.
Deze kennis stelt de LLM ook in staat om zich aan te passen aan verschillende taaltaken, zoals het vertalen van talen, schrijven in verschillende stijlen, enz. Een andere techniek die wordt gebruikt, is cross-lingual transfer learning, waarbij het model wordt voorge_traind op een grote corpus van meertalige gegevens voordat het wordt gefinetuned voor specifieke taken.
Deze tweestapsproces zorgt ervoor dat het model een sterke basis heeft in meertalig taalbegrip, waardoor het aanpasbaar is aan verschillende downstream-toepassingen.
Voorbeelden van meertalige Large Language Models

Bron: Ruder.io
Er zijn verschillende opvallende voorbeelden van meertalige LLM’s, elk aangepast aan specifieke taalbehoeften en culturele contexten. Laten we er een paar bekijken:
1. BLOOM
BLOOM is een open-toegankelijke meertalige LLM die prioriteit geeft aan diverse talen en toegankelijkheid. Met 176 miljard parameters kan BLOOM taken uitvoeren in 46 natuurlijke en 13 programmeertalen, waardoor het een van de grootste en meest diverse LLM’s is.
BLOOM’s open-source-natuur stelt onderzoekers, ontwikkelaars en taalgemeenschappen in staat om te profiteren van zijn mogelijkheden en bij te dragen aan zijn verbetering.
2. YAYI 2
YAYI 2 is een open-source LLM dat specifiek is ontworpen voor Aziatische talen, rekening houdend met de complexiteiten en culturele nuances van de regio. Het is voorge_traind van scratch op een meertalig corpus van meer dan 16 Aziatische talen met 2,65 biljoen gefilterde tokens.
Dit maakt het model in staat om betere resultaten te behalen en voldoet aan de specifieke eisen van talen en culturen in Azië.
3. PolyLM
PolyLM is een open-source ‘polyglot’ LLM dat zich richt op het aanpakken van de uitdagingen van talen met weinig middelen door aanpassingsmogelijkheden te bieden. Het is getraind op een dataset van ongeveer 640 miljard tokens en is beschikbaar in twee modelgroottes: 1,7B en 13B. PolyLM kent meer dan 16 verschillende talen.
Het stelt modellen die zijn getraind op talen met veel middelen in staat om te worden gefinetuned voor talen met weinig middelen en beperkte gegevens. Deze flexibiliteit maakt LLM’s nuttiger in verschillende taalsituaties en taken.
4. XGLM
XGLM, met 7,5 miljard parameters, is een meertalige LLM die is getraind op een corpus dat een diverse set van meer dan 20 talen dekt met behulp van de few-shot learning-techniek. Het maakt deel uit van een familie van grote meertalige LLM’s die zijn getraind op een enorm dataset van tekst en code.
Het heeft als doel om veel talen volledig te dekken, waardoor het zich richt op inclusiviteit en taaldiversiteit. XGLM toont het potentieel voor het bouwen van modellen die zijn aangepast aan de behoeften van verschillende taalgemeenschappen.
5. mT5
De mT5 (massively multilingual Text-to-Text Transfer Transformer) is ontwikkeld door Google (GOOGL ) AI. Getraind op de common crawl-dataset, is mT5 een state-of-the-art meertalige LLM die 101 talen kan verwerken, van veel gesproken talen als Spaans en Chinees tot minder talen als Baskisch en Quechua.
Het excelleert ook in meertalige taken zoals vertaling, samenvatting, vraagbeantwoording, enz.
Is een universele LLM mogelijk?
Het concept van een taalneutrale LLM, die in staat is om taal te begrijpen en te genereren zonder voorkeur voor een bepaalde taal, is intrigerend.
Hoewel het ontwikkelen van een echt universele LLM nog ver weg is, hebben huidige meertalige LLM’s aanzienlijk succes gedemonstreerd. Zodra ze volledig zijn ontwikkeld, kunnen ze voldoen aan de behoeften van ondervertegenwoordigde talen en diverse gemeenschappen.
Om bijvoorbeeld onderzoek te noemen, kunnen de meeste meertalige LLM’s zero-shot cross-lingual transfer faciliteren van een taal met veel middelen naar een taal met weinig middelen zonder taalspecifieke trainingsgegevens.
Bovendien hebben modellen zoals YAYI en BLOOM, die zich richten op specifieke talen en gemeenschappen, het potentieel getoond van taalgerichte benaderingen in het stimuleren van vooruitgang en inclusiviteit.
Om een universele LLM te bouwen of bestaande meertalige LLM’s te verbeteren, moeten individuen en organisaties het volgende doen:
- Crowdsourcen van native speakers voor community-engagement en curatie van taaldatasets.
- Steun community-inspanningen met betrekking tot open-source-bijdragen en financiering van meertalig onderzoek en ontwikkeling.
Uitdagingen van meertalige LLM’s
Hoewel het concept van universele meertalige LLM’s veelbelovend is, zijn er ook uitdagingen die moeten worden aangepakt voordat we kunnen profiteren van hun voordelen:
1. Gegevenshoeveelheid
Meertalige modellen vereisen een grotere woordenschat om tokens in veel talen weer te geven dan monolinguale modellen, maar veel talen ontbreken grote datasets. Dit maakt het moeilijk om deze modellen effectief te trainen.
2. Gegevenskwaliteitszorgen
Het waarborgen van de nauwkeurigheid en culturele geschiktheid van meertalige LLM-uitvoer over talen heen is een aanzienlijke zorg. Modellen moeten worden getraind en gefinetuned met zorgvuldige aandacht voor linguïstische en culturele nuances om biases en onnauwkeurigheden te voorkomen.
3. Bronbeperkingen
Het trainen en uitvoeren van meertalige modellen vereist aanzienlijke computationele middelen, zoals krachtige GPU’s (bijv. NVIDIA A100 GPU). De hoge kosten vormen een uitdaging, vooral voor talen en gemeenschappen met beperkte toegang tot computationele infrastructuur.
4. Modelarchitectuur
Het aanpassen van modelarchitecturen om diverse linguïstische structuren en complexiteiten te accommoderen is een voortdurende uitdaging. Modellen moeten in staat zijn om talen met verschillende woordvolgordes, morfologische variaties en schriften te verwerken, terwijl ze hoge prestaties en efficiëntie behouden.
5. Evaluatiecomplexiteiten
Het evalueren van de prestaties van meertalige LLM’s buiten Engelse benchmarks is cruciaal voor het meten van hun werkelijke effectiviteit. Het vereist het in overweging nemen van culturele nuances, linguïstische eigenaardigheden en domeinspecifieke vereisten.
Meertalige LLM’s hebben het potentieel om taalbarrières te doorbreken, ondervertegenwoordigde talen te empoweren en effectieve communicatie te faciliteren over diverse gemeenschappen.
Miss geen van de laatste nieuws en analyses in AI en ML – bezoek unite.ai vandaag.












