AI-modeller og platforme
Tilstanden for multilinguale LLM’er: At gå ud over engelsk
Ifølge Microsofts forskning har omkring 88% af verdens sprog, som tales af 1,2 milliarder mennesker, ikke adgang til Large Language Models (LLM’er). Dette skyldes, at de fleste LLM’er er engelsk-centrerede, dvs. de er primært bygget med engelske data og til engelsktalende. Denne engelske dominans findes også i LLM-udviklingen og har resulteret i et digitalt sproggap, der potentielt udelukker de fleste mennesker fra LLM’ernes fordele. For at løse dette problem for LLM’er er der brug for en LLM, der kan trænes på forskellige sprog og udføre opgaver på forskellige sprog. Indledning til multilinguale LLM’er!
Hvad er multilinguale LLM’er?
En multilingual LLM kan forstå og generere tekst på flere sprog. De trænes på datasæt, der indeholder forskellige sprog, og kan udføre forskellige opgaver på mere end ét sprog fra en brugers prompt.
Multilinguale LLM-applikationer er enorme og omfatter oversættelse af litteratur til lokale dialekter, real-time multilingual kommunikation, multilingual indholdsskabelse osv. De vil hjælpe alle med at få adgang til information og tale med hinanden let, uanset deres sprog.
Også multilinguale LLM’er løser udfordringer som manglen på kulturelle nuancer og kontekst, begrænsninger i træningsdata og den potentielle tab af viden under oversættelse.
Hvordan fungerer multilinguale LLM’er?
At bygge en multilingual LLM indebærer omhyggelig forberedelse af et balanceret korpus af tekst på forskellige sprog og valg af en passende arkitektur og træningsteknik til træning af modellen, foretrækkeligt en Transformer-model, der er perfekt til multilingual læring.

Kilde: Billede af forfatteren
En teknik er at dele embeddings, der fanger den semantiske betydning af ord på tværs af forskellige sprog. Dette gør, at LLM’er kan lære om lighederne og forskellene mellem hvert sprog, og dermed forstå de forskellige sprog bedre.
Dette kendskab giver også LLM’er mulighed for at tilpasse sig forskellige lingvistiske opgaver, som f.eks. oversættelse af sprog, skrivning i forskellige stile osv. En anden teknik, der anvendes, er cross-lingual transfer learning, hvor modellen først trænes på et stort korpus af multilingual data og derefter finjusteres på specifikke opgaver.
Denne to-trinsproces sikrer, at modellen har en solid grund i multilingual sprogforståelse, og dermed kan tilpasse sig forskellige downstream-applikationer.
Eksempler på multilinguale store sprogmodeller

Kilde: Ruder.io
Der er flere bemærkelsesværdige eksempler på multilinguale LLM’er, der hver især tilgodeser specifikke lingvistiske behov og kulturelle kontekster. Lad os udforske nogle af dem:
1. BLOOM
BLOOM er en åben multilingual LLM, der prioriterer diverse sprog og tilgængelighed. Med 176 milliarder parametre kan BLOOM håndtere opgaver på 46 naturlige og 13 programmeringssprog, hvilket gør den til en af de største og mest diverse LLM’er.
BLOOM’s åbne natur giver forskere, udviklere og sprogfællesskaber mulighed for at drage fordel af dens kapaciteter og bidrage til dens forbedring.
2. YAYI 2
YAYI 2 er en åben LLM, der er designet specifikt til asiatiske sprog, og tager hensyn til regionens kompleksiteter og kulturelle nuancer. Den er fortrænet fra scratch på et multilingualt korpus af over 16 asiatiske sprog, der indeholder 2,65 billioner filtrerede tokens.
Dette giver modellen bedre resultater og opfylder de specifikke krav til sprog og kulturer i Asien.
3. PolyLM
PolyLM er en åben ‘polyglot’ LLM, der fokuserer på at løse udfordringerne med lavresurs-sprog ved at tilbyde tilpasningsmuligheder. Den er trænet på et datasæt på omkring 640 milliarder tokens og er tilgængelig i to modellstørrelser: 1,7B og 13B. PolyLM kender over 16 forskellige sprog.
Den giver mulighed for, at modeller, der er trænet på højresurs-sprog, kan finjusteres for lavresurs-sprog med begrænsede data. Denne fleksibilitet gør LLM’er mere nyttige i forskellige sprog-situationer og opgaver.
4. XGLM
XGLM, der har 7,5 milliarder parametre, er en multilingual LLM, der er trænet på et korpus, der dækker et diversitet af over 20 sprog ved hjælp af few-shot learning-teknikken. Den er en del af en familie af store multilinguale LLM’er, der er trænet på et massivt datasæt af tekst og kode.
Den sigter mod at dække mange sprog fuldstændigt, hvilket er årsagen til, at den fokuserer på inklusivitet og lingvistisk diversitet. XGLM demonstrerer potentialet for at bygge modeller, der kan tilgodese behovene for forskellige sprogfællesskaber.
5. mT5
mT5 (massively multilingual Text-to-Text Transfer Transformer) er udviklet af Google (GOOGL ) AI. Trænet på common crawl-datasættet er mT5 en state-of-the-art multilingual LLM, der kan håndtere 101 sprog, der spænder fra bredt talte sprog som spansk og kinesisk til mindre ressourcerede sprog som baskisk og quechua.
Den excellerer også i multilinguale opgaver som oversættelse, sammenfatning, spørgsmål-svar osv.
Er en universel LLM mulig?
Konceptet om en sprog-uafhængig LLM, der kan forstå og generere sprog uden bias mod nogen bestemt sprog, er interessant.
Medens udviklingen af en virkelig universel LLM stadig er langt væk, har nuværende multilinguale LLM’er vist betydelig succes. Når de er fuldt udviklet, kan de tilgodese behovene for underrepræsenterede sprog og diverse fællesskaber.
For eksempel viser forskning, at de fleste multilinguale LLM’er kan facilitere zero-shot cross-lingual overføring fra et ressource-rigt sprog til et ressource-fattigt sprog uden opgave-specifik træningsdata.
Også modeller som YAYI og BLOOM, der fokuserer på specifikke sprog og fællesskaber, har vist potentialet for sprog-centrerede tilgange til at drive fremgang og inklusivitet.
For at bygge en universel LLM eller forbedre nuværende multilinguale LLM’er, skal individer og organisationer:
- Crowdsourcings af native talere for fællesskabsengagement og kuratering af sprog-datasættene.
- Støtte fællesskabsindsats omkring åbne bidrag og finansiering til multilingual forskning og udvikling.
Udfordringer for multilinguale LLM’er
Medens konceptet om universelle multilinguale LLM’er har stor potentiale, står de også over for flere udfordringer, der skal løses, før vi kan drage fordel af dem:
1. Data-mængde
Multilinguale modeller kræver en større ordforråd til at repræsentere tokens i mange sprog end monolinguale modeller, men mange sprog mangler store datasæt. Dette gør det svært at træne disse modeller effektivt.
2. Data-kvalitetsbekymringer
At sikre nøjagtigheden og kulturelle passende af multilinguale LLM-udgaver på tværs af sprog er en betydelig bekymring. Modellerne skal trænes og finjusteres med omhyggelig opmærksomhed på lingvistiske og kulturelle nuancer for at undgå bias og uregelmæssigheder.
3. Resursbegrænsninger
Træning og kørsel af multilinguale modeller kræver betydelige beregningsressourcer som kraftfulde GPU’er (f.eks. NVIDIA A100 GPU). Den høje omkostning stiller udfordringer, især for lavresurs-sprog og fællesskaber med begrænsede muligheder for adgang til beregningsinfrastruktur.
4. Model-arkitektur
At tilpasse model-arkitekturer til at rumme diverse lingvistiske strukturer og kompleksiteter er en fortsat udfordring. Modellerne skal kunne håndtere sprog med forskellige ordorden, morfologiske variationer og skriftsystemer, samtidig med at de opretholder høj ydelse og effektivitet.
5. Evaluationskompleksiteter
At evaluere multilinguale LLM’ers præstation ud over engelske benchmarks er afgørende for at måle deres virkelige effektivitet. Dette kræver, at man tager hensyn til kulturelle nuancer, lingvistiske særheder og domænespecifikke krav.
Multilinguale LLM’er har potentialet for at bryde sprogbarrierer, styrke underresourcede sprog og faciliterer effektiv kommunikation på tværs af diverse fællesskaber.
Miss ikke de seneste nyheder og analyser i AI og ML – besøg unite.ai i dag.












