AI-modeller og plattformer

Tilstanden for flerspråklige LLM-er: Å gå utenfor engelsk

mm
Legg til Unite.AI blant dine foretrukne kilder på Google

Ifølge Microsoft-forskning har omtrent 88% av verdens språk, som snakkes av 1,2 milliarder mennesker, mangler tilgang til Large Language Models (LLMs). Dette skyldes at de fleste LLM-er er engelsk-sentriske, dvs. de er hovedsakelig bygget med engelsk data og for engelsktalende. ​Dette engelske dominans fører også til en digital språklige gap, som potensielt kan utelukke de fleste mennesker fra fordelene med LLM-er. For å løse dette problemet for LLM-er, trenger man en LLM som kan trenes i forskjellige språk og utføre oppgaver i forskjellige språk. Velkommen til flerspråklige LLM-er!

Hva er flerspråklige LLM-er?

En flerspråklig LLM kan forstå og generere tekst på flere språk. De er trenet på datasett som inneholder forskjellige språk og kan utføre forskjellige oppgaver i mer enn ett språk fra en brukers prompt.

Flerspråklige LLM-applikasjoner er enorme, de inkluderer oversettelse av litteratur til lokale dialekter, sanntids flerspråklig kommunikasjon, flerspråklig innholdsskapning osv. De ville hjelpe alle å få tilgang til informasjon og snakke med hverandre lett, uansett språk.

Også, flerspråklige LLM-er løser utfordringer som mangelen på kulturelle nyanser og kontekst, begrensninger i treningsdata og mulig tap av kunnskap under oversettelse.

Hvordan fungerer flerspråklige LLM-er?

Bygging av en flerspråklig LLM innebærer å forberede en balansert korpus av tekst på forskjellige språk og velge en passende arkitektur og treningsmetode for å trene modellen, foretrukket en Transformer-modell, som er perfekt for flerspråklig læring.

Steg for å bygge en flerspråklig LLM

Kilde: Bilde av forfatter

En teknikk er å dele innlegg, som fanger den semantiske betydningen av ord på forskjellige språk. Dette gjør at LLM-er lærer likhetene og forskjellene mellom hvert språk, og kan forstå de forskjellige språkene bedre.

Dette kunnskapet gir også LLM-er mulighet til å tilpasse seg forskjellige språklige oppgaver, som oversettelse av språk, skriving i forskjellige stiler osv. En annen teknikk som brukes er kors-språklig overføringslæring, hvor modellen er forhåndstrent på en stor korpus av flerspråklig data før den finjusteres for bestemte oppgaver.

Denne to-trinns prosessen sikrer at modellen har en sterk basis i flerspråklig språkforståelse, og kan tilpasse seg forskjellige nedstrømsapplikasjoner.

Eksempler på flerspråklige store språkmodeller

Sammenligning av flerspråklige LLM-er

Kilde: Ruder.io

Flere bemerkelsesverdige eksempler på flerspråklige LLM-er har kommet frem, hver med sine egne språklige behov og kulturelle kontekster. La oss se på noen av dem:

1. BLOOM

BLOOM er en åpen tilgang flerspråklig LLM som prioriterer mangfoldige språk og tilgjengelighet. Med 176 milliarder parametre kan BLOOM håndtere oppgaver på 46 naturlige og 13 programmeringsspråk, og er en av de største og mest diverse LLM-er.

BLOOMs åpne kildekode tillater forskere, utviklere og språksamfunn å dra nytte av dens evner og bidra til dens forbedring.

2. YAYI 2

YAYI 2 er en åpen kildekode LLM som er spesifikt designet for asiatiske språk, og tar hensyn til regionens kompleksiteter og kulturelle nyanser. Den ble forhåndstrent fra scratch på en flerspråklig korpus av over 16 asiatiske språk som inneholder 2,65 billioner filtrerte token.

Dette gjør at modellen gir bedre resultater, og møter de spesifikke kravene til språk og kulturer i Asia.

3. PolyLM

PolyLM er en åpen kildekode “polyglott” LLM som fokuserer på å løse utfordringene med lav-resurs-språk ved å tilby tilpasningsmuligheter. Den ble trenet på en datasett på omtrent 640 milliarder token og er tilgjengelig i to modellstørrelser: 1,7 milliarder og 13 milliarder. PolyLM kjenner til over 16 forskjellige språk.

Den gjør det mulig for modeller som er trenet på høy-resurs-språk å bli finjustert for lav-resurs-språk med begrensede data. Denne fleksibiliteten gjør LLM-er mer nyttige i forskjellige språklige situasjoner og oppgaver.

4. XGLM

XGLM, som har 7,5 milliarder parametre, er en flerspråklig LLM som er trenet på en korpus som dekker en divers sett av over 20 språk ved å bruke few-shot-læringsteknikken. Den er en del av en familie av store flerspråklige LLM-er som er trenet på en massiv datasett av tekst og kode.

Den søker å dekke mange språk fullstendig, og fokuserer derfor på inklusivitet og språklig mangfold. XGLM demonstrerer potensialet for å bygge modeller som møter behovene til forskjellige språksamfunn.

5. mT5

mT5 (massivt flerspråklig tekst-til-tekst-overførings-transformator) ble utviklet av Google (GOOGL ) AI. Trenet på common crawl-datasettet, er mT5 en state-of-the-art flerspråklig LLM som kan håndtere 101 språk, fra bredt snakket spansk og kinesisk til mindre ressurs-rike språk som baskisk og quechua.

Den excellerer også i flerspråklige oppgaver som oversettelse, sammenfatting, spørsmål-svar osv.

Er en universell LLM mulig?

Konseptet om en språk-uavhengig LLM, som kan forstå og generere språk uten bias mot noen bestemt språk, er intrigerende.

mens utvikling av en virkelig universell LLM fortsatt er langt unna, har nåværende flerspråklige LLM-er demonstrert betydelig suksess. Når de er fullt utviklet, kan de møte behovene til under-representerte språk og diverse samfunn.

For eksempel viser forskning at de fleste flerspråklige LLM-er kan fasilitere null-skudd kors-språklig overføring fra et ressurs-rikt språk til et ressurs-fattig språk uten oppgave-spesifikt treningsdata.

Også, modeller som YAYI og BLOOM, som fokuserer på bestemte språk og samfunn, har demonstrert potensialet for språk-sentriske tilnærminger i å drive fremgang og inklusivitet.

For å bygge en universell LLM eller forbedre nåværende flerspråklige LLM-er, må enkeltpersoner og organisasjoner gjøre følgende:

  • Kilde native talere for samfunnsengasjement og kurasjon av språkdatasettene.
  • Støtte samfunnsinnsats når det gjelder åpne kildekode-bidrag og finansiering til flerspråklig forskning og utvikling.

Utfordringer for flerspråklige LLM-er

mens konseptet om universelle flerspråklige LLM-er har stor potensial, møter de også flere utfordringer som må løses før vi kan dra nytte av dem:

1. Datakvantitet

Flerspråklige modeller krever en større vokabular for å representere token på mange språk enn monolingvale modeller, men mange språk mangler store datasett. Dette gjør det vanskelig å trene disse modellene effektivt.

2. Datakvalitetsproblemer

Sikring av nøyaktigheten og kulturelle passende av flerspråklige LLM-utdata over språk er en betydelig bekymring. Modeller må trenes og finjusteres med omhyggelig oppmerksomhet på språklige og kulturelle nyanser for å unngå bias og uakkurathet.

3. Resursbegrensninger

Trenings- og kjøring av flerspråklige modeller krever betydelige beregningsressurser som kraftige GPU-er (f.eks. NVIDIA A100 GPU). Den høye kostnaden stiller utfordringer, spesielt for lav-resurs-språk og samfunn med begrensede tilgang til beregningsinfrastruktur.

4. Modellarkitektur

Tilpasning av modellarkitekturer for å møte diverse språklige strukturer og kompleksiteter er en pågående utfordring. Modeller må kunne håndtere språk med forskjellige ordrekkefølger, morfologiske variasjoner og skriftsystemer samtidig som de opprettholder høy ytelse og effektivitet.

5. Evalueringsskomplikasjoner

Evaluering av flerspråklige LLM-ers ytelse beyond engelske benchmark er kritisk for å måle deres virkelige effektivitet. Det krever å ta hensyn til kulturelle nyanser, språklige særegenheter og domene-spesifikke krav.

Flerspråklige LLM-er har potensialet til å bryte språkbarrierer, styrke under-resurs-språk og fasilitere effektiv kommunikasjon over diverse samfunn.

Ikke gå glipp av de siste nyhetene og analyser i AI og ML – besøk unite.ai i dag.

Haziqa er en dataforsker med omfattende erfaring med å skrive teknisk innhold for AI- og SaaS-selskaper.