Tankeledere
Transformer-påvirkning: Har maskinoversettelse blitt løst?
Google har nylig annonsert lanseringen av 110 nye språk på Google Translate som en del av deres 1000 språk-initiativ lansert i 2022. I 2022, ved starten, la de til 24 språk. Med de siste 110 nye språkene er det nå 243 språk. Denne raskere utvidelsen var mulig takket være Zero-Shot Machine Translation, en teknologi der maskinlæringsmodeller lærer å oversette til et annet språk uten føringer. Men i fremtiden vil vi se sammen om denne fremgangen kan være den ultimate løsningen på utfordringen med maskinoversettelse, og i mellomtiden kan vi utforske måtene det kan skje på. Men først er det dens historie.
Hvordan var det før?
Statistisk maskinoversettelse (SMT)
Dette var den opprinnelige metoden som Google Translate brukte. Den baserte seg på statistiske modeller. De analyserte store parallellkorpora, samlinger av sammenstillinger av setningsoversettelser, for å bestemme de mest sannsynlige oversettelsene. Først oversatte systemet tekst til engelsk som en midlertidig måte før den ble konvertert til målspråket, og den trengte å krysseferensiere fraser med omfattende datasett fra FNs og Europaparlamentets transkripsjoner. Det er forskjellig fra tradisjonelle tilnærminger som nødvendigvis krever kompilering av uttømte grammatikalske regler. Og dens statistiske tilnærming lot det tilpasse seg og lære fra data uten å avhenge av statiske språklige rammer som kunne bli fullstendig unødvendige.
Men det er noen ulemper med denne tilnærmingen også. Først brukte Google Translate frasebasert oversettelse hvor systemet delte setninger inn i fraser og oversatte dem enkeltvis. Dette var en forbedring overfor ord-for-ord-oversettelse, men hadde likevel begrensninger som uheldige fraseringer og kontekstfeil. Det forstod ikke fullstendig nuansene som vi gjør. Dessuten avhenger SMT sterkt av å ha parallellkorpora, og ethvert relativt sjeldent språk ville være vanskelig å oversette fordi det ikke har nok parallelt data.
Neural maskinoversettelse (NMT)
I 2016 skiftet Google til Neural Machine Translation. Den bruker dyplæringsmodeller til å oversette hele setninger som en helhet og på en gang, og gir mer flytende og nøyaktige oversettelser. NMT opererer på en lignende måte som å ha en sofistikert flerspråklig assistent innenfor din datamaskin. Ved å bruke en sekvens-til-sekvens (seq2seq) arkitektur prosesserer NMT en setning i ett språk for å forstå dens mening. Deretter genererer den en tilsvarende setning i et annet språk. Denne metoden bruker enorme datasett for læring, i motsetning til Statistisk maskinoversettelse som avhenger av statistiske modeller som analyserer store parallellkorpora for å bestemme de mest sannsynlige oversettelsene. I motsetning til SMT, som fokuserte på frasebasert oversettelse og trengte mye manuell innsats for å utvikle og vedlikeholde lingvistiske regler og ordbøker, lar NMTs evne til å prosessere hele sekvenser av ord den til å fange nuansene i språket mer effektivt. Så den har forbedret oversettelses kvalitet over ulike språkpar, ofte når det kommer til flyt og nøyaktighet sammenlignbar med menneskelige oversettere.
I virkeligheten brukte tradisjonelle NMT-modeller vanligvis gjentakende neurale nettverk – RNN-er – som den grunnleggende arkitekturen, siden de er designet for å prosessere sekvensielle data ved å vedlikeholde en skjult tilstand som utvikler seg når hver nytt innputt (ord eller token) prosesseres. Denne skjulte tilstanden tjener som en slags hukommelse som fanger konteksten til de foregående innputtene, og lar modellen lære avhengigheter over tid. Men RNN-er var komputasjonelt dyre og vanskelige å parallelisere effektivt, noe som begrenset hvor skalerbare de er.
Introduksjon av Transformers
I 2017 publiserte Google Research en artikkel med tittelen “Attention is All You Need,” og introduserte transformers til verden og markerte en avgjørende skifte bort fra RNN-er i neuralt nettverksarkitektur.
Transformers avhenger bare av oppmerksomhetsmekanismen, – selv-oppmerksomhet, som lar neurale maskinoversettelsesmodeller fokusere selektivt på de viktigste delene av innputtsekvenser. I motsetning til RNN-er, som prosesserer ord i en sekvens innenfor setninger, vurderer selv-oppmerksomhet hver token over hele teksten og bestemmer hvilke andre som er kritiske for å forstå dens kontekst. Denne samtidige beregningen av alle ord lar transformers til å effektivt fange både korte og lange avhengigheter uten å avhenge av gjentakende forbindelser eller konvolusjonsfilter.
Så ved å eliminere gjentakelse, tilbyr transformers flere nøkkel fordeler:
- Parallelisering: Oppmerksomhetsmekanismer kan beregnes parallelt over ulike segmenter av sekvensen, noe som akselerer trening på moderne maskinvare som GPU-er.
- Treningseffisiens: De krever også betydelig mindre treningstid sammenlignet med tradisjonelle RNN-baserte eller CNN-baserte modeller, og leverer bedre ytelse i oppgaver som maskinoversettelse.
Zero-Shot maskinoversettelse og PaLM 2
I 2022 lanserte Google støtte for 24 nye språk ved hjelp av Zero-Shot Machine Translation, og markerte en betydelig milepæl i maskinoversettelsesteknologi. De annonserte også 1000-språk-initiativet, som hadde som mål å støtte verdens 1000 mest talte språk. De har nå lansert 110 flere språk. Zero-Shot maskinoversettelse muliggjør oversettelse uten parallelt data mellom kilde- og målspråk, og eliminerer behovet for å lage treningsdata for hvert språkpar — en prosess som tidligere var kostbar og tidskrevende, og for noen språkpar også umulig.
Dette fremsteget ble mulig takket være arkitekturen og selv-oppmerksomhetsmekanismene til transformers. Transformermodellens evne til å lære kontekstuelle relasjoner over språk, i kombinasjon med dens skalerbarhet til å håndtere flere språk samtidig, muliggjorde utviklingen av mer effektive og effisiente flerspråklige oversettelsessystemer. Men zero-shot-modeller viser vanligvis lavere kvalitet enn de som er trent på parallelt data.
Deretter, bygget på fremgangen til transformers, introduserte Google PaLM 2 i 2023, som åpnet veien for lanseringen av 110 nye språk i 2024. PaLM 2 forbedret betydelig Translates evne til å lære nært beslektede språk som Awadhi og Marwadi (beslektet med hindi) og franske kreolske språk som Seychellois og Mauritian Creole. Forbedringene i PaLM 2, som compute-optimal skalerbarhet, forbedret datasett og raffinert design — muliggjorde mer effektiv språklæring og støttet Googles pågående innsats for å gjøre språkstøtte bedre og større og tilpasse seg diverse språklige nyanser.
Kan vi hevde at utfordringen med maskinoversettelse er fullstendig løst med transformers?
Utviklingen vi snakker om tok 18 år fra Googles innføring av SMT til de siste 110 nye språkene ved hjelp av Zero-Shot Machine Translation. Dette representerer et enormt sprang som potensielt kan redusere behovet for omfattende parallellkorpora-samling — en historisk og meget arbeidskrevende oppgave som bransjen har forfulgt i over to tiår. Men å hevde at maskinoversettelse er fullstendig løst ville være forhastet, både når det gjelder tekniske og etiske overveielser.
Aktuelle modeller sliter fortsatt med kontekst og kohensjon og gjør subtile feil som kan endre meningen du ønsket for en tekst. Disse problemene er svært tilstede i lengre, mer komplekse setninger hvor det er nødvendig å opprettholde den logiske flyten og forstå nyanser for å få resultater. Dessuten går kulturelle nyanser og idiomatiske uttrykk ofte tapt eller mister mening, og fører til oversettelser som kan være grammatisk korrekte, men ikke har den ønskede effekten eller høres unaturlig ut.
Data for fortrening: PaLM 2 og lignende modeller er fortrent på et diversifisert flerspråklig tekstkorpus, som overgår dens forgjenger PaLM. Denne forbedringen utstyrer PaLM 2 til å utmerke seg i flerspråklige oppgaver, og understreker den fortsatt viktige rollen til tradisjonelle datasett for å forbedre oversettelseskvalitet.
Domene-spesifikke eller sjeldne språk: I spesialiserte domener som juridiske, medisinske eller tekniske felt, sikrer parallellkorpora at modellene møter spesifikke terminologier og språknyanser. Avanserte modeller kan slite med domene-spesifikke jargon eller utviklingsretninger i språk, og stiller utfordringer for Zero-Shot Machine Translation. Dessuten er lavresurs-språk fortsatt dårlig oversatt, fordi de ikke har nok data til å trene nøyaktige modeller
Benchmarking: Parallellkorpora forblir essensielle for å evaluere og benchmarkere oversettelsesmodellens ytelse, spesielt utfordrende for språk som mangler tilstrekkelig parallelt data. Automatiserte metrikker som BLEU, BLERT og METEOR har begrensninger når det gjelder å vurdere nyanser i oversettelseskvalitet, bortsett fra grammatikk. Men så er vi mennesker begrenset av våre fordommer. Dessuten er det ikke mange kvalifiserte evaluatorene der ute, og å finne den perfekte tospråklige evaluator for hvert språkpar for å fange subtile feil.
Resursintensitet: Den resursintensive naturen til å trene og deployere LLM-er forblir en barriere, og begrenser tilgjengeligheten for noen applikasjoner eller organisasjoner.
Kulturell bevaring. Den etiske dimensjonen er dyptgående. Som Isaac Caswell, en Google Translate-forsker, beskriver Zero-Shot Machine Translation: “Du kan tenke på det som en polyglott som kjenner mange språk. Men så får den også se tekst på 1000 flere språk som ikke er oversatt. Du kan forestille deg hvis du er en stor polyglott, og så begynner å lese romaner på et annet språk, kan du begynne å sette sammen hva det kan bety basert på din kunnskap om språk generelt.” Likevel er det viktig å vurdere den langtidsvirkningen på mindre språk som mangler parallellkorpora, og som potensielt kan påvirke kulturell bevaring når avhengigheten skifter bort fra språkene selv.












