Tankeledere

Transformer Impact: Er maskinoversættelse blevet løst?

mm
Føj Unite.AI til dine foretrukne kilder på Google

Google har nylig annonceret udgivelsen af 110 nye sprog på Google Translate som en del af deres 1000 sprog-initiativ, der blev lanceret i 2022. I 2022 tilføjede de 24 nye sprog. Med de seneste 110 sprog er det nu 243 sprog. Denne hurtige udvidelse var mulig takket være Zero-Shot Machine Translation, en teknologi, hvor maskinlæringsmodeller kan lære at oversætte til et andet sprog uden forudgående eksempler. Men i fremtiden vil vi se, om denne udvikling kan være den ultimative løsning på udfordringen med maskinoversættelse, og i mellemtiden kan vi udforske, hvordan det kan ske. Men først skal vi se på historien.

Hvordan var det før?

Statistisk Maskinoversættelse (SMT)

Dette var den oprindelige metode, som Google Translate brugte. Den afhængige af statistiske modeller. De analyserede store parallelle korpus, samlinger af alignede sætninger, for at bestemme de mest sandsynlige oversættelser. Først oversatte systemet tekst til engelsk som et mellemtrin, før det blev konverteret til målsproget, og det krævede at krydskontrollere fraser med omfattende datasets fra FN og EU-transkriptioner. Det er anderledes end traditionelle tilgange, der kræver kompilering af udførlige grammatiske regler. Og dens statistiske tilgang lod det tilpasse sig og lære fra data uden at afhænge af statiske sprogmodeller, der hurtigt kunne blive fuldstændig unødvendige.

Men der er også nogle ulemper ved denne tilgang. Først brugte Google Translate frasebaseret oversættelse, hvor systemet brød sætninger ned i fraser og oversatte dem individuelt. Dette var en forbedring i forhold til ord-for-ord-oversættelse, men havde stadig begrænsninger som ukomfortabel fraseologi og kontekstfejl. Det forstod bare ikke fuldstændig nuancerne, som vi gør. Desuden afhænger SMT stærkt af at have parallelle korpus, og ethvert relativt sjældent sprog ville være svært at oversætte, fordi det ikke har nok parallel data.

Neurale Maskinoversættelse (NMT)

I 2016 skiftede Google til Neurale Maskinoversættelse. Den bruger dybe læringsmodeller til at oversætte hele sætninger som en helhed og på én gang, hvilket giver mere flydende og præcise oversættelser. NMT fungerer på samme måde som en sofistikeret multilingual assistent på din computer. Ved hjælp af en sekvens-til-sekvens (seq2seq) arkitektur behandler NMT en sætning i ét sprog for at forstå dens betydning. Derefter genererer den en tilsvarende sætning i et andet sprog. Denne metode bruger enorme datasets til læring, i modsætning til Statistisk Maskinoversættelse, der afhænger af statistiske modeller, der analyserer store parallelle korpus for at bestemme de mest sandsynlige oversættelser. I modsætning til SMT, der fokuserede på frasebaseret oversættelse og krævede meget manuelt arbejde til at udvikle og vedligeholde sprogmodeller og ordbøger, giver NMT’s evne til at behandle hele sekvenser af ord mulighed for at fange nuancerne i sproget mere effektivt. Så det har forbedret oversættelses kvalitet over forskellige sprogpar, ofte opnående niveauer af flydende og præcision, der er sammenlignelige med menneskelige oversættere.

I virkeligheden brugte traditionelle NMT-modeller Recurrent Neural Networks – RNN’er – som kernearkitektur, da de er designet til at behandle sekventielle data ved at opretholde en skjult tilstand, der udvikler sig, når hver ny indtastning (ord eller token) behandles. Denne skjulte tilstand fungerer som en slags hukommelse, der fanger konteksten af de foregående indtastninger, hvilket giver modellen mulighed for at lære afhængigheder over tid. Men RNN’er var beregningsmæssigt dyre og svære at parallelisere effektivt, hvilket begrænsede, hvor skalerbare de er.

Introduktion af Transformers

I 2017 offentliggjorde Google Research en artikel med titlen “Attention is All You Need,” og introducerede transformers til verden og markerede en afgørende skift væk fra RNN’er i neurale netværksarkitekturer.

Transformers afhænger kun af opmærksomhedsmechanismen, – selvopmærksomhed, der giver neurale maskinoversættelsesmodeller mulighed for at fokusere selektivt på de vigtigste dele af indtastningssekvenser. I modsætning til RNN’er, der behandler ord i en sekvens inden for sætninger, vurderer selvopmærksomhed hver token på tværs af hele teksten og bestemmer, hvilke andre er afgørende for at forstå dens kontekst. Denne simultane beregning af alle ord giver transformers mulighed for at fange både korte og lange afhængigheder uden at afhænge af rekurrente forbindelser eller convolutionelle filter.

Så ved at eliminere rekurrence giver transformers flere nøglefordele:

  • Parallelisering: Opmærksomhedsmechanismer kan beregnes i parallel på tværs af forskellige segmenter af sekvensen, hvilket accelererer træning på moderne hardware som GPU’er.
  • Trænings-effektivitet: De kræver også betydeligt mindre træningstid i forhold til traditionelle RNN-baserede eller CNN-baserede modeller, hvilket giver bedre præstation i opgaver som maskinoversættelse.

Zero-Shot Maskinoversættelse og PaLM 2

I 2022 annoncerede Google støtte til 24 nye sprog ved hjælp af Zero-Shot Maskinoversættelse, hvilket markerede en betydelig milepæl i maskinoversættelsesteknologi. De annoncerede også 1.000 Sprog-initiativet, der havde til formål at støtte verdens 1.000 mest talte sprog. De har nu rullet 110 flere sprog ud. Zero-Shot maskinoversættelse giver mulighed for oversættelse uden parallel data mellem kilde- og målsprog, hvilket eliminerer behovet for at oprette træningsdata for hvert sprogpar – en proces, der tidligere var dyrekøbt og tidskrævende, og for nogle sprogpar også umulig.

Denne fremgang blev mulig, fordi transformer-arkitekturen og selvopmærksomhedsmechanismerne giver mulighed for at lære kontekstuelle relationer på tværs af sprog, kombineret med deres skalerbarhed til at håndtere multiple sprog samtidig, hvilket har muliggjort udviklingen af mere effektive og effektive multilinguale oversættelsessystemer. Men zero-shot-modeller viser generelt lavere kvalitet end de, der er trænet på parallel data.

Derefter, bygget på fremskridtet med transformers, introducerede Google PaLM 2 i 2023, hvilket muliggjorde udgivelsen af 110 nye sprog i 2024. PaLM 2 forbedrede betydeligt Googles evne til at lære nært beslægtede sprog som Awadhi og Marwadi (beslægtet med hindi) og franske kreolske sprog som Seychellois og Mauritian Creole. Forbedringerne i PaLM 2, såsom compute-optimal skalerbarhed, forbedrede datasets og raffineret design – muliggjorde mere effektivt sprogtilæring og støttede Googles fortsatte bestræbelser på at gøre sprogstøtte bedre og større og tilpasse sig diverse sprognuancer.

Kan vi påstå, at udfordringen med maskinoversættelse er fuldstændig løst med transformers?

Udviklingen, vi taler om, tog 18 år fra Googles overgang til SMT til de 110 nye sprog ved hjælp af Zero-Shot Maskinoversættelse. Dette repræsenterer et enormt spring, der potentielt kan reducere behovet for omfattende parallel korpusindsamling – en historisk og meget arbejdskrævende opgave, som industrien har forfulgt i over to årtier. Men at påstå, at maskinoversættelse er fuldstændig løst, ville være forhastet, når man tager både tekniske og etiske overvejelser i betragtning.

Nuværende modeller kæmper stadig med kontekst og koherens og begår subtile fejl, der kan ændre mening i en tekst. Disse problemer er meget til stede i længere, mere komplekse sætninger, hvor det er nødvendigt at opretholde den logiske flow og forstå nuancer for at opnå resultater. Desuden går kulturelle nuancer og idiomatiske udtryk ofte tabt eller mister betydning, hvilket giver oversættelser, der kan være grammatisk korrekte, men ikke har den ønskede effekt eller lyder unaturlige.

Data til fortræning: PaLM 2 og lignende modeller er fortrænet på et diversificeret multilingualt tekstkorpus, der overgår dens forgænger PaLM. Denne forbedring giver PaLM 2 mulighed for at udmærke sig i multilinguale opgaver, hvilket understreger den fortsatte vigtighed af traditionelle datasets for at forbedre oversættelseskvalitet.

Domænespecifikke eller sjældne sprog: I specialiserede domæner som juridiske, medicinske eller tekniske fag sikrer parallelle korpus, at modellerne møder specifikke termer og sprognuancer. Avancerede modeller kan have svært ved at håndtere domænespecifik jargon eller udviklende sprogtilbøjeligheder, hvilket stiller udfordringer for Zero-Shot Maskinoversættelse. Desuden er lavresurs-sprog stadig dårligt oversat, fordi de ikke har nok data til at træne præcise modeller.

Benchmarking: Parallelle korpus forbliver essentielle for at evaluere og benchmarkere oversættelsesmodellernes præstation, især udfordrende for sprog, der mangler tilstrækkeligt parallel korpusdata. De automatiserede metrikker som BLEU, BLERT og METEOR har begrænsninger i forhold til at vurdere nuancer i oversættelseskvalitet ud over grammatik. Men så er vi mennesker hæmmet af vores fordomme. Desuden er der ikke så mange kvalificerede evalueringer derude, og det kan være svært at finde den perfekte tosprogede evaluator for hvert sprogpar til at fange subtile fejl.

Resurse-intensitet: Den resurse-intensive natur af at træne og implementere LLM’er forbliver en barriere, der begrænser tilgængeligheden for visse anvendelser eller organisationer.

Kulturel bevaring. Den etiske dimension er dyb. Som Isaac Caswell, en Google Translate-forsker, beskriver Zero-Shot Maskinoversættelse: “Du kan tænke på det som en polyglot, der kender mange sprog. Men derefter får den også mulighed for at se tekst på 1.000 flere sprog, der ikke er oversat. Du kan forestille dig, hvis du er en stor polyglot, og derefter begynder at læse romaner på et andet sprog, kan du begynde at samle sammen, hvad det kunne betyde baseret på din viden om sprog generelt.” Yet, det er afgørende at overveje den langsigtede indvirkning på mindre sprog, der mangler parallel korpus, hvilket potentielt kan påvirke kulturel bevaring, når afhængigheden af sprogene selv skifter.

Irina Barskaya, PhD, er en fremragende datavidenskabsmand med mere end et årtis erfaring, der omfatter både produktanalyse og analyse af avancerede teknologier. Hun stod i spidsen for oprettelsen og analysen af Yasmina, den første fuldt funktionsdygtige lokaliserede AI-baserede taleassistent for Saudi-Arabien, der håndterer kompleks data-lokalisering og mærkning for Modern Standard Arabic og Saudi-dialekter. For tiden står Irina i spidsen for kvalitetsanalyse på Yandex, hvor hun driver fremgang i AI-teknologier.