Tankeledare
Transformer Impact: Har maskinöversättning lösts?
Google har nyligen meddelat att de släpper 110 nya språk på Google Translate som en del av deras 1000-språksinitiativ som lanserades 2022. 2022, i början, lade de till 24 språk. Med de senaste 110 till, är det nu 243 språk. Denna snabba expansion var möjlig tack vare Zero-Shot Machine Translation, en teknik där maskinlärningsmodeller lär sig att översätta till ett annat språk utan föregående exempel. Men i framtiden kommer vi att se tillsammans om denna utveckling kan vara den ultimata lösningen på utmaningen med maskinöversättning, och under tiden kan vi undersöka hur det kan hända. Men först är det dess historia.
Hur var det före?
Statistisk maskinöversättning (SMT)
Detta var den ursprungliga metoden som Google Translate använde. Den byggde på statistiska modeller. De analyserade stora parallella korpusar, samlingar av anpassade meningsoversättningar, för att bestämma de mest sannolika översättningarna. Först översatte systemet texten till engelska som ett mellansteg innan den konverterades till målspråket, och det behövde korsreferera fraser med omfattande dataset från FN och EU:s parlament. Det skiljer sig från traditionella metoder som krävde att man sammanställde uttömmande grammatiska regler. Och dess statistiska tillvägagångssätt gjorde att det kunde anpassa sig och lära av data utan att förlita sig på statiska språkliga ramverk som kunde bli helt onödiga.
Men det finns också några nackdelar med denna metod. Först använde Google Translate frasbaserad översättning där systemet bröt ner meningar i fraser och översatte dem individuellt. Det var en förbättring jämfört med ord-för-ord-översättning, men hade fortfarande begränsningar som otympliga fraser och kontextfel. Det förstod helt enkelt inte nyanserna som vi gör. Dessutom bygger SMT tungt på att ha parallella korpusar, och något relativt ovanligt språk skulle vara svårt att översätta eftersom det inte har tillräckligt med parallell data.
Neural maskinöversättning (NMT)
2016 bytte Google till Neural Machine Translation. Den använder djupinlärningsmodeller för att översätta hela meningar som en helhet och på en gång, vilket ger mer flytande och exakta översättningar. NMT fungerar på liknande sätt som att ha en sofistikerad flerspråkig assistent inom din dator. Med en sekvens-till-sekvens (seq2seq) arkitektur bearbetar NMT en mening i ett språk för att förstå dess mening. Sedan genererar den en motsvarande mening i ett annat språk. Denna metod använder enorma dataset för att lära, till skillnad från Statistisk maskinöversättning som bygger på statistiska modeller som analyserar stora parallella korpusar för att bestämma de mest sannolika översättningarna. Till skillnad från SMT, som fokuserade på frasbaserad översättning och behövde mycket manuellt arbete för att utveckla och underhålla språkliga regler och ordböcker, låter NMT:s förmåga att bearbeta hela sekvenser av ord den att fånga språkets nyanser mer effektivt. Så den har förbättrat översättningskvaliteten över olika språkpar, ofta nått nivåer av flyt och exakthet som är jämförbara med mänskliga översättare.
I själva verket använde traditionella NMT-modeller återkommande neuronnät – RNN:er – som kärnarkitektur, eftersom de är utformade för att bearbeta sekventiell data genom att upprätthålla en dold tillstånd som utvecklas när varje ny indata (ord eller token) bearbetas. Detta dolda tillstånd fungerar som en sorts minne som fångar kontexten av föregående indata, vilket låter modellen lära sig beroenden över tid. Men RNN:er var beräkningsmässigt dyra och svåra att parallellisera effektivt, vilket begränsade hur skalbara de är.
Introduktion av Transformers
2017 publicerade Google Research en artikel med titeln “Attention is All You Need,” som introducerade transformers till världen och markerade en viktig förändring bort från RNN:er i neurala nätverksarkitekturer.
Transformers bygger bara på uppmärksamhetsmekanismen, – självuppmärksamhet, som tillåter neuronnät för maskinöversättning att fokusera selektivt på de viktigaste delarna av indatasekvenser. Till skillnad från RNN:er, som bearbetar ord i en sekvens inom meningar, utvärderar självuppmärksamhet varje token över hela texten, och bestämmer vilka andra som är avgörande för att förstå dess kontext. Denna samtidiga beräkning av alla ord möjliggör för transformers att effektivt fånga både korta och långa beroenden utan att förlita sig på återkommande anslutningar eller konvolutionsfilter.
Så genom att eliminera återkommande, erbjuder transformers flera nyckelfördelar:
- Parallellisering: Uppmärksamhetsmekanismer kan beräknas parallellt över olika segment av sekvensen, vilket accelererar träning på modern hårdvara som GPU:er.
- TräningsEffektivitet: De kräver också betydligt mindre tränings tid jämfört med traditionella RNN-baserade eller CNN-baserade modeller, vilket ger bättre prestanda i uppgifter som maskinöversättning.
Zero-Shot Machine Translation och PaLM 2
2022 släppte Google stöd för 24 nya språk med hjälp av Zero-Shot Machine Translation, vilket markerade en betydande milstolpe i maskinöversättnings-teknologi. De meddelade också 1000-språksinitiativet, som syftar till att stödja världens 1000 mest talade språk. De har nu släppt 110 fler språk. Zero-Shot maskinöversättning möjliggör översättning utan parallell data mellan käll- och målspråk, vilket eliminerar behovet av att skapa träningsdata för varje språkpar – en process som tidigare var kostsam och tidskrävande, och för vissa språkpar också omöjlig.
Denna utveckling blev möjlig tack vare arkitekturen och självuppmärksamhetsmekanismerna i transformers. Transformermodellens förmåga att lära sig kontextuella relationer över språk, i kombination med dess skalbarhet för att hantera flera språk samtidigt, möjliggjorde utvecklingen av mer effektiva och effektiva flerspråkiga översättningssystem. Men zero-shot-modeller visar vanligtvis lägre kvalitet än de som tränats på parallell data.
Sedan, byggande på framstegen med transformers, introducerade Google PaLM 2 2023, vilket möjliggjorde släppandet av 110 nya språk 2024. PaLM 2 förbättrade betydligt Translates förmåga att lära sig nära besläktade språk som Awadhi och Marwadi (besläktade med hindi) och franska kreolspråk som Seychellerna och Mauritius. Förbättringarna i PaLM 2, som compute-optimal skalning, förbättrade dataset och raffinerad design – möjliggjorde mer effektivt språkinlärning och stödde Googles pågående ansträngningar för att förbättra och utöka språkstöd och hantera språkliga nyanser.
Kan vi påstå att utmaningen med maskinöversättning har helt lösts med transformers?
Utvecklingen vi pratar om tog 18 år från Googles antagande av SMT till de senaste 110 ytterligare språken med Zero-Shot Machine Translation. Detta representerar ett enormt språng som potentiellt kan minska behovet av omfattande parallell korpusinsamling – en historiskt och mycket arbetskrävande uppgift som branschen har bedrivit i över två decennier. Men att påstå att maskinöversättning är helt löst vore förhastat, med tanke på både tekniska och etiska överväganden.
Aktuella modeller kämpar fortfarande med kontext och sammanhang och gör subtila misstag som kan förändra meningen du avsåg för en text. Dessa problem är mycket närvarande i längre, mer komplexa meningar där det krävs att man upprätthåller den logiska flödet och förstår nyanser för att få resultat. Dessutom förloras ofta kulturella nyanser och idiomatiska uttryck, eller förlorar mening, vilket orsakar översättningar som kan vara grammatiskt korrekta men inte har den avsedda effekten eller låter onaturliga.
Data för förträning: PaLM 2 och liknande modeller är förtränade på ett diversifierat flerspråkigt textkorpus, som överträffar sin föregångare PaLM. Denna förbättring utrustar PaLM 2 för att excellera i flerspråkiga uppgifter, och understryker den fortsatta viktigheten av traditionella dataset för att förbättra översättningskvalitet.
Domänspecifika eller sällsynta språk: I specialiserade domäner som juridik, medicin eller tekniska fält, säkerställer parallella korpusar att modellerna möter specifika termer och språkliga nyanser. Avancerade modeller kan kämpa med domänspecifika termer eller utvecklande språktrender, vilket utgör utmaningar för Zero-Shot Machine Translation. Dessutom är lågresursspråk fortfarande dåligt översatta, eftersom de inte har tillräckligt med data för att träna precisa modeller.
Benchmarking: Parallella korpusar förblir avgörande för att utvärdera och benchmarka översättningsmodellens prestanda, särskilt utmanande för språk som saknar tillräckligt med parallell korpusdata. Automatiserade metriker som BLEU, BLERT och METEOR har begränsningar när det gäller att bedöma nyanser i översättningskvalitet utöver grammatik. Men sedan är vi människor hämmade av våra fördomar. Dessutom finns det inte så många kvalificerade utvärderare där ute, och att hitta den perfekta tvåspråkiga utvärderaren för varje språkpar för att fånga subtila fel.
Resursintensitet: Den resursintensiva naturen av att träna och distribuera LLM:er förblir ett hinder, vilket begränsar tillgängligheten för vissa applikationer eller organisationer.
Kulturell bevarande. Den etiska dimensionen är djup. Som Isaac Caswell, en Google Translate-forskare, beskriver Zero-Shot Machine Translation: “Du kan tänka på det som en polyglott som känner till många språk. Men sedan, till på köpet, får den se text på 1000 fler språk som inte är översatta. Du kan föreställa dig att du är en stor polyglott, och sedan börjar du läsa romaner på ett annat språk, du kan börja att förstå vad det kan betyda baserat på din kunskap om språk i allmänhet.” Men det är viktigt att överväga den långsiktiga påverkan på minoritetsspråk som saknar parallella korpusar, vilket potentiellt kan påverka kulturell bevarande när beroendet skiftar bort från språken själva.












