Ajatusjohtajat

Transformerin Vaikutus: Onko Konekäännös Ratkaistu?

mm
Lisää Unite.AI suosikkilähteisiisi Google-palvelussa

Google on juuri ilmoittanut 110 uuden kielen julkaisemisesta Google Kääntäjässä osana 1000 kielen aloitetta, joka käynnistettiin vuonna 2022. Vuonna 2022 aloitettaessa he lisäsivät 24 kieltä. Uusien 110 kielen myötä määrä on nyt 243 kieltä. Tämä nopea laajentuminen oli mahdollista Zero-Shot Machine Translation -teknologian ansiosta, jossa koneoppimismallit oppivat kääntämään toiseen kielen ilman aiempia esimerkkejä. Mutta tulevaisuudessa nähdään yhdessä, voitko tämä edistysaskel olla konekäännöshaasteen lopullinen ratkaisu, ja sillä välin voimme tutkia, miten se voi tapahtua. Mutta ensin sen tarina.

Miten se oli ennen?

Tilastollinen Konekäännös (SMT)

Tämä oli alkuperäinen menetelmä, jota Google Kääntäjä käytti. Se perustui tilastollisiin malleihin. Ne analysoivat suuria rinnakkaisia korpuksia, joissa oli käännöksiä, määrittääkseen todennäköisimmät käännökset. Ensinnäkin järjestelmä käänsi tekstin englanniksi välivaiheena ennen kuin se kääntyi kohdekielen, ja se tarvitsi ristiviittauksia laajojen Yhdistyneiden Kansakuntien ja Euroopan parlamentin transkriptioiden kanssa. Se on erilainen perinteisiin lähestymistapoihin, jotka edellyttivät perusteellisten kieliopin sääntöjen kokoamista. Ja sen tilastollinen lähestymistapa antoi sille mahdollisuuden sopeutua ja oppia tietojen perusteella ilman, että se riippui staattisista kielitieteellisistä kehyksistä, jotka voivat nopeasti tulla täysin tarpeettomiksi.

Mutta tähän lähestymistapaan liittyy myös joitakin haittoja. Ensinnäkin Google Kääntäjä käytti lausekohtaisia käännöksiä, jossa järjestelmä jakoi lauseet lauseisiin ja käänsi ne yksittäin. Tämä oli parannus sana-sanakäännöksestä, mutta siinä oli edelleen rajoituksia, kuten kömpelö lauseenvastus ja kontekstin virheet. Se ei vain täysin ymmärtänyt nuansseja, kuten me. Lisäksi SMT riippuu voimakkaasti rinnakkaisista korpuksista, ja mikä tahansa suhteellisen harvinainen kieli olisi vaikea kääntää, koska sillä ei ole riittävästi rinnakkaisia tietoja.

Neuraalinen Konekäännös (NMT)

Vuonna 2016 Google siirtyi Neuraaliseen Konekääntöön. Se käyttää syväoppimismalleja kääntämään koko lauseita kerran, antaen sulavampia ja tarkempia käännöksiä. NMT toimii samalla tavalla kuin hienostunut monikielinen avustaja tietokoneessa. Se käyttää järjestystä-järjestymään (seq2seq) -arkkitehtuuria NMT prosessoi lauseen yhdessä kielessä ymmärtääkseen sen merkityksen. Sitten – luo vastaavan lauseen toisessa kielessä. Tämä menetelmä käyttää valtavia tietoja oppimiseen, toisin kuin Tilastollinen Konekäännös, joka perustuu tilastollisiin malleihin, jotka analysoivat laajoja rinnakkaisia korpuksia määrittääkseen todennäköisimmät käännökset. Toisin kuin SMT, joka keskittyi lausekohtaiseen käännökseen ja tarvitsi paljon manuaalista työtä kehittääkseen ja ylläpitääkseen kielisääntöjä ja sanastoa, NMT:n valta kuin koko sanajonon käsittely antaa sille mahdollisuuden ottaa kielen nuanssit paremmin. Niinpä se on parantanut käännösten laatua eri kielipareissa, usein saavuttaen sujuvuuden ja tarkkuuden, joka on verrattavissa ihmiskääntäjien tasoiseen.

Transformerien Johdanto

Vuonna 2017 Google Research julkaisi tutkimuksen nimeltä “Attention is All You Need,” jossa esiteltiin transformerit maailmalle ja merkitsi merkittävää muutosta pois RNN:istä neuroverkkoarkkitehtuurissa.

Transformerit perustuvat ainoastaan huomio-mekanismiin, – itsehuomio, joka antaa neuronisen konekäännösmallien valita tarkoitushakuisesti tärkeimmät osat syötejonoista. Toisin kuin RNN:t, jotka prosessivat sanat jonoissa lauseissa, itsehuomio arvioi jokaista merkintää koko tekstin yli, määrittääkseen, mitkä ovat tärkeitä sen kontekstin ymmärtämiseksi. Tämä samanaikainen laskenta kaikista sanoista antaa transformerille mahdollisuuden ottaa sekä lyhyet että pitkät riippuvuudet ilman, että se riippuu toistuvista yhteyksistä tai konvoluutiofiltristä.

Niinpä poistamalla toisto, transformerit tarjoavat useita avainhyötyjä:

  • Rinnakkaisuus: Huomio-mekanismit voivat laskea rinnakkain eri jaksojen osissa, mikä nopeuttaa koulutusta modernilla laitteistolla, kuten GPU:illa.
  • Koulutuksen Tehokkuus: Ne vaativat myös merkittävästi vähemmän koulutusaikaa verrattuna perinteisiin RNN-pohjaisiin tai CNN-pohjaisiin malleihin, tarjoten paremman suorituskyvyn tehtävissä, kuten konekäännöksessä.

Zero-Shot Konekäännös ja PaLM 2

Vuonna 2022 Google julkaisi tuen 24:lle uudelle kielelle Zero-Shot Konekäännöksen avulla, mikä merkitsi merkittävää merkkipaaluja konekäännöstechnologiassa. He ilmoittivat myös 1000 kielen aloitteesta, jonka tavoitteena on tukea maailman 1000 puhutuimman kielen. He ovat nyt julkaissut 110 uutta kieltä. Zero-Shot konekäännös mahdollistaa käännöksen ilman rinnakkaisia tietoja lähdetekstin ja kohdetekstin välillä, poistamalla tarpeen luoda koulutusdataa kullekin kieliparille – prosessi, joka oli aiemmin kallis ja aikaa vievä, ja joillekin kielipareille myös mahdoton.

Tämä edistysaskel oli mahdollinen transformerien arkkitehtuurin ja itsehuomio-mekanismien ansiosta. Transformer-mallin kyky oppia kontekstuaalisia suhteita kielten välillä, yhdistettynä sen skaalautuvuuteen käsitellä useita kieliä samanaikaisesti, mahdollisti monikielisen käännösjärjestelmän kehittämisen. Vaikka zero-shot-mallit näyttävät yleensä alempaa laatua kuin ne, jotka on koulutettu rinnakkaisilla tiedoilla.

Sitten, jatkamalla transformerien edistymistä, Google esitteli PaLM 2:n vuonna 2023, joka mahdollisti 110 uuden kielen julkaisemisen vuonna 2024. PaLM 2 paransi merkittävästi Kääntäjän kykyä oppia läheisiä kieliä, kuten Awadhi ja Marwadi (jotka liittyvät Hindiin) ja ranskalaisia kreoleja, kuten Seychellien ja Mauritiuksen kreolia. PaLM 2:n parannukset, kuten laskennallinen skaalautuvuus, parannetut tiedot ja hienostunut suunnittelu, mahdollistivat tehokkaamman kielien oppimisen ja tukivat Googlen jatkuvia ponnisteluita parantaa kielitukea ja sopeuttaa monia kielellisiä nuansseja.

<strong Voidaanko väittää, että konekäännöshaaste on täysin ratkaistu transformerien avulla?

Tämä evoluutio, josta puhumme, kesti 18 vuotta Googlen SMT-otteen jälkeen ja viimeaikaisen 110 uuden kielen julkaisemisen Zero-Shot Konekäännöksen avulla. Tämä edustaa valtavaa loikkaa, joka voi vähentää tarvetta laajalle rinnakkaiselle korpukselle – historiallisesti ja hyvin työläään tehtävään, jonka alalla on jahdattu yli kaksi vuosikymmentä. Mutta väittää, että konekäännös on täysin ratkaistu, olisi ennenaikainen, sekä teknisten että eettisten huomioon ottaen.

Nykyiset mallit kamppailevat edelleen kontekstin ja koherenssin kanssa ja tekevät hienoja virheitä, jotka voivat muuttaa tekstiin tarkoitetun merkityksen. Nämä ongelmat ovat erittäin läsnä pidemmässä, monimutkaisemmassa lauseissa, joissa on tarve ylläpitää loogista virtaa ja ymmärtää nuansseja tuloksien saavuttamiseksi. Lisäksi kulttuuriset nuanssit ja idiomaattiset ilmaukset usein häviävät tai menettävät merkityksensä, aiheuttaen käännökset, jotka ovat kieliopillisesti oikein, mutta eivät ole tarkoitetun vaikutuksen tai kuulostavat epäluonnollisilta.

Esikoulutuksen Data: PaLM 2 ja vastaavat mallit on esikoulutettu monikieliselle tekstikorpukselle, joka ylittää edeltäjänsä PaLM:n. Tämä parannus antaa PaLM 2:lle mahdollisuuden erottua monikielisissä tehtävissä, korostaa perinteisten tietojoukkojen jatkuvaa tärkeyttä käännöslaan laadun parantamiseksi.

Alakohtaiset tai Harvinaiset Kielet: Erikoistuneissa aloissa, kuten oikeudellisissa, lääketieteellisissä tai teknisissä, rinnakkaiset korpukselle varmistavat, että mallit kohtaavat tiettyjä termejä ja kielenuansseja. Edistyneet mallit voivat kamppailla alakohtaisen sanaston tai kehittyvien kielitrendien kanssa, mikä aiheuttaa haasteita Zero-Shot Konekäännökselle. Lisäksi vähävaraiset kielet käännetään edelleen huonosti, koska niillä ei ole tarvittavia tietoja koulutusmallien luomiseksi.

Benchmarking: Rinnakkaiset korpukselle ovat edelleen olennaisia käännösmallien suorituskyvyn arvioimiseksi ja benchmarkkaamiseksi, erityisesti haasteellisissa kielissä, joilla ei ole riittävästi rinnakkaisia tietoja. Automaattiset mittarit, kuten BLEU, BLERT ja METEOR, ovat rajoittuneita arvioimaan nuansseja käännöslaan laadussa kieliopin lisäksi. Mutta me ihmiset ovat rajoittuneita omien ennakkoluulojemme kanssa. Lisäksi ei ole tarpeeksi päteviä arvioijoita, ja löytäminen täydellinen kaksikielinen arvioija kullekin kieliparille voidakseen havaita hienot virheet.

Resurssien Tiivis: LLM:ien koulutuksen ja käyttöönoton resurssien tiivis luonne on edelleen este, joka rajoittaa saatavuutta joillekin sovelluksille tai organisaatioille.

Kulttuurin Säilyttäminen. Eettinen ulottuvuus on syvä. Kuten Isaac Caswell, Google Kääntäjän tutkimusscientisti, kuvailee Zero-Shot Konekäännöstä: “Voit ajatella sitä polyglottilaisena, joka tietää paljon kieliä. Mutta sitten se näkee myös tekstejä 1000:lla enemmällä kielellä, joita ei ole käännetty. Voit kuvitella, että olet joku suuri polyglotti, ja sitten aloitat lukemisen romaaneja toisella kielellä, voit alkaa ymmärtää, mitä se tarkoittaa yleisen kielen tiedon perusteella.” Kuitenkin on tärkeää ottaa huomioon pitkän aikavälin vaikutus vähäisiin kieliin, joilla ei ole rinnakkaisia korpuksia, mikä voi vaikuttaa kulttuurin säilyttämiseen, kun riippuvuus siirtyy kielistä itsestään.

Irina Barskaya, FT, on tunnettu data-analyytikko, jolla on yli kymmenen vuoden kokemus sekä tuoteanalytiikasta että älykkäiden teknologioiden analytiikasta. Hän johti Yasminan, ensimmäisen täysin toimivan paikallistetun älykkään ääniohjatun avustajan luomisen ja analytiikan Saudi-Arabiaan, joka käsittelee monimutkaisia tietojen paikallistamista ja merkintöjä modernin standardiarabian ja Saudi-dialektien kielille. Tällä hetkellä Irina johtaa laadun analytiikkaa Yandexissa, jossa hän edistää älytekniikkojen kehittymistä.