Andersonin kulma

Saksan kielen korkea hiilijalanjälki konekäännösmalleissa

mm
Lisää Unite.AI suosikkilähteisiisi Google-palvelussa

Uusi tutkimus konekäännösmallien aiheuttamasta hiilijalanjäljestä osoittaa, että saksan kieli voi olla kaikkein hiilitehokkain kieli koulutettavaksi, vaikka syytä tähän ei ole täysin selvä. Uusi raportti on tarkoitettu avaamaan uusia tutkimussuuntia hiilitehokkaampien konekäännösmenetelmien kehittämiseksi, kasvavan tietoisuuden keskellä siitä, kuinka paljon koneoppimisjärjestelmät kuluttavat sähköä.

Esijulkaisu on nimeltään Curb Your Carbon Emissions: Benchmarking Carbon Emissions in Machine Translation, ja se on peräisin Intian Manipal-instituutin teknologian tutkijoilta.

Tutkijat testasivat koulutusajoja ja laskivat hiilidioksidipäästöarvoja useille mahdollisille kieltenvälisten käännösmallien parille ja löysivät “merkitsevän epäsymmetrian” kolmen hiilitehokkaimman ja kolmen vähiten hiilitehokkaan kielenparin välillä.

Keskimääräinen hiilidioksidipäästö 10 koulutuskauden aikana. Vasemmalla, tulokset ConvSeq:n (ks. alla) avulla, oikealla, Transformers.

Keskimääräinen hiilidioksidipäästö 10 koulutuskauden aikana. Vasemmalla, tulokset ConvSeq:n avulla, oikealla, Transformers. Lähde: https://arxiv.org/pdf/2109.12584.pdf

Raportissa todetaan, että “ekologisimmat” kielenparit koulutettaviksi ovat englanti-ranska, ranska-englanti ja paradoksaalisesti saksan ja englannin välinen käännös, kun taas saksan kieli on mukana kaikissa korkeimmissa kulutuspareissa: ranska-saksa, englanti-saksa ja saksa-ranska.

Komponenttien korko

Tutkimuksen tulokset osoittavat, että sanaston monimuotoisuus “on suoraan verrannollinen koulutusaikaan, jotta voidaan saavuttaa riittävä suorituskyky”, ja huomauttaa, että saksan kieli on korkein sanaston monimuotoisuusindeksi kolmen testatun kielen joukossa, arvioitu Tyypin-Token-Suhteen (TTR) perusteella – sanaston koosta riippuva mittari.

Saksan kielen prosessoinnin lisääntynyt vaatimus ei heijastu lähtöaineistossa, jota kokeessa käytettiin. Itse asiassa saksan kielen tokenit, jotka on johdettu lähtöaineistosta, ovat vähemmän (299445) kuin englannin (320108) ja paljon vähemmän kuin ranskan (335917).

Luonnollisen kielen prosessoinnin haaste on saksan kielen yhdistelmäsanojen hajottaminen perussanoiksi. Luonnollisen kielen prosessointijärjestelmien on usein tehtävä tämä saksan kielelle ilman mitään ennen jakoa olevia kieliopillisia viitteitä tai kontekstuaalisia vihjeitä, joita voidaan löytää kielistä, joilla on alempi TTR-lukema, kuten englanti. Tätä prosessia kutsutaan yhdistelmien jakamiseksi tai yhdistelmien hajottamiseksi.

Saksan kieli on yksi maailman pisin yksittäinen sana, vaikka se menetti virallisen aseman 65-merkkinen entinen ennätys 2013, joka on tarpeeksi pitkä vaatimaan oman rivin tähän artikkeliin:

Rindfleischetikettierungsueberwachungsaufgabenuebertragungsgesetz

Sana viittaa lakiin, joka siirtää naudanlihan merkintöjen valvontatehtävät, mutta se menetti asemansa Euroopan unionin sääntöjen muutoksen vuoksi samana vuonna, jolloin se antoi tilaa muille suosituille, kuten “leski Danube-höyrylaiva-yhtiön kapteenin” (49 merkkiä):

Donaudampfschifffahrtsgesellschaftskapitaenswitwe

Yleensä saksan kielen syntaktinen rakenne edellyttää poikkeusta sanajärjestyksen oletuksista, jotka ovat perustana monissa länsimaisissa kielissä, ja suosittu (Berliinissä sijaitseva) spaCy-kielenkäsittelykehyksessä omaksuttiin vuonna 2016 oma kieli.

Englannin ja saksan kielen lauseiden projektiiviset kuvausmuodot osoittavat saksan kielen sanallisten elementtien monimutkaiset suhteet. Lähde: https://explosion.ai/blog/german-model

Englannin ja saksan kielen lauseiden projektiiviset kuvausmuodot osoittavat saksan kielen sanallisten elementtien monimutkaiset suhteet. Lähde: https://explosion.ai/blog/german-model

Tiedot ja testaus

Tutkijat käyttivät lähtöaineistona Multi30k-aineistoa, joka sisältää 30 000 näytettä ranskan, saksan ja englannin kielillä.

Tutkijoiden ensimmäinen malli oli Facebook AI:n 2017 Convolutional Sequence to Sequence (ConvSeq), joka on neuroverkko, joka sisältää konvoluutiokerroksia, mutta jossa ei ole rekurrentteja yksiköitä, vaan sen sijaan käytetään suodattimia tekstistä johdettujen ominaisuuksien saamiseksi. Tämä mahdollistaa kaikkien operaatioiden suorittamisen laskennallisesti tehokkaalla tavalla.

Tutkijoiden toinen lähestymistapa oli Google’ n vaikutusvaltainen Transformers-arkkitehtuuri, myös vuodelta 2017. Transformers käyttää lineaarisia kerroksia, huomioimekanismeja ja normalisointirutiineja. Alkuperäinen julkaistu malli on saanut kritiikkiä hiilitehokkuudesta, ja väitteitä myöhäisemmistä parannuksista on kiistetty.

Kokeet suoritettiin Google Colabissa, yhdenmukaisesti Tesla K80 -näytönohjaimella. Kielet verrattiin BLEU (Bilingual Evaluation Understudy) -arvosanalla ja CodeCarbon Machine Learning Emissions Calculator:lla. Data koulutettiin 10 epochin ajan.

Tulokset

Tutkijat totesivat, että saksan kielen koulutus kestää pidempään, mikä aiheuttaa korkeamman hiilidioksidipäästön. Vaikka jotkut muut kielenparit, kuten englanti-ranska ja ranska-englanti, olivat hiilidioksidipäästöltään korkeampia, ne koulutettiin nopeammin ja ratkaistiin helpommin, ja nämä kulutusrupeamat luonnehdittiin “suhteellisen merkityksettömiksi” verrattuna kielenpareihin, jotka sisältävät saksan kielen.

Kielenparien analyysi kooderin ja dekooderin hiilidioksidipäästöjen perusteella.

Kielenparien analyysi kooderin ja dekooderin hiilidioksidipäästöjen perusteella.

Tutkijat toteavat:

‘Tutkimuksemme antavat selkeän osoituksen siitä, että jotkut kielenparit ovat hiilidioksidipäästöltään tehokkaampia kuin toiset, ja tämä suuntaus jatkuu eri arkkitehtuureissa.’

He jatkavat:

‘Kuitenkin on edelleen avoimia kysymyksiä siitä, miksi on niin suuria eroja koulutusmalleissa tietyn kielenparin välillä, ja voivatko erilaiset arkkitehtuuri olla soveliaampia näille hiilidioksidipäästöltään tehokkaille kielenpareille, ja miksi näin olisi, jos se olisi totta.’

Raportissa todetaan, että syyt hiilidioksidipäästöjen eroon koulutusmalleissa eivät ole täysin selvät. He aikovat kehittää tätä tutkimussuuntaa ei-latinalaisilla kielillä.

13.20 – Tekstivirhe korjattu.

Kirjailija tekoälystä, alan erikoisosaaja ihmisen kuvansynteesissä. Entinen tutkimussisällön johtaja Metaphysic.ai:ssa, kunnes se liitettiin DNEG:n Brahma.ai:hin.
Portfolio-sivu: martinanderson.ai
Ota yhteyttä: martin@martinanderson.ai