Andersonin kulma

Huulien lukeminen visemejen ja koneoppimisen avulla

mm
Lisää Unite.AI suosikkilähteisiisi Google-palvelussa
HAL reads lips in 2001: A Space Odyssey (1968)

Teheranin tietokoneiden insinöörikoulun uusi tutkimus tarjoaa parannetun lähestymistavan haasteeseen luoda koneoppimisjärjestelmiä, jotka pystyvät lukemaan huulia.

Tutkimusraportti Lip Reading Using Viseme Decoding kertoo, että uusi järjestelmä saavuttaa 4%:n parannuksen sanavirheen osalta verrattuna aiempiin vastaaviin malleihin. Järjestelmä ratkaisee yleisen ongelman hyödyllisen koulutusdatan puutteesta kartoittamalla visemejä tekstisisällön avulla, joka on johdettu kuuden miljoonan esimerkin avulla OpenSubtitles-tietokannasta käännettyjen elokuvien nimistä.

Visemi on fonemin visuaalinen vastine, joka on käytännössä ääni>kuva -kartoitus, joka voi olla “ominaisuus” koneoppimismallissa.

Visemit toiminnassa.

Visemit toiminnassa. Lähde: https://developer.oculus.com/documentation/unity/audio-ovrlipsync-viseme-reference/

Tutkijat alkoivat määrittämällä alhaisimman virheen olemassa olevissa tietokannoissa ja kehittämällä visemijonot vakiintuneista kartoitusmenetelmistä. Vähitellen tämä prosessi kehittää visuaalisen sanastoa sanoista – vaikka on tarpeen määritellä eri sanojen visemien todennäköisyydet (kuten “heart” ja “art”).

Visemit tekstistä.

Visemit tekstistä. Lähde: https://arxiv.org/pdf/2104.04784.pdf

Kun kaksi identtistä sanaa tuottaa saman visemin, valitaan useimmin esiintyvä sana.

Malli perustuu perinteiseen järjestelmän järjestelmään, jossa visemit ennustetaan tekstistä ja mallinnetaan omassa putkessa:

Visemiarkkitehtuuri huulien lukemisessa

Yllä, perinteinen järjestelmä-järjestelmä merkkimallissa; alla, visemimerkkimallin lisäys Teheranin tutkimusmallissa. Lähde: https://arxiv.org/pdf/2104.04784.pdf

Mallia sovellettiin ilman visuaalista kontekstia LRS3-TED-tietokantaan, joka julkaistiin Oxfordin yliopistosta vuonna 2018, ja saatiin huonoin sanavirhe 24,29%.

Teheranin tutkimus sisältää myös grafemi-foneemi-muunnoksen käytön.

Kokeessa vuoden 2017 Oxfordin tutkimuksessa Lip Reading Sentences In The Wild (ks. alla), Video-To-Viseme-menetelmä saavutti sanavirheen 62,3%, verrattuna Oxfordin menetelmän 69,5%:iin.

Tutkijat päättelevät, että suuremman teksti-informaatiomäärän yhdistäminen grafemi-foneemi- ja visemikartoituksiin lupailee parannuksia automaattisissa huulien lukemisjärjestelmissä, ja myöntää, että käytetyt menetelmät voivat tuottaa vielä parempia tuloksia, kun ne yhdistetään nykyisiin kehittyneempiin kehyksiin.

Konepohjainen huulien lukeminen on ollut aktiivinen ja jatkuva tietokoneen näön ja NLP-tutkimuksen aihe viimeisen kahden vuosikymmenen ajan. Monien muiden esimerkkien ja projektien joukossa vuonna 2006 automaattisen huulien lukemisohjelmiston käyttö sai huomion, kun sitä käytettiin tulkitsemaan, mitä Adolf Hitler sanoi joissakin hänen Bavarian retkeilypaikkojen hiljaisissa elokuvissa, vaikka sovellus näyttää hävinneen hämärään (kaksitoista vuotta myöhemmin Sir Peter Jackson turvautui ihmishuulien lukijoita WW1-elokuvan They Shall Not Grow Old palautusprojektissa).

Vuonna 2017 Lip Reading Sentences in The Wild, yhteistyö Oxfordin yliopiston ja Google:n AI-tutkimusosaston välillä, tuotti huulien lukemiseen kykenevän AI:n, joka pystyi oikein tulkitsemaan 48%:ia puheesta videossa ilman ääntä, kun taas ihmishuulien lukija saavutti vain 12,4%:in tarkin tuloksen samasta materiaalista. Malli oli koulutettu tuhansilla tunteja BBC:n TV-kuvamateriaalilla.

Tämä työ seurasi erillistä Oxford/Google-aloitetta edelliseltä vuodelta, nimeltään LipNet, joka oli neuroverkkomalli, joka kartoitti videosekvenssejä muuttuvan pituuden tekstisekvensseihin Gated Recurrent Networkin (GRN) avulla, joka lisää toiminnallisuutta perusarkkitehtuuriin Recurrent Neural Network (RNN):ssä. Malli saavutti 4,1-kertaisen suorituskyvyn ihmishuulien lukijoita vastaan.

Ongelman, jonka mukaan saadaan tarkka transkripti reaaliajassa, syvenee, kun poistetaan hyödyllistä kontekstia, kuten ääntä, “kasvojen etuosa” -kuvausta, joka on hyvin valaistu, ja kieltä/kulttuuria, jossa foneemit/visemit ovat suhteellisen erottuvia.

Vaikka nykyisin ei ole empiiristä ymmärrystä siitä, mitkä kielet ovat vaikeimmin huulien lukemista täydellisen äänetön, japani on pääasiallinen ehdokas. Japanilaisten (sekä tiettyjen muiden länsi- ja itä-Asian) kasvojen ilmeet heidän puheensa sisällön vastaisesti tekevät heistä suuremman haasteen mielentilan analyysijärjestelmiä vastaan.

Kuitenkin on huomattava, että tieteellinen kirjallisuus aiheesta on yleensä varovainen, ei vähiten siksi, että jopa hyvätuloiset objektiiviset tutkimukset tässä aiheessa voivat vaarantaa rodullistamisen ja olemassa olevien stereotyyppien edistämisen.

Kielet, joissa on suuri osuus kurkkuääniä, kuten tšetšeeni ja hollanti, ovat erityisen ongelmallisia automaattisille puheen erotteluille, kun taas kulttuurit, joissa puhuja voi ilmaista tunteita tai nöyryyttä katsomalla pois (jälleen yleensä Aasian kulttuureissa) lisäävät ulottuvuutta, jossa AI:n huulien lukemisen tutkijoiden on kehitettävä lisämenetelmiä “täyttämiseen” muista kontekstuaalisista vihjeistä.

Kirjailija tekoälystä, alan erikoisosaaja ihmisen kuvansynteesissä. Entinen tutkimussisällön johtaja Metaphysic.ai:ssa, kunnes se liitettiin DNEG:n Brahma.ai:hin.
Portfolio-sivu: martinanderson.ai
Ota yhteyttä: martin@martinanderson.ai