Andersons vinkel

Læsning af læber med visemer og maskinlæring

mm
Føj Unite.AI til dine foretrukne kilder på Google
HAL reads lips in 2001: A Space Odyssey (1968)

Nyt forskning fra Skolen for Computer Engineering i Tehran tilbyder en forbedret metode til udfordringen med at skabe maskinlæringssystemer, der kan læse læber.

Dokumentet “Lip Reading Using Viseme Decoding” rapporterer, at det nye system opnår en 4% forbedring i ordfejlrate i forhold til de bedste tidligere modeller. Systemet løser det generelle problem med manglende nyttige træningsdata i dette område ved at kortlægge visemer til tekstindhold, der er afledt fra de seks millioner eksempler i OpenSubtitles-databasen af oversatte filmoverskrifter.

En visem er den visuelle pendant til en fonem, effektivt en lyd>billede kortlægning, der kan udgøre en ‘funktion’ i et maskinlæringmodell.

Visemer i aktion.

Visemer i aktion. Kilde: https://developer.oculus.com/documentation/unity/audio-ovrlipsync-viseme-reference/

Forskerne startede med at etablere den laveste fejlrate på tilgængelige datasæt og udviklede visemsekvenser fra etablerede kortlægningsprocedurer. Gradvis udvikler denne proces en visuel leksikon af ord – selvom det er nødvendigt at definere sandsynligheder for nøjagtighed for forskellige ord, der deler en visem (såsom ‘heart’ og ‘art’).

Afkode visemer

Visemer afkodede fra tekst. Kilde: https://arxiv.org/pdf/2104.04784.pdf

Hvor to identiske ord resulterer i samme visem, vælges det mest hyppigt forekommende ord.

Modellen bygger på traditionel sekvens-til-sekvens-læring ved at tilføje en underproces, hvor visemer forudsiges fra tekst og modelleres i en dedikeret pipeline:

Visem-arkitektur til læsning af læber

Ovenfor traditionelle sekvens-til-sekvens-metoder i et karaktermodell; nedenfor tilføjes visem-karaktermodellering i Tehran-forskningen. Kilde: https://arxiv.org/pdf/2104.04784.pdf

Modellen blev anvendt uden visuel kontekst mod LRS3-TED-datasættet, frigivet fra Oxford University i 2018, med den dårligste ordfejlrate (WER) på 24,29%.

Tehran-forskningen inkluderer også brugen af en grafem-til-fonem-omdanner.

I en test mod 2017 Oxford-forskningen Lip Reading Sentences In The Wild (se nedenfor) opnåede Video-To-Viseme-metoden en ordfejlrate på 62,3%, sammenlignet med 69,5% for Oxford-metoden.

Forskerne konkluderer, at brugen af en højere mængde tekstinformation, kombineret med grafem-til-fonem- og visem-kortlægning, lover forbedringer over den nuværende tilstand i automatiserede læsning af læber-systemer, mens de erkender, at metoderne kan producere endnu bedre resultater, når de inkorporeres i mere avancerede rammer.

Maskin-drevet læsning af læber har været et aktivt og pågående område for computer-vision og NLP-forskning i de sidste to årtier. Blandt mange andre eksempler og projekter fik brugen af automatiseret læsning af læber-software overskrifter, da det blev brugt til at fortolke, hvad Adolf Hitler sagde i nogle af de berømte stumfilm optaget på hans bayerske tilbagetrækning, selvom anvendelsen synes at være forsvundet i glemsel siden (12 år senere resorterede Sir Peter Jackson til menneskelige læsere af læber for at genskabe samtalerne i WW1-optagelser i restaureringsprojektet They Shall Not Grow Old).

I 2017 producerede Lip Reading Sentences in The Wild, et samarbejde mellem Oxford University og Googles AI-forskningsafdeling, en læsning af læber-AI, der kunne korrekt slutte 48% af tale i video uden lyd, hvor en menneskelig læser af læber kun kunne nå en nøjagtighed på 12,4% fra samme materiale. Modellen blev trænet på tusinder af timer med BBC-TV-optagelser.

Dette arbejde fulgte op på en separat Oxford/Google-initiativ fra det foregående år, kaldet LipNet, en neural netværksarkitektur, der kortlagde videosekvenser af variabel længde til tekstsekvenser ved hjælp af en Gated Recurrent Network (GRN), der tilføjer funktionalitet til den grundlæggende arkitektur af en Recurrent Neural Network (RNN). Modellen opnåede en 4,1-gange forbedret præstation i forhold til menneskelige læsere af læber.

Foruden problemet med at fremkalde en præcis transskription i realtid dykker udfordringen med at fortolke tale fra video, når man fjerner nyttig kontekst, såsom lyd, ‘ansigt-til-ansigt’-optagelser, der er godt belyst, og et sprog/kultur, hvor fonemer/visemer er relativt distinkte.

Selvom der ikke er nogen empirisk forståelse af, hvilke sprog er de sværeste at læse på læber i fuldstændig fravær af lyd, er japansk en primær kandidat. De forskellige måder, hvorpå japanske indfødte (såvel som visse andre vest- og østasiatiske indfødte) udnytter ansigtsudtryk mod indholdet af deres tale, gør dem allerede til en stor udfordring for sentiment-analyse-systemer.

Det er dog værd at bemærke, at meget af den videnskabelige litteratur på dette område er generelt omhyggelig, ikke mindst fordi selv velmente, objektive forskning i denne sfære risikerer at gå over i racemæssig profilering og udbredelse af eksisterende stereotyper.

Sprog med en høj proportion af gutturale komponenter, såsom tjetjensk og hollandsk, er særligt problematiske for automatiserede tale-ekstraktions-teknikker, mens kulturer, hvor taleren kan udtrykke følelse eller underkastelse ved at se væk (igen, generelt i asiatiske kulturer), tilføjer en ekstra dimension, hvor AI-læsning af læber-forskere vil nødt til at udvikle yderligere metoder til ‘indfylning’ fra andre kontekstuelle hints.

Forfatter til maskinlæringsartikler, domæneekspert i menneskesynssyntese. Tidligere leder af forskningsindhold på Metaphysic.ai, indtil opløsningen i DNEG's Brahma.ai.
Portfolio site: martinanderson.ai
Kontakt: martin@martinanderson.ai