AI-modeller og plattformer

Ny AI-basert ansiktsgjenkjenningsteknologi går et skritt videre

mm
Legg til Unite.AI blant dine foretrukne kilder på Google

Det ser ut til at bruken av kunstig intelligens i ansiktsgjenkjenningsteknologi er ett område som har utviklet seg mest så langt. Ifølge ZDNet har selskaper som Microsoft (MSFT ) allerede utviklet ansiktsgjenkjenningsteknologi som kan gjenkjenne ansiktsuttrykk (FR) med hjelp av emosjonstverktøy. Men begrensningen så langt har vært at disse verktøyene bare har vært begrenset til åtte såkalte kjerne-tilstander – sinne, forakt, frykt, avsky, lykke, sorg, overraskelse eller nøytral.

Nå kommer den japanske teknologiutvikleren Fujitsu med AI-basert teknologi som tar ansiktsgjenkjenning ett skritt videre i å spore uttrykte emosjoner.

Den eksisterende FR-teknologien er basert, som ZDNet forklarer, på “å identifisere ulike handlingseenheter (AUs) – det vil si bestemte ansiktsmuskulaturbevegelser vi gjør og som kan kobles til bestemte emosjoner.” I et gitt eksempel, “hvis både AU ‘kindheiseren’ og AU ‘lepphjørne-trekkeren’ identifiseres sammen, kan AI-en konkludere at personen det analyserer er glad.

Ifølge en Fujitsu-talsperson er “problemet med den nåværende teknologien er at AI-en må trenes på enorme datamengder for hver AU. Den må vite hvordan den kan gjenkjenne en AU fra alle mulige vinkler og posisjoner. Men vi har ikke nok bilder til det – så vanligvis er det ikke så nøyaktig.”

Et stort datamengde trengs for å trene AI til å være effektiv i å gjenkjenne emosjoner, og det er svært vanskelig for den nåværende FR å virkelig gjenkjenne hva personen som undersøkes føler. Og hvis personen ikke sitter foran kameraet og ser rett inn i det, blir oppgaven enda vanskeligere. Mange eksperter har bekreftet disse problemene i noen nye studier.

Fujitsu hevder å ha funnet en løsning for å øke kvaliteten på ansiktsgjenkjenningresultatene i å gjenkjenne emosjoner. I stedet for å bruke et stort antall bilder for å trene AI-en, har deres nyutviklede verktøy oppgaven å “uttrekke mer data fra ett bilde.” Selskapet kaller dette “normaliseringsprosessen”, som innebærer å konvertere bilder “tatt fra en bestemt vinkel til bilder som ligner et frontbilde.”

Ifølge talspersonen “kan vi med samme begrensede datamengde bedre gjenkjenne flere AUs, selv i bilder tatt fra en skjev vinkel, og med flere AUs kan vi identifisere komplekse emosjoner, som er mer subtile enn de kjerne-uttrykkene som nå analyseres.”

Selskapet hevder at de nå kan “gjenkjenne emosjonelle endringer så detaljerte som nervøst latter, med en gjenkjenningssikkerhet på 81%, et tall som ble bestemt gjennom ‘standard evalueringsmetoder’.” I sammenligning har uavhengig forskning vist at Microsofts verktøy har en gjenkjenningssikkerhet på 60%, og også hadde problemer med å gjenkjenne emosjoner når de arbeidet med bilder tatt fra mer skjeve vinkler.

Ifølge Fujitsu kan deres nye verktøy brukes til veisikkerhet “ved å gjenkjenne selv små endringer i sjåførenes konsentrasjon.”

Tidligere diplomat og oversetter for FN, nå frilans journalist/forfatter/forsker, med fokus på moderne teknologi, kunstig intelligens og moderne kultur.