AI-modeller og platforme

Ny AI-ansigtsgenkendelsesteknologi går et skridt videre

mm
Føj Unite.AI til dine foretrukne kilder på Google

Det ser ud til, at brugen af kunstig intelligens i ansigtsgenkendelsesteknologi er det, der er kommet længst indtil nu. Som ZDNet bemærker, har virksomheder som Microsoft (MSFT ) allerede udviklet ansigtsgenkendelsesteknologi, der kan genkende ansigtsudtryk (FR) med brug af emotionsværktøjer. Men begrænsningsfaktoren indtil nu har været, at disse værktøjer var begrænset til otte, såkaldte kerntilstande – vrede, foragt, frygt, afsky, lykke, sorg, overraskelse eller neutral.

Nu træder den japanske teknologiudvikler Fujitsu ind, med AI-baseret teknologi, der tager ansigtsgenkendelse et skridt videre i sporing af udtrykte emotioner.

Den eksisterende FR-teknologi er baseret, som ZDNet forklarer, på “identificering af forskellige handlingseenheder (AUs) – det vil sige bestemte ansigtsmuskelsbevægelser, vi laver, og som kan kobles til bestemte emotioner.” I et givet eksempel “kan AI konkludere, at personen, der analyseres, er glad, hvis både AU ‘kindhæver’ og AU ‘læbevinklehæver’ identificeres sammen.”

Som en Fujitsu-talsperson forklarede, “er problemet med den nuværende teknologi, at AI skal trænes på enorme datamængder for hver AU. Den skal vide, hvordan den kan genkende en AU fra alle mulige vinkler og positioner. Men vi har ikke nok billeder til det – så det er normalt ikke så nøjagtigt.”

En stor mængde data er nødvendig for at træne AI til at være effektiv i at detektere emotioner, og det er meget svært for den nuværende FR at virkelig genkende, hvad den undersøgte person føler. Og hvis personen ikke sidder foran kameraet og kigger lige ind i det, bliver opgaven endnu sværere. Mange eksperter har bekræftet disse problemer i nogle seneste undersøgelser.

Fujitsu hævder, at de har fundet en løsning til at forbedre kvaliteten af ansigtsgenkendelsesresultater i detektion af emotioner. I stedet for at bruge en stor mængde billeder til at træne AI, har deres nyoprettede værktøj til opgaven at “udtrække mere data ud af ét billede.” Selskabet kalder dette “normaliseringsprocessen”, som indebærer at konvertere billeder “taget fra en bestemt vinkel til billeder, der ligner et frontalt billede.”

Som talspersonen forklarede, “kan vi med den samme begrænsede datamængde bedre detektere flere AUs, selv i billeder taget fra en skæv vinkel, og med flere AUs kan vi identificere komplekse emotioner, som er mere subtile end de kerneudtryk, der i øjeblikket analyseres.”

Selskabet hævder, at de nu kan “detektere emotionelle ændringer så detaljerede som nervøs latter, med en detektionsnøjagtighed på 81%, et tal, der blev bestemt gennem ‘standard evalueringsmetoder’.” I sammenligning havde Microsoft-værktøjer, ifølge uafhængig forskning, en nøjagtighed på 60%, og havde også problemer med at detektere emotioner, når de arbejdede med billeder taget fra mere skæve vinkler.

Som de potentielle anvendelser nævner Fujitsu, at deres nye værktøjer kunne bruges til vej sikkerhed “ved at detektere selv små ændringer i chaufførernes koncentration.”

Tidligere diplomat og oversætter for FN, nuværende freelance journalist/forfatter/forsker, fokuserer på moderne teknologi, kunstig intelligens og moderne kultur.