AI-modeller och plattformar

Ny AI-teknik för ansiktsigenkänning går ett steg längre

mm
Lägg till Unite.AI bland dina föredragna källor på Google

Det verkar som att användningen av artificiell intelligens i ansiktsigenkänningsteknik är en av de som har utvecklats mest hittills. Som ZDNet noterar, har företag som Microsoft (MSFT ) redan utvecklat ansiktsigenkänningsteknik som kan känna igen ansiktsuttryck (FR) med hjälp av emotionverktyg. Men den begränsande faktorn hittills har varit att dessa verktyg har varit begränsade till åtta så kallade kärntillstånd – ilska, förakt, rädsla, avsmak, lycka, sorg, överraskning eller neutral.

Nu kommer den japanska tech-utvecklaren Fujitsu med AI-baserad teknik som tar ansiktsigenkänning ett steg längre i spårandet av uttryckta känslor.

Den befintliga FR-tekniken är baserad, som ZDNet förklarar, på “identifiering av olika handlingsenheter (AUs) – det vill säga vissa ansiktsmuskelrörelser som vi gör och som kan kopplas till specifika känslor.” I ett givet exempel, “om både AU ‘kindhöjare’ och AU ‘läpphörnare’ identifieras tillsammans, kan AI dra slutsatsen att personen som analyseras är glad.

Som en Fujitsu-talesperson förklarade, “problemet med den nuvarande tekniken är att AI behöver utbildas på stora datamängder för varje AU. Den behöver veta hur man känner igen en AU från alla möjliga vinklar och positioner. Men vi har inte tillräckligt med bilder för det – så vanligtvis är det inte så exakt.”

En stor mängd data behövs för att utbilda AI för att vara effektiv i att upptäcka känslor, och det är mycket svårt för den nuvarande FR att verkligen känna igen vad den undersökta personen känner. Och om personen inte sitter framför kameran och tittar rakt in i den, blir uppgiften ännu svårare. Många experter har bekräftat dessa problem i några senaste studier.

Fujitsu hävdar att de har funnit en lösning för att öka kvaliteten på ansiktsigenkänningens resultat i att upptäcka känslor. Istället för att använda en stor mängd bilder för att utbilda AI, har deras nysskapade verktyg uppgiften att “extrahera mer data ur en enda bild.” Företaget kallar detta “normaliseringsprocess”, som innebär att omvandla bilder “tagna från en viss vinkel till bilder som liknar en framsida.”

Som talespersonen förklarade, “med samma begränsade datamängd kan vi bättre upptäcka fler AUs, även i bilder tagna från en sned vinkel, och med fler AUs kan vi identifiera komplexa känslor, som är mer subtila än de kärnuttryck som för närvarande analyseras.”

Företaget hävdar att de nu kan “upptäcka känslomässiga förändringar så detaljerade som nervös skratt, med en upptäcktsfrekvens på 81%, ett nummer som bestämdes genom ‘standardiserade utvärderingsmetoder’.” I jämförelse, enligt oberoende forskning, har Microsofts verktyg en upptäcktsfrekvens på 60%, och hade också problem med att upptäcka känslor när de arbetade med bilder tagna från mer sneda vinklar.

Som potentiella tillämpningar nämner Fujitsu att deras nya verktyg kan användas för trafiksäkerhet “genom att upptäcka även små förändringar i förarnas koncentration.”

Före detta diplomat och översättare för UN, för närvarande frilansjournalist/författare/forskare, med fokus på modern teknik, artificiell intelligens och modern kultur.