AI-modeller och plattformar

Studie visar att AI-modeller inte matchar mänsklig visuell bearbetning

mm
Lägg till Unite.AI bland dina föredragna källor på Google

En ny studie från York University visar att djupa konvolutionsneuronnät (DCNN) inte matchar mänsklig visuell bearbetning genom att använda konfigural formperception. Enligt professor James Elder, medförfattare till studien, kan detta ha allvarliga och farliga verkliga världsimpликаktioner för AI-applikationer.

Den nya studien med titeln “Deep learning models fail to capture the configural nature of human shape perception” publicerades i Cell Press-tidskriften iScience.

Det var en samarbetsstudie mellan Elder, som innehar York Research Chair in Human and Computer Vision, samt Co-Director för Yorks Center for AI & Society, och professor Nicholas Baker, som är biträdande professor i psykologi och tidigare VISTA-postdoktorand vid York.

Nya visuella stimuli “Frankensteins”

Teamet använde nya visuella stimuli som kallades “Frankensteins”, som hjälpte dem att undersöka hur både den mänskliga hjärnan och DCNN bearbetar holistiska, konfigurala objektegenskaper.

“Frankensteins är bara objekt som har tagits isär och satts ihop på fel sätt”, säger Elder. “Som ett resultat har de alla rätt lokala egenskaper, men på fel platser.”

Studien fann att DCNN inte förvirras av Frankensteins som det mänskliga visuella systemet är. Detta avslöjar en känslighet för konfigurala objektegenskaper.

“Våra resultat förklarar varför djupa AI-modeller misslyckas under vissa förhållanden och pekar på behovet av att överväga uppgifter utöver objekterkännelse för att förstå visuell bearbetning i hjärnan”, fortsätter Elder. “Dessa djupa modeller tenderar att ta ‘genvägar’ när de löser komplexa erkänningsuppgifter. Medan dessa genvägar kan fungera i många fall, kan de vara farliga i vissa av de verkliga världens AI-applikationer som vi för närvarande arbetar med våra industri- och regeringspartners.”

Bild: York University

Verkliga världsimpликаktioner

Elder säger att en av dessa applikationer är trafiksäkerhetssystem för video.

“Objekten i en upptagen trafikscen – fordon, cyklar och fotgängare – blockerar varandra och anländer till en förarens öga som en samling av frånkopplade fragment”, säger han. “Hjärnan behöver korrekt gruppera dessa fragment för att identifiera de korrekta kategorierna och objekten. Ett AI-system för trafiksäkerhetsövervakning som bara kan uppfatta fragmenten individuellt kommer att misslyckas med denna uppgift, potentiellt missförstå riskerna för utsatta väganhängare.”

Forskarna säger också att ändringar i utbildning och arkitektur som syftar till att göra nätverk mer hjärnliknande inte uppnådde konfigural bearbetning. Inga av nätverken kunde korrekt förutsäga försök-för-försök mänskliga objektdomar.

“Vi spekulerar att för att matcha mänsklig konfigural känslighet, måste nätverken utbildas för att lösa en bredare serie objektsuppgifter utöver kategoriigenkänning”, avslutar Elder

Alex McFarland är en AI-journalist och författare som utforskar de senaste utvecklingarna inom artificiell intelligens. Han har samarbetat med många AI-startups och publikationer över hela världen.