AI-modeller og plattformer
Forskere utvikler nye teknikkér for å forbedre nedsettende bilder

Et team av forskere ved Yale-NUS College har utviklet nye datavisjons- og dyplæringsteknikker for å trekke ut mer nøyaktige data fra lavnivå-visjon i videoer forårsaket av miljøfaktorer som regn og nattlige forhold. De har også forbedret nøyaktigheten av 3D-menneskeposeestimering i videoer.
Datavisjonsteknologi, som brukes i applikasjoner som automatiske overvåkingssystemer, selvkjørende kjøretøy og helse- og sosiale avstandverktøy, påvirkes ofte av miljøfaktorer, som kan forårsake problemer med de trukne dataene.
Den nye forskningen ble presentert på 2021-konferansen om datavisjon og mønstergjenkjenning (CVPR).
Miljøpåvirkning på bilder
Forhold som lavt lys og menneskeskapte lyseffekter som glør, glans og flomlykter påvirker nattlige bilder. Regnbilder påvirkes også av regnstreker eller regnsamling.
Yale-NUS College Associate Professor of Science Robby Tan ledet forskningsteamet.
“Mange datavisjonssystemer som automatiske overvåkingssystemer og selvkjørende kjøretøy, er avhengige av god siktbarhet av inndataene for å fungere godt. For eksempel kan selvkjørende kjøretøy ikke fungere robustt i tung regn, og CCTV-automatiske overvåkingssystemer feiler ofte om natten, særlig hvis scenene er mørke eller det er betydelig glør eller flomlykter,” sa Assoc. Prof Tan.
Teamet baserte seg på to separate studier som innførte dyplæringalgoritmer for å forbedre kvaliteten på nattlige videoer og regnvideoer.
Den første studien fokuserte på å øke lysstyrken samtidig som den undertrykte støy og lyseffekter, som glør, glans og flomlykter, for å skape klare nattlige bilder. Den nye teknikken er rettet mot å forbedre klarheten i nattlige bilder og videoer når det er uunngåelig glør, som eksisterende metoder ennå ikke har klart å gjøre.
I land hvor tung regn er vanlig, påvirker regnsamling negativt siktbarheten i videoer. Den andre studien satte ut til å løse problemet ved å innføre en metode som anvender en rammejustering, som muliggjør bedre visuell informasjon uten å bli påvirket av regnstreker, som ofte dukker opp tilfeldig i forskjellige rammeverk. Teamet brukte en bevegelig kamera til å anvende dybdeestimering, som hjalp til å fjerne regnveileffekten. Mens eksisterende metoder dreier seg om å fjerne regnstreker, kan de nyutviklede metodene fjerne både regnstreker og regnveileffekten samtidig.

Bilde: Yale-NUS College
3D-menneskeposeestimering
I tillegg til de nye teknikker, presenterte teamet også sin forskning på 3D-menneskeposeestimering, som kan brukes i videoovervåking, videospill og sportskringkasting.
3D-menneskeposeestimering fra en monokulær video, eller video tatt fra en enkelt kamera, har blitt stadig mer forsket på de siste årene. I motsetning til videoer fra flere kameraer, er monokulære videoer mer fleksible og kan tas med en enkelt kamera, som for eksempel en mobiltelefon.
Med det sagt, påvirker høy aktivitet som flere personer i samme scene nøyaktigheten i menneskegjenkjenning. Dette er særlig sant når personer interagerer nært eller overlapper hverandre i monokulære videoer.
Teamets tredje studie estimerte 3D-menneskepose fra en video ved å kombinere to eksisterende metoder, som var topp-ned og bunn-opp-tilnærmingene. Den nye metoden produserer mer pålitelig poseestimering i flerpersonssettninger sammenlignet med de to andre, og den er bedre utstyrt til å håndtere avstand mellom personer.
“Som en neste skritt i vår 3D-menneskeposeestimeringsforskning, som støttes av National Research (NRC ) Foundation, vil vi se på hvordan vi kan beskytte personlige informasjon om videoer. For synsforbedringsmetodene, stræber vi etter å bidra til fremgang i datavisjonsfeltet, som er kritisk for mange applikasjoner som kan påvirke våre daglige liv, som for eksempel å muliggjøre selvkjørende kjøretøy å fungere bedre i dårlig vær,” sa Assoc. Prof Tan.












