Modelli e piattaforme di IA

I ricercatori sviluppano nuove tecniche per migliorare le immagini degradate

mm
Aggiungi Unite.AI alle tue fonti preferite su Google

Un team di ricercatori del Yale-NUS College ha sviluppato nuovi approcci di visione computerizzata e apprendimento profondo per estrarre dati più precisi da immagini a basso livello in video causate da fattori ambientali come la pioggia e le condizioni notturne. Hanno anche migliorato la precisione della stima della posizione umana 3D in video.

La tecnologia di visione computerizzata, utilizzata in applicazioni come sistemi di sorveglianza automatica, veicoli autonomi e strumenti di salute e distanziamento sociale, è spesso influenzata da fattori ambientali, che possono causare problemi con i dati estratti.

La nuova ricerca è stata presentata alla Conferenza 2021 su Visione Computerizzata e Riconoscimento di Pattern (CVPR).

Impatto ambientale sulle immagini

Condizioni come la luce bassa e gli effetti luminosi artificiali come abbagliamento, bagliore e luci abbondanti influenzano le immagini notturne. Le immagini della pioggia sono anche influenzate da strisce di pioggia o accumulo di pioggia.

Il professor associato di Scienze Robby Tan ha guidato il team di ricerca.

“Molti sistemi di visione computerizzata, come la sorveglianza automatica e le auto a guida autonoma, dipendono dalla chiara visibilità dei video di input per funzionare bene. Ad esempio, le auto a guida autonoma non possono funzionare in modo robusto in caso di pioggia intensa e i sistemi di sorveglianza automatica CCTV spesso falliscono di notte, in particolare se le scene sono buie o ci sono abbondanti luci o abbagliamento”, ha detto il professor Tan.

Il team si è basato su due studi separati che hanno introdotto algoritmi di apprendimento profondo per migliorare la qualità dei video notturni e dei video della pioggia.

Il primo studio si è concentrato sull’aumento della luminosità mentre si sopprimeva il rumore e gli effetti luminosi, come abbagliamento, bagliore e luci abbondanti, per creare immagini notturne chiare. La nuova tecnica è finalizzata a migliorare la chiarezza nelle immagini e nei video notturni quando c’è un inevitabile abbagliamento, che i metodi esistenti non hanno ancora fatto.

In paesi dove la pioggia intensa è comune, l’accumulo di pioggia influisce negativamente sulla visibilità nei video. Il secondo studio ha cercato di affrontare il problema introducendo un metodo che utilizza un allineamento dei frame, che consente una migliore informazione visiva senza essere influenzata dalle strisce di pioggia, che spesso appaiono casualmente in frame diversi. Il team ha utilizzato una telecamera in movimento per impiegare la stima della profondità, che ha aiutato a rimuovere l’effetto di velatura della pioggia. Mentre i metodi esistenti si concentrano sull’eliminazione delle strisce di pioggia, quelli appena sviluppati possono rimuovere sia le strisce di pioggia che l’effetto di velatura della pioggia contemporaneamente.

Immagine: Yale-NUS College

Stima della posizione umana 3D

Insieme alle nuove tecniche, il team ha anche presentato la sua ricerca sulla stima della posizione umana 3D, che può essere utilizzata nella sorveglianza video, nei giochi video e nella trasmissione sportiva.

La stima della posizione umana 3D da un video monocular, o video ripreso da una singola telecamera, è stata sempre più oggetto di ricerca negli ultimi anni. A differenza dei video provenienti da più telecamere, i video monoculari sono più flessibili e possono essere ripresi con una singola telecamera, come un telefono cellulare.

Detto ciò, un’attività intensa come quella di più individui nella stessa scena influisce sull’accuratezza della rilevazione umana. Ciò è particolarmente vero quando gli individui interagiscono strettamente o si sovrappongono l’un l’altro nel video monocular.

Lo studio del team ha stimato la posizione umana 3D da un video combinando due metodi esistenti, che erano l’approccio top-down e bottom-up. Il nuovo metodo produce una stima della posizione più affidabile in ambienti multi-individui rispetto agli altri due e è meglio equipaggiato per gestire la distanza tra gli individui.

“Come prossimo passo nella nostra ricerca sulla stima della posizione umana 3D, che è supportata dalla National Research (NRC ) Foundation, cercheremo di proteggere le informazioni di privacy dei video. Per i metodi di miglioramento della visibilità, cerchiamo di contribuire ai progressi nel campo della visione computerizzata, che sono fondamentali per molte applicazioni che possono influenzare la nostra vita quotidiana, come ad esempio consentire alle auto a guida autonoma di funzionare meglio in condizioni meteorologiche avverse”, ha detto il professor Tan.

Alex McFarland è un giornalista e scrittore di intelligenza artificiale che esplora gli ultimi sviluppi nel campo dell'intelligenza artificiale. Ha collaborato con numerose startup di intelligenza artificiale e pubblicazioni in tutto il mondo.