KI-Modelle und Plattformen
Forscher entwickeln neue Techniken zur Verbesserung von verschlechterten Bildern

Ein Team von Forschern am Yale-NUS College hat neue Computer-Vision- und Deep-Learning-Ansätze entwickelt, um aus niedrigauflösenden Bildern in Videos, die durch Umweltfaktoren wie Regen und Nachtbedingungen verursacht werden, genauere Daten zu extrahieren. Sie haben auch die Genauigkeit der 3D-Human-Pose-Estimation in Videos verbessert.
Computer-Vision-Technologie, die in Anwendungen wie automatischen Überwachungssystemen, autonomen Fahrzeugen und Gesundheits- und Sozialentfernungstools verwendet wird, wird oft durch Umweltfaktoren beeinträchtigt, die Probleme mit den extrahierten Daten verursachen können.
Die neue Forschung wurde auf der 2021 Conference on Computer Vision and Pattern Recognition (CVPR) vorgestellt.
Umweltbedingter Einfluss auf Bilder
Bedingungen wie schlechtes Licht und von Menschen gemachte Lichteffekte wie Glimmer, Glanz und Flutlicht beeinflussen Nachtbilder. Regenbilder werden auch durch Regenstreifen oder Regenansammlungen beeinflusst.
Der Associate Professor of Science Robby Tan von der Yale-NUS College leitete das Forschungsteam.
“Viele Computer-Vision-Systeme wie automatische Überwachung und selbstfahrende Autos benötigen eine klare Sichtbarkeit der Eingabevideos, um gut zu funktionieren. Zum Beispiel können selbstfahrende Autos nicht robust in starkem Regen funktionieren und CCTV-Überwachungssysteme schlagen oft in der Nacht fehl, insbesondere wenn die Szenen dunkel sind oder es erhebliche Glimmer oder Flutlicht gibt”, sagte Assoc. Prof. Tan.
Das Team stützte sich auf zwei separate Studien, die Deep-Learning-Algorithmen zur Verbesserung der Qualität von Nacht- und Regenvideos einführten.
Die erste Studie konzentrierte sich auf die Verbesserung der Helligkeit und gleichzeitige Unterdrückung von Rauschen und Lichteffekten wie Glimmer, Glanz und Flutlicht, um klare Nachtbilder zu erstellen. Die neue Technik zielt darauf ab, die Klarheit in Nachtbildern und -videos zu verbessern, wenn unvermeidbarer Glimmer vorhanden ist, was bestehende Methoden noch nicht erreicht haben.
In Ländern, in denen starker Regen häufig ist, beeinflusst Regenansammlungen die Sichtbarkeit in Videos negativ. Die zweite Studie versuchte, dieses Problem zu lösen, indem sie eine Methode einführte, die eine Frame-Ausrichtung verwendet, die bessere visuelle Informationen ohne Beeinflussung durch Regenstreifen ermöglicht, die oft zufällig in verschiedenen Frames erscheinen. Das Team verwendete eine bewegliche Kamera, um die Tiefenschätzung zu verwenden, die half, den Regenverhang-Effekt zu entfernen. Während bestehende Methoden sich auf die Entfernung von Regenstreifen konzentrieren, können die neu entwickelten Methoden sowohl Regenstreifen als auch den Regenverhang-Effekt gleichzeitig entfernen.

Bild: Yale-NUS College
3D-Human-Pose-Estimation
Zusammen mit den neuen Techniken stellte das Team auch seine Forschung zur 3D-Human-Pose-Estimation vor, die in Videoüberwachung, Videospiele und Sportübertragungen verwendet werden kann.
Die 3D-Mehrpersonen-Pose-Estimation aus einem monokularen Video, oder einem Video, das mit einer einzigen Kamera aufgenommen wurde, wurde in den letzten Jahren zunehmend erforscht. Im Gegensatz zu Videos aus mehreren Kameras sind monokulare Videos flexibler und können mit einer einzigen Kamera, wie einem Mobiltelefon, aufgenommen werden.
Allerdings beeinflusst hohe Aktivität wie mehrere Personen in derselben Szene die Genauigkeit in der menschlichen Erkennung. Dies ist besonders wahr, wenn Personen eng miteinander interagieren oder sich in dem monokularen Video überlappen.
Die dritte Studie des Teams schätzte die 3D-Human-Pose aus einem Video, indem sie zwei bestehende Methoden kombinierte, die top-down- und bottom-up-Ansätze waren. Die neue Methode produziert zuverlässigere Pose-Schätzungen in Mehrpersonenszenarien im Vergleich zu den anderen beiden und ist besser geeignet, um den Abstand zwischen Personen zu handhaben.
“Als nächstes in unserer 3D-Human-Pose-Estimation-Forschung, die durch die National Research (NRC ) Foundation unterstützt wird, werden wir uns damit befassen, wie wir die Privatsphäreinformationen der Videos schützen können. Für die Sichtbarkeitsverbesserungsmethoden streben wir danach, zur Weiterentwicklung des Computer-Vision-Feldes beizutragen, da sie für viele Anwendungen von entscheidender Bedeutung sind, die unser tägliches Leben beeinflussen können, wie zum Beispiel die Verbesserung der Funktion von selbstfahrenden Autos in widrigen Wetterbedingungen”, sagte Assoc. Prof. Tan.












