Kąt Andersona

Wykrywanie fałszywych połączeń wideo za pomocą oświetlenia monitora

mm
Dodaj Unite.AI do preferowanych źródeł w Google

Nowe badanie przeprowadzone przez naukowców z National Security Agency (NSA) i Uniwersytetu Kalifornijskiego w Berkeley przedstawia nową metodę wykrywania fałszywych połączeń wideo w czasie rzeczywistym – poprzez obserwację efektu oświetlenia monitora na wygląd osoby na drugim końcu połączenia wideo.

Popularny użytkownik DeepFaceLive Druuzil Tech & Games testuje swój własny model Christiana Bale'a DeepFaceLab w sesji na żywo z jego followerami, podczas gdy źródła światła się zmieniają. Źródło: https://www.youtube.com/watch?v=XPQLDnogLKA

Popularny użytkownik DeepFaceLive Druuzil Tech & Games testuje swój własny model Christiana Bale’a DeepFaceLab w sesji na żywo z jego followerami, podczas gdy źródła światła się zmieniają. Źródło: https://www.youtube.com/watch?v=XPQLDnogLKA

System działa poprzez umieszczenie elementu graficznego na ekranie użytkownika, który zmienia się w wąskim zakresie kolorów szybciej niż typowy system fałszywych połączeń wideo może zareagować – nawet jeśli, jak w przypadku implementacji DeepFaceLive (pokazanej powyżej), ma pewną możliwość utrzymania transmisji kolorów w czasie rzeczywistym i uwzględniania oświetlenia otoczenia.

Jednorodny obraz koloru wyświetlany na monitorze osoby na drugim końcu (tj. potencjalnego oszusta) przechodzi przez ograniczoną zmianę odcieni, które są zaprojektowane tak, aby nie aktywować automatycznego balansu bieli i innych systemów kompensacji oświetlenia, które mogłyby naruszyć tę metodę.

Z artykułu, ilustracja zmiany warunków oświetleniowych z monitora przed użytkownikiem, który działa jako rozproszone źródło światła.

Z artykułu, ilustracja zmiany warunków oświetleniowych z monitora przed użytkownikiem, który działa jako rozproszone źródło światła. Źródło: https://farid.berkeley.edu/downloads/publications/cvpr22a.pdf

Teoria za tą metodą polega na tym, że systemy fałszywych połączeń wideo w czasie rzeczywistym nie mogą zareagować na czas na zmiany przedstawione na grafice na ekranie, zwiększając “opóźnienie” efektu fałszywego połączenia wideo w pewnych częściach widma kolorów, ujawniając jego obecność.

Aby móc dokładnie zmierzyć odbite światło monitora, system musi uwzględnić i wykluczyć wpływ ogólnego oświetlenia otoczenia, które nie jest związane ze światłem z monitora. Następnie może on odróżnić braki w pomiarze aktywnego oświetlenia i odcienia twarzy użytkownika, reprezentując przesunięcie czasowe o 1-4 klatki między nimi.

Poprzez ograniczenie zmian odcieni w grafice

Poprzez ograniczenie zmian odcieni w grafice “wykrywacza” na ekranie i zapewnienie, że kamera internetowa użytkownika nie jest.promptowana do automatycznego dostosowania ustawień przechwycenia przez nadmierną zmianę oświetlenia monitora, badacze byli w stanie wykryć charakterystyczne opóźnienie w dostosowaniu systemu fałszywych połączeń wideo do zmian oświetlenia.

Artykuł kończy się słowami:

‘Ponieważ pokładamy uzasadnione zaufanie w połączenia wideo na żywo, a połączenia wideo stają się coraz bardziej powszechne w naszym życiu prywatnym i zawodowym, proponujemy, że techniki uwierzytelniania połączeń wideo (i audio) będą tylko zwiększać swoje znaczenie.’

Badanie zatytułowane Wykrywanie fałszywych połączeń wideo w czasie rzeczywistym za pomocą aktywnego oświetlenia zostało przeprowadzone przez Candice R. Gerstner, matematyka stosowanego w Departamencie Obrony USA, i profesora Hany Farida z Berkeley.

Erozja zaufania

Scena badań nad fałszywymi połączeniami wideo uległa znaczącej zmianie w ciągu ostatnich sześciu miesięcy, od ogólnego wykrywania fałszywych połączeń wideo (tj. ukierunkowanego na nagrane filmy i treści pornograficzne) do wykrywania “żywych” połączeń wideo, w odpowiedzi na rosnącą falę incydentów związanych z fałszywymi połączeniami wideo w wideokonferencjach i ostrzeżeniem FBI dotyczącym rosnącego użycia takich technologii w aplikacjach do pracy zdalnej.

Nawet jeśli wideokonferencja nie okazuje się fałszywa, zwiększające się możliwości fałszywych połączeń wideo za pomocą sztucznej inteligencji zaczynają generować paranoję.

Nowy artykuł stwierdza:

‘Stworzenie fałszywych połączeń wideo w czasie rzeczywistym [stanowi] unikalne zagrożenia ze względu na ogólne zaufanie do połączeń wideo na żywo, a także ze względu na trudność w wykrywaniu fałszywych połączeń wideo w czasie rzeczywistym, podczas gdy połączenie jest w trakcie.’

Społeczność badawcza dążyła od dawna do znalezienia niezawodnych oznak fałszywych połączeń wideo, które nie mogą być łatwo skompensowane. Chociaż media często przedstawiają to jako wojnę technologiczną między badaczami bezpieczeństwa a twórcami fałszywych połączeń wideo, większość negacji wczesnych podejść (takich jak analiza mrugania oczu, rozróżnianie pozy head i analiza zachowania) wystąpiła po prostu dlatego, że twórcy i użytkownicy starali się stworzyć bardziej realistyczne fałszywe połączenia wideo w ogóle, a nie specjalnie w celu rozprawienia się z najnowszym “znakiem” zidentyfikowanym przez społeczność bezpieczeństwa.

Rzucanie światła na fałszywe połączenia wideo na żywo

Wykrywanie fałszywych połączeń wideo w środowiskach wideo na żywo jest obciążone koniecznością uwzględnienia słabych połączeń wideo, które są bardzo powszechne w scenariuszach wideokonferencji. Nawet bez fałszywej warstwy połączenia wideo, treści wideo mogą być poddane opóźnieniom, artefaktom renderowania i innym typom degradacji audio i wideo. Mogą one służyć do ukrycia niedoskonałości w architekturze fałszywych połączeń wideo na żywo, zarówno wideo, jak i audio fałszywych połączeń wideo.

Nowy system autorów poprawia wyniki i metody przedstawione w publikacji z 2020 roku z Centrum Komputowania Sieciowego na Uniwersytecie Temple w Filadelfii.

Z artykułu z 2020 roku, można zaobserwować zmianę w

Z artykułu z 2020 roku, można zaobserwować zmianę w “wypełnionym” oświetleniu twarzy wraz ze zmianą zawartości ekranu użytkownika. Źródło: https://cis.temple.edu/~jiewu/research/publications/Publication_files/FakeFace__ICDCS_2020.pdf

Różnica w nowej pracy polega na tym, że bierze pod uwagę sposób, w jaki kamery internetowe reagują na zmiany oświetlenia. Autorzy wyjaśniają:

‘Ponieważ wszystkie nowoczesne kamery internetowe wykonują automatyczne naświetlanie, wysokiej intensywności aktywne oświetlenie [używane w poprzedniej pracy] jest prawdopodobnie wyzwaniem dla automatycznego naświetlania kamery, co z kolei wpłynie na zarejestrowany wygląd twarzy. Aby uniknąć tego, zastosowaliśmy aktywne oświetlenie składające się z izoluminacyjnej zmiany odcienia.

‘Chociaż unikamy w ten sposób automatycznego naświetlania kamery, mogłoby to spowodować wyzwolenie białego balansu kamery, co ponownie wpłynęłoby na zarejestrowany wygląd twarzy. Aby uniknąć tego, działamy w zakresie odcieni, który empirycznie ustaliliśmy jako nie wyzwalający białego balansu.’

Dla tej inicjatywy autorzy rozważyli również podobne poprzednie próby, takie jak LiveScreen, które nakładają niewidoczną wzór oświetlenia na monitor użytkownika w celu ujawnienia fałszywych połączeń wideo.

Chociaż ten system osiągnął wskaźnik dokładności 94,8%, badacze dochodzą do wniosku, że subtelność wzorów oświetlenia uczyniłaby takie podejście trudne do wdrożenia w jasno oświetlonych środowiskach, i zamiast tego proponują, że ich własny system lub system w podobnym stylu mógłby być włączony publicznie i domyślnie do popularnych oprogramowań do wideokonferencji:

‘Nasze proponowane interwencje mogą być zrealizowane przez uczestnika połączenia, który po prostu udostępnia swój ekran i wyświetla zmieniający się wzór, lub, idealnie, mogą być bezpośrednio zintegrowane z klientem połączenia wideo.’

Testy

Autorzy użyli mieszanki syntetycznych i rzeczywistych podmiotów do przetestowania swojego wykrywacza fałszywych połączeń wideo opartego na Dlib. W przypadku scenariusza syntetycznego użyli Mitsubę, renderer do przodu i tyłu z Federalnego Instytutu Technologicznego w Lozannie.

Przykłady z symulowanego zestawu danych, zawierające zmieniający się odcień skóry, rozmiar źródła światła, intensywność światła otoczenia i odległość od kamery.

Przykłady z testów symulowanego środowiska, zawierające zmieniający się odcień skóry, rozmiar źródła światła, intensywność światła otoczenia i odległość od kamery.

Scena przedstawia głowę CGI przechwyconą z wirtualnej kamery z polem widzenia 90°. Głowy te mają odblaskowość Lamberta i neutralne odcienie skóry, i są umieszczone 2 stopy przed wirtualną kamerą.

Aby przetestować ramę w różnych możliwych odcieniach skóry i ustawieniach, badacze przeprowadzili serię testów, zmieniając różne aspekty sekwencyjnie. Zmieniane aspekty obejmowały odcień skóry, odległość i rozmiar źródła światła.

Autorzy komentują:

‘W symulacji, z naszymi różnymi założeniami spełnionymi, nasza proponowana technika jest bardzo odporna na szeroki zakres konfiguracji obrazowania.’

Dla scenariusza rzeczywistego badacze użyli 15 wolontariuszy z różnymi odcieniami skóry, w różnych środowiskach. Każdy z nich został poddany dwóm cyklom ograniczonej zmiany odcienia, w warunkach, w których częstotliwość odświeżania wyświetlacza 30 Hz była zsynchronizowana z kamerą internetową, co oznacza, że aktywne oświetlenie trwało tylko przez jedną sekundę na raz. Wyniki były ogólnie porównywalne z testami syntetycznymi, chociaż korelacje znacznie wzrosły wraz ze wzrostem wartości oświetlenia.

Przyszłe kierunki

System, jak przyznają badacze, nie uwzględnia typowych zakryć twarzy, takich jak grzywka, okulary lub broda. Niemniej jednak zauważają, że maskowanie tego rodzaju może być dodane do późniejszych systemów (poprzez etykietowanie i późniejsze segmentację semantyczną), które mogą być szkolone do przyjmowania wartości wyłącznie z obszarów skóry w celu podmiotu.

Autorzy sugerują również, że podobny paradygmat mógłby być wykorzystany do wykrywania fałszywych połączeń audio, i że wykrywany dźwięk mógłby być odtwarzany w częstotliwości poza normalnym zakresem słyszenia ludzkiego.

Prawdopodobnie najbardziej interesująco, badacze sugerują, że rozszerzenie obszaru oceny poza twarz w bogatszym frameworku przechwycenia mogłoby znacznie poprawić możliwość wykrywania fałszywych połączeń wideo*:

‘Bardziej zaawansowane szacowanie oświetlenia 3D dostarczyłoby bogatszy model wyglądu, który byłby jeszcze trudniejszy do obejścia przez fałszerza.

‘Chociaż skupiliśmy się tylko na twarzy, komputerowy wyświetlacz również oświetla szyję, górę ciała i otoczenie, z których można by pobrać podobne pomiary.

‘Te dodatkowe pomiary zmusiłyby fałszerza do rozważenia całej sceny 3D, a nie tylko twarzy.’

 

* Moja konwersja cytowań w tekście autorów na linki.

Pierwotnie opublikowane 6 lipca 2022.

Pisarz specjalizujący się w dziedzinie machine learning, specjalista w dziedzinie syntezowania obrazów ludzi. Były szef działu treści badawczych w Metaphysic.ai, do czasu jego rozwiązania i połączenia z DNEG's Brahma.ai.
Portfolio site: martinanderson.ai
Contact: martin@martinanderson.ai