Kąt Andersona

Wykrywanie fałszywych wideokonferencji z użyciem funkcji “wibracji” smartfona

mm
Dodaj Unite.AI do preferowanych źródeł w Google
An AI-generated illustration: 'a gorgeous panoramic picture of a man sitting in an office, looking into his smartphone, which he is holding; the man is wearing a Guy Fawkes mask; photorealistic, UHQ' - ChatGPT 3, Tuesday, 24 września 2024 13:27:31

Nowe badania z Singapuru zaproponowały nową metodę wykrywania, czy osoba na drugim końcu wideokonferencji za pomocą smartfona używa metod takich jak DeepFaceLive do podszywania się pod kogoś innego.

Tytuł nowego podejścia to SFake, które porzuca metody biernego wykrywania stosowane przez większość systemów i powoduje, że telefon użytkownika wibruje (za pomocą tych samych mechanizmów powszechnych w smartfonach), a także lekko rozmywa twarz.

Chociaż systemy live deepfaking są w stanie replikować rozmycie ruchu, o ile tylko rozmyte nagrania były częścią danych szkoleniowych lub przynajmniej danych wstępnych, nie są w stanie zareagować wystarczająco szybko na nieoczekiwane rozmycie tego rodzaju i nadal generują nie rozmyte fragmenty twarzy, ujawniając istnienie fałszywej wideokonferencji.

DeepFaceLive nie jest w stanie symulować rozmycia spowodowanego przez drgania kamery. Źródło: https://arxiv.org/pdf/2409.10889v1

DeepFaceLive nie jest w stanie symulować rozmycia spowodowanego przez drgania kamery. Źródło: https://arxiv.org/pdf/2409.10889v1

Wyniki testów na własnym zestawie danych (ponieważ nie istnieją żadne zestawy danych zawierające aktywne drgania kamery) wykazały, że SFake przewyższa konkurencyjne metody wykrywania fałszywych wideokonferencji, nawet w trudnych warunkach, takich jak naturalny ruch ręki, który występuje, gdy osoba na wideokonferencji trzyma kamerę w ręku, zamiast używać statywu.

Rosnące zapotrzebowanie na wykrywanie fałszywych wideokonferencji

Badania nad wykrywaniem fałszywych wideokonferencji zwiększyły się ostatnio. W następstwie kilku lat udanych ataków na wideokonferencje z użyciem głosu, wcześniej tego roku pracownik finansowy został oszukany i przekonał do przekazania 25 milionów dolarów na konto oszusta, który podszywał się pod dyrektora finansowego w fałszywej wideokonferencji.

Chociaż system tego rodzaju wymaga wysokiego poziomu dostępu do sprzętu, wielu użytkowników smartfonów jest już przyzwyczajonych do usług weryfikacji finansowych i innych, które proszą o nagranie cech twarzy w celu uwierzytelnienia (co jest nawet częścią procesu weryfikacji na LinkedIn).

Wygląda na to, że takie metody będą coraz częściej stosowane w systemach wideokonferencyjnych, ponieważ tego rodzaju przestępstwa będą nadal pojawiać się w nagłówkach.

Większość rozwiązań, które zajmują się fałszywymi wideokonferencjami w czasie rzeczywistym, zakłada statyczną sytuację, w której komunikujący się używa stacjonarnej kamery internetowej, a nie spodziewa się ruchu ani nadmiernych zmian środowiskowych lub oświetleniowych. Rozmowa przez smartphone nie oferuje takiej “stałej” sytuacji.

Zamiast tego SFake wykorzystuje szereg metod wykrywania, aby zrekompensować wysoką liczbę wariantów wizualnych w wideokonferencji z użyciem smartfona, i wydaje się, że jest to pierwszy projekt badawczy, który zajmuje się tym problemem za pomocą standardowego sprzętu wibrującego wbudowanego w smartfony.

Artykuł artykuł nosi tytuł Shaking the Fake: Detecting Deepfake Videos in Real Time via Active Probes, i pochodzi od dwóch badaczy z Nanyang Technological University w Singapurze.

Metoda

SFake został zaprojektowany jako usługa oparta na chmurze, gdzie lokalna aplikacja wysyła dane do usługi API, a wyniki są zwracane.

Jednak jego niewielki rozmiar (450 MB) i zoptymalizowana metodyka pozwalają na przetwarzanie wykrywania fałszywych wideokonferencji całkowicie na urządzeniu, w przypadkach, gdy połączenie sieciowe może spowodować nadmierne kompresowanie wysyłanych obrazów, wpływając na proces diagnostyczny.

Uruchamianie “wszystkiego lokalnie” w ten sposób oznacza, że system miałby bezpośredni dostęp do strumienia kamery użytkownika, bez kodera often associated z wideokonferencjami.

Średni czas analizy wymaga próbki wideo o długości 4 sekund, podczas której użytkownik jest proszony o pozostanie nieruchomo, a SFake wysyła “sondy” w celu spowodowania wibracji kamery w wybranych, losowych interwałach, których systemy takie jak DeepFaceLive nie są w stanie odpowiednio szybko zareagować.

(Powinno się ponownie podkreślić, że każdy atak, który nie zawiera rozmycia w zbiorze danych szkoleniowych, jest mało prawdopodobny, aby mógł wygenerować model, który może generować rozmycie, nawet w znacznie bardziej korzystnych okolicznościach, i że DeepFaceLive nie może po prostu “dodać” tej funkcjonalności do modelu wyszkolonego na niedostatecznie przygotowanym zbiorze danych)

System wybiera wybrane obszary twarzy jako potencjalne obszary zawierające fałszywe treści, wykluczając oczy i brwi (ponieważ mruganie i inne ruchy twarzy w tym obszarze są poza zakresem wykrywania rozmycia i nie są idealnymi wskaźnikami).

Konceptualny schemat SFake.

Konceptualny schemat SFake.

Jak widać na powyższym schemacie konceptualnym, po wybraniu odpowiednich i nieprzewidywalnych wzorów wibracji, ustaleniu najlepszej długości ogniskowej i wykonaniu rozpoznania twarzy (w tym wykrywania punktów orientacyjnych za pomocą komponentu Dlib, który szacuje standardowe 68 punktów orientacyjnych twarzy), SFake wyznacza gradienty z wejściowej twarzy i koncentruje się na wybranych obszarach tych gradientów.

Ciąg zmienności jest uzyskiwany przez sekwencyjną analizę każdego klatki w krótkim klipie poddanym badaniu, aż do uzyskania średniej lub “idealnej” sekwencji, a reszta jest ignorowana.

To zapewnia wyodrębnione cechy, które mogą być użyte jako miara prawdopodobieństwa zawartości fałszywej, na podstawie wyszkolonej bazy danych (o której więcej za chwilę).

System wymaga rozdzielczości obrazu 1920×1080 pikseli, a także co najmniej 2-krotnego powiększenia obiektywu. Artykuł zauważa, że takie rozdzielczości (i nawet wyższe) są obsługiwane w Microsoft Teams, Skype, Zoom i Tencent Meeting.

Większość smartfonów ma kamerę przednią i tylną, a często tylko jedna z nich ma możliwości powiększania wymagane przez SFake; aplikacja wymagałaby więc od komunikującego się użycia kamery, która spełnia te wymagania.

Celem jest uzyskanie poprawnej proporcji twarzy użytkownika w strumieniu wideo, który system będzie analizował. Artykuł obserwuje, że średnia odległość, z której kobiety używają urządzeń mobilnych, wynosi 34,7 cm, a dla mężczyzn 38,2 cm (jak zgłoszono w Journal of Optometry), i że SFake działa bardzo dobrze na tych odległościach.

Ponieważ stabilizacja jest problemem w przypadku wideokonferencji z ręki, a rozmycie, które występuje z ruchu ręki, jest przeszkodą w funkcjonowaniu SFake, badacze próbowali kilku metod, aby temu przeciwdziałać. Najbardziej skuteczna z nich była obliczanie centralnego punktu oszacowanych punktów orientacyjnych i użycie go jako ” kotwicy” – efektywnie technika stabilizacji algorytmicznej. Za pomocą tej metody uzyskano dokładność 92%.

Dane i testy

Ponieważ nie istniały odpowiednie zestawy danych do tego celu, badacze stworzyli własne:

‘[Użyliśmy] 8 różnych marek smartfonów, aby nagrać 15 uczestników różnych płci i wieku, aby zbudować własny zestaw danych. Umieściliśmy smartphone na podstawce 20 cm od uczestnika i powiększyliśmy dwukrotnie, celując w twarz uczestnika, aby objąć wszystkie jego cechy twarzy, podczas gdy wibrował smartphone w różnych wzorach.

‘Dla telefonów, których przednie kamery nie mogą powiększać, użyliśmy kamer tylnych jako zamienników. Nagraliśmy 150 długich filmów, każdy o długości 20 sekund. Domyślnie założyliśmy, że okres wykrywania trwa 4 sekundy. Wycięliśmy 10 klipów o długości 4 sekund z jednego długiego filmu, losowo wybierając czas startu. W ten sposób uzyskaliśmy łącznie 1500 prawdziwych klipów, każdy o długości 4 sekund.’

Chociaż DeepFaceLive (link do GitHub) był głównym celem badania, ponieważ jest obecnie najczęściej używanym otwartym systemem live deepfaking, badacze uwzględnili cztery inne metody, aby wyszkolić swój podstawowy model wykrywania: Hififace; FS-GANV2; RemakerAI; i MobileFaceSwap – ten ostatni był szczególnie odpowiednim wyborem, biorąc pod uwagę docelowe środowisko.

1500 fałszywych filmów zostało użytych do szkolenia, wraz z równą liczbą prawdziwych i niezmienionych filmów.

SFake został przetestowany wobec kilku różnych klasyfikatorów, w tym SBI; FaceAF; CnnDetect; LRNet; DefakeHop variants; i bezpłatną usługę wykrywania fałszywych filmów online Deepaware. Dla każdej z tych metod fałszywych filmów 1500 fałszywych i 1500 prawdziwych filmów zostało wyszkolonych.

Dla podstawowego klasyfikatora testowego użyto prostej sieci neuronowej dwuwarstwowej z funkcją aktywacji ReLU. 1000 prawdziwych i 1000 fałszywych filmów zostało wybranych losowo (chociaż fałszywe filmy były wyłącznie przykładami DeepFaceLive).

Obszar pod krzywą charakterystyki odbiorcy (AUC/AUROC) i dokładność (ACC) zostały użyte jako metryki.

Dla szkolenia i wnioskowania użyto NVIDIA RTX 3060, a testy zostały przeprowadzone pod Ubuntu. Filmy testowe zostały nagrane za pomocą Xiaomi Redmi 10x, Xiaomi Redmi K50, OPPO Find x6, Huawei Nova9, Xiaomi 14 Ultra, Honor 20, Google Pixel 6a i Huawei P60.

Aby dostosować się do istniejących metod wykrywania, testy zostały zaimplementowane w PyTorch. Główne wyniki testów są ilustrowane w poniższej tabeli:

Wyniki dla SFake w porównaniu z innymi metodami.

Wyniki dla SFake w porównaniu z innymi metodami.

Tutaj autorzy komentują:

‘We wszystkich przypadkach dokładność wykrywania SFake przekroczyła 95%. Spośród pięciu algorytmów fałszywych filmów, z wyjątkiem Hififace, SFake działa lepiej przeciwko innym algorytmom fałszywych filmów niż inne sześć metod wykrywania. Ponieważ nasz klasyfikator został wyszkolony przy użyciu fałszywych obrazów wygenerowanych przez DeepFaceLive, osiąga najwyższy wskaźnik dokładności 98,8% przy wykrywaniu DeepFaceLive.

‘Kiedy mamy do czynienia z fałszywymi twarzami wygenerowanymi przez RemakerAI, inne metody wykrywania działają słabo. Spekulujemy, że może to być spowodowane automatycznym kompresowaniem filmów podczas pobierania z Internetu, co powoduje utratę szczegółów obrazu i tym samym obniża dokładność wykrywania. Jednak to nie wpływa na wykrywanie przez SFake, które osiąga dokładność 96,8% przy wykrywaniu RemakerAI.’

Autorzy zauważają ponadto, że SFake jest najbardziej efektywnym systemem w scenariuszu, w którym zastosowano 2-krotne powiększenie obiektywu, ponieważ to powiększenie ruchu jest niezwykle trudnym wyzwaniem. Nawet w tej sytuacji SFake był w stanie osiągnąć dokładność rozpoznawania 84% i 83%, odpowiednio dla 2,5 i 3 krotnego powiększenia.

Wnioski

Projekt, który wykorzystuje słabości systemu live deepfaking przeciwko sobie, to świeży pomysł w roku, w którym wykrywanie fałszywych wideokonferencji zostało zdominowane przez artykuły, które po prostu wymieszały stare podejścia wokół analizy częstotliwości (co jest daleko od odporności na innowacje w przestrzeni fałszywych filmów).

Na koniec 2022 roku inny system wykorzystywał zmiany jasności monitora jako hak wykrywania; i w tym samym roku moja własna demonstracja niezdolności DeepFaceLive do radzenia sobie z trudnymi widokami bocznymi zyskała pewne zainteresowanie społeczności.

DeepFaceLive jest odpowiednim celem dla takiego projektu, ponieważ jest prawdopodobnie celem zainteresowania przestępczego w odniesieniu do oszustw wideokonferencyjnych.

Jednak ostatnio zauważyłem pewne anegdotyczne dowody, że system LivePortrait, który jest obecnie bardzo popularny w społeczności VFX, radzi sobie lepiej z widokami bocznymi niż DeepFaceLive; byłoby interesujące, gdyby mógł być uwzględniony w tym badaniu.

 

Pierwotnie opublikowane we wtorek, 24 września 2024

Pisarz na temat uczenia maszynowego, specjalista w dziedzinie syntezy obrazu ludzkiego. Były kierownik treści badawczych w Metaphysic.ai, do czasu jego rozwiązania w DNEG's Brahma.ai.
Strona portfelowo: martinanderson.ai
Kontakt: [email protected]