Modele i platformy AI

Jak AI sprawia, że rozpoznawanie języka migowego jest bardziej precyzyjne niż kiedykolwiek

mm
Dodaj Unite.AI do preferowanych źródeł w Google

Gdy myślimy o przełamywaniu barier komunikacyjnych, często koncentrujemy się na aplikacjach do tłumaczenia języka lub asystentach głosowych. Ale dla milionów osób używających języka migowego te narzędzia nie całkowicie zlikwidowały przepaść. Język migowy to nie tylko ruchy rąk – jest to bogaty, złożony sposób komunikacji, który obejmuje wyrażenia twarzy i język ciała, każdy element niosący istotne znaczenie.

To, co sprawia, że jest to szczególnie wyzwaniem, polega na tym, że w przeciwieństwie do języków mówionych, które głównie różnią się słownictwem i gramatyką, języki migowe na całym świecie różnią się fundamentalnie w sposobie przekazywania znaczenia. Na przykład amerykański język migowy (ASL) ma własną unikalną gramatykę i składnię, która nie odpowiada językowi angielskiemu.

Ta złożoność oznacza, że tworzenie technologii do rozpoznawania i tłumaczenia języka migowego w czasie rzeczywistym wymaga zrozumienia całego systemu językowego w ruchu.

Nowe podejście do rozpoznawania

To właśnie tutaj zespół na Florida Atlantic University’s (FAU) College of Engineering and Computer Science zdecydował się podjąć nowe podejście. Zamiast próbować rozwiązać całą złożoność języka migowego na raz, skoncentrowali się na opanowaniu pierwszego, kluczowego kroku: rozpoznawaniu gestów alfabetu ASL z bezprecedensową dokładnością za pomocą AI.

Wyobraź sobie, że uczysz komputer, aby czytał pismo ręczne, ale w trzech wymiarach i w ruchu. Zespół stworzył coś niezwykłego: zestaw danych 29 820 statycznych obrazów pokazujących gesty rąk ASL. Ale nie tylko zebrali zdjęcia. Oznaczyli każde zdjęcie 21 kluczowymi punktami na ręku, tworząc szczegółową mapę, jak ręce poruszają się i formują różne znaki.

Dr Bader Alsharif, który kierował tym badaniem jako kandydat na stopień doktora, wyjaśnia: “Ta metoda nie była jeszcze badana w poprzednich badaniach, co sprawia, że jest to nowy i obiecujący kierunek dla przyszłych postępów”.

Rozbicie technologii

Przejdźmy do połączenia technologii, które sprawiają, że system rozpoznawania języka migowego działa.

MediaPipe i YOLOv8

Cuda dzieją się dzięki bezproblemowej integracji dwóch potężnych narzędzi: MediaPipe i YOLOv8. Wyobraź sobie MediaPipe jako eksperta od obserwacji rąk – wykwalifikowanego tłumacza języka migowego, który może śledzić każdy subtelny ruch palców i położenie ręki. Zespół badawczy wybrał MediaPipe specjalnie ze względu na jego wyjątkową zdolność do śledzenia punktów odniesienia rąk, identyfikując 21 precyzyjnych punktów na każdej ręce, o czym już wspomnieliśmy.

Ale śledzenie to nie wszystko – musimy zrozumieć, co te ruchy znaczą. To właśnie tutaj pojawia się YOLOv8. YOLOv8 to ekspert od rozpoznawania wzorców, który bierze wszystkie te śledzone punkty i stwierdza, jaki litera lub gest je reprezentuje. Badania pokazują, że gdy YOLOv8 przetwarza obraz, dzieli go na siatkę S × S, przy czym każda komórka siatki jest odpowiedzialna za wykrywanie obiektów (w tym przypadku gestów rąk) w ramach swoich granic.

Alsharif et al., Franklin Open (2024)

Jak system naprawdę działa

Proces jest bardziej złożony, niż się może wydawać na pierwszy rzut oka.

Oto, co dzieje się za kulisami:

Etapa wykrywania rąk

Gdy wykonujesz znak, MediaPipe najpierw identyfikuje Twoją rękę w kadrze i mapuje te 21 kluczowe punkty. Nie są to tylko losowe kropki – odpowiadają one konkretnym stawom i punktom odniesienia na Twojej ręce, od czubków palców do podstawy dłoni.

Analiza przestrzenna

YOLOv8 następnie bierze te informacje i analizuje je w czasie rzeczywistym. Dla każdej komórki siatki w obrazie przewiduje:

  • Prawdopodobieństwo wystąpienia gestu rąk
  • Dokładne współrzędne położenia gestu
  • Wynik ufności jego przewidywania

Klasyfikacja

System wykorzystuje tzw. predykcję prostokąta ograniczającego – wyobraź sobie, że rysujesz idealny prostokąt wokół Twojego gestu rąk. YOLOv8 oblicza pięć kluczowych wartości dla każdego prostokąta: współrzędne x i y dla centrum, szerokość, wysokość i wynik ufności.

Alsharif et al., Franklin Open (2024)

Dlaczego to połączenie działa tak dobrze

Zespół badawczy odkrył, że łącząc te technologie, stworzyli coś, co jest większe niż suma ich części. Dokładne śledzenie MediaPipe w połączeniu z zaawansowanym wykrywaniem obiektów YOLOv8 dało niezwykle dokładne wyniki – mówimy o dokładności 98% i wyniku F1 99%.

To, co sprawia, że jest to szczególnie imponujące, to sposób, w jaki system radzi sobie z złożonością języka migowego. Niektóre znaki mogą wyglądać bardzo podobnie dla nieprzeszkolonych oczu, ale system może dostrzec subtelne różnice.

Rekordowe wyniki

Gdy badacze rozwijają nową technologię, zawsze pojawia się pytanie: “Jak dobrze to naprawdę działa?” Dla tego systemu rozpoznawania języka migowego wyniki są imponujące.

Zespół z FAU przetestował swój system, i oto, co znaleźli:

  • System poprawnie identyfikuje znaki 98% czasu
  • Lapie 98% wszystkich znaków wykonanych przed nim
  • Ogólny wynik wynosi imponujące 99%

“Wyniki naszych badań pokazują, że nasz model jest w stanie dokładnie wykryć i sklasyfikować gesty języka migowego z bardzo niewielką ilością błędów”, wyjaśnia Alsharif.

System działa dobrze w sytuacjach codziennych – różne oświetlenie, różne położenia rąk i nawet z różnymi osobami wykonującymi znaki.

To przełomowe osiągnięcie posuwa granice tego, co jest możliwe w rozpoznawaniu języka migowego. Poprzednie systemy miały trudności z dokładnością, ale łącząc śledzenie rąk MediaPipe z możliwościami wykrywania YOLOv8, zespół badawczy stworzył coś wyjątkowego.

“Sukces tego modelu jest w dużej mierze wynikiem starannej integracji, starannego tworzenia zbioru danych i dokładnego dostrojenia”, mówi Mohammad Ilyas, jeden z współautorów badania. Ta uwaga do szczegółów opłaciła się w niezwykłym wyniku systemu.

Co to oznacza dla komunikacji

Sukces tego systemu otwiera przed nami ekscytujące możliwości, aby uczynić komunikację bardziej dostępną i inkluzywną.

Zespół nie zatrzymuje się na rozpoznawaniu liter. Kolejnym wielkim wyzwaniem jest nauczenie systemu, aby zrozumiał jeszcze szerszy zakres kształtów i gestów rąk. Wyobraź sobie te momenty, kiedy znaki wyglądają prawie identycznie – jak litery “M” i “N” w języku migowym. Badacze pracują nad tym, aby ich system jeszcze lepiej rozróżniał te subtelne różnice. Jak mówi dr Alsharif: “Co ważne, wyniki tego badania podkreślają nie tylko solidność systemu, ale także jego potencjał do zastosowania w praktycznych, rzeczywistych aplikacjach”.

Zespół koncentruje się obecnie na:

  • Uzyskaniu, aby system działał gładko na zwykłych urządzeniach
  • Zrobieniu go wystarczająco szybkim dla rozmów w świecie rzeczywistym
  • Upewnieniu się, że działa niezawodnie w każdym środowisku

Dziekan Stella Batalama z College of Engineering and Computer Science na FAU dzieli się większą wizją: “Poprawiając rozpoznawanie amerykańskiego języka migowego, ta praca przyczynia się do tworzenia narzędzi, które mogą poprawić komunikację dla społeczności głuchych i słabosłyszących”.

Wyobraź sobie, że wchodzisz do gabinetu lekarskiego lub uczestniczysz w zajęciach, gdzie ta technologia mostkuje luki w komunikacji natychmiast. To jest prawdziwy cel tutaj – robienie codziennych interakcji bardziej gładkimi i naturalnymi dla wszystkich zaangażowanych. To tworzenie technologii, która naprawdę pomaga ludziom się łączyć. Niezależnie od tego, czy jest to edukacja, opieka zdrowotna czy codzienne rozmowy, ten system reprezentuje krok w stronę świata, w którym bariery komunikacyjne stają się coraz mniejsze.

Alex prowadzi operacje informacyjne zasilane AI w Unite.AI, łącząc dziennikarstwo, badania i automatyzację, aby wspierać terminowe i skalowalne relacjonowanie sztucznej inteligencji. Jego praca pomaga zapewnić, że nowe osiągnięcia w dziedzinie AI są prezentowane efektywnie, przy zachowaniu standardów redakcyjnych publikacji.