Modely a platformy AI
Jak AI dělá rozpoznávání znakového jazyka přesnější než kdykoli předtím

Když přemýšlíme o překonání komunikačních bariér, často se soustředíme na aplikace pro překlad jazyků nebo hlasové asistenty. Ale pro miliony lidí, kteří používají znakový jazyk, tyto nástroje ještě úplně nepřebírají mezeru. Znakový jazyk není jen o pohybech rukou – je to bohatý, komplexní způsob komunikace, který zahrnuje i mimiku a jazyk těla, přičemž každý prvek nese zásadní význam.
To, co dělá tuto výzvu besonders náročnou, je skutečnost, že znakové jazyky po celém světě se liší fundamentálně v tom, jak přenášejí význam. Americký znakový jazyk (ASL), například, má svou vlastní jedinečnou gramatiku a syntax, která se neshoduje se spisovnou angličtinou.
Tato složitost znamená, že vytváření technologie pro rozpoznávání a překlad znakového jazyka v reálném čase vyžaduje pochopení celého jazykového systému v pohybu.
Nový přístup k rozpoznávání
Tady je místo, kde tým na Floridské atlantické univerzitě (FAU) v College of Engineering and Computer Science rozhodl jít novou cestou. Místo toho, aby se snažili zvládnout celou složitost znakového jazyka najednou, soustředili se na zvládnutí kritického prvního kroku: rozpoznávání gest ASL abecedy s bezprecedentní přesností pomocí AI.
Představte si to jako učení počítače číst rukopis, ale ve třech rozměrech a v pohybu. Tým vytvořil něco pozoruhodného: dataset 29 820 statických obrazů znakových gest ASL. Ale oni pouze nesbírali obrázky. Označili každý obraz 21 klíčovými body na ruce, vytvářející detailní mapu toho, jak ruce pohybují a formují různé znaky.
Dr. Bader Alsharif, který vedl tuto výzkum jako doktorand, vysvětluje: “Tato metoda nebyla prozkoumána v předchozích výzkumech, což z ní činí novou a slibnou směr pro budoucí pokroky.”
Rozklad technologie
Pojďme se ponořit do kombinace technologií, které činí systém rozpoznávání znakového jazyka funkčním.
MediaPipe a YOLOv8
Magie se děje prostřednictvím bezproblémové integrace dvou mocných nástrojů: MediaPipe a YOLOv8. Představte si MediaPipe jako odborníka na sledování rukou – zkušeného tlumočníka znakového jazyka, který může sledovat každý jemný pohyb prstů a polohu ruky. Výzkumný tým zvolil MediaPipe speciálně pro jeho výjimečnou schopnost poskytovat přesné sledování klíčových bodů rukou, identifikující 21 přesných bodů na každé ruce, jak jsme zmínili výše.
Ale sledování nestačí – potřebujeme pochopit, co tyto pohyby znamenají. To je místo, kde YOLOv8 vstupuje do hry. YOLOv8 je odborník na rozpoznávání vzorců, který bere všechny tyto sledované body a určuje, který písmeno nebo gesto reprezentují. Výzkum ukazuje, že když YOLOv8 zpracovává obraz, rozdělí ho do S × S mřížky, přičemž každá buňka mřížky je zodpovědná za detekci objektů (v tomto případě gest rukou) v rámci svých hranic.

Alsharif et al., Franklin Open (2024)
Jak systém skutečně funguje
Proces je sofistikovanější, než by se na první pohled mohlo zdát.
Tady je, co se děje za scénou:
Fáze detekce ruky
Když provedete gesto, MediaPipe nejprve identifikuje vaši ruku v rámci a mapuje 21 klíčových bodů. Tyto body nejsou jen náhodné tečky – odpovídají specifickým kloubům a orientačním bodům na vaší ruce, od konečků prstů po základ palce.
Prostorová analýza
YOLOv8 poté bere tyto informace a analyzuje je v reálném čase. Pro každou buňku mřížky v obraze předpovídá:
- Pravděpodobnost přítomnosti gesta ruky
- Přesné souřadnice umístění gesta
- Skóre spolehlivosti jeho předpovědi
Klasifikace
Systém používá něco, co se nazývá “předpověď ohraničujícího rámečku” – představte si kreslení perfektního obdélníku kolem vašeho gesta ruky. YOLOv8 vypočítá pět zásadních hodnot pro každou buňku: x a y souřadnice pro střed, šířku, výšku a skóre spolehlivosti.

Alsharif et al., Franklin Open (2024)
Proč tato kombinace funguje tak dobře
Výzkumný tým zjistil, že kombinací těchto technologií vytvořili něco většího než součet jejich částí. Precizní sledování MediaPipe v kombinaci s pokročilým rozpoznáváním objektů YOLOv8 produkovalo pozoruhodně přesné výsledky – mluvíme o 98% přesnosti a 99% F1 skóre.
Co dělá tuto kombinaci besonders působivou, je to, jak systém zvládá složitost znakového jazyka. Některé znaky mohou vypadat velmi podobně pro neškolené oči, ale systém může rozpoznat jemné rozdíly.
Rekordní výsledky
Když výzkumníci vyvíjejí novou technologii, vždy se ptají: “Jak dobře to vlastně funguje?” Pro tento systém rozpoznávání znakového jazyka jsou výsledky působivé.
Tým z FAU podrobil svůj systém přísnému testování, a tady jsou výsledky:
- Systém správně identifikuje znaky 98% času
- Chytá 98% všech znaků provedených před ním
- Celkové hodnocení dosahuje působivých 99%
“Výsledky našeho výzkumu demonstrují schopnost našeho modelu přesně detekovat a klasifikovat gesta amerického znakového jazyka s velmi málo chybami,” vysvětluje Alsharif.
Systém funguje dobře v každodenních situacích – různé osvětlení, různé polohy rukou a dokonce i s různými lidmi, kteří znakový jazyk používají.
Tento průlom posouvá hranice toho, co je možné v rozpoznávání znakového jazyka. Předchozí systémy měly potíže s přesností, ale kombinací sledování rukou MediaPipe a detekčních schopností YOLOv8 vytvořil výzkumný tým něco zvláštního.
“Úspěch tohoto modelu je largely způsoben pečlivou integrací přenosného učení, důkladným vytvořením datasetu a přesným laděním,” říká Mohammad Ilyas, jeden z autorů studie. Tato pozornost k detailu se vyplatila ve výkonu systému.
Co to znamená pro komunikaci
Úspěch tohoto systému otevírá zajímavé možnosti pro zpřístupnění komunikace a zajištění její dostupnosti.
Tým nezastaví na pouhém rozpoznávání písmen. Další velkou výzvou je naučit systém chápat ještě širší rozsah tvarů a gest rukou. Představte si ty okamžiky, kdy znaky vypadají téměř identicky – jako písmena “M” a “N” v znakovém jazyce. Výzkumníci pracují na tom, aby jejich systém lépe rozpoznal tyto jemné rozdíly. Jak říká Dr. Alsharif: “Důležité je, že výsledky této studie zdůrazňují nejen robustnost systému, ale také jeho potenciál pro praktické, reálné aplikace.”
Tým se nyní soustředí na:
- Zajištění toho, aby systém fungoval hladce na běžných zařízeních
- Učinění systému dostatečně rychlým pro reálné konverzace
- Zajištění toho, aby systém fungoval spolehlivě v jakémkoli prostředí
Děkan Stella Batalama z College of Engineering and Computer Science na FAU sdílí větší vizi: “Zlepšením rozpoznávání amerického znakového jazyka přispívá tato práce k vytváření nástrojů, které mohou vylepšit komunikaci pro neslyšící a těžce slyšící komunitu.”
Představte si, že vstupujete do ordinace lékaře nebo navštěvujete třídu, kde tato technologie mostí komunikační mezery okamžitě. To je skutečný cíl zde – činění každodenních interakcí hladšími a přirozenějšími pro všechny zúčastněné. Je to vytváření technologie, která skutečně pomáhá lidem spojit se. Bez ohledu na to, zda je to ve vzdělávání, zdravotnictví nebo každodenních konverzacích, tento systém představuje krok směrem ke světu, kde komunikační bariéry stále menší.












