ModÃĻles et plateformes d’IA

Comment l’IA rend la reconnaissance de la langue des signes plus prÃĐcise que jamais

mm
Ajouter Unite.AI à vos sources prÃĐfÃĐrÃĐes sur Google

Lorsque nous pensons à briser les barriÃĻres de la communication, nous nous concentrons souvent sur les applications de traduction de langues ou les assistants vocaux. Mais pour des millions de personnes qui utilisent la langue des signes, ces outils n’ont pas encore comblÃĐ le fossÃĐ. La langue des signes n’est pas seulement une question de mouvements de mains – c’est une forme de communication riche et complexe qui inclut les expressions faciales et le langage corporel, chaque ÃĐlÃĐment portant un sens crucial.

Voici ce qui rend cela particuliÃĻrement difficile : contrairement aux langues parlÃĐes, qui varient principalement en vocabulaire et en grammaire, les langues des signes du monde entier diffÃĻrent fondamentalement dans la façon dont elles vÃĐhiculent le sens. La langue des signes amÃĐricaine (ASL), par exemple, a sa propre grammaire et sa propre syntaxe qui ne correspondent pas à l’anglais parlÃĐ.

Cette complexitÃĐ signifie que la crÃĐation d’une technologie pour reconnaÃŪtre et traduire la langue des signes en temps rÃĐel nÃĐcessite une comprÃĐhension d’un systÃĻme de langage entier en mouvement.

Une nouvelle approche de la reconnaissance

C’est là que l’ÃĐquipe de l’UniversitÃĐ de Floride Atlantique (FAU) a dÃĐcidÃĐ de prendre une approche fraÃŪche. Au lieu d’essayer de rÃĐsoudre toute la complexitÃĐ de la langue des signes d’un seul coup, ils se sont concentrÃĐs sur la maÃŪtrise d’une ÃĐtape cruciale : reconnaÃŪtre les gestes de l’alphabet ASL avec une prÃĐcision sans prÃĐcÃĐdent grÃĒce à l’IA.

Imaginez-vous en train d’enseigner à un ordinateur à lire l’ÃĐcriture manuscrite, mais en trois dimensions et en mouvement. L’ÃĐquipe a crÃĐÃĐ quelque chose de remarquable : une base de donnÃĐes de 29 820 images statiques montrant des gestes de mains ASL. Mais ils n’ont pas seulement collectÃĐ des images. Ils ont marquÃĐ chaque image avec 21 points clÃĐs sur la main, crÃĐant une carte dÃĐtaillÃĐe de la façon dont les mains bougent et forment diffÃĐrents signes.

Le Dr Bader Alsharif, qui a menÃĐ cette recherche en tant que candidat au doctorat, explique : ÂŦ Cette mÃĐthode n’a pas ÃĐtÃĐ explorÃĐe dans les recherches prÃĐcÃĐdentes, ce qui en fait une nouvelle et prometteuse direction pour les progrÃĻs futurs. Âŧ

DÃĐcortiquer la technologie

Plongeons dans la combinaison de technologies qui fait fonctionner le systÃĻme de reconnaissance de la langue des signes.

MediaPipe et YOLOv8

La magie se produit grÃĒce à l’intÃĐgration sans faille de deux outils puissants : MediaPipe et YOLOv8. Pensez à MediaPipe comme un expert en observation des mains – un interprÃĻte de langue des signes compÃĐtent qui peut suivre chaque mouvement subtil des doigts et chaque position de la main. L’ÃĐquipe de recherche a choisi MediaPipe spÃĐcifiquement pour sa capacitÃĐ exceptionnelle à fournir un suivi prÃĐcis des repÃĻres de la main, en identifiant 21 points prÃĐcis sur chaque main, comme mentionnÃĐ ci-dessus.

Mais le suivi ne suffit pas – nous devons comprendre ce que ces mouvements signifient. C’est là que YOLOv8 entre en jeu. YOLOv8 est un expert en reconnaissance de modÃĻles, prenant tous ces points suivis et dÃĐterminant quel lettre ou geste ils reprÃĐsentent. La recherche montre que lorsque YOLOv8 traite une image, il la divise en une grille S × S, chaque cellule de la grille ÃĐtant responsable de la dÃĐtection d’objets (dans ce cas, des gestes de mains) à l’intÃĐrieur de ses limites.

Alsharif et al., Franklin Open (2024)

Comment le systÃĻme fonctionne rÃĐellement

Le processus est plus sophistiquÃĐ qu’il n’y paraÃŪt à premiÃĻre vue.

Voici ce qui se passe derriÃĻre la scÃĻne :

Étape de dÃĐtection de la main

Lorsque vous faites un signe, MediaPipe identifie d’abord votre main dans le cadre et cartographie les 21 points clÃĐs. Ce ne sont pas juste des points alÃĐatoires – ils correspondent à des articulations et des repÃĻres spÃĐcifiques sur votre main, des doigts jusqu’à la base de la paume.

Analyse spatiale

YOLOv8 prend ensuite ces informations et les analyse en temps rÃĐel. Pour chaque cellule de la grille dans l’image, il prÃĐdit :

  • La probabilitÃĐ de la prÃĐsence d’un geste de main
  • Les coordonnÃĐes prÃĐcises de l’emplacement du geste
  • Le score de confiance de sa prÃĐdiction

Classification

Le systÃĻme utilise quelque chose appelÃĐ ÂŦ prÃĐdiction de boÃŪte de dÃĐlimitation Âŧ – imaginez dessiner un rectangle parfait autour de votre geste de main. YOLOv8 calcule cinq valeurs cruciales pour chaque boÃŪte : les coordonnÃĐes x et y du centre, la largeur, la hauteur et un score de confiance.

Alsharif et al., Franklin Open (2024)

Pourquoi cette combinaison fonctionne si bien

L’ÃĐquipe de recherche a dÃĐcouvert que, en combinant ces technologies, ils ont crÃĐÃĐ quelque chose de plus grand que la somme de ses parties. Le suivi prÃĐcis de MediaPipe combinÃĐ Ã  la dÃĐtection d’objets avancÃĐe de YOLOv8 a produit des rÃĐsultats remarquablement prÃĐcis – nous parlons d’un taux de prÃĐcision de 98 % et d’un score F1 de 99 %.

Ce qui rend cela particuliÃĻrement impressionnant, c’est la façon dont le systÃĻme gÃĻre la complexitÃĐ de la langue des signes. Certains signes peuvent sembler trÃĻs similaires aux yeux non formÃĐs, mais le systÃĻme peut repÃĐrer des diffÃĐrences subtiles.

RÃĐsultats record

Lorsque les chercheurs dÃĐveloppent de nouvelles technologies, la grande question est toujours : ÂŦ Comment ça fonctionne rÃĐellement ? Âŧ Pour ce systÃĻme de reconnaissance de la langue des signes, les rÃĐsultats sont impressionnants.

L’ÃĐquipe de la FAU a soumis leur systÃĻme à des tests rigoureux, et voici ce qu’ils ont trouvÃĐ :

  • Le systÃĻme identifie correctement les signes 98 % du temps
  • Il dÃĐtecte 98 % de tous les signes faits devant lui
  • Le score de performance global atteint un impressionnant 99 %

ÂŦ Les rÃĐsultats de notre recherche dÃĐmontrent la capacitÃĐ de notre modÃĻle à dÃĐtecter et à classifier avec prÃĐcision les gestes de la langue des signes amÃĐricaine avec trÃĻs peu d’erreurs Âŧ, explique Alsharif.

Le systÃĻme fonctionne bien dans des situations quotidiennes – diffÃĐrentes lumiÃĻres, positions de main variÃĐes et mÊme avec diffÃĐrentes personnes qui font des signes.

Cette percÃĐe pousse les limites de ce qui est possible dans la reconnaissance de la langue des signes. Les systÃĻmes prÃĐcÃĐdents ont luttÃĐ pour l’exactitude, mais en combinant le suivi des mains de MediaPipe avec les capacitÃĐs de dÃĐtection de YOLOv8, l’ÃĐquipe de recherche a crÃĐÃĐ quelque chose de spÃĐcial.

ÂŦ Le succÃĻs de ce modÃĻle est largement dÃŧ à l’intÃĐgration soigneuse de l’apprentissage de transfert, à la crÃĐation mÃĐticuleuse de la base de donnÃĐes et au rÃĐglage prÃĐcis Âŧ, dÃĐclare Mohammad Ilyas, l’un des co-auteurs de l’ÃĐtude. Cette attention aux dÃĐtails a payÃĐ en termes de performance remarquable du systÃĻme.

Ce que cela signifie pour la communication

Le succÃĻs de ce systÃĻme ouvre des possibilitÃĐs excitantes pour rendre la communication plus accessible et plus inclusive.

L’ÃĐquipe ne s’arrÊte pas à la reconnaissance des lettres. Le prochain grand dÃĐfi est d’enseigner au systÃĻme à comprendre un ÃĐventail encore plus large de formes de mains et de gestes. Pensez à ces moments oÃđ les signes semblent presque identiques – comme les lettres ÂŦ M Âŧ et ÂŦ N Âŧ en langue des signes. Les chercheurs travaillent à aider leur systÃĻme à repÃĐrer ces diffÃĐrences subtiles encore mieux. Comme le dit le Dr Alsharif : ÂŦ Il est important de noter que les rÃĐsultats de cette ÃĐtude soulignent non seulement la robustesse du systÃĻme, mais ÃĐgalement son potentiel à Être utilisÃĐ dans des applications pratiques et en temps rÃĐel. Âŧ

L’ÃĐquipe se concentre maintenant sur :

  • Faire fonctionner le systÃĻme sur des appareils rÃĐguliers
  • Le rendre suffisamment rapide pour des conversations en temps rÃĐel
  • S’assurer qu’il fonctionne de maniÃĻre fiable dans n’importe quel environnement

Le doyen Stella Batalama de la facultÃĐ d’ingÃĐnierie et de sciences informatiques de la FAU partage la vision plus large : ÂŦ En amÃĐliorant la reconnaissance de la langue des signes amÃĐricaine, ce travail contribue à la crÃĐation d’outils qui peuvent amÃĐliorer la communication pour la communautÃĐ sourde et malentendante. Âŧ

Imaginez que vous entrez dans un cabinet mÃĐdical ou que vous assistez à un cours oÃđ cette technologie comble les lacunes de communication instantanÃĐment. C’est l’objectif rÃĐel ici – rendre les interactions quotidiennes plus fluides et plus naturelles pour tous les participants. C’est crÃĐer une technologie qui aide rÃĐellement les gens à se connecter. Que ce soit dans l’ÃĐducation, les soins de santÃĐ ou les conversations quotidiennes, ce systÃĻme reprÃĐsente un pas vers un monde oÃđ les barriÃĻres de la communication continuent de diminuer.

Alex McFarland est un journaliste et ÃĐcrivain en intelligence artificielle qui explore les derniers dÃĐveloppements en intelligence artificielle. Il a collaborÃĐ avec de nombreuses startups et publications en intelligence artificielle dans le monde entier.