Modele și platforme AI

Cum IA face recunoașterea limbajului semnelor mai precisă ca niciodată

mm
Adaugă Unite.AI la sursele tale preferate pe Google

Când ne gândim la înlăturarea barierelor de comunicare, ne concentrăm adesea pe aplicații de traducere a limbajelor sau asistenți vocali. Dar pentru milioanele de persoane care utilizează limbajul semnelor, aceste instrumente nu au reușit să acopere complet decalajul. Limbajul semnelor nu este doar despre mișcări ale mâinilor – este o formă bogată și complexă de comunicare care include expresii faciale și limbajul corpului, fiecare element purtând un sens crucial.

Aici se află ceea ce face această sarcină deosebit de dificilă: în timp ce limbile vorbite se diferențiază în principal prin vocabular și gramatică, limbajele semnelor din întreaga lume diferă fundamental în modul în care transmit sensul. De exemplu, Limbajul Semnelor Americane (ASL) are propria sa gramatică și sintaxă unică, care nu se potrivește cu limba engleză vorbită.

Această complexitate înseamnă că crearea tehnologiei pentru a recunoaște și traduce limbajul semnelor în timp real necesită o înțelegere a întregului sistem de limbă în mișcare.

O Abordare Nouă a Recunoașterii

Aici intervine echipa de la Universitatea Florida Atlantic (FAU), Colegiul de Inginerie și Științe Computaționale, care a decis să abordeze problema dintr-un punct de vedere proaspăt. În loc să încerce să rezolve întreaga complexitate a limbajului semnelor deodată, s-au concentrat pe stăpânirea unui prim pas crucial: recunoașterea gesturilor alfabetului ASL cu o acuratețe fără precedent, utilizând inteligența artificială.

Gândiți-vă la aceasta ca la învățarea unui computer să citească scrisul de mână, dar în trei dimensiuni și în mișcare. Echipa a creat ceva remarcabil: o bază de date cu 29.820 de imagini statice care arată gesturi ale mâinilor în ASL. Dar nu au colectat doar poze. Au marcat fiecare imagine cu 21 de puncte cheie pe mână, creând o hartă detaliată a modului în care mâinile se mișcă și formează diferite semne.

Dr. Bader Alsharif, care a condus această cercetare ca doctorand, explică: “Această metodă nu a fost explorată în cercetările anterioare, făcând-o o direcție nouă și promițătoare pentru viitoarele avansări.”

Descompunerea Tehnologiei

Hățișul tehnologic care face ca sistemul de recunoaștere a limbajului semnelor să funcționeze este o combinație de tehnologii puternice.

MediaPipe și YOLOv8

Magia se întâmplă prin integrarea fără cusur a două instrumente puternice: MediaPipe și YOLOv8. Gândiți-vă la MediaPipe ca la un expert în urmărirea mâinilor – un interpret priceput al limbajului semnelor care poate urmări fiecare mișcare subtilă a degetelor și poziția mâinii. Echipa de cercetare a ales MediaPipe în special pentru capacitatea sa excepțională de a oferi urmărirea precisă a punctelor de reper ale mâinii, identificând 21 de puncte precise pe fiecare mână, așa cum am menționat mai sus.

Dar urmărirea nu este suficientă – avem nevoie să înțelegem ce înseamnă aceste mișcări. Aici intervine YOLOv8. YOLOv8 este un expert în recunoașterea modelelor, care ia toate punctele urmărite și determină care literă sau gest reprezintă. Cercetarea arată că atunci când YOLOv8 procesează o imagine, o împarte într-o grilă S × S, cu fiecare celulă a grilei responsabilă pentru detectarea obiectelor (în acest caz, gesturi ale mâinilor) din interiorul limitelor sale.

Alsharif et al., Franklin Open (2024)

Cum Funcționează Sistemul în Realitate

Procesul este mai sofisticat decât pare la prima vedere.

Iată ce se întâmplă în spatele cortinei:

Etapa de Detectare a Mâinii

Când faceți un semn, MediaPipe identifică mai întâi mâna în cadru și creează o hartă a celor 21 de puncte cheie. Acestea nu sunt doar puncte aleatoare – corespund unor articulații și puncte de reper specifice pe mână, de la vârfurile degetelor până la baza palmei.

Analiză Spațială

YOLOv8 ia apoi aceste informații și le analizează în timp real. Pentru fiecare celulă a grilei din imagine, prezice:

  • Probabilitatea prezenței unui gest al mâinii
  • Coordonatele precise ale poziției gestului
  • Punctajul de încredere al prezicerii sale

Clasificare

Sistemul utilizează o tehnică numită “prezicere a cutiei delimitatoare” – imaginați-vă desenând un dreptunghi perfect în jurul gestului mâinii. YOLOv8 calculează cinci valori cheie pentru fiecare cutie: coordonatele x și y pentru centru, lățime, înălțime și un punctaj de încredere.

Alsharif et al., Franklin Open (2024)

De Ce Această Combinație Funcționează Atât de Bine

Echipa de cercetare a descoperit că, combinând aceste tehnologii, au creat ceva mai mare decât suma părților sale. Urmărirea precisă a MediaPipe, combinată cu detectarea avansată a obiectelor YOLOv8, a produs rezultate remarcabil de precise – vorbim despre o rată de precizie de 98% și un punctaj F1 de 99%.

Ceea ce face această realizare deosebit de impresionantă este modul în care sistemul gestionează complexitatea limbajului semnelor. Unele semne ar putea părea foarte asemănătoare pentru ochiul neantrenat, dar sistemul poate detecta diferențe subtile.

Rezultate Fără Precedent

Când cercetătorii dezvoltă tehnologii noi, întrebarea mare este întotdeauna: “Cum de fapt funcționează?” Pentru acest sistem de recunoaștere a limbajului semnelor, rezultatele sunt impresionante.

Echipa de la FAU a supus sistemul la teste riguroase și iată ce au găsit:

  • Sistemul identifică corect semnele în 98% din cazuri
  • Prinde 98% din toate semnele făcute în fața lui
  • Punctajul general de performanță atinge un impresionant 99%

“Rezultatele cercetării noastre demonstrează capacitatea modelului nostru de a detecta și clasifica gesturile limbajului semnelor americane cu foarte puține erori,” explică Alsharif.

Sistemul funcționează bine în situații de zi cu zi – diferite condiții de iluminare, diverse poziții ale mâinilor și chiar cu diferiți oameni care fac semne.

Această realizare împinge limitele a ceea ce este posibil în recunoașterea limbajului semnelor. Sistemele anterioare au luptat cu acuratețea, dar prin combinarea urmăririi mâinilor MediaPipe cu capacitățile de detectare YOLOv8, echipa de cercetare a creat ceva special.

“Succesul acestui model se datorează în mare măsură integrării atente a învățării transferate, creării meticuloase a bazei de date și reglării precise,” spune Mohammad Ilyas, unul dintre coautorii studiului. Această atenție la detalii s-a concretizat în performanța remarcabilă a sistemului.

Ce Înseamnă Acest Lucru pentru Comunicare

Succesul acestui sistem deschide perspective interesante pentru a face comunicarea mai accesibilă și incluzivă.

Echipa nu se oprește la recunoașterea literelor. Următoarea mare provocare este învățarea sistemului să înțeleagă un spectru și mai larg de forme și gesturi ale mâinilor. Gândiți-vă la acele momente în care semnele par aproape identice – precum literele ‘M’ și ‘N’ în limbajul semnelor. Cercetătorii lucrează pentru a ajuta sistemul să prindă aceste diferențe subtile și mai bine. Așa cum spune Dr. Alsharif: “Este important de remarcat că rezultatele acestui studiu subliniază nu numai robustețea sistemului, ci și potențialul său de a fi utilizat în aplicații practice și în timp real.”

Echipa se concentrează acum pe:

  • A face sistemul să funcționeze neted pe dispozitive obișnuite
  • A-l face suficient de rapid pentru conversații din lumea reală
  • A se asigura că funcționează fiabil în orice mediu

Decanul Stella Batalama de la Colegiul de Inginerie și Științe Computaționale al FAU împărtășește viziunea mai largă: “Prin îmbunătățirea recunoașterii limbajului semnelor americane, această lucrare contribuie la crearea unor instrumente care pot îmbunătăți comunicarea pentru comunitatea surdă și cu deficiențe de auz.”

Imaginați-vă intrând într-un cabinet medical sau participând la o clasă unde această tehnologie podidește instantaneu golurile de comunicare. Acesta este obiectivul real aici – făcând interacțiunile zilnice mai fluente și mai naturale pentru toată lumea implicată. Este vorba despre crearea tehnologiei care ajută realmente oamenii să se conecteze. Indiferent dacă este vorba de educație, asistență medicală sau conversații de zi cu zi, acest sistem reprezintă un pas către o lume în care barierele de comunicare devin tot mai mici.

Alex McFarland este un jurnalist și scriitor de inteligență artificială, care explorează cele mai recente dezvoltări în domeniul inteligenței artificiale. El a colaborat cu numeroase startup-uri de inteligență artificială și publicații din întreaga lume.