AI-modellen en platforms

Hoe AI het herkennen van gebarentaal nog nauwkeuriger maakt dan ooit tevoren

mm
Voeg Unite.AI toe aan je voorkeursbronnen op Google

Wanneer we denken aan het doorbreken van communicatiebarriÃĻres, focussen we vaak op vertaalapps of spraakassistenten. Maar voor miljoenen mensen die gebarentaal gebruiken, hebben deze tools de kloof nog niet echt overbrugd. Gebarentaal is niet alleen maar handbewegingen – het is een rijke, complexe vorm van communicatie die ook gezichtsuitdrukkingen en lichaamstaal omvat, waarbij elk element een cruciale betekenis draagt.

Dit is vooral uitdagend omdat het creÃŦren van technologie om gebarentaal te herkennen en vertalen in real-time een begrip van een heel taalsysteem in beweging vereist.

Een nieuwe aanpak van herkenning

Dit is waar een team aan de Florida Atlantic University’s (FAU) College of Engineering and Computer Science besloot om een frisse aanpak te nemen. In plaats van te proberen de hele complexiteit van gebarentaal in ÃĐÃĐn keer aan te pakken, richtten ze zich op het beheersen van een cruciale eerste stap: het herkennen van ASL-alfabetgebaren met ongekende nauwkeurigheid door middel van AI.

Stel je voor dat je een computer leert om handschriften te lezen, maar in drie dimensies en in beweging. Het team bouwde iets opmerkelijks: een dataset van 29.820 statische afbeeldingen van ASL-handgebaren. Maar ze verzamelden niet alleen afbeeldingen. Ze markeerden elke afbeelding met 21 sleutelpunten op de hand, waardoor een gedetailleerde kaart ontstond van hoe handen bewegen en verschillende tekens vormen.

Dr. Bader Alsharif, die deze onderzoek leidde als promovendus, legt uit: “Deze methode is niet eerder onderzocht in eerdere onderzoeken, waardoor het een nieuwe en veelbelovende richting is voor toekomstige verbeteringen.”

Het uiteenrafelen van de technologie

Laten we dieper duiken in de combinatie van technologieÃŦn die dit systeem voor het herkennen van gebarentaal doet werken.

MediaPipe en YOLOv8

De magie gebeurt door de naadloze integratie van twee krachtige tools: MediaPipe en YOLOv8. Denk aan MediaPipe als een expert hand-watcher – een ervaren gebarentaalvertaler die elke subtiele vingerbeweging en handpositie kan volgen. Het onderzoeksteam koos MediaPipe specifiek vanwege zijn uitzonderlijke vermogen om nauwkeurige handlandmark-tracking te bieden, waarbij 21 precieze punten op elke hand worden geÃŊdentificeerd, zoals we hierboven vermeldden.

Maar volgen is niet genoeg – we moeten begrijpen wat deze bewegingen betekenen. Dat is waar YOLOv8 om de hoek komt kijken. YOLOv8 is een patroonherkenningsexpert, die al die getrackte punten neemt en begrijpt welk letterteken of gebaar ze vertegenwoordigen. Het onderzoek toont aan dat wanneer YOLOv8 een afbeelding verwerkt, het deze opdeelt in een S × S-grid, waarbij elke gridcel verantwoordelijk is voor het detecteren van objecten (in dit geval handgebaren) binnen zijn grenzen.

Alsharif et al., Franklin Open (2024)

Hoe het systeem werkelijk werkt

Het proces is ingewikkelder dan het op het eerste gezicht lijkt.

Dit is wat er achter de schermen gebeurt:

Handdetectiestap

Wanneer je een teken maakt, identificeert MediaPipe eerst je hand in het kader en maakt een kaart van die 21 sleutelpunten. Dit zijn geen willekeurige punten – ze komen overeen met specifieke gewrichten en kenmerken op je hand, van vingertoppen tot palm_basis.

Ruimtelijke analyse

YOLOv8 neemt deze informatie en analyseert het in real-time. Voor elke gridcel in de afbeelding, voorspelt het:

  • De waarschijnlijkheid van de aanwezigheid van een handgebaar
  • De precieze coÃķrdinaten van de locatie van het gebaar
  • De betrouwbaarheidsscore van zijn voorspelling

Classificatie

Het systeem gebruikt iets dat “bounding box prediction” wordt genoemd – stel je voor dat je een perfecte rechthoek rond je handgebaar tekent. YOLOv8 berekent vijf cruciale waarden voor elke doos: x- en y-coÃķrdinaten voor het centrum, breedte, hoogte en een betrouwbaarheidsscore.

Alsharif et al., Franklin Open (2024)

Waarom deze combinatie zo goed werkt

Het onderzoeksteam ontdekte dat door deze technologieÃŦn te combineren, ze iets groter creÃŦerden dan de som van de delen. MediaPipe’s precieze tracking in combinatie met YOLOv8’s geavanceerde objectdetectie produceerde opmerkelijk nauwkeurige resultaten – we hebben het over een precisie van 98% en een F1-score van 99%.

Wat dit bijzonder indrukwekkend maakt, is hoe het systeem de complexiteit van gebarentaal aanpakt. Sommige tekens kunnen voor ongetrainde ogen erg lijken, maar het systeem kan subtiele verschillen opmerken.

Recordbrekende resultaten

Wanneer onderzoekers nieuwe technologie ontwikkelen, is de grote vraag altijd: “Hoe goed werkt het eigenlijk?” Voor dit systeem voor het herkennen van gebarentaal zijn de resultaten indrukwekkend.

Het team van FAU heeft hun systeem grondig getest, en hier zijn de resultaten:

  • Het systeem identificeert tekens correct 98% van de tijd
  • Het detecteert 98% van alle tekens die voor het worden gemaakt
  • De algehele prestatiescore bereikt een indrukwekkende 99%

“Resultaten uit ons onderzoek demonstreren de mogelijkheid van ons model om Amerikaanse gebarentaalgebaren nauwkeurig te detecteren en te classificeren met heel weinig fouten,” legt Alsharif uit.

Het systeem werkt goed in dagelijkse situaties – verschillende verlichting, verschillende handposities en zelfs met verschillende mensen die gebarentaal gebruiken.

Deze doorbraak duwt de grenzen van wat mogelijk is in het herkennen van gebarentaal. Eerdere systemen hebben moeite gehad met nauwkeurigheid, maar door MediaPipe’s handtracking te combineren met YOLOv8’s detectievermogen, creÃŦerde het onderzoeksteam iets speciaals.

“Het succes van dit model is grotendeels te wijten aan de zorgvuldige integratie van transfer learning, zorgvuldige datasetcreatie en precieze afstemming,” zegt Mohammad Ilyas, een van de co-auteurs van de studie. Deze aandacht voor detail betaalde zich uit in de opmerkelijke prestaties van het systeem.

Wat dit betekent voor communicatie

Het succes van dit systeem opent opwindende mogelijkheden voor het maken van communicatie toegankelijker en inclusiever.

Het team stopt niet bij het herkennen van letters. De volgende grote uitdaging is het leren van het systeem om een nog bredere reeks handvormen en gebaren te begrijpen. Denk aan die momenten waarop tekens bijna identiek lijken – zoals de letters ‘M’ en ‘N’ in gebarentaal. De onderzoekers werken eraan om hun systeem deze subtiele verschillen nog beter te laten detecteren. Zoals Dr. Alsharif het zegt: “Belangrijk is dat de resultaten van deze studie niet alleen de robuustheid van het systeem aantonen, maar ook het potentieel om in praktische, real-time toepassingen te worden gebruikt.”

Het team richt zich nu op:

  • Het systeem zo te maken dat het soepel werkt op reguliere apparaten
  • Het zo snel te maken dat het geschikt is voor echte wereldgesprekken
  • Ervoor te zorgen dat het betrouwbaar werkt in elke omgeving

Decaan Stella Batalama van FAU’s College of Engineering and Computer Science deelt de bredere visie: “Door het herkennen van Amerikaanse gebarentaal te verbeteren, draagt dit werk bij aan het creÃŦren van tools die de communicatie voor de dove en slechthorende gemeenschap kunnen verbeteren.”

Stel je voor dat je een dokterspraktijk binnenloopt of een klas bijwoont waar deze technologie communicatiebarriÃĻres direct overbrugt. Dat is het echte doel hier – het maken van dagelijkse interacties soepeler en natuurlijker voor iedereen die betrokken is. Het is het creÃŦren van technologie die mensen echt helpt om verbinding te maken. Of het nu in onderwijs, gezondheidszorg of dagelijkse gesprekken is, dit systeem vertegenwoordigt een stap naar een wereld waar communicatiebarriÃĻres steeds kleiner worden.

Alex McFarland is een AI-journalist en schrijver die de laatste ontwikkelingen op het gebied van kunstmatige intelligentie onderzoekt. Hij heeft samengewerkt met talloze AI-startups en publicaties wereldwijd.