AI-mallit ja alustat

Kuinka tekoäly tekee viittomakielen tunnistamisesta tarkemman kuin koskaan

mm
Lisää Unite.AI suosikkilähteisiisi Google-palvelussa

Kun puhumme viestintäesteiden murtamisesta, usein keskitymme kielenkäännössovelluksiin tai älypuhelimien ääniohjaukseen. Mutta niille, jotka käyttävät viittomakieltä, nämä työkalut eivät ole täysin siltoja. Viittomakieli ei ole vain kädenliikkeitä – se on rikas, monimutkainen viestintämuoto, joka sisältää kasvojen ilmeet ja kehonkielen, ja jokainen näistä elementeistä kantaa tärkeää merkitystä.

Tämä tekee tästä haasteesta erityisen haastavan: toisin kuin puhutut kielet, jotka pääasiassa vaihtelevat sanastossa ja kieliopissa, viittomakielet ympäri maailmaa eroavat perustavasti siinä, miten ne välittävät merkitystä. Esimerkiksi amerikkalainen viittomakieli (ASL) on omaa luokkaansa oman kieliopin ja syntaksin kanssa, joka ei vastaa puhuttua englantia.

Tämä monimutkaisuus tarkoittaa, että viittomakielen tunnistamiseen ja kääntämiseen tarvitaan koko kielen järjestelmän ymmärtämistä liikkeessä.

Uusi lähestymistapa tunnistamiseen

Tässä kohtaa Floridan Atlantic Universityn (FAU) insinööritieteiden ja tietojenkäsittelytieteen tiedekunnan tiimi päätti ottaa tuoreen lähestymistavan. Sen sijaan, että yrittäisivät kohdata koko viittomakielen monimutkaisuutta kerran, he keskittyivät hallitsemaan tärkeän ensimmäisen askeleen: tunnistamaan ASL-aakkoselliset eleet ennennäkemättömällä tarkkuudella tekoälyn avulla.

Ajattele tätä kuin opettamista tietokoneelle lukemaan käsin kirjoitettua tekstiä, mutta kolmiulotteisesti ja liikkeessä. Tiimi loi jotain merkittävää: aineiston 29 820 staattisesta kuvasta, jotka esittävät ASL-käsiensykkeitä. Mutta he eivät vain keränneet kuvia. He merkitsivät jokaisen kuvan 21 avainpisteellä kädessä, luoden yksityiskohtaisen kartan siitä, miten kädet liikkuvat ja muodostavat eri merkit.

Tohtori Bader Alsharif, joka johti tätä tutkimusta tohtorikoulutettavana, selittää: “Tämä menetelmä ei ole tutkittu aiemmassa tutkimuksessa, mikä tekee siitä uuden ja lupaavan suunnan tulevaisuuden edistymiselle.”

Teknologian purkaminen

Puhkaistaan nyt teknologian yhdistelmää, joka tekee viittomakielen tunnistusjärjestelmän toimivaksi.

MediaPipe ja YOLOv8

Taika tapahtuu kahden voimakkaan työkalun vaivattomassa yhdistelmässä: MediaPipe ja YOLOv8. Ajattele MediaPipea kuin taitavaa käsi-seuraajaa – taitavaa viittomakielen tulkkia, joka voi seurata jokaisen hienon sormenliikkeen ja käsiasennon. Tutkimusryhmä valitsi MediaPipea sen poikkeuksellisen kyvyn antaa tarkkaa käden maamerkintäseurantaa, tunnistamalla 21 tarkkaa pistettä kummassakin kädessä, kuten mainitsimme aiemmin.

Mutta seuranta ei riitä – meidän on ymmärrettävä, mitä nämä liikkeet tarkoittavat. Siinä YOLOv8 tulee kuvaan. YOLOv8 on mallintunnistusasiantuntija, joka ottaa kaikki nämä seurannat ja määrittää, mikä kirjain tai ele ne edustavat. Tutkimus osoittaa, että kun YOLOv8 prosessoi kuvan, se jakaa sen S × S -ruudukkoon, ja jokainen ruutu on vastuussa objektiiden (tässä tapauksessa käsiensykkeiden) havaitsemisesta omassa rajauksessaan.

Alsharif et al., Franklin Open (2024)

Kuinka järjestelmä toimii todella

Prosessi on monimutkaisempi kuin mitä se ensin vaikuttaa.

Tässä on mitä tapahtuu taustalla:

Käden havaitsemisvaihe

Kun teet merkin, MediaPipe tunnistaa ensin kätesi kehyksessä ja kartoittaa ne 21 avainpistettä. Nämä eivät ole vain satunnaisia pisteitä – ne vastaavat tiettyjä niveliä ja maamerkkiä kädessäsi, sormenpäistä rystysaukon pohjalle.

Paikkatila-analyysi

YOLOv8 ottaa tämän tiedon ja analysoi sitä reaaliajassa. Jokaiselle ruudulle kuvassa se ennustaa:

  • Käden eleen läsnäolon todennäköisyyden
  • Tarkan koordinaatin eleen sijainnista
  • Luottamusluokan ennustuksesta

Luokittelu

Järjestelmä käyttää jotain, mitä kutsutaan “rajausennustukseksi” – kuvittele piirtäväsi täydellisen suorakaiteen käsiellesi. YOLOv8 laskaa viisi tärkeää arvoa jokaiselle ruudulle: x- ja y-koordinaatit keskipisteelle, leveys, korkeus ja luottamusluokka.

Alsharif et al., Franklin Open (2024)

Miksi tämä yhdistelmä toimii niin hyvin

Tutkimusryhmä löysi, että yhdistämällä nämä teknologiat, he loivat jotain, mikä on suurempi kuin osiensa summa. MediaPipen tarkka seuranta yhdistettynä YOLOv8:n edistyneeseen objektiyhdistämiseen tuotti erittäin tarkat tulokset – puhumme 98 prosentin tarkkuudesta ja 99 prosentin F1-pisteestä.

Se, mikä tekee tästä erityisen vaikuttavan, on, miten järjestelmä käsittelee viittomakielen monimutkaisuuden. Jotkut merkit saattavat näyttää hyvin samanlaisilta koulutettujen silmille, mutta järjestelmä voi havaita hienot erot.

Ennätykselliset tulokset

Kun tutkijat kehittävät uutta teknologiaa, suuri kysymys on aina: “Kuinka hyvin se tosiaan toimii?” Tässä viittomakielen tunnistusjärjestelmässä tulokset ovat vaikuttavat.

FAU:n tiimi asetti järjestelmänsä läpi tiukkojen testien, ja tässä on mitä he löysivät:

  • Järjestelmä tunnistaa merkit oikein 98 prosenttisesti
  • Se havaitsee 98 prosenttia kaikista merkeistä, jotka tehdään sen edessä
  • Kokonaisuuden suorituskyky saavuttaa vaikuttavan 99 prosentin

“Tutkimuksemme tulokset osoittavat mallimme kyvyn havaita ja luokitella amerikkalaisen viittomakielen eleet hyvin vähäisillä virheillä”, Alsharif selittää.

Järjestelmä toimii hyvin arkipäivän tilanteissa – erilaisissa valaistusolosuhteissa, erilaisissa käsiasennoissa ja jopa eri ihmisten viittoessa.

Tämä läpimurto työntää rajat siitä, mitä on mahdollista viittomakielen tunnistuksessa. Aikaisemmat järjestelmät ovat kamppailleet tarkkuuden kanssa, mutta yhdistämällä MediaPipen käden seurannan YOLOv8:n havaintokykyyn, tutkimusryhmä loi jotain erityistä.

“Tämän mallin menestys on suurelta osin siinä, että siinä yhdistyvät huolellinen siirtymällinen oppiminen, tarkka aineiston luominen ja tarkka viritys”, sanoo Mohammad Ilyas, yksi tutkimuksen tekijöistä. Tämä tarkkaavaisuus maksoi järjestelmän merkittävässä suorituskyvyssä.

Mikä tämä merkitsee viestinnälle

Tämän järjestelmän menestys avaa jännittäviä mahdollisuuksia viestinnän tekemiseksi helpommaksi ja kaikille saatavammaksi.

Tiimi ei pysähdy vain kirjaimien tunnistamiseen. Seuraava suuri haaste on opettaa järjestelmälle ymmärtämään vielä laajempi valikoima käsien muotoja ja eleitä. Ajattele niitä hetkiä, kun merkit näyttävät lähes identtisiltä – kuten kirjaimet ‘M’ ja ‘N’ viittomakielessä. Tutkijat työskentelevät järjestelmänsä parantamiseksi havaitsemaan nämä hienot erot entistä paremmin. Kuten tohtori Alsharif toteaa: “Tärkeää on, että tämän tutkimuksen tulokset korostavat järjestelmän luotettavuutta ja sen potentiaalia käytännön, reaaliaikaisissa sovelluksissa.”

Tiimi keskittyy nyt:

  • Saan järjestelmän toimimaan sileästi tavallisilla laitteilla
  • Tekemään siitä tarpeeksi nopean reaaliaikaisiin keskusteluihin
  • Varmistamaan, että se toimii luotettavasti missä tahansa ympäristössä

FAU:n insinööritieteiden ja tietojenkäsittelytieteen tiedekunnan dekaani Stella Batalama jakaa laajemman vision: “Parantamalla amerikkalaisen viittomakielen tunnistusta, tämä työ edistää työkalujen luomista, jotka voivat parantaa viestintää kuurojen ja huonokuuloisten yhteisölle.”

Kuvittele käveleväsi lääkärin vastaanotolle tai osallistuvasi luokkaan, jossa tämä teknologia siltaa viestintäkuilun välittömästi. Se on todellinen tavoite tässä – tehdä päivittäisistä vuorovaikutuksista sulavampia ja luonnollisempia kaikille osapuolille. Se on luomassa teknologiaa, joka todella auttaa ihmisiä yhteyden muodostamisessa. Olipa kyse sitten koulutuksesta, terveydenhuollosta tai arkipäivän keskusteluista, tämä järjestelmä edustaa askelta kohti maailmaa, jossa viestintäesteet jatkuvasti pienenevät.

Alex McFarland on AI-toimittaja ja kirjailija, joka tutkii viimeisimpiä kehityksiä tekoälyssä. Hän on tehnyt yhteistyötä useiden AI-startup-yritysten ja julkaisujen kanssa maailmanlaajuisesti.