Моделі та платформи ШІ
Як штучний інтелект робить розпізнавання мови жестів більш точним, ніж будь-коли

Коли ми думаємо про подолання комунікативних бар’єрів, ми часто зосереджуємося на застосунках для перекладу мови або голосових помічниках. Але для мільйонів людей, які використовують мову жестів, ці інструменти ще не повністю подолали розрив. Мова жестів – це не просто рухи рук – це багата, складна форма комунікації, яка включає в себе міміку і мову тіла, кожен елемент якої несе важливе значення.
Ось що робить це особливо складним: на відміну від мов, які в основному відрізняються лексикою і граматикою, мови жестів у світі відрізняються фундаментально тим, як вони передають значення. Американська мова жестів (ASL), наприклад, має свою унікальну граматику і синтаксис, який не збігається з англійською мовою.
Ця складність означає, що створення технології для розпізнавання і перекладу мови жестів в режимі реального часу вимагає розуміння цілої мовної системи в русі.
Новий підхід до розпізнавання
Саме тут команда з Університету Флориди-Атлантичного (FAU) вирішила застосувати новий підхід. Замість того, щоб намагатися подолати всю складність мови жестів одразу, вони зосередилися на освоєнні важливого першого кроку: розпізнаванні жестів алфавіту ASL з безпрецедентною точністю за допомогою штучного інтелекту.
Подіумайте про це, як про навчання комп’ютера читати рукописний текст, але в трьох вимірах і в русі. Команда створила щось видатне: набір даних із 29 820 статичних зображень, що показують жести рук ASL. Але вони не просто зібрали картинки. Вони позначили кожне зображення 21 ключовим точкам на руці, створивши детальну карту того, як руки рухаються і утворюють різні знаки.
Доктор Бадер Аль-Шариф, який очолював це дослідження як кандидат філософських наук, пояснює: “Цей метод не був досліджений у попередніх дослідженнях, що робить його новим і перспективним напрямком для майбутніх досягнень”.
Розбивка технології
Давайте глибше зануримося в поєднання технологій, які робить систему розпізнавання мови жестів працювати.
MediaPipe і YOLOv8
Чудеса відбуваються завдяки безшовній інтеграції двох потужних інструментів: MediaPipe і YOLOv8. Подумайте про MediaPipe як про експерта з відстеження рук – досвідченого тлумача мови жестів, який може відстежувати кожен тонкий рух пальців і положення рук. Команда дослідників вибрала MediaPipe спеціально за його виняткову здатність забезпечувати точне відстеження орієнтирів рук, ідентифікуючи 21 точну точку на кожній руці, як ми згадали вище.
Але відстеження недостатньо – нам потрібно зрозуміти, що означають ці рухи. Саме тут вступає в дію YOLOv8. YOLOv8 – це експерт із розпізнавання закономірностей, який приймає всі ці відстежені точки і визначає, який букву або жест вони представляють. Дослідження показує, що коли YOLOv8 обробляє зображення, воно ділить його на сітку S × S, причому кожна клітинка сітки відповідає за виявлення об’єктів (у цьому випадку жестів рук) у своїх межах.

Alsharif et al., Franklin Open (2024)
Як система насправді працює
Процес ще більш складний, ніж може здаватися на перший погляд.
Ось що відбувається за кулісами:
Стадія виявлення рук
Коли ви робите жест, MediaPipe спочатку визначає вашу руку в кадрі і створює карту цих 21 ключових точок. Це не просто випадкові точки – вони відповідають конкретним суглобам і орієнтирам на вашій руці, від кінчиків пальців до основи долоні.
Просторова аналіз
YOLOv8 потім приймає цю інформацію і аналізує її в режимі реального часу. Для кожної клітинки сітки в зображенні воно передбачає:
- Ймовірність присутності жесту рук
- Точні координати місця розташування жесту
- Оцінка впевненості у своєму передбаченні
Класифікація
Система використовує так зване “передбачення обмежувальної рамки” – уявіть, що ви малюєте ідеальну прямокутну рамку навколо вашого жесту рук. YOLOv8 обчислює п’ять важливих значень для кожної рамки: x- і y-координати центру, ширина, висота і оцінка впевненості.

Alsharif et al., Franklin Open (2024)
Чому це поєднання працює так добре
Команда дослідників виявила, що поєднуючи ці технології, вони створили щось більше, ніж сума її частин. Точне відстеження MediaPipe у поєднанні з передовим розпізнаванням об’єктів YOLOv8 дало надзвичайно точні результати – ми говоримо про рівень точності 98% і оцінку F1 у 99%.
Що робить це особливо вражаючим, так це те, як система справляється із складністю мови жестів. Деякі жести можуть виглядати дуже схоже на не треновані очі, але система може виявити тонкі відмінності.
Рекордні результати
Коли дослідники розробляють нову технологію, велике питання завжди таке: “Як добре вона насправді працює?” Для цієї системи розпізнавання мови жестів результати вражаючі.
Команда з FAU піддавала свою систему суворим тестам, і ось що вони виявили:
- Система правильно розпізнає жести у 98% випадків
- Вона виявляє 98% всіх жестів, зроблених перед нею
- Загальний показник продуктивності сягає вражаючих 99%
“Результати нашого дослідження демонструють здатність нашої моделі точно виявляти і класифікувати жести американської мови жестів з мінімальною кількістю помилок”, пояснює Аль-Шариф.
Система працює добре у повсякденних ситуаціях – при різних умовах освітлення, різних положеннях рук і навіть з різними людьми, які роблять жести.
Цей прорив розширює межі того, що можливо у розпізнаванні мови жестів. Попередні системи мали труднощі з точністю, але поєднуючи відстеження рук MediaPipe з можливостями розпізнавання YOLOv8, команда дослідників створила щось особливе.
“Успіх цієї моделі в основному пояснюється ретельною інтеграцією передавання знань, ретельним створенням набору даних і точним налаштуванням”, говорить Мохаммад Ільяс, один із співавторів дослідження. Ця увага до деталей окупилася у вражаючій продуктивності системи.
Що це означає для комунікації
Успіх цієї системи відкриває перспективи для створення більш доступної і інклюзивної комунікації.
Команда не зупиняється на розпізнаванні лише букв. Наступним великим викликом є навчання системи розуміти ще ширший спектр форм рук і жестів. Подумайте про ті моменти, коли жести майже ідентичні – наприклад, букви “М” і “Н” у мові жестів. Дослідники працюють над тим, щоб їхня система могла ще краще виявляти ці тонкі відмінності. Як каже доктор Аль-Шариф: “Важливо, що результати цього дослідження підкреслюють не тільки стійкість системи, але й її потенціал для використання у практичних, реальних застосуваннях”.
Команда зараз зосереджена на:
- Зробленні системи, щоб вона працювала гладко на звичайних пристроях
- Зробленні її достатньо швидкою для реальних розмов
- Забезпеченні її роботи у будь-якому середовищі
Декан Стелла Баталама з коледжу інженерії та комп’ютерних наук FAU поділяє більшу візію: “Поліпшення розпізнавання американської мови жестів це робота сприяє створенню інструментів, які можуть покращити комунікацію для глухих і слабочуючих людей”.
Уявіть, що ви входите до кабінету лікаря або відвідуєте заняття, де ця технологія миттєво подолає комунікаційні бар’єри. Саме це і є справжньою метою – зробити щоденні взаємодії більш гладкими і природними для всіх учасників. Це створення технологій, які насправді допомагають людям зв’язуватися. Будь то освіта, охорона здоров’я або щоденні розмови, ця система представляє крок до світу, де комунікаційні бар’єри продовжують зменшуватися.












