Модели и платформы ИИ

Как ИИ делает распознавание языка жестов более точным, чем когда-либо

mm
Добавьте Unite.AI в избранные источники в Google

Когда мы думаем о преодолении коммуникационных барьеров, мы часто фокусируемся на приложениях для перевода языка или голосовых помощниках. Но для миллионов людей, использующих язык жестов, эти инструменты еще не полностью преодолели разрыв. Язык жестов – это не только движения рук – это богатая, сложная форма коммуникации, включающая выражения лица и язык тела, каждый элемент которого несет важный смысл.

Вот что делает это особенно сложным: в отличие от устных языков, которые в основном различаются по словарю и грамматике, языки жестов по всему миру фундаментально различаются в том, как они передают смысл. Американский язык жестов (ASL), например, имеет свою уникальную грамматику и синтаксис, которые не соответствуют устной английской речи.

Эта сложность означает, что создание технологии для распознавания и перевода языка жестов в режиме реального времени требует понимания всей языковой системы в движении.

Новый подход к распознаванию

Именно здесь команда в Университете Флориды-Атлантика (FAU) решила принять свежий подход. Вместо того, чтобы пытаться решить всю сложность языка жестов сразу, они сосредоточились на освоении важного первого шага: распознавании жестов алфавита ASL с беспрецедентной точностью с помощью ИИ.

Представьте себе обучение компьютеру чтению рукописного текста, но в трех измерениях и в движении. Команда создала что-то замечательное: набор данных из 29 820 статических изображений, показывающих жесты рук ASL. Но они не просто собрали фотографии. Они пометили каждое изображение 21 ключевой точкой на руке, создав подробную карту того, как руки движутся и образуют различные знаки.

Доктор Бадер Аль-Шариф, который возглавил это исследование как кандидат на степень PhD, объясняет: “Этот метод не был исследован в предыдущих исследованиях, что делает его новым и перспективным направлением для будущих достижений.”

Разбор технологии

Давайте глубже погрузимся в комбинацию технологий, которая делает систему распознавания языка жестов работоспособной.

MediaPipe и YOLOv8

Магия происходит через бесшовную интеграцию двух мощных инструментов: MediaPipe и YOLOv8. Представьте себе MediaPipe как эксперта по наблюдению за руками – опытного переводчика языка жестов, который может отслеживать каждое тонкое движение пальцев и положение руки. Исследовательская команда выбрала MediaPipe специально для его исключительной способности обеспечивать точное отслеживание ориентиров руки, определяя 21 точный пункт на каждой руке, как мы упоминали выше.

Но отслеживание недостаточно – нам нужно понять, что означают эти движения. Именно здесь YOLOv8 вступает в игру. YOLOv8 – это эксперт по распознаванию образов, который принимает все эти отслеженные точки и определяет, какой букве или жесту они соответствуют. Исследование показывает, что когда YOLOv8 обрабатывает изображение, оно делит его на сетку S × S, где каждая ячейка сетки отвечает за обнаружение объектов (в данном случае, жестов рук) в своих границах.

Аль-Шариф и др., Франклин Опен (2024)

Как система фактически работает

Процесс более сложный, чем может показаться на первый взгляд.

Вот что происходит за кулисами:

Этап обнаружения рук

Когда вы делаете жест, MediaPipe сначала определяет вашу руку в кадре и создает карту этих 21 ключевых точек. Это не просто случайные точки – они соответствуют конкретным суставам и ориентирам на вашей руке, от кончиков пальцев до основания ладони.

Пространственный анализ

YOLOv8 затем принимает эту информацию и анализирует ее в режиме реального времени. Для каждой ячейки сетки в изображении он предсказывает:

  • Вероятность наличия жеста руки
  • Точные координаты местоположения жеста
  • Уровень уверенности в своем прогнозе

Классификация

Система использует так называемое “предсказание ограничивающей рамки” – представьте себе рисование идеального прямоугольника вокруг вашего жеста руки. YOLOv8 рассчитывает пять важных значений для каждой рамки: x и y координаты центра, ширина, высота и уровень уверенности.

Аль-Шариф и др., Франклин Опен (2024)

Почему эта комбинация работает так хорошо

Исследовательская команда обнаружила, что, объединив эти технологии, они создали что-то большее, чем сумма их частей. Точное отслеживание MediaPipe в сочетании с передовым обнаружением объектов YOLOv8 произвело замечательно точные результаты – мы говорим о точности 98% и показателе F1 99%.

Что делает это особенно впечатляющим, так это то, как система справляется с сложностью языка жестов. Некоторые знаки могут выглядеть очень похожими на неопытные глаза, но система может обнаружить тонкие различия.

Рекордные результаты

Когда исследователи разрабатывают новую технологию, большой вопрос всегда заключается в том: “Как хорошо она фактически работает?” Для этой системы распознавания языка жестов результаты впечатляющие.

Команда в FAU подвергла свою систему тщательному тестированию, и вот что они обнаружили:

  • Система правильно определяет знаки в 98% случаев
  • Она обнаруживает 98% всех знаков, сделанных перед ней
  • Общий показатель производительности достигает впечатляющих 99%

“Результаты нашего исследования демонстрируют способность нашей модели точно обнаруживать и классифицировать жесты американского языка жестов с очень少ими ошибками”, объясняет Аль-Шариф.

Система работает хорошо в повседневных ситуациях – при разных освещениях, различных положениях рук и даже с разными людьми, делающими жесты.

Этот прорыв расширяет границы того, что возможно в распознавании языка жестов. Предыдущие системы испытывали трудности с точностью, но, объединив отслеживание рук MediaPipe с возможностями обнаружения YOLOv8, исследовательская команда создала что-то особенное.

“Успех этой модели в значительной степени обусловлен тщательной интеграцией передачи обучения, тщательным созданием набора данных и точной настройкой”, говорит Мохаммад Ильяс, один из соавторов исследования. Это внимание к деталям оправдалось в замечательной производительности системы.

Что это значит для коммуникации

Успех этой системы открывает интересные возможности для того, чтобы сделать коммуникацию более доступной и инклюзивной.

Команда не останавливается на распознавании только букв. Следующая большая задача – обучить систему понимать еще более широкий спектр форм и жестов рук. Подумайте о тех моментах, когда знаки выглядят почти идентично – как буквы “М” и “Н” в языке жестов. Исследователи работают над тем, чтобы их система могла обнаружить эти тонкие различия еще лучше. Как говорит доктор Аль-Шариф: “Важно отметить, что результаты этого исследования подчеркивают не только прочность системы, но и ее потенциал для использования в практических, реальных приложениях.”

Команда сейчас фокусируется на:

  • Сделать систему работоспособной на обычных устройствах
  • Сделать ее достаточно быстрой для реальных разговоров
  • Обеспечить ее надежную работу в любой среде

Дин Стелла Баталама из Колледжа инженерии и компьютерных наук FAU делится большим видением: “Улучшая распознавание американского языка жестов, эта работа способствует созданию инструментов, которые могут улучшить коммуникацию для глухих и слабослышащих.”

Представьте себе вход в кабинет врача или посещение занятия, где эта технология сразу же преодолевает коммуникационные барьеры. Это и есть настоящая цель – сделать повседневные взаимодействия более гладкими и естественными для всех участников. Это создание технологии, которая действительно помогает людям соединяться. Будь то в образовании, здравоохранении или повседневных разговорах, эта система представляет собой шаг к миру, где коммуникационные барьеры становятся все меньше и меньше.

Алекс Макфарленд - журналист и писатель в области искусственного интеллекта, исследующий последние разработки в этой области. Он сотрудничал с многочисленными стартапами и изданиями в области искусственного интеллекта во всем мире.