AI 모델 및 플랫폼
AI가 수화 인식의 정밀도를 이전보다 더 높이는 방법

우리가 의사소통의 장벽을 깰 때, 우리는 종종 언어 번역 앱이나 음성 조작기를 생각합니다. 그러나 수백만 명의 수화 사용자를 위해 이러한 도구는 아직까지 그 간격을 메우지 못했습니다. 수화는 단순히 손의 움직임이 아님을 명심하세요. 수화는 얼굴 표정과 몸 언어를 포함하여 풍부하고 복잡한 의사소통 형태로, 각 요소가 중요한 의미를 가지고 있습니다.
이것이 특히 어려운 이유는 다음과 같습니다. 다른 언어와는 달리, 주로 어휘와 문법이 다르기 때문에, 전 세계의 수화는 의미를 전달하는 방식에 근본적으로 다릅니다. 예를 들어, 미국 수화(American Sign Language, ASL)는 영어와 일치하지 않는 고유한 문법과 구문을 가지고 있습니다.
이 복잡성은 수화의 전체 언어 시스템을 이해하는 것을 필요로 하기 때문에, 실시간으로 수화를 인식하고 번역하는 기술을 개발하는 것이 어렵습니다.
새로운 인식 접근법
플로리다 애틀랜틱 대학교(FAU)의 공과대학 및 컴퓨터 과학 대학에서 연구팀은 새로운 접근법을 취하기로 결정했습니다. 전체 수화의 복잡성을 한꺼번에 해결하려고 하지 않고, 그들은 첫 번째 중요한 단계에 집중했습니다. 즉, 이전에 없던 정확도로 ASL 알파벳 제스처를 인식하는 것입니다.
컴퓨터가 손글씨를 읽는 것과 비슷하다고 생각하세요. 하지만 3차원에서 그리고 움직이는 상태에서 vậy. 연구팀은 29,820개의 정적 이미지로 구성된 데이터셋을 구축했습니다. 이 이미지들은 ASL 수화 제스처를 보여줍니다. 그러나 단순히 이미지만 수집한 것이 아닙니다. 각 이미지에 21개의 주요 점을 표시했습니다. 이는 손의 움직임과 다양한 수화의 형성을 자세히 매핑한 것입니다.
이 연구를 주도한 박사 과정 학생인 Dr. Bader Alsharif는 다음과 같이 설명합니다. “이 방법은 이전 연구에서 탐구되지 않았기 때문에, 미래의 발전을 위한 새로운이자 유망한 방향입니다.”
기술의 분해
이 수화 인식 시스템이 작동하는 기술의 조합에 대해 더 자세히 살펴보겠습니다.
MediaPipe와 YOLOv8
매직은 두 가지 강력한 도구의 무결한 통합을 통해 발생합니다. MediaPipe와 YOLOv8입니다. MediaPipe를 전문 손 감시자로 생각하세요.それは 매우 미묘한 손가락의 움직임과 손의 위치를 추적할 수 있는 숙련된 수화 통역사입니다. 연구팀은 MediaPipe를 선택했습니다. 이유는 이전에 언급한 21개의 손 랜드마크를 정확하게 추적할 수 있는 능력 때문입니다.
그러나 추적만으로는 충분하지 않습니다. 우리는 이러한 움직임의 의미를 이해해야 합니다. 그것이 YOLOv8가 등장하는 곳입니다. YOLOv8는 패턴 인식 전문가입니다. 추적된 모든 점을 가져와서 어떤 문자나 제스처를 나타내는지 결정합니다. 연구에 따르면 YOLOv8가 이미지를 처리할 때, 그것은 S × S 격자로 나누며, 각 격자 셀은 그 경계 내의 객체(이 경우, 수화 제스처)를 감지하는 책임을 지닙니다.

Alsharif et al., Franklin Open (2024)
시스템의 실제 작동 방식
과정은 처음 nhìn에 보이는 것보다 더 복잡합니다.
이것이 실제로 어떻게 작동하는지 살펴보겠습니다.
손 감지 단계
수화를 할 때, MediaPipe는 먼저 손의 위치를 식별하고 21개의 주요 점을 매핑합니다. 이는 손의 관절과 랜드마크에 해당하는 특정 점입니다.
공간 분석
그런 다음 YOLOv8가 이 정보를 실시간으로 분석합니다. 이미지의 각 격자 셀에 대해, 다음과 같은 것을 예측합니다.
- 수화 제스처가存在하는 확률
- 제스처의 위치의 정확한 좌표
- 예측의 신뢰도 점수
분류
시스템은 “바운딩 박스 예측”이라고 하는 것을 사용합니다. 손 제스처를 완벽하게 둘러싼 사각형을 그리세요. YOLOv8는 각 박스에 대해 5개의 중요한 값을 계산합니다. x와 y 좌표, 너비, 높이, 그리고 신뢰도 점수입니다.

Alsharif et al., Franklin Open (2024)
이 조합이 इतन 잘 작동하는 이유
연구팀은 이러한 기술을 결합하여, 부분의 합보다 더 큰 것을 만들었습니다. MediaPipe의 정밀 추적과 YOLOv8의 고급 객체 감지로 인해 정확도가 매우 높았습니다. 98%의 정밀도와 99%의 F1 점수를 달성했습니다.
이것이 특히 인상적인 것은 수화의 복잡성을 다루는 방식입니다. 일부 수화는 미숙한 눈으로 보아 거의 동일해 보일 수 있지만, 시스템은 미묘한 차이를 감지할 수 있습니다.
기록적인 결과
새로운 기술을 개발할 때, 큰 질문은 항상 “이 기술이 실제로 얼마나 잘 작동하는가?”입니다. 이 수화 인식 시스템의 경우, 결과는 인상적입니다.
FAU의 연구팀은 시스템을 철저한 테스트를 거쳤습니다. 그리고 그들은 다음과 같은 것을 발견했습니다.
- 시스템은 98%의 확률로 수화를 올바르게 식별합니다
- 그것은 98%의 수화를 감지합니다
- 전체 성능 점수는 99%에 달합니다
Alsharif는 다음과 같이 설명합니다. “연구 결과는 우리 모델이 거의 오류 없이 미국 수화 제스처를 정확하게 감지하고 분류할 수 있는 능력을 보여줍니다.”
시스템은 일상 상황에서 잘 작동합니다. 다양한 조명, 손의 위치, 그리고 다른 사람의 수화에도 잘 작동합니다.
이 기술은 수화 인식의 경계를 넓히는 것입니다. 이전 시스템은 정확성에 어려움을 겪었지만, MediaPipe의 손 추적과 YOLOv8의 감지 능력을 결합하여 연구팀은 특별한 것을 만들었습니다.
연구의 공동 저자 중 한 명인 Mohammad Ilyas는 다음과 같이 말합니다. “이 모델의 성공은 전이 학습, 데이터셋 생성, 그리고 정교한 조정을 신중하게 통합한 결과입니다.” 이러한 세부 사항에 대한 주의가 시스템의卓越한 성능으로 이어졌습니다.
의사소통에 대한 의미
이 시스템의 성공은 더 접근 가능하고 포용적인 의사소통을 위한 흥미로운 가능성을 열어줍니다.
연구팀은 단순히 문자만을 인식하는 것을 중단하지 않습니다. 다음 큰 도전은 더广い 범위의 손 모양과 제스처를 이해하는 것입니다. 수화에서 거의 동일해 보이는 제스처, 예를 들어 ‘M’과 ‘N’을 생각해 보세요. 연구자들은 이러한 미묘한 차이를 더 잘 잡아낼 수 있도록 시스템을 개선하고 있습니다. Dr. Alsharif는 다음과 같이 말합니다. “이 연구의 발견은 시스템의 견고성뿐만 아니라 실제 응용 프로그램에서 사용될 수 있는 잠재력을 강조합니다.”
연구팀은現在 다음에 집중하고 있습니다.
- 시스템을 일반 장치에서 원활하게 작동하도록 하는 것
- 실제 대화에 충분히 빠르게 만드는 것
- 어떤 환경에서도 신뢰할 수 있게 만드는 것
FAU의 공과대학 및 컴퓨터 과학 대학의 학장인 Stella Batalama는 더 큰 비전을 공유합니다. “미국 수화 인식을 개선함으로써, 이 연구는 청각 장애인과 난청인 커뮤니티의 의사소통을 강화할 수 있는 도구를 만들기 위한 기여를 합니다.”
의사의 사무실에 들어가거나 수업에 참석할 때, 이 기술이 의사소통의 간격을 즉시 메우는 것을 상상해 보세요. 그것이 여기서의 실제 목표입니다. 일상적인 상호작용을 모든 참여자에게 더 부드럽고 자연스럽게 만드는 것입니다. 그것은 실제로 사람들을 연결하는 기술을 만드는 것입니다. 교육, 의료, 또는 일상적인 대화에서, 이 시스템은 의사소통의 장벽이 점점 더 작아지는 세계로 향하는 한 걸음입니다.












