Mô hình và nền tảng AI

Làm thế nào AI đang làm cho nhận dạng ngôn ngữ ký hiệu chính xác hơn bao giờ hết

mm
Thêm Unite.AI vào các nguồn ưu tiên của bạn trên Google

Khi chúng ta nghĩ về việc phá vỡ các rào cản giao tiếp, chúng ta thường tập trung vào các ứng dụng dịch ngôn ngữ hoặc trợ lý giọng nói. Nhưng đối với hàng triệu người sử dụng ngôn ngữ ký hiệu, những công cụ này chưa thực sự bắc cầu giao tiếp.

Ngôn ngữ ký hiệu không chỉ là về các động tác tay – nó là một hình thức giao tiếp phong phú, phức tạp bao gồm cả biểu cảm khuôn mặt và ngôn ngữ cơ thể, mỗi yếu tố mang lại ý nghĩa quan trọng.

Điều này đặc biệt khó khăn vì việc tạo ra công nghệ để nhận dạng và dịch ngôn ngữ ký hiệu trong thời gian thực đòi hỏi phải hiểu một hệ thống ngôn ngữ hoàn chỉnh trong chuyển động.

Một cách tiếp cận mới để nhận dạng

Đây là nơi một nhóm tại Đại học Florida Atlantic (FAU) quyết định thực hiện một cách tiếp cận mới. Thay vì cố gắng giải quyết toàn bộ sự phức tạp của ngôn ngữ ký hiệu cùng một lúc, họ tập trung vào việc掌握 một bước đầu tiên quan trọng: nhận dạng các động tác tay ngôn ngữ ký hiệu Mỹ (ASL) với độ chính xác chưa từng có trước đây thông qua AI.

Hãy nghĩ về nó như việc dạy cho máy tính cách đọc chữ viết tay, nhưng trong ba chiều và trong chuyển động. Nhóm đã xây dựng một điều gì đó đáng chú ý: một tập dữ liệu gồm 29.820 hình ảnh tĩnh thể hiện các động tác tay ngôn ngữ ký hiệu Mỹ. Nhưng họ không chỉ thu thập hình ảnh. Họ đã đánh dấu từng hình ảnh với 21 điểm chính trên tay, tạo ra một bản đồ chi tiết về cách tay di chuyển và tạo thành các dấu hiệu khác nhau.

Tiến sĩ Bader Alsharif, người dẫn đầu nghiên cứu này như một ứng viên tiến sĩ, giải thích: “Phương pháp này chưa được khám phá trong nghiên cứu trước đây, làm cho nó trở thành một hướng đi mới và đầy hứa hẹn cho các tiến bộ trong tương lai.”

Phá vỡ công nghệ

Hãy cùng khám phá sự kết hợp của các công nghệ làm cho hệ thống nhận dạng ngôn ngữ ký hiệu này hoạt động.

MediaPipe và YOLOv8

Điều kỳ diệu xảy ra thông qua sự tích hợp liền mạch của hai công cụ mạnh mẽ: MediaPipe và YOLOv8. Hãy nghĩ về MediaPipe như một chuyên gia theo dõi tay – một người thông dịch ngôn ngữ ký hiệu có tay nghề cao có thể theo dõi mọi chuyển động tinh tế của ngón tay và vị trí tay. Nhóm nghiên cứu đã chọn MediaPipe đặc biệt vì khả năng cung cấp theo dõi điểm mốc tay chính xác, xác định 21 điểm chính xác trên mỗi tay, như chúng tôi đã đề cập ở trên.

Nhưng việc theo dõi không đủ – chúng ta cần hiểu những chuyển động này có ý nghĩa gì. Đó là nơi YOLOv8 tham gia. YOLOv8 là một chuyên gia nhận dạng mẫu, lấy tất cả các điểm được theo dõi và xác định xem chúng đại diện cho chữ cái hoặc cử chỉ nào. Nghiên cứu cho thấy rằng khi YOLOv8 xử lý một hình ảnh, nó chia hình ảnh thành một lưới S × S, với mỗi ô lưới chịu trách nhiệm phát hiện đối tượng (trong trường hợp này, các động tác tay) trong giới hạn của nó.

Alsharif et al., Franklin Open (2024)

Hệ thống thực sự hoạt động như thế nào

Quá trình này phức tạp hơn nó có vẻ như tại first glance.

Đây là những gì xảy ra sau hậu trường:

Giai đoạn phát hiện tay

Khi bạn tạo một dấu hiệu, MediaPipe đầu tiên xác định tay của bạn trong khung hình và tạo bản đồ các điểm chính trên tay. Những điểm này không chỉ là những chấm ngẫu nhiên – chúng tương ứng với các khớp và điểm mốc cụ thể trên tay của bạn, từ ngón tay đến gốc tay.

Phân tích không gian

YOLOv8 sau đó lấy thông tin này và phân tích nó trong thời gian thực. Đối với mỗi ô lưới trong hình ảnh, nó dự đoán:

  • Xác suất của một cử chỉ tay hiện diện
  • Tọa độ chính xác của vị trí cử chỉ
  • Điểm số tin cậy của dự đoán

Phân loại

Hệ thống sử dụng một cái gọi là “dự đoán hộp giới hạn” – hãy tưởng tượng vẽ một hình chữ nhật hoàn hảo xung quanh cử chỉ tay của bạn. YOLOv8 tính toán năm giá trị quan trọng cho mỗi hộp: tọa độ x và y cho trung tâm, chiều rộng, chiều cao và điểm số tin cậy.

Alsharif et al., Franklin Open (2024)

Tại sao sự kết hợp này hoạt động tốt như vậy

Nhóm nghiên cứu đã phát hiện ra rằng bằng cách kết hợp các công nghệ này, họ đã tạo ra một thứ gì đó lớn hơn tổng của các phần. Việc theo dõi chính xác của MediaPipe kết hợp với khả năng phát hiện đối tượng tiên tiến của YOLOv8 đã tạo ra kết quả đáng chú ý – chúng tôi đang nói về một tỷ lệ chính xác 98% và điểm F1 99%.

Điều làm cho điều này đặc biệt ấn tượng là cách hệ thống xử lý sự phức tạp của ngôn ngữ ký hiệu. Một số dấu hiệu có thể trông rất giống nhau đối với mắt chưa được đào tạo, nhưng hệ thống có thể phát hiện ra sự khác biệt tinh tế.

Kết quả phá kỷ lục

Khi các nhà nghiên cứu phát triển công nghệ mới, câu hỏi lớn luôn là: “Nó hoạt động tốt như thế nào?” Đối với hệ thống nhận dạng ngôn ngữ ký hiệu này, kết quả thật ấn tượng.

Nhóm tại FAU đã đưa hệ thống của họ qua các thử nghiệm nghiêm ngặt, và đây là những gì họ đã tìm thấy:

  • Hệ thống xác định chính xác các dấu hiệu 98% thời gian
  • Nó bắt 98% tất cả các dấu hiệu được thực hiện trước nó
  • Tổng điểm hiệu suất đạt 99% ấn tượng

“Kết quả từ nghiên cứu của chúng tôi chứng minh khả năng của mô hình chúng tôi trong việc phát hiện và phân loại chính xác các cử chỉ ngôn ngữ ký hiệu Mỹ với rất ít lỗi,” Alsharif giải thích.

Hệ thống hoạt động tốt trong các tình huống hàng ngày – ánh sáng khác nhau, vị trí tay khác nhau và thậm chí với những người khác nhau thực hiện các dấu hiệu.

Đột phá này đẩy ranh giới của những gì có thể trong nhận dạng ngôn ngữ ký hiệu. Các hệ thống trước đây đã gặp khó khăn với độ chính xác, nhưng bằng cách kết hợp việc theo dõi tay của MediaPipe với khả năng phát hiện của YOLOv8, nhóm nghiên cứu đã tạo ra một thứ gì đó đặc biệt.

“Sự thành công của mô hình này chủ yếu là do sự tích hợp cẩn thận của việc học chuyển, tạo tập dữ liệu tỉ mỉ và điều chỉnh chính xác,” Mohammad Ilyas, một trong những đồng tác giả của nghiên cứu, cho biết. Sự chú ý đến chi tiết này đã được đền đáp trong hiệu suất đáng chú ý của hệ thống.

Điều này có ý nghĩa gì cho giao tiếp

Sự thành công của hệ thống này mở ra những khả năng thú vị để làm cho giao tiếp trở nên dễ tiếp cận và hòa nhập hơn.

Nhóm không dừng lại ở việc nhận dạng các chữ cái. Thử thách lớn tiếp theo là dạy hệ thống hiểu một loạt các hình tay và cử chỉ rộng lớn hơn. Hãy nghĩ về những khoảnh khắc khi các dấu hiệu trông gần như giống hệt – như các chữ cái ‘M’ và ‘N’ trong ngôn ngữ ký hiệu. Các nhà nghiên cứu đang làm việc để giúp hệ thống của họ bắt được những sự khác biệt tinh tế này thậm chí còn tốt hơn. Như Dr. Alsharif nói: “Quan trọng là, các phát hiện từ nghiên cứu này không chỉ nhấn mạnh sự mạnh mẽ của hệ thống mà còn tiềm năng của nó để được sử dụng trong các ứng dụng thực tế, thời gian thực.”

Nhóm hiện đang tập trung vào:

  • Làm cho hệ thống hoạt động trơn tru trên các thiết bị thông thường
  • Làm cho nó đủ nhanh cho các cuộc trò chuyện trong thế giới thực
  • Đảm bảo nó hoạt động đáng tin cậy trong bất kỳ môi trường nào

Dean Stella Batalama từ Khoa Kỹ thuật và Khoa học Máy tính của FAU chia sẻ tầm nhìn lớn hơn: “Bằng cách cải thiện nhận dạng ngôn ngữ ký hiệu Mỹ, công việc này góp phần tạo ra các công cụ có thể nâng cao giao tiếp cho cộng đồng điếc và khó nghe.”

Hãy tưởng tượng bước vào một văn phòng bác sĩ hoặc tham dự một lớp học nơi công nghệ này bắc cầu giao tiếp ngay lập tức. Đó là mục tiêu thực sự ở đây – làm cho các tương tác hàng ngày trở nên mượt mà và tự nhiên hơn cho mọi người tham gia. Đó là việc tạo ra công nghệ thực sự giúp mọi người kết nối. Bất kể trong giáo dục, chăm sóc sức khỏe hay các cuộc trò chuyện hàng ngày, hệ thống này đại diện cho một bước tiến tới một thế giới nơi các rào cản giao tiếp ngày càng nhỏ hơn.

Alex McFarland là một nhà báo và nhà văn về trí tuệ nhân tạo, khám phá những phát triển mới nhất trong lĩnh vực trí tuệ nhân tạo. Ông đã hợp tác với nhiều công ty khởi nghiệp và xuất bản về trí tuệ nhân tạo trên toàn thế giới.