โมเดลและแพลตฟอร์ม AI
AI ช่วยให้การรับรู้ภาษามือมีความแม่นยำมากกว่าที่เคย

เมื่อเราคิดถึงการทำลายข้อจำกัดในการสื่อสาร เรามักจะเน้นไปที่ แอปพลิเคชันแปลภาษา หรือผู้ช่วยเสียง แต่สำหรับล้านคนซึ่งใช้ภาษามือ เครื่องมือเหล่านี้ยังไม่ได้ข้ามช่องว่างนี้ภาษามือไม่ใช่แค่การเคลื่อนไหวกำมือเท่านั้น แต่เป็นรูปแบบการสื่อสารที่มีความซับซ้อนและ丰富 ซึ่งรวมถึงน้ำเสียงและภาษากายที่มีความหมายสำคัญ
สิ่งที่ทำให้สิ่งนี้ท้าทายมากขึ้นคือภาษามือทั่วโลกมีความแตกต่างกันในหลักการในการสื่อสารความหมาย ไม่เหมือนกับภาษาพูดซึ่งมีความแตกต่างหลักในเรื่องคำศัพท์และไวยากรณ์ ภาษามืออเมริกัน (ASL) มีไวยากรณ์และโครงสร้างที่ไม่เหมือนกับภาษาอังกฤษ
ความซับซ้อนนี้หมายความว่าการสร้างเทคโนโลยีเพื่อรับรู้และแปลภาษามือในเวลาจริงต้องมีความเข้าใจในระบบภาษาทั้งหมดที่เคลื่อนไหว
แนวทางใหม่ในการรับรู้
ที่นี่ทีมงานจากมหาวิทยาลัยฟลอริดาแอตแลนติก (FAU) สหกลุ่มวิศวกรรมและวิทยาศาสตร์คอมพิวเตอร์ตัดสินใจที่จะใช้แนวทางใหม่ แทนที่จะพยายามจัดการกับความซับซ้อนของภาษามือทั้งหมดในครั้งเดียว พวกเขามุ่งเน้นไปที่การทำความเข้าใจขั้นตอนแรกที่สำคัญ: การรับรู้อักษรมือ ASL ด้วยความแม่นยำที่ไม่เคยเห็นมาก่อนผ่าน AI
นึกถึงการ教คอมพิวเตอร์อ่านการเขียนมือ แต่ในสามมิติและเคลื่อนไหว ทีมงานสร้างสิ่งที่น่าประทับใจ: ชุดข้อมูล 29,820 รูปภาพที่แสดงอักษรมือ ASL ที่ไม่เคลื่อนไหว แต่พวกเขาไม่เพียงแค่รวบรวมรูปภาพ พวกเขายังทำเครื่องหมายที่แต่ละรูปภาพด้วย 21 จุดสำคัญบนมือ ซึ่งสร้างแผนที่ที่มีรายละเอียดเกี่ยวกับวิธีการเคลื่อนไหวและรูปทรงของมือ
ดร.บาเดอร์ อัลชาริฟ ผู้นำการวิจัยนี้ในฐานะผู้สมัครปริญญาเอกอธิบายว่า: “วิธีการนี้ยังไม่ได้ถูกสำรวจในงานวิจัยก่อนหน้านี้ ทำให้เป็นทิศทางใหม่และน่าหวังสำหรับการพัฒนาต่อในอนาคต”
การแบ่งเทคโนโลยี
มาทำความเข้าใจกับเทคโนโลยีที่รวมกันทำให้ระบบการรับรู้ภาษามือทำงาน
MediaPipe และ YOLOv8
สิ่งมหัศจรรย์เกิดขึ้นผ่านการรวมกันอย่างไร้รอยต่อของสองเครื่องมือที่มีพลัง: MediaPipe และ YOLOv8 นึกถึง MediaPipe เป็นนักสังเกตมือที่เชี่ยวชาญ – ผู้ตีความภาษามือที่สามารถติดตามการเคลื่อนไหวของนิ้วและตำแหน่งมือที่ละเอียดอ่อนได้ ทีมงานวิจัยเลือก MediaPipe โดยเฉพาะสำหรับความสามารถที่ยอดเยี่ยมในการให้การตรวจสอบจุดสำคัญบนมือที่แม่นยำ ซึ่งระบุ 21 จุดสำคัญบนมือแต่ละข้างตามที่กล่าวไว้ข้างต้น
แต่การตรวจสอบไม่เพียงพอ – เราต้องเข้าใจความหมายของการเคลื่อนไหวเหล่านี้ YOLOv8 เป็นนักติดตามรูปแบบที่รับจุดเหล่านั้นทั้งหมดและตัดสินว่าสิ่งเหล่านั้นแทนอักษรหรือการเคลื่อนไหวใด การวิจัยแสดงให้เห็นว่าเมื่อ YOLOv8 ประมวลผลภาพ จะแบ่งภาพออกเป็นกริด S × S โดยแต่ละเซลล์ในช่องต้องรับผิดชอบในการตรวจจับวัตถุ (ในกรณีนี้คือการเคลื่อนไหวของมือ) ภายในขอบเขตของมัน

Alsharif et al., Franklin Open (2024)
วิธีการทำงานของระบบ
กระบวนการนี้ซับซ้อนกว่าที่ดูเหมือนในตอนแรก
นี่คือสิ่งที่เกิดขึ้นเบื้องหลัง:
ขั้นตอนการตรวจจับมือ
เมื่อคุณทำสัญลักษณ์ MediaPipe ระบุมือของคุณในเฟรมและทำแผนที่ 21 จุดสำคัญเหล่านั้น จุดเหล่านี้ไม่ใช่จุดสุ่ม – สอดคล้องกับข้อต่อและจุดสำคัญบนมือของคุณ ตั้งแต่นิ้วหัวแม่มือไปจนถึงฐานของฝ่ามือ
การวิเคราะห์เชิงพื้นที่
YOLOv8 รับข้อมูลนี้และวิเคราะห์แบบเรียลไทม์ สำหรับแต่ละเซลล์ในช่องต้องคาดการณ์:
- ความน่าจะเป็นที่จะมีการเคลื่อนไหวของมือ
- พิกัดที่แน่นอนของตำแหน่งการเคลื่อนไหว
- คะแนนความมั่นใจของการคาดการณ์
การจำแนกประเภท
ระบบใช้การคาดการณ์ “การคาดการณ์กล่องขอบเขต” – นึกถึงการวาดรูปสี่เหลี่ยมจัตุรัสที่สมบูรณ์แบบรอบการเคลื่อนไหวของมือ YOLOv8 คำนวณค่าสำคัญ 5 ค่าสำหรับแต่ละกล่อง: พิกัด x และ y สำหรับจุดศูนย์กลาง, ความกว้าง, ความสูง และคะแนนความมั่นใจ

Alsharif et al., Franklin Open (2024)
เหตุผลที่การรวมนี้ทำงานได้ดี
ทีมวิจัยพบว่าการรวมเทคโนโลยีเหล่านี้ทำให้เกิดสิ่งที่มากกว่าผลรวมของส่วนประกอบ MediaPipe ที่ติดตามมืออย่างแม่นยำรวมกับการตรวจจับวัตถุของ YOLOv8 ทำให้เกิดผลลัพธ์ที่แม่นยำอย่างน่าประทับใจ – เรากำลังพูดถึงอัตราความแม่นยำ 98% และคะแนน F1 99%
สิ่งที่ทำให้สิ่งนี้น่าประทับใจเป็นพิเศษคือวิธีที่ระบบจัดการกับความซับซ้อนของภาษามือ บางสัญลักษณ์อาจดูเหมือนคล้ายกันมากสำหรับคนไม่ชำนาญ แต่ระบบสามารถสังเกตเห็นความแตกต่างที่ละเอียด
ผลลัพธ์ที่ทำลายสถิติ
เมื่อนักวิจัยพัฒนเทคโนโลยีใหม่ คำถามใหญ่เสมอคือ “มันทำงานได้ดีแค่ไหน?” สำหรับระบบการรับรู้ภาษามือนี้ ผลลัพธ์เป็นเรื่องที่น่าประทับใจ
ทีมงานจาก FAU ทดสอบระบบอย่างเข้มงวด และนี่คือสิ่งที่พวกเขาพบ:
- ระบบระบุสัญลักษณ์ถูกต้อง 98% ของเวลา
- มันจับ 98% ของสัญลักษณ์ทั้งหมดที่ทำขึ้น
- คะแนนประสิทธิภาพโดยรวมถึง 99%
“ผลลัพธ์จากงานวิจัยของเราแสดงให้เห็นถึงความสามารถของโมเดลในการตรวจจับและจำแนกอักษรมือ ASL ได้อย่างแม่นยำด้วยข้อผิดพลาดเพียงเล็กน้อย” อัลชาริฟ์อธิบาย
ระบบทำงานได้ดีในสถานการณ์จริง – ไฟที่แตกต่างกัน ตำแหน่งมือที่หลากหลาย และแม้กระทั่งบุคคลที่แตกต่างกันในการสื่อสาร
การผ่านทางนี้ผลักดันขอบเขตของสิ่งที่เป็นไปได้ในด้านการรับรู้ภาษามือ ระบบก่อนหน้านี้ต้องดิ้นรนกับความแม่นยำ แต่ด้วยการรวม MediaPipe ที่ติดตามมือเข้ากับการตรวจจับของ YOLOv8 ทีมวิจัยสร้างสิ่งที่พิเศษ
“ความสำเร็จของโมเดลนี้ส่วนใหญ่มาจากการรวมการเรียนรู้แบบถ่ายโอน การสร้างชุดข้อมูลอย่างรอบคอบ และการปรับให้แม่นยำ” โมฮัมหมัด อิลยาส หนึ่งในผู้เขียนร่วมของการศึกษานี้กล่าว การใส่ใจในรายละเอียดเหล่านี้ส่งผลให้ระบบมีประสิทธิภาพที่น่าประทับใจ
สิ่งนี้หมายถึงอะไรสำหรับการสื่อสาร
ความสำเร็จของระบบนี้เปิดโอกาสที่น่าตื่นเต้นสำหรับการทำให้การสื่อสารมีความเข้าถึงและครอบคลุมมากขึ้น
ทีมงานไม่ได้หยุดเพียงแค่การรับรู้ตัวอักษรเท่านั้น แต่ยังพยายามสอนให้ระบบเข้าใจรูปทรงและอิริยาบถของมือที่หลากหลายมากขึ้น นึกถึงช่วงเวลาที่สัญลักษณ์ดูเหมือนกันมาก เช่น ตัวอักษร ‘M’ และ ‘N’ ในภาษามือ ทีมวิจัยกำลังทำงานเพื่อช่วยให้ระบบจับข้อแตกต่างที่ละเอียดเหล่านี้ได้ดีขึ้น
ทีมงานกำลังเน้นไปที่:
- การทำให้ระบบทำงานบนอุปกรณ์ปกติได้อย่างราบรื่น
- การทำให้มันเร็วพอที่จะใช้ในการสนทนาจริง
- การทำให้แน่ใจว่ามันทำงานได้อย่างน่าเชื่อถือในสภาพแวดล้อมใดๆ
ดีน สเตลล่า บาตาลาม่า จากสหกลุ่มวิศวกรรมและวิทยาศาสตร์คอมพิวเตอร์ของ FAU แบ่งปันความมุ่งหมายที่ใหญ่กว่า: “ด้วยการปรับปรุงการรับรู้ภาษามืออเมริกัน งานนี้มีส่วนช่วยในการสร้างเครื่องมือที่สามารถเพิ่มการสื่อสารสำหรับชุมชนคนหูหนวกและคนตาบอด”
นึกถึงการเดินเข้าไปในห้องรอของแพทย์หรือการเข้าร่วมชั้นเรียนที่เทคโนโลยีนี้เชื่อมช่องว่างการสื่อสารทันที นั่นคือเป้าหมายที่แท้จริงที่นี่ – ทำให้ปฏิสัมพันธ์ประจำวันราบรื่นและเป็นธรรมชาติมากขึ้นสำหรับทุกคนที่เกี่ยวข้อง มันคือการสร้างเทคโนโลยีที่ช่วยให้ผู้คนเชื่อมต่อได้ ไม่ว่าจะในด้านการศึกษา การดูแลสุขภาพ หรือการสนทนาในชีวิตประจำวัน ระบบนี้เป็นก้าวหนึ่งเข้าสู่โลกที่ช่องว่างการสื่อสารยังคงเล็กลง












