โมเดลและแพลตฟอร์ม AI

Google DeepMind นำเทคโนโลยีแปลภาษามือมาใช้กับโทรศัพท์มือถือด้วย SL2T

mm
เพิ่ม Unite.AI ลงในแหล่งข้อมูลที่คุณต้องการบน Google

Google DeepMind ได้พัฒนาและเปิดตัวโมเดลแปลภาษามือ SL2T ซึ่งเป็นครั้งแรกที่เทคโนโลยีแปลภาษามือมาถึงฟีเจอร์โทรศัพท์มือถือ โมเดลนี้สามารถแปลภาษามือเป็นข้อความใน Gboard และ Live Transcribe บนโทรศัพท์ Pixel 11 โดยเริ่มต้นด้วยการแปลภาษามืออเมริกัน (American Sign Language) เป็นภาษาอังกฤษเมื่อวันที่ 12 สิงหาคม 2026

ฟีเจอร์นี้สามารถใช้งานได้ทุกที่ที่ผู้ใช้ปกติจะพิมพ์ ผู้ใช้ที่เป็นคนหูหนวกสามารถพูดคุยหรือเขียนข้อความโดยใช้ภาษามือแทนการพิมพ์ ใน Live Transcribe ผู้ใช้สามารถตอบกลับโดยใช้ภาษามือแทนที่การพิมพ์ Google ระบุว่าผู้ทดสอบพบว่าการใช้ภาษามือเป็นวิธีที่เร็วและเป็นธรรมชาติมากกว่าการพิมพ์ภาษาอังกฤษ

SL2T เป็นโมเดลแรกที่ Google อธิบายว่าเป็นผลงานที่มีคุณภาพและความสามารถในการแปลภาษามือที่ดีเยี่ยม โมเดลนี้ได้รับการฝึกฝนจากข้อมูลการแสดงภาษามือมากกว่า 100,000 ชั่วโมง โดยครอบคลุมภาษามือมากกว่า 50 ภาษา โดยมีข้อมูลภาษามืออเมริกันประมาณหนึ่งในสี่ของทั้งหมด การฝึกฝนร่วมกันระหว่างภาษา องศา และระดับความสามารถ ทำให้โมเดลนี้มีประสิทธิภาพมากกว่าระบบเดียวใน实验ของบริษัท ตามที่ระบุใน ประกาศ

สิ่งที่โมเดลเห็นและแปล

ระบบไม่ได้ประมวลผลวิดีโอของคนแสดงภาษามือโดยตรง โมเดล MediaPipe Holistic ที่ทำงานบนอุปกรณ์สามารถติดตามจุดสำคัญ 130 จุดบนใบหน้า ร่างกาย และมือของคนแสดงภาษามือทุกเฟรม และส่งพิกัดทางเรขาคณิตเหล่านี้ออกไปเพื่อแปลภาษา โดยไม่ส่งวิดีโอของคนแสดงภาษามือออกไป ซึ่งเป็นรูปแบบการออกแบบที่ Google กล่าวว่าเป็นการรักษาความเป็นส่วนตัว

จากกระแสพิกัดเหล่านี้ SL2T สามารถสร้างข้อความภาษาอังกฤษได้โดยตรง โดยไม่ต้องผ่านชั้นกลางที่เรียกว่า glosses ซึ่งเป็นชั้นที่ระบบแปลภาษามือส่วนใหญ่เคยใช้ Glosses จะมอบฉลากที่ตายตัวให้กับภาษามือแต่ละภาษา ซึ่งจำกัดคำศัพท์และสูญเสียเครื่องหมายที่ไม่ใช่มือและโครงสร้างพื้นที่ที่มีความหมายทางไวยากรณ์ในภาษามือ การลบชั้นนี้ทำให้คุณภาพการแปลสามารถปรับขนาดตามข้อมูลการฝึกฝนได้

ภาษามือเป็นภาษาที่เป็นอิสระและมีไวยากรณ์ของตนเอง ไม่ใช่ภาษาที่แสดงเป็นภาษาพูด ซึ่งทำให้การแปลภาษามือเป็นภาษาอังกฤษเป็นงานที่ยาก และเป็นปัญหาที่ยากในการติดตามการเคลื่อนไหวของมือ ศอก ตัว และใบหน้าในอัตราเฟรมสูง

ผลลัพธ์จากการทดสอบและรูปแบบข้อผิดพลาดที่เหลืออยู่

ใน FLEURS-ASL benchmark ซึ่งเป็นมาตรฐานที่วัดคุณภาพการแปลภาษามืออเมริกันเป็นภาษาอังกฤษ SL2T ได้รับคะแนน 70 BLEURT ซึ่งเป็นคะแนนสูงสุดที่เคยรายงานมาก่อนหน้านี้ ตามที่ Google ระบุ

Google เผยแพร่ตัวอย่างผลลัพธ์จาก FLEURS-ASL โดยแสดงผลลัพธ์ที่ดีและรูปแบบข้อผิดพลาดที่สามารถระบุได้ โมเดลนี้อาจแทนที่ภาษามือที่หายากและตัวอักษรที่เร็วเกินไป และอาจสูญเสียการก่อสร้างแบบผสมและภาพที่แสดงถึงการกระทำ

ที่ที่ Google ระบุว่าเครื่องมือนี้ไม่ควรใช้

การเปิดตัวครั้งนี้มีการกำกับดูแลในระดับที่ไม่เหมือนใคร Google DeepMind ได้ก่อตั้งคณะกรรมการที่ปรึกษาด้านภาษามือ ซึ่งรวมถึงองค์กรคนหูหนวกหลายแห่ง เช่น National Association of the Deaf, World Federation of the Deaf, Deaf Professional Arts Network และ Rochester Institute of Technology’s National Technical Institute for the Deaf

คณะกรรมการได้ร่วมกันเผยแพร่ รายงานผลกระทบร่วมกัน ซึ่งระบุว่า SL2T 1.0 เป็นเครื่องมือช่วยในการสร้างข้อความสำหรับการสื่อสารที่ไม่เป็นทางการ เช่น การส่งข้อความ การค้นหา การนำทาง และการสนทนา

วิธีการทำงานของ SL2T ในขอบเขตของโมเดล

รายงานผลกระทบรวมถึงขอบเขตทางเทคนิคของโมเดล โดยละเอียด คุณภาพการแปลภาษาลดลงในสถานการณ์ที่มีแสงสว่างต่ำ หรือเมื่อเสื้อผ้าทำให้ความแตกต่างระหว่างมือและใบหน้าลดลง โมเดลนี้สามารถติดตามการเคลื่อนไหวของคนแสดงภาษามือได้เพียงคนเดียว และไม่สามารถจัดการกับการแสดงภาษามือหลายคนได้

การอัปเดตในระยะใกล้จะรวมถึงการเพิ่มการแปลภาษาและเครื่องหมายวรรคตอน การเพิ่มความสามารถในการจดจำการเคลื่อนไหวของใบหน้าและคิ้ว และการสนับสนุนภาษามือหลายภาษา

โครงการนี้เริ่มต้นด้วย Sam Sepah ผู้ที่เป็นคนหูหนวก และมุมมองของคนหูหนวกถูกนำมาใช้ในการรวบรวมข้อมูล การทดสอบ และการประเมิน Google ระบุว่าการเปิดตัว SL2T เป็นเพียงจุดเริ่มต้นของความพยายามที่ยาวนานกว่านี้ โดยมีเป้าหมายในการพัฒนาภาษามือเพิ่มเติม การสร้างภาษามือ และความสามารถอื่นๆ ที่กว้างขวางกว่า

ฟีเจอร์นี้จะมาถึงในโทรศัพท์ Pixel 11 โดยไม่มีค่าใช้จ่ายเพิ่มเติม และจะตามมาในอุปกรณ์อื่นๆ ในอนาคต โดยการนำเทคโนโลยีนี้ไปใช้ในการรวบรวมข้อมูล การศึกษาผู้ใช้ และการประเมิน Google ระบุว่าการเปิดตัว SL2T เป็นเพียงจุดเริ่มต้นของความพยายามที่ยาวนานกว่านี้

จอนาส รีฟ เป็นนักวิเคราะห์ที่สร้างโดย AI ที่ Unite.AI โดยมุ่งเน้นไปที่ปัญญาประดิษฐ์แบบ认知 (Cognitive AI) ปัญญาประดิษฐ์ทั่วไป (Artificial General Intelligence - AGI) และรากฐานทางทฤษฎีของปัญญาประดิษฐ์ เขาได้สำรวจว่ากระบวนการเรียนรู้ การให้เหตุผล ความจำ และการสรุปผลเกิดขึ้นในระบบทางชีววิทยาและระบบประดิษฐ์ โดยเชื่อมโยงระหว่างโครงสร้าง AI สมัยใหม่และคำถามที่มีมานานในด้านวิทยาศาสตร์认知และปรัชญาของจิต

ด้วยแนวทางเชิงแนวคิดและสะท้อนกลับ จอนาสได้ตรวจสอบกรอบการทำงาน เช่น โมเดลการให้เหตุผล ระบบอージェนต์ การรับรู้ที่เกิดขึ้น และทฤษฎีการจัดตำแหน่ง โดยมีเป้าหมายเพื่อชี้แจงว่าการก้าวหน้าไปสู่ AGI หมายถึงอะไร และไม่หมายถึงอะไร โดยไม่ได้ตาม đuổiเส้นเวลาหรือการโฆษณา เขาเน้นย้ำถึงหลักการแรก การใช้เหตุผลเชิงแนวคิด และข้อจำกัดของโมเดลปัจจุบัน

บทความที่เขียนโดยจอนาส รีฟเป็นผลงานที่สร้างโดย AI และได้รับการตรวจสอบโดยทีมบรรณาธิการของ Unite.AI เพื่อให้แน่ใจถึงความถูกต้อง ความชัดเจน และการอภิปรายที่มีความรับผิดชอบเกี่ยวกับแนวคิด AI ที่ทันสมัย