โมเดลและแพลตฟอร์ม AI

Speechmatics เปิดตัวซอฟต์แวร์การจดจำเสียงอัตโนมัติ

mm
เพิ่ม Unite.AI ลงในแหล่งข้อมูลที่คุณต้องการบน Google

บริษัทสตาร์ทอัพเทคโนโลยีการจดจำเสียงชั้นนำ Speechmatics ได้เปิดตัวซอฟต์แวร์ ‘การรู้จำเสียงอัตโนมัติ’ ที่ใช้เทคนิคการเรียนรู้ลึกที่ทันสมัยและแบบจำลองการฝึกอบรมด้วยตนเองที่มีประสิทธิภาพ

ชุดข้อมูลของ Stanford

Speechmatics ใช้ข้อมูลจาก ‘การวิจัยความแตกต่างทางเชื้อชาติในการจดจำเสียง’ ของ Stanford และสามารถบรรลุความแม่นยำโดยรวม 82.8% สำหรับเสียงของชาวอเมริกันเชื้อสายแอฟริกา ในขณะที่ Google (GOOGL ) มีเพียง 68.7% และ Amazon (AMZN ) มีเพียง 68.6%

ระดับความแม่นยำนี้เทียบเท่ากับการลดข้อผิดพลาดในการจดจำเสียงลง 45% ซึ่งเท่ากับสามคำในประโยคปกติ นอกจากความแม่นยำแล้ว ระบบ Speechmatics ใหม่ยังแสดงให้เห็นถึงความแม่นยำที่ดีขึ้นในเรื่องของเสียงพูด อายุ ส่วนผสมทางสังคม และลักษณะทางสังคมประชากรอื่นๆ

มักจะมีความเข้าใจผิดในการจดจำเสียงเนื่องจากข้อมูลที่มีฉลากที่จำกัดที่อัลกอริทึมสามารถใช้ในการฝึกอบรมได้ ข้อมูลที่มีฉลากจำเป็นต้องมีการจัดประเภทโดยมนุษย์ ซึ่งหมายความว่ามีข้อมูลน้อยสำหรับระบบเหล่านี้ นอกจากนี้ยังจำกัดการแสดงเสียงทั้งหมด ซึ่งสร้างปัญหาใหม่

การฝึกอบรมด้วยข้อมูลที่ไม่มีฉลาก

Speechmatics ก้าวหน้าอย่างมากในด้านนี้ เนื่องจากเทคโนโลยีของพวกเขาได้รับการฝึกอบรมจากข้อมูลที่ไม่มีฉลากจำนวนมากที่มาจากอินเทอร์เน็ต ข้อมูลนี้มาจากสื่อสังคมออนไลน์ และพอดแคสต์

การเรียนรู้ด้วยตนเองทำให้ระบบสามารถฝึกอบรมได้ 1.1 ล้านชั่วโมง ซึ่งเพิ่มขึ้นจาก 30,000 ชั่วโมงก่อนหน้านี้ ทำให้มีการแสดงเสียงที่หลากหลายมากขึ้น และช่วยลดความลำเอียงและข้อผิดพลาดในการจดจำเสียง

เมื่อพูดถึงเสียงเด็ก Speechmatics ยังแสดงให้เห็นถึงความสามารถในการเอาชนะคู่แข่งด้วย โดยบรรลุความแม่นยำ 91.8% ในขณะที่ Google มีเพียง 83.4% และ Deepgram มีเพียง 82.3%

Katy Wigdahl เป็น CEO ของ Speechmatics

“เรามีภารกิจในการส่งมอบความสามารถในการเรียนรู้ของเครื่องรุ่นต่อไป และให้เทคโนโลยีการพูดที่ครอบคลุมและเข้าถึงได้มากขึ้น การประกาศครั้งนี้เป็นขั้นตอนสำคัญในการบรรลุภารกิจนั้น”

“การมุ่งเน้นของเราที่จะจัดการกับความลำเอียงของ AI นำไปสู่ความก้าวหน้าที่ยิ่งใหญ่นี้ในอุตสาหกรรมการจดจำเสียง และผลกระทบจะนำไปสู่การเปลี่ยนแปลงในหลายๆ สถานการณ์” Wigdahl กล่าวต่อ “ลองนึกถึงคำบรรยายที่ไม่ถูกต้องที่เรามองเห็นบนโซเชียลมีเดีย การพิจารณาคดีที่คำพูดถูกเขียนผิด และแพลตฟอร์ม eLearning ที่ต้องดิ้นรนในการรับเสียงเด็กๆ ตลอดการระบาดของโควิด-19 ข้อผิดพลาดที่ผู้คนต้องยอมรับจนถึงตอนนี้สามารถส่งผลกระทบต่อชีวิตประจำวันของพวกเขาได้”

Allison Zhu Koenecke เป็นผู้เขียนนำของการศึกษาที่ Stanford เกี่ยวกับการจดจำเสียง

“มันสำคัญที่จะศึกษาและปรับปรุงความยุติธรรมในระบบสปีช-ทู-เท็กซต์ เนื่องจากมีศักยภาพที่จะก่อให้เกิดอันตรายที่แตกต่างกันต่อบุคคลผ่านภาคส่วนต่างๆ ตั้งแต่สุขภาพไปจนถึงกระบวนการยุติธรรม”

Alex นำทีมการดำเนินงานข่าวสารที่ขับเคลื่อนด้วย AI ของ Unite.AI โดยผสานการทำข่าว, การวิจัย และระบบอัตโนมัติเพื่อสนับสนุนการครอบคลุมปัญญาประดิษฐ์อย่างทันท่วงทีและขยายได้ งานของเขาช่วยให้การพัฒนาปัญญาประดิษฐ์ที่กำลังเกิดขึ้นถูกนำเสนออย่างมีประสิทธิภาพในขณะที่ยังคงรักษามาตรฐานบรรณาธิการของสำนักพิมพ์.