โมเดลและแพลตฟอร์ม AI

aiOla เปิดตัว QUASAR เพื่อเปลี่ยนแปลงวิธีการทำงานของการรู้จำเสียงพูดในระดับ Production

mm
เพิ่ม Unite.AI ลงในแหล่งข้อมูลที่คุณต้องการบน Google

aiOla ได้เปิดตัว QUASAR ซึ่งเป็นแพลตฟอร์มที่ออกแบบมาเพื่อแก้ไขปัญหาหนึ่งที่คงอยู่ในด้าน voice AI ขององค์กร ซึ่งก็คือ การรู้จำเสียงพูดที่ไม่สม่ำเสมอในสถานการณ์จริง แทนที่จะบังคับให้ลูกค้าใช้ ASR จากผู้ให้บริการเดียว QUASAR จะทำงานเป็นประตูอัจฉริยะที่ส่งต่อการร้องขอเสียงแต่ละครั้งไปยัง ASR ที่มีประสิทธิภาพสูงสุดในขณะนั้น

การเปลี่ยนแปลงนี้มีความสำคัญเนื่องจากเสียงพูดกลายเป็นข้อมูลหลักสำหรับ AI ที่ขับเคลื่อนด้วยเสียงในด้านต่างๆ เช่น ตัวแทนจำหน่าย คอมพลายแอนซ์ อนาลิติกส์ ค้นหา และระบบ AI อัตโนมัติ ที่เพิ่มขึ้นเรื่อยๆ ในขณะที่คะแนนการประเมินมักเป็นแนวทางในการเลือก ASR สภาพแวดล้อมการผลิตมักจะมีเสียงพูดที่มีเสียงพื้นหลัง อัตราการเปลี่ยนแปลงของเครือข่าย และคำศัพท์ที่เฉพาะเจาะจง ซึ่งสามารถเปลี่ยนแปลงความแม่นยำของการรู้จำเสียงพูดได้อย่างมาก

ทำไม ASR แบบ One-Size-Fits-All จึงล้มเหลวในระดับใหญ่

ส่วนใหญ่ขององค์กรในปัจจุบันจะใช้ ASR เป็นการตัดสินใจด้านโครงสร้างพื้นฐาน โดยเลือกผู้ให้บริการ ASR เดียวตามคะแนนการประเมินโดยรวมแล้วฝังตัวไว้ในกระบวนการทำงาน แต่ในทางปฏิบัติแล้ว สิ่งนี้ทำให้เกิดจุดบอด ASR ที่มีประสิทธิภาพสูงในการรู้จำเสียงพูดที่สะอาดและอ่านออกเสียงอาจต้องดิ้นรนในการรู้จำเสียงพูดที่มีเสียงพื้นหลังหรือคำศัพท์ที่เฉพาะเจาะจง ในขณะที่ ASR อีกตัวอาจสามารถจัดการกับเสียงพื้นหลังได้ดี แต่พลาดการรู้จำคำศัพท์ที่เหมาะสมหรือลำดับเลขที่สำคัญสำหรับการบัญชีและความถูกต้อง

การเปลี่ยนผู้ให้บริการ ASR เพื่อแก้ไขช่องว่างเหล่านี้มีค่าใช้จ่ายสูงและอาจทำให้เกิดการหยุดชะงัก ซึ่งอาจต้องมีการฝึกอบรมใหม่ การตรวจสอบใหม่ และการหยุดทำงาน ในขณะที่มีการเปิดตัว ASR ใหม่และอัปเดตอย่างต่อเนื่อง ซึ่งเกินความสามารถขององค์กรในการทดสอบและนำไปใช้ ส่งผลให้ประสิทธิภาพการรู้จำเสียงพูดลดลง การสรุปที่ไม่ถูกต้อง การวิเคราะห์ที่อ่อนแอ และค่าใช้จ่ายในการรับรองคุณภาพที่สูงขึ้น

ภายในโครงสร้างของ QUASAR: การรู้จำเสียงพูดเป็นปัญหาแบบไดนามิก

QUASAR มองการรู้จำเสียงพูดเป็นปัญหาในการเพิ่มประสิทธิภาพในเวลาจริง โดยการประเมินการร้องขอเสียงแต่ละครั้งก่อนที่จะทำการรู้จำเสียงพูด โดยพิจารณาจากปัจจัยต่างๆ เช่น ลักษณะของเสียงพูด สภาพแวดล้อมเสียงพื้นหลัง และบริบทของโดเมน จากการประเมินนี้ ระบบจะส่งต่อเสียงไปยัง ASR ที่มีประสิทธิภาพสูงสุดสำหรับการรู้จำเสียงพูดในขณะนั้น

จากมุมมองทางเทคนิค QUASAR ทำงานเป็นชั้นการกำกับดูแลที่สามารถทำงานร่วมกับ API ของคลาวด์เชิงพาณิชย์ โมเดลที่ติดตั้งเอง และการนำ ASR มาใช้เอง ชั้นการ trừส่วนนี้ช่วยให้องค์กรสามารถทดลองกับ ASR ใหม่ๆ จัดสรรต้นทุนและคุณภาพ และหลีกเลี่ยงการล็อกติดกับผู้ให้บริการโดยไม่ต้องเปลี่ยนแปลงแอปพลิเคชันในระดับล่าง

ที่แก่นกลางของ QUASAR คือกลไกการประเมินและจัดอันดับแบบไม่จำเป็นต้องมีการกำกับดูแล ซึ่งให้คะแนน ASR ต่างๆ ในเวลาจริง แทนที่จะพึ่งพาค่าเฉลี่ยทางประวัติศาสตร์ ระบบจะเรียนรู้อย่างต่อเนื่องจากสภาพแวดล้อมจริง ทำให้การตัดสินใจในการรู้จำเสียงพูดปรับเปลี่ยนไปตามสภาพแวดล้อม ผู้พูด และกรณีการใช้งานที่เปลี่ยนแปลงไป

ประสิทธิภาพในการรู้จำเสียงพูดในสถานการณ์จริง

ในการประเมินภายในที่ครอบคลุมหกรายการฐานข้อมูลมาตรฐานที่หลากหลาย ตั้งแต่เสียงพูดที่อ่านออกเสียงและเสียงพูดระดับมืออาชีพ ไปจนถึงเสียงพูดที่มีเสียงพื้นหลังและคำศัพท์ที่เฉพาะเจาะจง QUASAR ได้เลือก ASR ที่มีประสิทธิภาพสูงสุดด้วยความแม่นยำโดยรวม 88.8% หรือตัวเลือกที่ดีที่สุดเมื่อผลลัพธ์เท่ากัน ความแม่นยำสูงถึง 97% สำหรับเสียงพูดที่สะอาดและอยู่ในช่วง 79-88% สำหรับเสียงพูดที่ท้าทายซึ่งมีเสียงพื้นหลังและคำศัพท์ที่เฉพาะเจาะจง

ผลลัพธ์เหล่านี้เน้นย้ำถึงข้อค้นพบสำคัญว่า ไม่มี ASR เดียวที่ชนะอย่างต่อเนื่องในทุกสถานการณ์ แต่การกำหนดเส้นทางอัจฉริยะสามารถจับข้อดีของ ASR หลายตัวได้

การเปิดใช้งานเสียงพูดเป็นโครงสร้างพื้นฐานที่มีชีวิต

โดยการแยกการรู้จำเสียงพูดออกจากผู้ให้บริการที่ตายตัว QUASAR ทำให้ ASR กลายเป็น “โครงสร้างพื้นฐานที่มีชีวิต” ตามที่ aiOla อธิบาย องค์กรสามารถมองเห็นประสิทธิภาพการรู้จำเสียงพูดได้อย่างละเอียดที่ระดับการโต้ตอบ และสามารถปรับให้เหมาะสมกับความแม่นยำ ต้นทุน หรือความหน่วงตามกรณีการใช้งาน

แนวทางนี้ยังเร่งการขยายไปสู่ภูมิภาคและแนวตั้งใหม่ๆ แทนที่จะรอผู้ให้บริการ ASR เดียวที่จะรองรับภาษา เสียงพูด หรือคำศัพท์ที่เฉพาะเจาะจง องค์กรสามารถส่งต่อการร้องขอไปยัง ASR ที่เหมาะสมที่สุดสำหรับจุดเฉพาะนั้น และเปลี่ยนไปใช้ตัวเลือกที่ดีกว่าเมื่อมีการปรับปรุง

วิสัยทัศน์ที่กว้างขึ้นของ aiOla สำหรับกระบวนการทำงานที่ขับเคลื่อนด้วยเสียง

QUASAR สร้างขึ้นจากภารกิจที่กว้างขึ้นของ aiOla ในการทำให้เสียงพูดเป็น界面ธรรมชาติสำหรับระบบองค์กร โมเดลที่ได้รับอนุญาตของบริษัทผสมผสานการรู้จำเสียงพูดกับข้อมูลการทำงานเพื่อแปลงการรับเข้าเสียงพูดเป็นข้อมูลที่มีโครงสร้างและทันเวลา ทำให้สามารถทำงานอัตโนมัติได้ด้วยมือฟรีในอุตสาหกรรมที่สำคัญที่การป้อนข้อมูลด้วยมือยังคงเป็นปัญหาการขัดขวาง

ด้วยเงินทุน 58 ล้านดอลลาร์และทีมที่ขับเคลื่อนด้วยการวิจัย aiOla กำลังวางตำแหน่งเสียงพูดไม่เพียงแต่เป็นวิธีการป้อนข้อมูลเท่านั้น แต่ยังเป็นโครงสร้างพื้นฐานสำหรับการดำเนินงาน AI ที่ขับเคลื่อนด้วยเสียง ด้วย QUASAR บริษัทกำลังขยายวิสัยทัศน์นี้ไปยังชั้น ASR เอง โดยท้าทายสมมติฐานที่มีมานานเกี่ยวกับวิธีการใช้ ASR ในระดับใหญ่

เมื่อเสียงพูดกลายเป็น界面หลักสำหรับทั้ง AI และระบบองค์กร การรู้จำเสียงพูดที่มีบริบทและตระหนักถึงสถานการณ์อาจเป็นสิ่งจำเป็น การเปิดตัว QUASAR ส่งสัญญาณถึงการเปลี่ยนแปลงจากตัวเลือกแบบจำลองที่ตายตัวไปสู่การกำกับดูแลที่ขับเคลื่อนด้วยประสิทธิภาพ ซึ่งอาจเปลี่ยนแปลงวิธีที่ระบบ AI ที่ขับเคลื่อนด้วยเสียงทั้งหมดใช้ ASR

อองตวนเป็นผู้นำที่มีวิสัยทัศน์และเป็นหุ้นส่วนผู้ก่อตั้งของ Unite.AI โดยมีความหลงใหลที่ไม่สั่นคลอนในการ塑造และ推廣อนาคตของ AI และหุ่นยนต์ เขาเป็นผู้ประกอบการซีรีย์ที่เชื่อว่า AI จะมีผลกระทบต่อสังคมมากเท่ากับไฟฟ้า และมักจะพูดถึงศักยภาพของเทคโนโลยีที่เป็นนวัตกรรมและ AGI

ในฐานะ นักอนาคต เขาได้ทำการสำรวจว่านวัตกรรมเหล่านี้จะเปลี่ยนแปลงโลกของเราอย่างไร นอกจากนี้เขายังเป็นผู้ก่อตั้ง Securities.io ซึ่งเป็นแพลตฟอร์มที่มุ่งเน้นในการลงทุนในเทคโนโลยีที่ทันสมัยที่สุดซึ่งกำลังเปลี่ยนแปลงอนาคตและเปลี่ยนแปลงอุตสาหกรรมทั้งหมด