โมเดลและแพลตฟอร์ม AI
aiOla เปิดตัว QUASAR เพื่อเปลี่ยนแปลงวิธีการทำงานของการรู้จำเสียงพูดในระดับ Production

aiOla ได้เปิดตัว QUASAR ซึ่งเป็นแพลตฟอร์มที่ออกแบบมาเพื่อแก้ไขปัญหาหนึ่งที่คงอยู่ในด้าน voice AI ขององค์กร ซึ่งก็คือ การรู้จำเสียงพูดที่ไม่สม่ำเสมอในสถานการณ์จริง แทนที่จะบังคับให้ลูกค้าใช้ ASR จากผู้ให้บริการเดียว QUASAR จะทำงานเป็นประตูอัจฉริยะที่ส่งต่อการร้องขอเสียงแต่ละครั้งไปยัง ASR ที่มีประสิทธิภาพสูงสุดในขณะนั้น
การเปลี่ยนแปลงนี้มีความสำคัญเนื่องจากเสียงพูดกลายเป็นข้อมูลหลักสำหรับ AI ที่ขับเคลื่อนด้วยเสียงในด้านต่างๆ เช่น ตัวแทนจำหน่าย คอมพลายแอนซ์ อนาลิติกส์ ค้นหา และระบบ AI อัตโนมัติ ที่เพิ่มขึ้นเรื่อยๆ ในขณะที่คะแนนการประเมินมักเป็นแนวทางในการเลือก ASR สภาพแวดล้อมการผลิตมักจะมีเสียงพูดที่มีเสียงพื้นหลัง อัตราการเปลี่ยนแปลงของเครือข่าย และคำศัพท์ที่เฉพาะเจาะจง ซึ่งสามารถเปลี่ยนแปลงความแม่นยำของการรู้จำเสียงพูดได้อย่างมาก
ทำไม ASR แบบ One-Size-Fits-All จึงล้มเหลวในระดับใหญ่
ส่วนใหญ่ขององค์กรในปัจจุบันจะใช้ ASR เป็นการตัดสินใจด้านโครงสร้างพื้นฐาน โดยเลือกผู้ให้บริการ ASR เดียวตามคะแนนการประเมินโดยรวมแล้วฝังตัวไว้ในกระบวนการทำงาน แต่ในทางปฏิบัติแล้ว สิ่งนี้ทำให้เกิดจุดบอด ASR ที่มีประสิทธิภาพสูงในการรู้จำเสียงพูดที่สะอาดและอ่านออกเสียงอาจต้องดิ้นรนในการรู้จำเสียงพูดที่มีเสียงพื้นหลังหรือคำศัพท์ที่เฉพาะเจาะจง ในขณะที่ ASR อีกตัวอาจสามารถจัดการกับเสียงพื้นหลังได้ดี แต่พลาดการรู้จำคำศัพท์ที่เหมาะสมหรือลำดับเลขที่สำคัญสำหรับการบัญชีและความถูกต้อง
การเปลี่ยนผู้ให้บริการ ASR เพื่อแก้ไขช่องว่างเหล่านี้มีค่าใช้จ่ายสูงและอาจทำให้เกิดการหยุดชะงัก ซึ่งอาจต้องมีการฝึกอบรมใหม่ การตรวจสอบใหม่ และการหยุดทำงาน ในขณะที่มีการเปิดตัว ASR ใหม่และอัปเดตอย่างต่อเนื่อง ซึ่งเกินความสามารถขององค์กรในการทดสอบและนำไปใช้ ส่งผลให้ประสิทธิภาพการรู้จำเสียงพูดลดลง การสรุปที่ไม่ถูกต้อง การวิเคราะห์ที่อ่อนแอ และค่าใช้จ่ายในการรับรองคุณภาพที่สูงขึ้น
ภายในโครงสร้างของ QUASAR: การรู้จำเสียงพูดเป็นปัญหาแบบไดนามิก
QUASAR มองการรู้จำเสียงพูดเป็นปัญหาในการเพิ่มประสิทธิภาพในเวลาจริง โดยการประเมินการร้องขอเสียงแต่ละครั้งก่อนที่จะทำการรู้จำเสียงพูด โดยพิจารณาจากปัจจัยต่างๆ เช่น ลักษณะของเสียงพูด สภาพแวดล้อมเสียงพื้นหลัง และบริบทของโดเมน จากการประเมินนี้ ระบบจะส่งต่อเสียงไปยัง ASR ที่มีประสิทธิภาพสูงสุดสำหรับการรู้จำเสียงพูดในขณะนั้น
จากมุมมองทางเทคนิค QUASAR ทำงานเป็นชั้นการกำกับดูแลที่สามารถทำงานร่วมกับ API ของคลาวด์เชิงพาณิชย์ โมเดลที่ติดตั้งเอง และการนำ ASR มาใช้เอง ชั้นการ trừส่วนนี้ช่วยให้องค์กรสามารถทดลองกับ ASR ใหม่ๆ จัดสรรต้นทุนและคุณภาพ และหลีกเลี่ยงการล็อกติดกับผู้ให้บริการโดยไม่ต้องเปลี่ยนแปลงแอปพลิเคชันในระดับล่าง
ที่แก่นกลางของ QUASAR คือกลไกการประเมินและจัดอันดับแบบไม่จำเป็นต้องมีการกำกับดูแล ซึ่งให้คะแนน ASR ต่างๆ ในเวลาจริง แทนที่จะพึ่งพาค่าเฉลี่ยทางประวัติศาสตร์ ระบบจะเรียนรู้อย่างต่อเนื่องจากสภาพแวดล้อมจริง ทำให้การตัดสินใจในการรู้จำเสียงพูดปรับเปลี่ยนไปตามสภาพแวดล้อม ผู้พูด และกรณีการใช้งานที่เปลี่ยนแปลงไป
ประสิทธิภาพในการรู้จำเสียงพูดในสถานการณ์จริง
ในการประเมินภายในที่ครอบคลุมหกรายการฐานข้อมูลมาตรฐานที่หลากหลาย ตั้งแต่เสียงพูดที่อ่านออกเสียงและเสียงพูดระดับมืออาชีพ ไปจนถึงเสียงพูดที่มีเสียงพื้นหลังและคำศัพท์ที่เฉพาะเจาะจง QUASAR ได้เลือก ASR ที่มีประสิทธิภาพสูงสุดด้วยความแม่นยำโดยรวม 88.8% หรือตัวเลือกที่ดีที่สุดเมื่อผลลัพธ์เท่ากัน ความแม่นยำสูงถึง 97% สำหรับเสียงพูดที่สะอาดและอยู่ในช่วง 79-88% สำหรับเสียงพูดที่ท้าทายซึ่งมีเสียงพื้นหลังและคำศัพท์ที่เฉพาะเจาะจง
ผลลัพธ์เหล่านี้เน้นย้ำถึงข้อค้นพบสำคัญว่า ไม่มี ASR เดียวที่ชนะอย่างต่อเนื่องในทุกสถานการณ์ แต่การกำหนดเส้นทางอัจฉริยะสามารถจับข้อดีของ ASR หลายตัวได้
การเปิดใช้งานเสียงพูดเป็นโครงสร้างพื้นฐานที่มีชีวิต
โดยการแยกการรู้จำเสียงพูดออกจากผู้ให้บริการที่ตายตัว QUASAR ทำให้ ASR กลายเป็น “โครงสร้างพื้นฐานที่มีชีวิต” ตามที่ aiOla อธิบาย องค์กรสามารถมองเห็นประสิทธิภาพการรู้จำเสียงพูดได้อย่างละเอียดที่ระดับการโต้ตอบ และสามารถปรับให้เหมาะสมกับความแม่นยำ ต้นทุน หรือความหน่วงตามกรณีการใช้งาน
แนวทางนี้ยังเร่งการขยายไปสู่ภูมิภาคและแนวตั้งใหม่ๆ แทนที่จะรอผู้ให้บริการ ASR เดียวที่จะรองรับภาษา เสียงพูด หรือคำศัพท์ที่เฉพาะเจาะจง องค์กรสามารถส่งต่อการร้องขอไปยัง ASR ที่เหมาะสมที่สุดสำหรับจุดเฉพาะนั้น และเปลี่ยนไปใช้ตัวเลือกที่ดีกว่าเมื่อมีการปรับปรุง
วิสัยทัศน์ที่กว้างขึ้นของ aiOla สำหรับกระบวนการทำงานที่ขับเคลื่อนด้วยเสียง
QUASAR สร้างขึ้นจากภารกิจที่กว้างขึ้นของ aiOla ในการทำให้เสียงพูดเป็น界面ธรรมชาติสำหรับระบบองค์กร โมเดลที่ได้รับอนุญาตของบริษัทผสมผสานการรู้จำเสียงพูดกับข้อมูลการทำงานเพื่อแปลงการรับเข้าเสียงพูดเป็นข้อมูลที่มีโครงสร้างและทันเวลา ทำให้สามารถทำงานอัตโนมัติได้ด้วยมือฟรีในอุตสาหกรรมที่สำคัญที่การป้อนข้อมูลด้วยมือยังคงเป็นปัญหาการขัดขวาง
ด้วยเงินทุน 58 ล้านดอลลาร์และทีมที่ขับเคลื่อนด้วยการวิจัย aiOla กำลังวางตำแหน่งเสียงพูดไม่เพียงแต่เป็นวิธีการป้อนข้อมูลเท่านั้น แต่ยังเป็นโครงสร้างพื้นฐานสำหรับการดำเนินงาน AI ที่ขับเคลื่อนด้วยเสียง ด้วย QUASAR บริษัทกำลังขยายวิสัยทัศน์นี้ไปยังชั้น ASR เอง โดยท้าทายสมมติฐานที่มีมานานเกี่ยวกับวิธีการใช้ ASR ในระดับใหญ่
เมื่อเสียงพูดกลายเป็น界面หลักสำหรับทั้ง AI และระบบองค์กร การรู้จำเสียงพูดที่มีบริบทและตระหนักถึงสถานการณ์อาจเป็นสิ่งจำเป็น การเปิดตัว QUASAR ส่งสัญญาณถึงการเปลี่ยนแปลงจากตัวเลือกแบบจำลองที่ตายตัวไปสู่การกำกับดูแลที่ขับเคลื่อนด้วยประสิทธิภาพ ซึ่งอาจเปลี่ยนแปลงวิธีที่ระบบ AI ที่ขับเคลื่อนด้วยเสียงทั้งหมดใช้ ASR












