การระดมทุน

Modulate ระดมทุน $25M เพื่อสร้างชั้นปัญญาประดิษฐ์สำหรับ Voice AI

mm
เพิ่ม Unite.AI ลงในแหล่งข้อมูลที่คุณต้องการบน Google

Modulate ได้ระดมทุนใหม่จำนวน $25 ล้าน ในขณะที่บริษัทที่ตั้งอยู่ในบอสตันมุ่งใช้ประโยชน์จากความท้าทายที่กำลังเติบโตในด้านปัญญาประดิษฐ์: การสอนเครื่องให้เข้าใจไม่เพียงแต่สิ่งที่คนพูด แต่ยังรวมถึงวิธีการพูดของพวกเขา.

Future Ventures นำรอบการระดมทุนนี้ พร้อมการเข้าร่วมจาก Hyperplane และ Lakestar. การระดมทุนนี้ทำให้เงินทุนรวมของ Modulate เพิ่มเป็น $60 ล้าน และจะถูกใช้เพื่อขยายการวิจัย AI ทีมวิศวกรรม เครื่องมือสำหรับนักพัฒนา ความร่วมมือ และตัวเลือกการใช้งาน

การลงทุนนี้เกิดขึ้นในขณะที่เสียงกำลังกลายเป็นอินเทอร์เฟซสำหรับเอเจนต์ AI แพลตฟอร์มบริการลูกค้า สภาพแวดล้อมเกม และระบบความปลอดภัยอย่างเพิ่มขึ้น ในขณะที่เทคโนโลยีการแปลงเสียงเป็นข้อความได้พัฒนาขึ้นอย่างมาก Modulate เชื่อว่าการมีเพียงบทถอดความเท่านั้นทำให้พลาดข้อมูลส่วนใหญ่ที่อยู่ในเสียงของมนุษย์

เทคโนโลยีของบริษัทจึงวิเคราะห์เสียงพื้นฐานเพื่อค้นหาสัญญาณต่าง ๆ เช่น อารมณ์ โทนเสียง ความตั้งใจ ช่วงพัก การพูดสังเคราะห์ และพฤติกรรมการสนทนา

ก้าวไกลเกินการแปลงเสียงเป็นข้อความ

ส่วนใหญ่ของสแต็ก AI เสียงในปัจจุบันใช้สถาปัตยกรรมที่ค่อนข้างตรงไปตรงมา: แปลงเสียงเป็นข้อความ แล้วส่งบทถอดความที่ได้ไปยังโมเดลภาษาใหญ่ (LLM).

วิธีนี้ทำงานได้ดีเมื่อคำพูดเองมีข้อมูลที่เกี่ยวข้องส่วนใหญ่ แต่จะจำกัดเมื่อความหมายขึ้นอยู่กับการล้อเลียน ความหงุดหงิด ความลังเล ความเครียด การขัดจังหวะ หรือการเปลี่ยนโทนเสียง

Modulate ได้สร้างแพลตฟอร์มหลักของตน Velma ตามแนวคิดว่าควรวิเคราะห์สัญญาณเหล่านี้โดยตรงจากเสียง แทนที่จะสร้างใหม่จากบทถอดความภายหลัง

บริษัทอธิบายว่า Velma เป็นระบบปัญญาประดิษฐ์การสนทนาที่ทำงานโดยใช้เสียงเป็นพื้นฐาน สามารถสร้างบทถอดความพร้อมกับการระบุผู้พูด อารมณ์ หัวข้อการสนทนา ความรู้สึก และพฤติกรรมมากกว่า 150 รายการ นักพัฒนายังสามารถกำหนดพฤติกรรมแบบกำหนดเองโดยใช้คำอธิบายภาษาธรรมชาติได้

สิ่งนี้ทำให้เทคโนโลยีสามารถนำไปใช้ในแอปพลิเคชันต่าง ๆ ตั้งแต่การระบุลูกค้าที่หงุดหงิดก่อนที่การสนทนาจะแย่ลง ไปจนถึงการตรวจจับพฤติกรรมที่น่าสงสัยระหว่างการทำธุรกรรมทางการเงิน หรือการระบุว่าเอเจนต์เสียง AI กำลังทำงานอย่างไม่คาดคิด

ในเดือนมิถุนายน Modulate เปิดให้เข้าถึง Velma โดยตรงแก่ผู้พัฒนาผ่าน API ทำให้การเข้าถึงขยายออกไปนอกเหนือจากการใช้งานในระดับองค์กรเดิม

Modulate ใช้วิธีการแบบ Ensemble กับ AI ด้านเสียง

สถาปัตยกรรมใต้ Velma คือสิ่งที่ Modulate เรียกว่า Ensemble Listening Model หรือ ELM.

แทนที่จะใช้โมเดลขนาดใหญ่ตัวเดียวทำทุกงาน ELM ประสานงานโมเดลเฉพาะทางมากกว่า 100 ตัว โดยแต่ละส่วนประกอบวิเคราะห์ลักษณะต่าง ๆ ของสตรีมเสียง

โมเดลเหล่านี้สามารถตรวจสอบคุณสมบัติพื้นฐาน เช่น การเปลี่ยนผู้พูดและช่วงพัก พร้อมกับสัญญาณระดับสูงเช่นอารมณ์ ความตั้งใจที่รับรู้ เครื่องหมายเสียงสังเคราะห์ ความสับสน หรือรูปแบบพฤติกรรม ชั้นการประสานงานจะรวมการสังเกตเหล่านั้นเป็นการตีความที่กว้างขึ้นของการสนทนา

นี่เป็นปรัชญาที่แตกต่างอย่างชัดเจนจากยุทธศาสตร์ที่กำลังเป็นที่นิยมมากขึ้นในการใช้โมเดลพื้นฐานมัลติโหมดขนาดใหญ่อย่างต่อเนื่องกับเสียง

Modulate อธิบายว่าการเชี่ยวชาญทำให้สถาปัตยกรรมของบริษัทสามารถให้ผลลัพธ์ที่โปร่งใสยิ่งขึ้นพร้อมกับลดปริมาณการคำนวณที่ต้องใช้ สำหรับแอปพลิเคชันระดับองค์กรเช่นการตรวจจับการฉ้อโกงและการปฏิบัติตามกฎระเบียบ ความสามารถในการเข้าใจเหตุผลที่ระบบส่งสัญญาณเตือนอาจสำคัญเทียบเท่ากับสัญญาณเตือนเอง

ตามที่บริษัทระบุ วิธีการนี้อาจมีประสิทธิภาพการคำนวณสูงสุดถึง 1,000 เท่าเมื่อเทียบกับการใช้โมเดลขนาดใหญ่ตัวเดียวสำหรับงานวิเคราะห์เสียงบางประเภท

Voice AI สร้างปัญหาการตรวจสอบใหม่

ช่วงเวลาของการระดมทุนยังสะท้อนถึงการเปลี่ยนแปลงที่กว้างขึ้นใน AI ระดับองค์กร

ระบบ AI มีความสามารถเพิ่มขึ้นในการดำเนินการสนทนาด้วยเสียงอย่างครบถ้วนกับลูกค้า ซึ่งหมายความว่าบริษัทต้องเฝ้าติดตามการโต้ตอบที่รวมไม่เพียงแต่พนักงานมนุษย์ แต่ยังรวมถึงเอเจนต์อัตโนมัติที่ทำงานในหลายพันหรืออาจเป็นหลายล้านการสนทนา

เอเจนต์เสียงอาจทำตามสคริปต์อย่างเทคนิคแต่ยังคงขัดจังหวะลูกค้าอย่างต่อเนื่อง ไม่สามารถรับรู้ความหงุดหงิดได้ เข้าใจความตั้งใจผิด หรือโต้ตอบอย่างไม่เหมาะสมต่อสถานการณ์ที่มีอารมณ์

Modulate มองเห็นโอกาสที่จะกลายเป็นชั้นการฟังอิสระที่ทำงานเคียงข้างเอเจนต์เหล่านั้น

เทคโนโลยีเอเจนต์เสียงของบริษัทออกแบบมาเพื่อระบุสัญญาณเช่นการขัดจังหวะ ช่วงพัก อารมณ์ สำเนียง และลักษณะอื่น ๆ ที่ยากต่อการจับจากข้อความเพียงอย่างเดียว ทำให้นักพัฒนาสามารถปรับพฤติกรรมของเอเจนต์ได้ขณะการสนทนายังคงดำเนินอยู่

โครงสร้างพื้นฐานเดียวกันนี้สามารถนำไปใช้กับการสนทนามนุษย์ที่องค์กรต้องระบุการฉ้อโกง ความเสี่ยงด้านการปฏิบัติตามกฎ ระหว่างการล่วงละเมิด หรือเหตุการณ์สำคัญอื่น ๆ ในเวลาจริง

จากการตรวจสอบเกมสู่ปัญญาประดิษฐ์เสียงที่กว้างขวาง

เป้าหมายปัจจุบันของ Modulate แสดงถึงการขยายตัวอย่างมีนัยสำคัญจากการมุ่งเน้นเดิมที่เกมออนไลน์

หนึ่งในผลิตภัณฑ์ที่เป็นที่รู้จักดีที่สุดของบริษัท, ToxMod, ถูกพัฒนาเพื่อวิเคราะห์การสื่อสารด้วยเสียงแบบเรียลไทม์บนแพลตฟอร์มเกมและสังคม และระบุการคุกคาม, ภัยคุกคาม, การล่อลวง, และพฤติกรรมที่เป็นอันตรายอื่น ๆ

สิ่งนั้นยังคงเป็นส่วนสำคัญของธุรกิจ Modulate กล่าวว่า ToxMod สามารถบูรณาการโดยตรงกับโครงสร้างพื้นฐานเสียงที่มีอยู่ในขณะเดียวกันก็ส่งต่อการโต้ตอบที่อาจเป็นปัญหาไปยังระบบการตรวจสอบหรือผู้ตรวจสอบมนุษย์

บริษัทได้ร่วมงานกับบริษัทเกมชั้นนำหลายแห่งรวมถึง Activision, Riot Games, Rockstar Games, และ Rec Room

แต่เทคโนโลยีพื้นฐานที่จำเป็นสำหรับการเข้าใจความเป็นพิษในเกมหลายผู้เล่นก็สามารถปรับใช้กับสภาพแวดล้อมอื่น ๆ ที่บริบทมีความสำคัญได้เช่นกัน

Modulate ตอนนี้วางตำแหน่งเทคโนโลยีของตนในด้านการป้องกันการฉ้อโกง, ศูนย์ติดต่อ, การดูแลเอเจนต์ AI, การตรวจจับดีปเฟก, ประสบการณ์ลูกค้า, และความเชื่อถือและความปลอดภัย

แพลตฟอร์มสำหรับนักพัฒนาของบริษัทในขณะนี้มีโมเดลหลายกลุ่มครอบคลุมการถอดเสียง, การตรวจจับดีปเฟก, การลบข้อมูลเสียง, ปัญญาประดิษฐ์การสนทนา, และความสามารถอื่น ๆ ในการวิเคราะห์เสียง

ดีปเฟกเพิ่มเหตุผลอีกหนึ่งประการให้เข้าใจเสียงโดยตรง

Synthetic speech กำลังกลายเป็นส่วนสำคัญอีกส่วนหนึ่งของโอกาสนั้น

เมื่อเทคโนโลยีการโคลนเสียงที่น่าเชื่อถือยิ่งขึ้นเข้ามาใช้ได้, องค์กรที่จัดการธุรกรรมทางการเงินหรือข้อมูลที่ละเอียดอ่อนต้องพิจารณาไม่เพียงแต่สิ่งที่ผู้โทรพูดเท่านั้น แต่ยังต้องตรวจสอบว่าเสียงนั้นเป็นของจริงหรือไม่

ดังนั้น Modulate จึงขยายเข้าสู่การตรวจจับดีปเฟกโดยผสานการวิเคราะห์เสียงสังเคราะห์กับข้อมูลบริบทที่กว้างขวางที่มีผ่านโมเดลเสียงของบริษัท

บริษัทกล่าวว่าเทคโนโลยีของตนในปัจจุบันวิเคราะห์เสียงมากกว่า 10 ล้านชั่วโมงต่อเดือนและได้ประมวลผลเสียงรวมกว่า 600 ล้านชั่วโมง

การขยายเข้าสู่ด้านเช่นการตรวจจับเพลงที่สร้างโดย AI ยังแสดงให้เห็นว่าโครงสร้างสถาปัตยกรรมพื้นฐานสามารถนำไปใช้ได้อย่างกว้างขวาง ตัวอย่างเช่น ระบบการตรวจจับเพลงของ Modulate จะประเมินการมีอยู่ของเพลง, เสียงร้องที่สร้างโดย AI, และเครื่องดนตรีที่สร้างโดย AI แยกกันก่อนจะรวมสัญญาณเหล่านั้นเป็นผลลัพธ์ที่สามารถตีความได้

ความท้าทายต่อไปสำหรับ AI เสียงคือการเข้าใจ ไม่ใช่การพูด

การลงทุนจำนวน 25 ล้านดอลลาร์ทำให้ Modulate มีทรัพยากรเพิ่มเติมเพื่อขยายการวิจัย, วิศวกรรม, เครื่องมือสำหรับนักพัฒนา, และความร่วมมือ อย่างกว้างขวางยิ่งขึ้น มันสะท้อนถึงความท้าทายที่เพิ่มขึ้นสำหรับ AI เสียง: การพูดอย่างเป็นธรรมชาติเป็นเพียงครึ่งหนึ่งของการสนทนา

เมื่อเอเจนต์เสียงเข้าสู่การให้บริการลูกค้า, การดูแลสุขภาพ, บริการทางการเงิน, และสาขาอื่น ๆ ระบบจะต้องเข้าใจสัญญาณที่การถอดข้อความมักพลาด เช่น ความหงุดหงิด, ความลังเล, การเน้น, โทนเสียง, และอาจมีเสียงสังเคราะห์

สิ่งนั้นอาจสร้างชั้นสติปัญญาใหม่รอบการโต้ตอบด้วยเสียง ช่วยให้ระบบตรวจจับการฉ้อโกง, รับรู้เมื่อผู้ใช้ไม่พอใจ, หรือระบุเมื่อเอเจนต์ AI เข้าใจผิดหรือจัดการการสนทนาไม่ถูกต้อง

แต่เทคโนโลยียังทำให้เกิดคำถามเกี่ยวกับความเป็นส่วนตัว, ความแม่นยำ, และอคติ การสรุปอารมณ์หรือเจตนาจากเสียงพูดเป็นเรื่องที่เป็นอัตวิสัยมากกว่าการถอดคำพูด โดยเฉพาะเมื่อครอบคลุมสำเนียง, ภาษา, และวัฒนธรรมที่แตกต่างกัน

เมื่อ AI มีความสามารถในการพูดเหมือนมนุษย์มากขึ้น แนวหน้าถัดไปอาจเป็นการกำหนดว่าเครื่องจักรสามารถฟังได้ดีแค่ไหน—และการใช้ความสามารถเหล่านั้นอย่างรับผิดชอบเป็นอย่างไร

อองตวนเป็นผู้นำที่มีวิสัยทัศน์และเป็นหุ้นส่วนผู้ก่อตั้งของ Unite.AI โดยมีความหลงใหลที่ไม่สั่นคลอนในการ塑造และ推廣อนาคตของ AI และหุ่นยนต์ เขาเป็นผู้ประกอบการซีรีย์ที่เชื่อว่า AI จะมีผลกระทบต่อสังคมมากเท่ากับไฟฟ้า และมักจะพูดถึงศักยภาพของเทคโนโลยีที่เป็นนวัตกรรมและ AGI

ในฐานะ นักอนาคต เขาได้ทำการสำรวจว่านวัตกรรมเหล่านี้จะเปลี่ยนแปลงโลกของเราอย่างไร นอกจากนี้เขายังเป็นผู้ก่อตั้ง Securities.io ซึ่งเป็นแพลตฟอร์มที่มุ่งเน้นในการลงทุนในเทคโนโลยีที่ทันสมัยที่สุดซึ่งกำลังเปลี่ยนแปลงอนาคตและเปลี่ยนแปลงอุตสาหกรรมทั้งหมด