โมเดลและแพลตฟอร์ม AI

โมดูเลทแนะนำโมเดลการฟังแบบアンサンブル Redefining วิธีการที่ AI เข้าใจเสียงมนุษย์

mm
เพิ่ม Unite.AI ลงในแหล่งข้อมูลที่คุณต้องการบน Google

ปัญญาประดิษฐ์ได้ก้าวหน้าอย่างรวดเร็ว แต有一 lĩnh vựcที่ยังคงยากต่อการทำความเข้าใจอย่างแท้จริงคือเสียงมนุษย์ ไม่ใช่แค่คำพูด แต่ยังรวมถึงอารมณ์ที่อยู่เบื้องหลัง การตั้งใจที่ถูกกำหนดโดยโทนและจังหวะ และสัญญาณที่ละเอียดอ่อนที่ทำให้สามารถแยกแยะระหว่างการพูดคุยที่เป็นมิตรและความโกรธหรือการหลอกลวงได้ วันนี้ Modulate ประกาศความสำเร็จครั้งสำคัญด้วยการเปิดตัว Ensemble Listening Model (ELM) ซึ่งเป็นโครงสร้าง AI ใหม่ที่ออกแบบมาเพื่อการฟังเสียงในโลกแห่งความเป็นจริง

ร่วมกับการประกาศการวิจัย โมดูเลทเปิดตัว Velma 2.0 ซึ่งเป็นการนำโมเดลการฟังแบบアンサンブルไปใช้ในการผลิตเป็นครั้งแรก บริษัทระบุว่า Velma 2.0 มีความแม่นยำในการสนทนาสูงกว่าโมเดลภาษาขนาดใหญ่ และมีค่าใช้จ่ายที่ต่ำกว่ามาก ซึ่งเป็นข้ออ้างที่สำคัญในยุคที่องค์กรต่างๆ กำลังประเมินความยั่งยืนของการนำ AI ไปใช้

ทำไมเสียงจึงยากต่อการทำความเข้าใจสำหรับ AI

ระบบ AI ส่วนใหญ่ที่วิเคราะห์เสียงจะใช้วิธีการที่คุ้นเคย คือการแปลงเสียงเป็นข้อความ และจากนั้นจึงประมวลผลข้อความนั้นโดยใช้โมเดลภาษาขนาดใหญ่ แม้ว่าวิธีการนี้จะ有效สำหรับการถอดเสียงและสรุป แต่ก็ลบข้อมูลที่สำคัญที่ทำให้เสียงมีความหมาย

โทน การเน้นอารมณ์ การลังเล การใช้เสียงเยาะเย้ย การพูดทับกัน และเสียงพื้นหลัง ล้วนเป็นสัญญาณที่มีความสำคัญ เมื่อเสียงถูกแบนให้เป็นข้อความ สัญญาณเหล่านี้จะสูญหายไป ซึ่งบ่อยครั้งจะทำให้เกิด การเข้าใจผิด หรือความรู้สึกที่ไม่ถูกต้อง ซึ่งจะกลายเป็นปัญหาอย่างมากในสถานการณ์ต่างๆ เช่น การสนับสนุนลูกค้า การตรวจจับฉ้อโกง การเล่นเกมออนไลน์ และการสื่อสารที่ขับเคลื่อนด้วย AI

ตามที่โมดูเลทระบุ การจำกัดนี้เป็นเรื่องของโครงสร้างมากกว่าข้อมูล โมเดลภาษาขนาดใหญ่ถูกออกแบบมาเพื่อทำนายข้อความ ไม่ใช่เพื่อการรวมสัญญาณเสียงและพฤติกรรมหลายอย่างในเวลาเดียวกัน โมเดลการฟังแบบアンサンブルถูกสร้างขึ้นเพื่อแก้ไขช่องว่างนี้

อะไรคือโมเดลการฟังแบบアンサンブル?

โมเดลการฟังแบบアンサンブルไม่ใช่เครือข่ายประสาทเทียมเดียวที่ถูกฝึกให้ทำทุกอย่างพร้อมๆ กัน แต่เป็นระบบที่ประกอบด้วยโมเดลหลายตัวที่มีความเชี่ยวชาญแตกต่างกัน แต่ละโมเดลจะวิเคราะห์มิติที่แตกต่างกันของการโต้ตอบเสียง

ภายใน ELM โมเดลที่แยกจากกันจะตรวจสอบอารมณ์ ความเครียด สัญญาณการหลอกลวง อัตลักษณ์ของผู้พูด จังหวะ การเน้นเสียง เสียงพื้นหลัง และเสียงที่อาจถูกสร้างขึ้นหรือปลอมแปลง สัญญาณเหล่านี้จะถูกสynchronizes ผ่านชั้นการประสานที่มีการจัดเวลา ซึ่งจะสร้างการวิเคราะห์ที่เป็นเอกภาพและสามารถอธิบายได้เกี่ยวกับสิ่งที่เกิดขึ้นในการสนทนา

การแบ่งงานนี้เป็นศูนย์กลางของแนวทาง ELM ไม่ใช่การอาศัยโมเดลขนาดใหญ่เพียงตัวเดียวในการอนุมานความหมายอย่างไม่ชัดเจน แต่โมเดลการฟังแบบアンサンブルจะรวมมุมมองที่มุ่งเน้นหลายมุมมองเข้าด้วยกัน ซึ่งจะปรับปรุงความแม่นยำและความโปร่งใส

ภายใน Velma 2.0

Velma 2.0 เป็นการพัฒนาที่สำคัญของระบบアンサンブルก่อนหน้าของโมดูเลท มันใช้โมเดลประกอบมากกว่า 100 ตัวที่ทำงานร่วมกันในเวลาเดียวกัน โดยมี 5 ชั้นการวิเคราะห์

ชั้นแรกมุ่งเน้นไปที่การประมวลผลเสียงพื้นฐาน โดยกำหนดจำนวนผู้พูด จังหวะการพูด และการหยุดพัก ชั้นต่อไปคือการถอดรหัสสัญญาณเสียง ซึ่งระบุสถานะทางอารมณ์ ระดับความเครียด สัญญาณการหลอกลวง ตัวบ่งชี้เสียงสังเคราะห์ และเสียงพื้นหลัง

ชั้นที่สามประเมินความตั้งใจที่รับรู้ โดยแยกแยะระหว่างคำชมที่แท้จริงและคำพูดที่เยาะเย้ยหรือไม่เป็นมิตร การสร้างแบบจำลองพฤติกรรมติดตามพลวัตของการสนทนาเมื่อเวลาผ่านไป โดยระบุความหงุดหงิด ความสับสน การพูดตามบท หรือความพยายามในการหลอกลวง ชั้นสุดท้าย คือ การวิเคราะห์การสนทนา ซึ่งแปลความเข้าใจเหล่านี้เป็นเหตุการณ์ที่เกี่ยวข้องกับองค์กร เช่น ลูกค้าที่ไม่พอใจ การละเมิดนโยบาย การฉ้อโกง หรือตัวแทน AI ที่ทำงานผิดปกติ

โมดูเลทรายงานว่า Velma 2.0 เข้าใจความหมายและความตั้งใจของการสนทนาได้ดีกว่าโมเดลภาษาขนาดใหญ่ประมาณ 30% ในขณะที่มีค่าใช้จ่ายที่ต่ำกว่า 10 ถึง 100 เท่าเมื่อปรับขนาด

จากเกมม็อดเดอเรชั่นไปสู่อินเทลลิเจนซ์องค์กร

ต้นกำเนิดของโมเดลการฟังแบบアンサンブルอยู่ในงานก่อนหน้าของโมดูเลทกับเกมออนไลน์ เกมยอดนิยม เช่น Call of Duty และ Grand Theft Auto Online สร้างสภาพแวดล้อมเสียงที่ท้าทายที่สุดเท่าที่จะจินตนาการได้ การสนทนาเร็ว เสียงดัง มีอารมณ์ และเต็มไปด้วยภาษาเฉพาะและอ้างอิงตามบริบท

การแยกแยะระหว่างการพูดคุยที่เป็นมิตรและความโกรธที่แท้จริงในเวลาเดียวกันจำเป็นต้องมีมากกว่าการถอดเสียง เมื่อโมดูเลทดำเนินการระบบการดูแลเสียง ToxMod ของตน มันจัดตั้งアンサンブルที่ซับซ้อนขึ้นเรื่อยๆ ของโมเดลเพื่อจับจุดเน้นเหล่านี้ ซึ่งนำไปสู่การสร้างโครงสร้างใหม่

Velma 2.0 ขยายโครงสร้างนี้ไปไกลกว่าเกม วันนี้มันขับเคลื่อนแพลตฟอร์มองค์กรของโมดูเลท โดยวิเคราะห์หลายร้อยล้านการสนทนาในอุตสาหกรรมต่างๆ เพื่อระบุการฉ้อโกง พฤติกรรมที่ไม่เหมาะสม ความไม่พอใจของลูกค้า และกิจกรรม AI ที่ผิดปกติ

ความท้าทายต่อโมเดลฟาวน์เดชัน

การประกาศครั้งนี้เกิดขึ้นเมื่อองค์กรต่างๆ กำลังประเมินกลยุทธ์ AI ของตนใหม่尽管มีการลงทุนจำนวนมาก สัดส่วนใหญ่ของโครงการ AI ไม่บรรลุผลิต หรือไม่ได้คุณค่าระยะยาว อุปสรรคทั่วไปรวมถึง การหลอกลวง ต้นทุนการอนุมานที่เพิ่มขึ้น การตัดสินใจที่ไม่โปร่งใส และความยากในการรวมข้อมูลเชิงลึกของ AI เข้ากับกระบวนการทำงาน

โมเดลการฟังแบบアンサンブルจัดการกับปัญหาเหล่านี้โดยตรง โดยการอาศัยโมเดลขนาดเล็กที่มีจุดประสงค์เฉพาะมากกว่าระบบขนาดใหญ่เพียงตัวเดียว ELM มีค่าใช้จ่ายในการดำเนินการที่ต่ำกว่า ง่ายต่อการตรวจสอบ และมีความสามารถในการอธิบายได้มากขึ้น แต่ละเอาต์พุตสามารถสืบย้อนกลับไปสู่สัญญาณเฉพาะ ทำให้องค์กรสามารถเข้าใจได้ว่าเหตุใดจึงได้ข้อสรุปนั้น

ระดับความโปร่งใสนี้มีความสำคัญอย่างยิ่งในสภาพแวดล้อมที่มีการควบคุมหรือมีความเสี่ยงสูง जहการตัดสินใจแบบกล่องดำไม่ถูกต้อง โมดูเลทจัดตำแหน่ง ELM ไม่เพียงแต่เป็นทางเลือกสำหรับโมเดลภาษาขนาดใหญ่ แต่ยังเป็นโครงสร้างที่เหมาะสมกว่าสำหรับอินเทลลิเจนซ์เสียงระดับองค์กร

ไปไกลกว่าการถอดเสียงเป็นข้อความ

หนึ่งในด้านที่มองไปข้างหน้ามากที่สุดของ Velma 2.0 คือความสามารถในการวิเคราะห์ว่าสิ่งที่พูดถูกพูดไปอย่างไร ไม่ใช่แค่ว่าพูดอะไรบ้าง ซึ่งรวมถึงการตรวจจับเสียงสังเคราะห์หรือเสียงปลอม ซึ่งเป็นข้อกังวลที่เพิ่มขึ้นเมื่อเทคโนโลยีการสร้างเสียงพัฒนาขึ้น

เมื่อเทคโนโลยีการสร้างเสียงดีขึ้น องค์กรต่างๆ จะต้องเผชิญกับความเสี่ยงที่เพิ่มขึ้นที่เกี่ยวข้องกับการฉ้อโกง การปลอมตัว และการหลอกลวงทางสังคม โดยการฝังการตรวจจับเสียงสังเคราะห์เข้าไปในアンサンブルของตน Velma 2.0 รักษาความถูกต้องเป็นสัญญาณหลัก ไม่ใช่เพียงตัวเลือกเสริม

การสร้างแบบจำลองพฤติกรรมของระบบยังช่วยให้ได้ข้อมูลเชิงลึกเชิงรุก มันสามารถระบุได้ว่าผู้พูดกำลังอ่านจากสคริปต์ เมื่อความหงุดหงิดกำลังเพิ่มขึ้น หรือเมื่อการสนทนากำลังจะเข้าสู่ความขัดแย้ง ความสามารถเหล่านี้ช่วยให้องค์กรสามารถแทรกแซงได้เร็วขึ้นและมีประสิทธิภาพมากขึ้น

ทิศทางใหม่สำหรับ AI องค์กร

Modulate อธิบายโมเดลการฟังแบบアンサンブルว่าเป็นหมวดหมู่ใหม่ของโครงสร้าง AI ซึ่งแยกจากทั้งการประมวลผลสัญญาณแบบดั้งเดิมและโมเดลฟาวน์เดชันขนาดใหญ่ ความเข้าใจเบื้องหลังคือว่าปฏิสัมพันธ์ของมนุษย์ที่ซับซ้อนจะถูกเข้าใจได้ดีกว่าผ่านการเชี่ยวชาญที่ประสานกันมากกว่าการขยายขนาดอย่างดุเดือด

เมื่อองค์กรต่างๆ ต้องการระบบ AI ที่รับผิดชอบ มีประสิทธิภาพ และสอดคล้องกับความต้องการในการดำเนินงานจริง โมเดลการฟังแบบアンサンブルชี้ไปที่อนาคตที่ความฉลาดจะถูกสร้างขึ้นจากส่วนประกอบที่มุ่งเน้นหลายส่วน ด้วย Velma 2.0 ที่อยู่ในสถานการณ์ผลิตแล้ว โมดูเลทกำลัง betting ว่าการเปลี่ยนแปลงโครงสร้างนี้จะกระจายไปไกลกว่าการดูแลเสียงและความสนับสนุนลูกค้า

ในอุตสาหกรรมที่กำลังมองหาทางเลือกแทนกล่องดำที่ใหญ่ขึ้นเรื่อยๆ โมเดลการฟังแบบアンサンブルชี้ให้เห็นว่าการพัฒนาที่สำคัญถัดไปของ AI อาจมาจากการฟังอย่างระมัดระวัง ไม่ใช่แค่การประมวลผลที่ก้าวร้าว

อองตวนเป็นผู้นำที่มีวิสัยทัศน์และเป็นหุ้นส่วนผู้ก่อตั้งของ Unite.AI โดยมีความหลงใหลที่ไม่สั่นคลอนในการ塑造และ推廣อนาคตของ AI และหุ่นยนต์ เขาเป็นผู้ประกอบการซีรีย์ที่เชื่อว่า AI จะมีผลกระทบต่อสังคมมากเท่ากับไฟฟ้า และมักจะพูดถึงศักยภาพของเทคโนโลยีที่เป็นนวัตกรรมและ AGI

ในฐานะ นักอนาคต เขาได้ทำการสำรวจว่านวัตกรรมเหล่านี้จะเปลี่ยนแปลงโลกของเราอย่างไร นอกจากนี้เขายังเป็นผู้ก่อตั้ง Securities.io ซึ่งเป็นแพลตฟอร์มที่มุ่งเน้นในการลงทุนในเทคโนโลยีที่ทันสมัยที่สุดซึ่งกำลังเปลี่ยนแปลงอนาคตและเปลี่ยนแปลงอุตสาหกรรมทั้งหมด