โมเดลและแพลตฟอร์ม AI

AudioSep : แยกสิ่งใดๆ ที่คุณอธิบาย

mm
เพิ่ม Unite.AI ลงในแหล่งข้อมูลที่คุณต้องการบน Google

LASS หรือ Language-queried Audio Source Separation เป็นรูปแบบใหม่สำหรับ CASA หรือ Computational Auditory Scene Analysis ที่มีเป้าหมายในการแยกเสียงเป้าหมายออกจากส่วนผสมของเสียงโดยใช้คำถามภาษาธรรมชาติที่ให้インターフェซที่มีมาตรฐานและปรับขนาดได้สำหรับงานและแอปพลิเคชันเสียงดิจิทัล แม้ว่าเฟรมเวิร์ก LASS จะมีความก้าวหน้าอย่างมากในอดีตไม่กี่ปีในด้านการบรรลุประสิทธิภาพที่ต้องการสำหรับแหล่งเสียงเฉพาะ เช่น เครื่องดนตรี แต่ก็ไม่สามารถแยกเสียงเป้าหมายในโดเมนที่เปิดกว้างได้

AudioSep เป็นแบบจำลองพื้นฐานที่มีเป้าหมายในการแก้ไขข้อจำกัดของเฟรมเวิร์ก LASS โดยการเปิดใช้งานการแยกเสียงเป้าหมายโดยใช้คำถามภาษาธรรมชาติ ผู้พัฒนาเฟรมเวิร์ก AudioSep ได้ฝึกอบรมแบบจำลองอย่างกว้างขวางบนชุดข้อมูลหลายรูปแบบขนาดใหญ่ และประเมินประสิทธิภาพของเฟรมเวิร์กบนงานเสียงหลายอย่าง รวมถึงการแยกเครื่องดนตรี, การแยกเหตุการณ์เสียง และการปรับปรุงเสียงพูด

ในบทความนี้ เราจะมาดูการทำงานของเฟรมเวิร์ก AudioSep โดยจะประเมินโครงสร้างของแบบจำลอง, ชุดข้อมูลที่ใช้ในการฝึกอบรมและประเมิน, และแนวคิดที่สำคัญที่เกี่ยวข้องกับการทำงานของแบบจำลอง AudioSep

CASA, USS, QSS, LASS Frameworks : พื้นฐานสำหรับ AudioSep

เฟรมเวิร์ก CASA หรือ Computational Auditory Scene Analysis เป็นเฟรมเวิร์กที่นักพัฒนาสามารถใช้ในการออกแบบระบบการฟังของเครื่องจักรที่สามารถรับรู้สภาพแวดล้อมเสียงที่ซับซ้อนได้เหมือนกับวิธีที่มนุษย์รับรู้เสียงโดยใช้ระบบการฟังของตนเอง การแยกเสียง โดยเฉพาะการแยกเสียงเป้าหมาย เป็นหนึ่งในพื้นที่การวิจัยหลักภายในเฟรมเวิร์ก CASA และมีเป้าหมายในการแก้ปัญหา “ปัญหาปาร์ตี้ค็อกเทล” หรือการแยกการบันทึกเสียงจริงออกจากแหล่งเสียงอื่นๆ

การแยกเสียงส่วนใหญ่ที่ทำในอดีตมุ่งเน้นไปที่การแยกแหล่งเสียงเดียวหรือหลายแหล่ง เช่น การแยกเสียงดนตรีหรือเสียงพูด โมเดลใหม่ที่เรียกว่า USS หรือ Universal Sound Separation มีเป้าหมายในการแยกเสียงที่ไม่แน่นอนในบันทึกเสียงจริง อย่างไรก็ตาม การแยกเสียงทุกแหล่งจากส่วนผสมของเสียงเป็นงานที่ท้าทายและจำกัด เนื่องจากมีแหล่งเสียงที่หลากหลายในโลก ซึ่งเป็นสาเหตุหลักที่ทำให้方法 USS ไม่เหมาะสมสำหรับการใช้งานจริงที่ทำงานในเวลาจริง

ทางเลือกที่เป็นไปได้สำหรับวิธี USS คือ QSS หรือ Query-based Sound Separation ซึ่งมีเป้าหมายในการแยกแหล่งเสียงเป้าหมายออกจากส่วนผสมของเสียงโดยอาศัยชุดคำถามเฉพาะ เนื่องจาก QSS ช่วยให้นักพัฒนและผู้ใช้สามารถแยกแหล่งเสียงที่ต้องการออกจากส่วนผสมตามความต้องการ ทำให้ QSS เป็นวิธีแก้ปัญหาที่เป็นไปได้สำหรับการใช้งานดิจิทัลจริง เช่น การแก้ไขเนื้อหามัลติมีเดียหรือการแก้ไขเสียง

นอกจากนี้ นักพัฒนายังได้เสนอการขยายเฟรมเวิร์ก QSS ซึ่งเรียกว่า LASS หรือ Language-queried Audio Source Separation ซึ่งมีเป้าหมายในการแยกแหล่งเสียงที่ไม่แน่นอนออกจากส่วนผสมของเสียงโดยใช้คำอธิบายภาษาธรรมชาติของแหล่งเสียงเป้าหมาย เนื่องจาก LASS ช่วยให้ผู้ใช้สามารถแยกแหล่งเสียงเป้าหมายโดยใช้คำสั่งภาษาธรรมชาติได้ จึงอาจกลายเป็นเครื่องมือที่ทรงพลังที่มีการใช้งานอย่างกว้างขวางในแอปพลิเคชันเสียงดิจิทัล

เมื่อเปรียบเทียบกับวิธีการแยกเสียงด้วยคำถามเสียงหรือวิธีการแยกเสียงด้วยภาพ การใช้คำสั่งภาษาธรรมชาติสำหรับการแยกเสียงมีข้อดีมากกว่า เนื่องจากมีความยืดหยุ่นและทำให้การได้รับข้อมูลคำถามง่ายขึ้น นอกจากนี้ เมื่อเปรียบเทียบกับเฟรมเวิร์กการแยกเสียงที่ใช้คำสั่งแบบกำหนดไว้ล่วงหน้า LASS ไม่จำกัดจำนวนคำถามที่เข้ามาและสามารถขยายไปยังโดเมนที่เปิดกว้างได้อย่างง่ายดาย

เดิมที เฟรมเวิร์ก LASS พึ่งพาการเรียนรู้แบบมีคำสั่งซึ่งแบบจำลองได้รับการฝึกอบรมบนชุดข้อมูลที่มีคำสั่งและเสียงคู่กัน อย่างไรก็ตาม ปัญหาหลักของแนวทางนี้คือการไม่มีข้อมูลเสียงและข้อความที่มีคำสั่งและฉลากที่จำกัด เพื่อลดการขึ้นอยู่กับข้อมูลเสียงและข้อความที่มีคำสั่งและฉลากที่มีคำสั่งแบบมีคำสั่ง ผู้พัฒนาจึงใช้การเรียนรู้แบบหลายรูปแบบที่มีการกำกับดูแล

AudioSep : ส่วนประกอบหลักและสถาปัตยกรรม

สถาปัตยกรรมของเฟรมเวิร์ก AudioSep ประกอบด้วยสองส่วนหลัก: ตัวเข้ารหัสข้อความและแบบจำลองการแยก

ตัวเข้ารหัสข้อความ

เฟรมเวิร์ก AudioSep ใช้ตัวเข้ารหัสข้อความของโมเดล CLIP หรือ CLAP เพื่อแยกข้อความออกจากคำถามภาษาธรรมชาติ

ตัวเข้ารหัสข้อความของ CLIP หรือ CLAP ใช้การเรียนรู้แบบขัดแย้งเพื่อเรียนรู้การแมปข้อความไปยังพื้นที่เชิงซึ่งแบ่งปันโดยการแสดงภาพ

แบบจำลองการแยก

เฟรมเวิร์ก AudioSep ใช้แบบจำลองการแยกในโดเมนความถี่ โดยใช้ ResUNet เป็นแบบจำลองการแยกหลัก

แบบจำลอง ResUNet ใช้การแปลงฟูเรียร์แบบช่วงสั้นเพื่อแยกสเปกโทรแกรมที่ซับซ้อนออกจากสัญญาณเวฟ

การฝึกอบรมและการสูญเสีย

ในการฝึกอบรมแบบจำลอง AudioSep ผู้พัฒนาจะใช้การเพิ่มความดังและการฝึกอบรมแบบจุดสิ้นสุดโดยใช้ฟังก์ชันการสูญเสีย L1 ระหว่างสัญญาณเวฟที่แท้จริงและคาดการณ์

ชุดข้อมูลและมาตรฐาน

แบบจำลอง AudioSep เป็นแบบจำลองพื้นฐานที่มีเป้าหมายในการแก้ไขข้อจำกัดของแบบจำลอง LASS โดยการเปิดใช้งานการแยกเสียงโดยใช้คำถามภาษาธรรมชาติ

AudioSet

AudioSet เป็นชุดข้อมูลเสียงขนาดใหญ่ที่มีมากกว่า 2 ล้านคลิปเสียง 10 วินาทีจาก YouTube

VGGSound

VGGSound เป็นชุดข้อมูลเสียงและภาพขนาดใหญ่ที่มีมากกว่า 200,000 คลิปวิดีโอ 10 วินาทีจาก YouTube

AudioCaps

AudioCaps เป็นชุดข้อมูลการอธิบายเสียงที่ใหญ่ที่สุดซึ่งมีมากกว่า 50,000 คลิปเสียง 10 วินาทีจาก AudioSet

รายละเอียดการฝึกอบรม

ในการฝึกอบรมแบบจำลอง AudioSep ผู้พัฒนาจะใช้การเพิ่มความดังและการฝึกอบรมแบบจุดสิ้นสุดโดยใช้ฟังก์ชันการสูญเสีย L1 ระหว่างสัญญาณเวฟที่แท้จริงและคาดการณ์

ผลการประเมิน

บนชุดข้อมูลที่เห็น

ผลการประเมินของแบบจำลอง AudioSep บนชุดข้อมูลที่เห็นแสดงให้เห็นว่าแบบจำลองมีประสิทธิภาพสูงในการแยกเสียง

บนชุดข้อมูลที่ไม่เห็น

ผลการประเมินของแบบจำลอง AudioSep บนชุดข้อมูลที่ไม่เห็นแสดงให้เห็นว่าแบบจำลองมีประสิทธิภาพสูงในการแยกเสียงในสถานการณ์ zero-shot

การแสดงผลการแยก

ผลการแสดงผลการแยกของแบบจำลอง AudioSep แสดงให้เห็นว่าแบบจำลองสามารถแยกเสียงได้อย่างแม่นยำ

การเปรียบเทียบคำถามข้อความ

ผลการเปรียบเทียบคำถามข้อความของแบบจำลอง AudioSep แสดงให้เห็นว่าแบบจำลองสามารถแยกเสียงได้อย่างแม่นยำโดยใช้คำถามข้อความที่หลากหลาย

สรุป

แบบจำลอง AudioSep เป็นแบบจำลองพื้นฐานที่มีเป้าหมายในการแก้ไขข้อจำกัดของแบบจำลอง LASS โดยการเปิดใช้งานการแยกเสียงโดยใช้คำถามภาษาธรรมชาติ

วิศวกรโดยอาชีพ นักเขียนโดยหัวใจ คุณ Kunal เป็นนักเขียนเทคนิคที่มีความรักและเข้าใจอย่างลึกซึ้งเกี่ยวกับ AI และ ML มุ่งมั่นที่จะทำให้แนวคิดที่ซับซ้อนในด้านเหล่านี้ง่ายขึ้นผ่านเอกสารที่น่าสนใจและให้ข้อมูล