โมเดลและแพลตฟอร์ม AI
AudioSep : แยกสิ่งใดๆ ที่คุณอธิบาย

LASS หรือ Language-queried Audio Source Separation เป็นรูปแบบใหม่สำหรับ CASA หรือ Computational Auditory Scene Analysis ที่มีเป้าหมายในการแยกเสียงเป้าหมายออกจากส่วนผสมของเสียงโดยใช้คำถามภาษาธรรมชาติที่ให้インターフェซที่มีมาตรฐานและปรับขนาดได้สำหรับงานและแอปพลิเคชันเสียงดิจิทัล แม้ว่าเฟรมเวิร์ก LASS จะมีความก้าวหน้าอย่างมากในอดีตไม่กี่ปีในด้านการบรรลุประสิทธิภาพที่ต้องการสำหรับแหล่งเสียงเฉพาะ เช่น เครื่องดนตรี แต่ก็ไม่สามารถแยกเสียงเป้าหมายในโดเมนที่เปิดกว้างได้
AudioSep เป็นแบบจำลองพื้นฐานที่มีเป้าหมายในการแก้ไขข้อจำกัดของเฟรมเวิร์ก LASS โดยการเปิดใช้งานการแยกเสียงเป้าหมายโดยใช้คำถามภาษาธรรมชาติ ผู้พัฒนาเฟรมเวิร์ก AudioSep ได้ฝึกอบรมแบบจำลองอย่างกว้างขวางบนชุดข้อมูลหลายรูปแบบขนาดใหญ่ และประเมินประสิทธิภาพของเฟรมเวิร์กบนงานเสียงหลายอย่าง รวมถึงการแยกเครื่องดนตรี, การแยกเหตุการณ์เสียง และการปรับปรุงเสียงพูด
ในบทความนี้ เราจะมาดูการทำงานของเฟรมเวิร์ก AudioSep โดยจะประเมินโครงสร้างของแบบจำลอง, ชุดข้อมูลที่ใช้ในการฝึกอบรมและประเมิน, และแนวคิดที่สำคัญที่เกี่ยวข้องกับการทำงานของแบบจำลอง AudioSep
CASA, USS, QSS, LASS Frameworks : พื้นฐานสำหรับ AudioSep
เฟรมเวิร์ก CASA หรือ Computational Auditory Scene Analysis เป็นเฟรมเวิร์กที่นักพัฒนาสามารถใช้ในการออกแบบระบบการฟังของเครื่องจักรที่สามารถรับรู้สภาพแวดล้อมเสียงที่ซับซ้อนได้เหมือนกับวิธีที่มนุษย์รับรู้เสียงโดยใช้ระบบการฟังของตนเอง การแยกเสียง โดยเฉพาะการแยกเสียงเป้าหมาย เป็นหนึ่งในพื้นที่การวิจัยหลักภายในเฟรมเวิร์ก CASA และมีเป้าหมายในการแก้ปัญหา “ปัญหาปาร์ตี้ค็อกเทล” หรือการแยกการบันทึกเสียงจริงออกจากแหล่งเสียงอื่นๆ
การแยกเสียงส่วนใหญ่ที่ทำในอดีตมุ่งเน้นไปที่การแยกแหล่งเสียงเดียวหรือหลายแหล่ง เช่น การแยกเสียงดนตรีหรือเสียงพูด โมเดลใหม่ที่เรียกว่า USS หรือ Universal Sound Separation มีเป้าหมายในการแยกเสียงที่ไม่แน่นอนในบันทึกเสียงจริง อย่างไรก็ตาม การแยกเสียงทุกแหล่งจากส่วนผสมของเสียงเป็นงานที่ท้าทายและจำกัด เนื่องจากมีแหล่งเสียงที่หลากหลายในโลก ซึ่งเป็นสาเหตุหลักที่ทำให้方法 USS ไม่เหมาะสมสำหรับการใช้งานจริงที่ทำงานในเวลาจริง
ทางเลือกที่เป็นไปได้สำหรับวิธี USS คือ QSS หรือ Query-based Sound Separation ซึ่งมีเป้าหมายในการแยกแหล่งเสียงเป้าหมายออกจากส่วนผสมของเสียงโดยอาศัยชุดคำถามเฉพาะ เนื่องจาก QSS ช่วยให้นักพัฒนและผู้ใช้สามารถแยกแหล่งเสียงที่ต้องการออกจากส่วนผสมตามความต้องการ ทำให้ QSS เป็นวิธีแก้ปัญหาที่เป็นไปได้สำหรับการใช้งานดิจิทัลจริง เช่น การแก้ไขเนื้อหามัลติมีเดียหรือการแก้ไขเสียง
นอกจากนี้ นักพัฒนายังได้เสนอการขยายเฟรมเวิร์ก QSS ซึ่งเรียกว่า LASS หรือ Language-queried Audio Source Separation ซึ่งมีเป้าหมายในการแยกแหล่งเสียงที่ไม่แน่นอนออกจากส่วนผสมของเสียงโดยใช้คำอธิบายภาษาธรรมชาติของแหล่งเสียงเป้าหมาย เนื่องจาก LASS ช่วยให้ผู้ใช้สามารถแยกแหล่งเสียงเป้าหมายโดยใช้คำสั่งภาษาธรรมชาติได้ จึงอาจกลายเป็นเครื่องมือที่ทรงพลังที่มีการใช้งานอย่างกว้างขวางในแอปพลิเคชันเสียงดิจิทัล
เมื่อเปรียบเทียบกับวิธีการแยกเสียงด้วยคำถามเสียงหรือวิธีการแยกเสียงด้วยภาพ การใช้คำสั่งภาษาธรรมชาติสำหรับการแยกเสียงมีข้อดีมากกว่า เนื่องจากมีความยืดหยุ่นและทำให้การได้รับข้อมูลคำถามง่ายขึ้น นอกจากนี้ เมื่อเปรียบเทียบกับเฟรมเวิร์กการแยกเสียงที่ใช้คำสั่งแบบกำหนดไว้ล่วงหน้า LASS ไม่จำกัดจำนวนคำถามที่เข้ามาและสามารถขยายไปยังโดเมนที่เปิดกว้างได้อย่างง่ายดาย
เดิมที เฟรมเวิร์ก LASS พึ่งพาการเรียนรู้แบบมีคำสั่งซึ่งแบบจำลองได้รับการฝึกอบรมบนชุดข้อมูลที่มีคำสั่งและเสียงคู่กัน อย่างไรก็ตาม ปัญหาหลักของแนวทางนี้คือการไม่มีข้อมูลเสียงและข้อความที่มีคำสั่งและฉลากที่จำกัด เพื่อลดการขึ้นอยู่กับข้อมูลเสียงและข้อความที่มีคำสั่งและฉลากที่มีคำสั่งแบบมีคำสั่ง ผู้พัฒนาจึงใช้การเรียนรู้แบบหลายรูปแบบที่มีการกำกับดูแล
AudioSep : ส่วนประกอบหลักและสถาปัตยกรรม
สถาปัตยกรรมของเฟรมเวิร์ก AudioSep ประกอบด้วยสองส่วนหลัก: ตัวเข้ารหัสข้อความและแบบจำลองการแยก
ตัวเข้ารหัสข้อความ
เฟรมเวิร์ก AudioSep ใช้ตัวเข้ารหัสข้อความของโมเดล CLIP หรือ CLAP เพื่อแยกข้อความออกจากคำถามภาษาธรรมชาติ
ตัวเข้ารหัสข้อความของ CLIP หรือ CLAP ใช้การเรียนรู้แบบขัดแย้งเพื่อเรียนรู้การแมปข้อความไปยังพื้นที่เชิงซึ่งแบ่งปันโดยการแสดงภาพ
แบบจำลองการแยก
เฟรมเวิร์ก AudioSep ใช้แบบจำลองการแยกในโดเมนความถี่ โดยใช้ ResUNet เป็นแบบจำลองการแยกหลัก
แบบจำลอง ResUNet ใช้การแปลงฟูเรียร์แบบช่วงสั้นเพื่อแยกสเปกโทรแกรมที่ซับซ้อนออกจากสัญญาณเวฟ
การฝึกอบรมและการสูญเสีย
ในการฝึกอบรมแบบจำลอง AudioSep ผู้พัฒนาจะใช้การเพิ่มความดังและการฝึกอบรมแบบจุดสิ้นสุดโดยใช้ฟังก์ชันการสูญเสีย L1 ระหว่างสัญญาณเวฟที่แท้จริงและคาดการณ์
ชุดข้อมูลและมาตรฐาน
แบบจำลอง AudioSep เป็นแบบจำลองพื้นฐานที่มีเป้าหมายในการแก้ไขข้อจำกัดของแบบจำลอง LASS โดยการเปิดใช้งานการแยกเสียงโดยใช้คำถามภาษาธรรมชาติ
AudioSet
AudioSet เป็นชุดข้อมูลเสียงขนาดใหญ่ที่มีมากกว่า 2 ล้านคลิปเสียง 10 วินาทีจาก YouTube
VGGSound
VGGSound เป็นชุดข้อมูลเสียงและภาพขนาดใหญ่ที่มีมากกว่า 200,000 คลิปวิดีโอ 10 วินาทีจาก YouTube
AudioCaps
AudioCaps เป็นชุดข้อมูลการอธิบายเสียงที่ใหญ่ที่สุดซึ่งมีมากกว่า 50,000 คลิปเสียง 10 วินาทีจาก AudioSet
รายละเอียดการฝึกอบรม
ในการฝึกอบรมแบบจำลอง AudioSep ผู้พัฒนาจะใช้การเพิ่มความดังและการฝึกอบรมแบบจุดสิ้นสุดโดยใช้ฟังก์ชันการสูญเสีย L1 ระหว่างสัญญาณเวฟที่แท้จริงและคาดการณ์
ผลการประเมิน
บนชุดข้อมูลที่เห็น
ผลการประเมินของแบบจำลอง AudioSep บนชุดข้อมูลที่เห็นแสดงให้เห็นว่าแบบจำลองมีประสิทธิภาพสูงในการแยกเสียง
บนชุดข้อมูลที่ไม่เห็น
ผลการประเมินของแบบจำลอง AudioSep บนชุดข้อมูลที่ไม่เห็นแสดงให้เห็นว่าแบบจำลองมีประสิทธิภาพสูงในการแยกเสียงในสถานการณ์ zero-shot
การแสดงผลการแยก
ผลการแสดงผลการแยกของแบบจำลอง AudioSep แสดงให้เห็นว่าแบบจำลองสามารถแยกเสียงได้อย่างแม่นยำ
การเปรียบเทียบคำถามข้อความ
ผลการเปรียบเทียบคำถามข้อความของแบบจำลอง AudioSep แสดงให้เห็นว่าแบบจำลองสามารถแยกเสียงได้อย่างแม่นยำโดยใช้คำถามข้อความที่หลากหลาย
สรุป
แบบจำลอง AudioSep เป็นแบบจำลองพื้นฐานที่มีเป้าหมายในการแก้ไขข้อจำกัดของแบบจำลอง LASS โดยการเปิดใช้งานการแยกเสียงโดยใช้คำถามภาษาธรรมชาติ












