โมเดลและแพลตฟอร์ม AI

นักวิจัยสร้างโมเดล AI ที่สามารถร้องเพลงได้ทั้งภาษาจีนและภาษาอังกฤษ

mm
เพิ่ม Unite.AI ลงในแหล่งข้อมูลที่คุณต้องการบน Google

ทีมนักวิจัยจาก Microsoft และ Zhajiang University ได้สร้างโมเดล AI ที่สามารถร้องเพลงได้ในหลายภาษาเมื่อเร็วๆ นี้ ตามที่ VentureBeat รายงาน โมเดล DeepSinger AI ที่พัฒนาโดยทีมนี้ ได้รับการฝึกฝนจาก ข้อมูลจากเว็บไซต์เพลงต่างๆ โดยใช้อัลกอริทึมที่สามารถจับเสียงและคุณภาพของเสียงได้

การสร้าง “เสียง” ของ AI ที่ร้องเพลงต้องใช้อัลกอริทึมที่สามารถคาดการณ์และควบคุมทั้งความสูงและความยาวของเสียงได้ เมื่อมนุษย์ร้องเพลง เสียงที่พวกเขาสร้างขึ้นมีรูปแบบและจังหวะที่ซับซ้อนกว่าการพูดมาก อีกปัญหาหนึ่งที่ทีมต้อง克服คือข้อมูลฝึกอบรมสำหรับการพูดมีมาก แต่ข้อมูลฝึกอบรมสำหรับการร้องเพลงมีน้อย เมื่อรวมกับความท้าทายที่ว่าเพลงต้องมีทั้งเสียงและเนื้อร้องที่ต้องวิเคราะห์ ปัญหาในการสร้างเสียงร้องจึงซับซ้อนมาก

ระบบ DeepSinger ที่นักวิจัยสร้างขึ้นได้ 克服ความท้าทายเหล่านี้โดยพัฒนากระบวนการข้อมูลที่สามารถขุดและแปลงข้อมูลเสียงได้ คลิปเสียงร้องถูกถอดออกจากเว็บไซต์เพลงต่างๆ แล้วเสียงร้องจะถูกแยกออกจากเสียงอื่นๆ และแบ่งออกเป็นประโยค ต่อไปคือการกำหนดความยาวของทุกๆ พอนีมในเนื้อร้อง ซึ่งจะส่งผลให้เกิดตัวอย่างเสียงที่มีเอกลักษณ์ในการร้อง ขั้นตอนสุดท้ายคือการทำความสะอาดข้อมูลเพื่อจัดการกับตัวอย่างฝึกอบรมที่บิดเบี้ยวหลังจากที่เนื้อร้องและตัวอย่างเสียงถูกจัดเรียงตามคะแนนความมั่นใจ

วิธีการเดียวกันนี้ดูเหมือนจะทำงานได้ดีสำหรับหลายภาษา DeepSinger ได้รับการฝึกฝนจากตัวอย่างเสียงร้องภาษาจีน คันโตเนส และภาษาอังกฤษที่ประกอบด้วยนักร้อง 89 คน ร้องเป็นเวลา 92 ชั่วโมง ผลการศึกษาพบว่าระบบ DeepSinger สามารถสร้างตัวอย่างเสียงร้องที่มีคุณภาพสูงได้ตามมาตรการเช่นความแม่นยำของเสียงสูงและเสียงร้องที่ดูเป็นธรรมชาติ นักวิจัยได้ให้ 20 คนจัดอันดับเพลงที่สร้างโดย DeepSinger และเพลงฝึกอบรมตามมาตรการเหล่านี้ และช่องว่างระหว่างคะแนนสำหรับตัวอย่างที่สร้างและเสียงจริงนั้นเล็กมาก ผู้เข้าร่วมให้คะแนน DeepSinger โดยเฉลี่ยที่เบี่ยงเบนระหว่าง 0.34 ถึง 0.76

ในอนาคต นักวิจัยต้องการลองปรับปรุงคุณภาพของเสียงที่สร้างขึ้นโดยการฝึกฝนแบบผสมผสานของโมเดลย่อยที่ประกอบเป็น DeepSinger โดยใช้เทคโนโลยีพิเศษ เช่น WaveNet ที่ออกแบบมาเพื่อสร้างเสียงพูดที่ดูเป็นธรรมชาติผ่านเวฟเสียง

ระบบ DeepSinger สามารถใช้เพื่อช่วยให้นักร้องและศิลปินเพลงอื่นๆ แก้ไขงานของตนโดยไม่ต้องกลับเข้าไปในสตูดิโออีกครั้ง มันสามารถใช้เพื่อสร้างเสียง deepfake ได้ ทำให้ดูเหมือนว่าศิลปินร้องเพลงที่พวกเขาไม่เคยร้องมาก่อน แม้ว่ามันจะสามารถใช้สำหรับพารอ디หรือเสียดสีได้ แต่ก็ยังมีข้อสงสัยเกี่ยวกับกฎหมาย

DeepSinger เป็นเพียงหนึ่งในหลายๆ ระบบ AI ใหม่ที่สามารถเปลี่ยนแปลงวิธีการทำงานของเพลงและซอฟต์แวร์ OpenAI ได้เผยแพร่ระบบ AI ของตนเองที่เรียกว่า JukeBox ซึ่งสามารถสร้างเพลงดั้งเดิมได้ตามสไตล์หรือศิลปินเฉพาะ อีกเครื่องมือเพลง AI ที่น่าสนใจ ได้แก่ Google’s Magenta และ Amazon’s DeepComposer (AMZN ) Magenta เป็นไลบรารีสำหรับการจัดการเสียงและภาพที่เปิดกว้างซึ่งสามารถใช้สร้างสิ่งต่างๆ ตั้งแต่การแบ็คกิ้งดรัมอัตโนมัติไปจนถึงเกมวิดีโอที่ใช้เสียงเป็นหลัก ในขณะที่ Amazon’s DeepComposer มุ่งเป้าไปที่ผู้ที่ต้องการฝึกอบรมและปรับแต่งโมเดลการเรียนรู้ลึกที่ใช้เสียงของตนเอง โดยให้ผู้ใช้สามารถนำโมเดลตัวอย่างที่ฝึกอบรมไว้แล้วมาปรับให้เหมาะสมกับความต้องการของตนเอง

(GOOGL )

คุณสามารถฟังตัวอย่างเสียงที่สร้างโดย DeepSinger ได้ที่ ลิงก์นี้

นักบล็อกและโปรแกรมเมอร์ที่มีความเชี่ยวชาญใน Machine Learning และ Deep Learning หัวข้อ Daniel หวังที่จะช่วยให้ผู้อื่นใช้พลังของ AI สำหรับสิ่งที่ดี