โมเดลและแพลตฟอร์ม AI

Text-to-Music Generative AI : Stability Audio, Google’s MusicLM และอื่นๆ

mm
เพิ่ม Unite.AI ลงในแหล่งข้อมูลที่คุณต้องการบน Google

ดนตรี ซึ่งเป็นรูปแบบศิลปะที่เข้าถึงจิตวิญญาณของมนุษย์ เป็นเพื่อนร่วมทางที่คอยอยู่กับเราเสมอ การสร้างดนตรีด้วยปัญญาประดิษฐ์เริ่มต้นขึ้นหลายทศวรรษที่แล้ว ในตอนแรก ความพยายามเหล่านั้นเป็นเรื่องง่ายและ直截ถึงประเด็น โดยมีแอลกอริทึมพื้นฐานที่สร้างทำนองเพลงที่น่าเบื่อ แต่เมื่อเทคโนโลยีได้รับการปรับปรุง ความซับซ้อนและความสามารถของเครื่องมือสร้างดนตรี AI ก็เพิ่มขึ้นตามไปด้วย เปิดทางให้การเรียนรู้เชิงลึกและประมวลผลภาษาธรรมชาติ (NLP) มีบทบาทสำคัญในด้านเทคโนโลยีนี้

ในปัจจุบัน แพลตฟอร์มอย่าง Spotify กำลังใช้ AI เพื่อปรับประสบการณ์การฟังเพลงให้เหมาะสมยิ่งขึ้นสำหรับผู้ใช้ แอลกอริทึมการเรียนรู้เชิงลึกเหล่านี้วิเคราะห์ความชอบส่วนบุคคลของผู้ใช้ตามองค์ประกอบต่างๆ ของดนตรี เช่น จังหวะและอารมณ์ เพื่อสร้างคำแนะนำเพลงที่เหมาะสม พวกเขายังวิเคราะห์รูปแบบการฟังเพลงในวงกว้างและค้นหาเนื้อหาที่เกี่ยวข้องกับเพลงบนอินเทอร์เน็ตเพื่อสร้างโปรไฟล์เพลงที่มีรายละเอียด

จุดเริ่มต้นของ AI ในดนตรี: การเดินทางจากการประพันธ์แบบแอลกอริทึมไปยังการสร้างแบบเจเนอเรทีฟ

ในระยะแรกของการผสมผสาน AI เข้ากับโลกดนตรี ซึ่งครอบคลุมตั้งแต่ช่วงปี 1950 ถึง 1970 การมุ่งเน้นหลักอยู่ที่การประพันธ์แบบแอลกอริทึม ซึ่งเป็นวิธีการที่คอมพิวเตอร์ใช้เซตของกฎที่กำหนดไว้เพื่อสร้างดนตรี การสร้างที่น่าสนใจครั้งแรกในระยะนี้คือ Illiac Suite สำหรับ String Quartet ในปี 1957 ซึ่งใช้แอลกอริทึม Monte Carlo ซึ่งเป็นกระบวนการที่เกี่ยวข้องกับตัวเลขสุ่มเพื่อกำหนดเสียงและจังหวะภายในขอบเขตของทฤษฎีดนตรีและความน่าจะเป็นทางสถิติ

รูปภาพที่สร้างโดยผู้เขียนโดยใช้ Midjourney

รูปภาพที่สร้างโดยผู้เขียนโดยใช้ Midjourney

ความซับซ้อนของการแปลข้อความเป็นดนตรี

ดนตรีถูกเก็บไว้ในรูปแบบข้อมูลที่มีหลายมิติซึ่งครอบคลุมองค์ประกอบต่างๆ เช่น เมโลดี้ ฮาร์มอนี จังหวะ และอัตรา ทำให้การแปลข้อความเป็นดนตรีเป็นงานที่ซับซ้อนมาก เพลงมาตรฐานหนึ่งเพลงแสดงด้วยตัวเลขเกือบหนึ่งล้านตัวในคอมพิวเตอร์ ซึ่งเป็นตัวเลขที่สูงกว่า 格式ข้อมูลอื่นๆ เช่น ภาพถ่าย ข้อความ เป็นต้น

สาขาการสร้างเสียงกำลังเห็นแนวทางใหม่ๆ ในการเอาชนะความท้าทายในการสร้างเสียงที่สมจริง วิธีหนึ่งคือการสร้างสเปกโทรแกรม แล้วแปลงกลับเป็นเสียง

ยุทธวิธีอื่นใช้การแสดงผลสัญลักษณ์ของดนตรี เช่น นอตชีต ซึ่งสามารถตีความและเล่นโดยนักดนตรีได้ วิธีนี้ได้รับการดิจิทัล化แล้ว โดยมีเครื่องมืออย่าง Chamber Ensemble Generator ของ Magenta ที่สร้างดนตรีในรูปแบบ MIDI ซึ่งเป็นโปรโตคอลที่ช่วยให้คอมพิวเตอร์และเครื่องดนตริสื่อสารกันได้

แม้ว่าวิธีการเหล่านี้จะพัฒนาสาขานี้ แต่ก็มีข้อจำกัดของตัวเอง ซึ่งเน้นย้ำถึงความซับซ้อนของการสร้างเสียง

Google’s MusicLM

MusicLM ของ Google (GOOGL ) เปิดตัวในเดือนพฤษภาคมปีนี้ MusicLM สามารถสร้างเพลงที่มีคุณภาพสูงซึ่งสอดคล้องกับอารมณ์ที่อธิบายไว้ในข้อความโดยตรง โดยใช้การสร้างแบบลำดับชั้น MusicLM มีความสามารถในการเปลี่ยนคำอธิบายข้อความเป็นดนตรีที่สอดคล้องกันในอัตรา 24 kHz ตลอดระยะเวลาที่ขยายออกไป

ข้อมูลทางเทคนิค

MusicLM ใช้หลักการของ AudioLM ซึ่งเป็นเฟรมเวิร์กที่แนะนำในปี 2022 สำหรับการสร้างเสียง AudioLM สังเคราะห์เสียงเป็นงานสร้างแบบ语言 โดยใช้พื้นที่การแสดงออกที่ไม่ต่อเนื่องของหน่วยเสียง โดยใช้ลำดับของหน่วยเสียงที่มีขนาดใหญ่ขึ้นเรื่อยๆ ซึ่งเรียกว่า “tokens” วิธีนี้รับประกันคุณภาพสูงและความสอดคล้องในระยะยาวตลอดระยะเวลาที่สำคัญ

เพื่ออำนวยความสะดวกในการสร้าง MusicLM ขยายความสามารถของ AudioLM เพื่อรวมการปรับให้เหมาะสมตามข้อความ ซึ่งเป็นเทคนิคที่จัดแนวเสียงที่สร้างขึ้นให้สอดคล้องกับเนื้อหาของข้อความที่เข้ามา

ฉันใช้เวลาที่ผ่านมา 5 ปีในการศึกษาสิ่งที่น่าสนใจเกี่ยวกับ Machine Learning และ Deep Learning ความเชี่ยวชาญและความหลงใหลของฉันทำให้ฉันเข้าร่วมในโครงการพัฒนาซอฟต์แวร์มากกว่า 50 โครงการที่มีความหลากหลาย โดยมุ่งเน้นไปที่ AI/ML ความอยากรู้อยากเห็นของฉันยังทำให้ฉันสนใจในด้าน Natural Language Processing ซึ่งเป็นสาขาที่ฉันต้องการสำรวจต่อไป