โมเดลและแพลตฟอร์ม AI
Stability AI เปิดตัว Stable Audio 2.0: เสริมศักยภาพให้ครีเอเตอร์ด้วยเสียงที่สร้างโดย AI ที่ทันสมัย

Stability AI ได้ขยายขอบเขตของนวัตกรรมอีกครั้งด้วยการเปิดตัว Stable Audio 2.0 ซึ่งเป็นรุ่นต่อเนื่องของตัวแบบก่อนหน้านี้ โดยนำเสนอฟีเจอร์ใหม่ที่เป็นนวัตกรรมซึ่ง promis เพื่อปฏิวัติวิธีการสร้างและจัดการเนื้อหาออดิโอของศิลปินและนักดนตรี
Stable Audio 2.0 เป็น里程碑ที่สำคัญในการพัฒนาออดิโอที่สร้างโดย AI โดยกำหนดมาตรฐานใหม่สำหรับคุณภาพ ความหลากหลาย และศักยภาพสร้างสรรค์ ด้วยความสามารถในการสร้างแทร็กเต็มรูปแบบ การแปลงตัวอย่างเสียงโดยใช้คำสั่งภาษาธรรมชาติ และการผลิตเสียงเอฟเฟกต์ที่หลากหลาย ตัวแบบนี้เปิดโลกใหม่ของความเป็นไปได้สำหรับครีเอเตอร์ในสาขาต่างๆ
เมื่อความต้องการวิธีแก้ปัญหาเสียงที่เป็นนวัตกรรมยังคงเติบโต Stability AI ได้เตรียมการให้ Stable Audio 2.0 เป็นเครื่องมือที่จำเป็นสำหรับมืออาชีพที่ต้องการเพิ่มผลผลิตสร้างสรรค์และปรับปรุงกระบวนการทำงาน โดยใช้พลังของเทคโนโลยี AI ที่ทันสมัย Stable Audio 2.0 เสริมศักยภาพให้ผู้ใช้ในการสำรวจดินแดนใหม่ๆ ในด้านการแต่งเพลง การออกแบบเสียง และการผลิตออดิโอหลังการผลิต
คุณสมบัติหลักของ Stable Audio 2.0 คืออะไร
Stable Audio 2.0 มีคุณสมบัติที่น่าประทับใจซึ่งสามารถเปลี่ยนแปลงภูมิทัศน์ของออดิโอที่สร้างโดย AI ได้ ตั้งแต่การสร้างแทร็กเต็มรูปแบบไปจนถึงการแปลงตัวอย่างเสียง การผลิตเสียงเอฟเฟกต์ที่ดีขึ้น และการถ่ายโอนสไตล์ ตัวแบบนี้ให้ครีเอเตอร์มีเครื่องมือที่ครอบคลุมในการนำวิสัยทัศน์ทางเสียงมาเป็นจริง
การสร้างแทร็กเต็มรูปแบบ
Stable Audio 2.0 ตั้ง mìnhให้แตกต่างจากตัวแบบออดิโอที่สร้างโดย AI อื่นๆ ด้วยความสามารถในการสร้างแทร็กเต็มรูปแบบที่มีความยาวถึง 3 นาที แทร็กเหล่านี้ไม่ใช่แค่ตัวอย่างที่ขยายออกไป แต่เป็นชิ้นงานที่มีโครงสร้างที่ชัดเจน รวมถึงส่วนต่างๆ เช่น การแนะนำ การพัฒนา และการสรุป สิ่งนี้ช่วยให้ผู้ใช้สามารถสร้างผลงานดนตรีที่สมบูรณ์พร้อมเรื่องราวและความก้าวหน้าที่ชัดเจน ซึ่งเพิ่มศักยภาพในการสร้างสรรค์ดนตรีด้วยความช่วยเหลือของ AI
นอกจากนี้ ตัวแบบยังรวมเสียงเอฟเฟกต์แบบสเตอริโอเพื่อเพิ่มความลึกและขนาดให้กับเสียงที่สร้างขึ้น การรวมเสียงเอฟเฟกต์เหล่านี้ช่วยเพิ่มความสมจริงและความสามารถในการดึงดูดผู้ฟังของแทร็ก ทำให้เหมาะสำหรับการใช้งานต่างๆ ตั้งแต่เสียงพื้นหลังในวิดีโอไปจนถึงผลงานดนตรีที่สมบูรณ์
การแปลงตัวอย่างเสียง
หนึ่งในคุณสมบัติที่น่าตื่นเต้นที่สุดของ Stable Audio 2.0 คือความสามารถในการแปลงตัวอย่างเสียง ผู้ใช้สามารถอัปโหลดตัวอย่างเสียงของตนเองและแปลงมันโดยใช้คำสั่งภาษาธรรมชาติ คุณสมบัตินี้เปิดโลกใหม่ของความเป็นไปได้ในการสร้างสรรค์ให้กับศิลปินและนักดนตรี โดยให้โอกาสในการทดลองกับการจัดการและสร้างเสียงใหม่ในแบบที่ไม่เคยเป็นไปได้ก่อนหน้านี้
ด้วยการ tận dụngพลังของ AI ผู้ใช้สามารถปรับเปลี่ยนตัวอย่างเสียงที่มีอยู่ให้เหมาะสมกับความต้องการหรือวิสัยทัศน์ทางศิลปะของตนเอง ไม่ว่าจะเป็นการเปลี่ยนโทนเสียงของเครื่องดนตรี การเปลี่ยนอารมณ์ของชิ้นงาน หรือการสร้างเสียงใหม่ทั้งหมดจากตัวอย่างที่มีอยู่ Stable Audio 2.0 ให้วิธีการที่直截และง่ายต่อการสำรวจการแปลงตัวอย่างเสียง
การผลิตเสียงเอฟเฟกต์ที่ดีขึ้น
นอกจากความสามารถในการสร้างดนตรีแล้ว Stable Audio 2.0 ยังโดดเด่นในการผลิตเสียงเอฟเฟกต์ที่หลากหลาย ตั้งแต่เสียงพื้นหลังที่เบาๆ เช่น เสียงใบไม้ร่วงหรือเสียงเครื่องจักรที่ทำงาน ไปจนถึงเสียงเอฟเฟกต์ที่ซับซ้อนและสมจริง เช่น เสียงถนนในเมืองหรือสภาพแวดล้อมทางธรรมชาติ ตัวแบบสามารถสร้างองค์ประกอบเสียงที่หลากหลาย
คุณสมบัตินี้มีคุณค่าอย่างยิ่งสำหรับครีเอเตอร์ที่ทำงานในอุตสาหกรรมภาพยนตร์ โทรทัศน์ วิดีโอเกม และโปรเจ็กต์มัลติมีเดียอื่นๆ ด้วย Stable Audio 2.0 ผู้ใช้สามารถสร้างเสียงเอฟเฟกต์คุณภาพสูงได้อย่างรวดเร็วและง่ายดาย ซึ่งจะช่วยลดความจำเป็นในการทำงานฟอลเลย์หรือการใช้สินทรัพย์ที่มีใบอนุญาต
การถ่ายโอนสไตล์
Stable Audio 2.0 นำเสนอฟีเจอร์การถ่ายโอนสไตล์ ซึ่งช่วยให้ผู้ใช้สามารถเปลี่ยนลักษณะทาง审美และโทนเสียงของเสียงที่สร้างขึ้นหรืออัปโหลดได้อย่างไร้ขอบเขต คุณสมบัตินี้ช่วยให้ครีเอเตอร์สามารถปรับเสียงเอาต์พุตให้เหมาะสมกับธีม สไตล์ หรืออารมณ์ของโปรเจ็กต์ของตน
ด้วยการประยุกต์ใช้การถ่ายโอนสไตล์ ผู้ใช้สามารถทดลองกับสไตล์ดนตรีต่างๆ ผสมผสานแนวเพลง หรือสร้างพาเลตต์เสียงใหม่ทั้งหมด คุณสมบัตินี้มีประโยชน์อย่างยิ่งในการสร้างเสียงพื้นหลังที่สอดคล้องกัน การปรับเปลี่ยนดนตรีให้เหมาะสมกับเนื้อหาทางภาพ หรือการสำรวจการรีมิกซ์และการผสมผสานเสียงใหม่ๆ
ความก้าวหน้าทางเทคโนโลยีของ Stable Audio 2.0
ด้านล่าง Stable Audio 2.0 เป็นเทคโนโลยี AI ที่ทันสมัยซึ่งให้ประสิทธิภาพและคุณภาพที่น่าประทับใจของมัน ตัวแบบมีการออกแบบมาเพื่อจัดการกับความท้าทายเฉพาะในการสร้างเสียงที่สอดคล้องกันและเต็มรูปแบบ ในขณะเดียวกันก็รักษาการควบคุมที่แม่นยำเกี่ยวกับรายละเอียด
สถาปัตยกรรมแบบการแพร่กระจายแบบแฝง
ที่แกนกลางของ Stable Audio 2.0 คือสถาปัตยกรรมแบบการแพร่กระจายแบบแฝงที่ได้รับการปรับให้เหมาะสมสำหรับการสร้างเสียง ตัวแบบนี้ประกอบด้วยสองส่วนหลัก: ตัวเข้ารหัสอัตโนมัติที่ถูกบีบอัดอย่างมาก และตัวแปลงการแพร่กระจาย (DiT)
ตัวเข้ารหัสอัตโนมัติมีหน้าที่ในการบีบอัดเวฟฟอร์มเสียงดั้งเดิมให้เข้าไปในตัวแทนการที่กะทัดรัด สิ่งนี้ช่วยให้ตัวแบบสามารถจับข้อเท็จจริงที่สำคัญของเสียงในขณะเดียวกันก็กรองรายละเอียดที่ไม่สำคัญออกไป ส่งผลให้การสร้างเสียงที่สอดคล้องกันและเป็นระเบียบมากขึ้น
ตัวแปลงการแพร่กระจาย ซึ่งคล้ายกับที่ใช้ในโมเดล Stable Diffusion 3 ของ Stability AI มาแทนที่สถาปัตยกรรม U-Net ที่ใช้ในรุ่นก่อนหน้า ตัวแปลงการแพร่กระจายมีความเหมาะสมอย่างยิ่งในการจัดการกับลำดับข้อมูลที่ยาว ทำให้เหมาะสำหรับการประมวลผลและสร้างเสียงที่มีความยาว

การปรับปรุงประสิทธิภาพและคุณภาพ
การรวมตัวเข้ารหัสอัตโนมัติที่ถูกบีบอัดและตัวแปลงการแพร่กระจายทำให้ Stable Audio 2.0 สามารถบรรลุผลลัพธ์ที่น่าประทับใจในด้านประสิทธิภาพและคุณภาพของเสียงที่สร้างขึ้น เมื่อเทียบกับรุ่นก่อนหน้า
การบีบอัดที่มีประสิทธิภาพของตัวเข้ารหัสอัตโนมัติทำให้ตัวแบบสามารถประมวลผลและสร้างเสียงได้เร็วขึ้น ลดความต้องการทรัพยากรการคำนวณและทำให้สามารถเข้าถึงได้โดยผู้ใช้หลากหลายมากขึ้น ในขณะเดียวกัน ตัวแปลงการแพร่กระจายสามารถรับรู้และจำลองโครงสร้างขนาดใหญ่ ทำให้เสียงที่สร้างขึ้นมีคุณภาพสูงและความสมบูรณ์
ความก้าวหน้าเหล่านี้ส่งผลให้ตัวแบบสามารถสร้างเสียงที่สมจริงและดึงดูดใจได้อย่างน่าประทับใจ ไม่ว่าจะเป็นเพลงเต็มรูปแบบ เสียงพื้นหลังที่ซับซ้อน หรือเสียงเอฟเฟกต์ที่ละเอียดอ่อน สถาปัตยกรรมของ Stable Audio 2.0 เป็นรากฐานสำหรับการพัฒนาต่อๆ ไปในด้านออดิโอที่สร้างโดย AI และเปิดทางให้กับเครื่องมือที่ซับซ้อนและแสดงออกได้มากขึ้นสำหรับครีเอเตอร์
สิทธิของผู้สร้างด้วย Stable Audio 2.0
เมื่อออดิโอที่สร้างโดย AI ยังคงพัฒนาและกลายเป็นที่นิยมมากขึ้น มันจึงเป็นสิ่งสำคัญที่จะต้องกล่าวถึงผลกระทบทางจริยธรรมและรับประกันว่าสิทธิของผู้สร้างได้รับการคุ้มครอง Stability AI ได้ดำเนินการเชิงรุกเพื่อจัดลำดับความสำคัญของการพัฒนาทางจริยธรรมและค่าตอบแทนที่ยุติธรรมสำหรับศิลปินที่มีส่วนร่วมในการฝึกอบรม Stable Audio 2.0
Stable Audio 2.0 ได้รับการฝึกอบรมโดยใช้เซตข้อมูลที่ได้รับอนุญาตจาก AudioSparx ซึ่งเป็นแหล่งที่เชื่อถือได้ของเนื้อหาออดิโอคุณภาพสูง เซตข้อมูลนี้ประกอบด้วยไฟล์เสียงมากกว่า 800,000 ไฟล์ รวมถึงเพลง เสียงเอฟเฟกต์ และเสียงสolo พร้อมด้วยเมตาดาต้าข้อความที่เกี่ยวข้อง ด้วยการใช้เซตข้อมูลที่ได้รับอนุญาต Stability AI รับประกันว่าตัวแบบถูกสร้างขึ้นจากฐานข้อมูลเสียงที่ได้รับมาอย่างถูกต้องและได้รับการอ้างอิงอย่างเหมาะสม
การรับรู้ถึงความสำคัญของความเป็นอิสระของผู้สร้าง Stability AI ได้ให้โอกาสแก่ศิลปินทุกคนที่มีผลงานอยู่ในเซตข้อมูล AudioSparx เพื่อเลือกไม่ให้ผลงานของตนถูกใช้ในการฝึกอบรม Stable Audio 2.0 สิ่งนี้ช่วยให้ครีเอเตอร์สามารถควบคุมวิธีการใช้ผลงานของตนและรับประกันว่าเฉพาะผู้ที่ยินยอมให้ใช้เสียงของตนสำหรับการฝึกอบรม AI เท่านั้นที่จะถูกรวมอยู่ในเซตข้อมูล
Stability AI มุ่งมั่นที่จะให้ครีเอเตอร์ที่มีส่วนร่วมในการพัฒนาของ Stable Audio 2.0 ได้รับค่าตอบแทนที่ยุติธรรมสำหรับความพยายามของพวกเขา โดยการรับอนุญาตเซตข้อมูล AudioSparx และให้โอกาสเลือกไม่เข้าร่วม Stability AI แสดงให้เห็นถึงความมุ่งมั่นในการสร้างระบบนิเวศที่ยั่งยืนและยุติธรรมสำหรับออดิโอที่สร้างโดย AI ซึ่งครีเอเตอร์ได้รับการเคารพและได้รับค่าตอบแทนสำหรับการมีส่วนร่วม
เพื่อป้องกันการละเมิดลิขสิทธิ์และปกป้องสิทธิของผู้สร้าง Stability AI ได้ร่วมมือกับ Audible Magic ซึ่งเป็นผู้ให้บริการชั้นนำด้านเทคโนโลยีการตระหนักเนื้อหา โดยการรวมระบบการรู้จำเนื้อหาที่ทันสมัย (ACR) ของ Audible Magic เข้ากับกระบวนการอัปโหลดเสียง Stable Audio 2.0 สามารถระบุและป้ายกำกับเนื้อหาที่อาจละเมิดลิขสิทธิ์ได้ รับประกันว่าเฉพาะเนื้อหาที่เป็นของต้นฉบับหรือได้รับอนุญาตอย่างเหมาะสมเท่านั้นที่จะถูกใช้ภายในแพลตฟอร์ม
ผ่านการคำนึงถึงจริยธรรมและโครงการที่มุ่งเน้นผู้สร้าง Stability AI ตั้งมาตรฐานที่เข้มแข็งสำหรับการพัฒนา AI ที่รับผิดชอบในโดเมนออดิโอ โดยการจัดลำดับความสำคัญของสิทธิของผู้สร้างและกำหนดแนวทางที่ชัดเจนสำหรับการใช้ข้อมูลและค่าตอบแทน Stability AI ส่งเสริมสภาพแวดล้อมที่ร่วมมือกันและยั่งยืน ซึ่ง AI และความคิดสร้างสรรค์ของมนุษย์สามารถอยู่ร่วมกันและเติบโตได้
การกำหนดอนาคตของการสร้างเสียงด้วย Stability AI
Stable Audio 2.0 เป็น里程碑ที่สำคัญในด้านออดิโอที่สร้างโดย AI โดยให้ครีเอเตอร์มีเครื่องมือที่ครอบคลุมในการสำรวจดินแดนใหม่ๆ ในด้านดนตรี การออกแบบเสียง และการผลิตออดิโอ ด้วยสถาปัตยกรรมแบบการแพร่กระจายแบบแฝงที่ทันสมัย ประสิทธิภาพที่น่าประทับใจ และความมุ่งมั่นต่อการพิจารณาด้านจริยธรรมและสิทธิของผู้สร้าง Stability AI อยู่ในแนวหน้าของการกำหนดอนาคตของการสร้างเสียง เมื่อเทคโนโลยีนี้ยังคงพัฒนา มันจะชัดเจนว่าออดิโอที่สร้างโดย AI จะมีบทบาทที่สำคัญในภูมิทัศน์สร้างสรรค์ โดยให้ศิลปินและนักดนตรีเครื่องมือที่จำเป็นในการขยายขอบเขตของงานศิลปะและ重新กำหนดสิ่งที่เป็นไปได้ในโลกของเสียง












