Mô hình và nền tảng AI

Trình tạo âm nhạc bằng trí tuệ nhân tạo dựa trên văn bản: Stability Audio, MusicLM của Google và nhiều hơn nữa

mm
Thêm Unite.AI vào các nguồn ưu tiên của bạn trên Google

Âm nhạc, một hình thức nghệ thuật vang vọng với tâm hồn con người, đã là người bạn đồng hành không thể thiếu của chúng ta. Việc tạo ra âm nhạc bằng trí tuệ nhân tạo đã bắt đầu từ vài thập kỷ trước. Ban đầu, những nỗ lực này rất đơn giản và trực quan, với các thuật toán cơ bản tạo ra những bản nhạc đơn điệu. Tuy nhiên, khi công nghệ tiến bộ, sự phức tạp và khả năng của các công cụ tạo nhạc bằng AI cũng phát triển, mở đường cho việc học sâu và xử lý ngôn ngữ tự nhiên (NLP) đóng vai trò quan trọng trong lĩnh vực này.

Ngày nay, các nền tảng như Spotify đang tận dụng AI để tinh chỉnh trải nghiệm nghe của người dùng. Các thuật toán học sâu này phân tích sở thích cá nhân dựa trên các yếu tố âm nhạc khác nhau như nhịp độ và tâm trạng để tạo ra các gợi ý bài hát được cá nhân hóa. Họ thậm chí còn phân tích các mẫu nghe rộng lớn hơn và tìm kiếm các cuộc thảo luận về bài hát trên internet để xây dựng các hồ sơ bài hát chi tiết.

Nguồn gốc của AI trong âm nhạc: Hành trình từ sáng tác thuật toán đến mô hình hóa sinh

Trong giai đoạn đầu của AI trong thế giới âm nhạc, từ những năm 1950 đến 1970, trọng tâm chính là sáng tác thuật toán. Đây là một phương pháp mà máy tính sử dụng một tập hợp các quy tắc được định nghĩa để tạo ra âm nhạc. Tác phẩm đáng chú ý đầu tiên trong giai đoạn này là Illiac Suite cho String Quartet vào năm 1957. Nó sử dụng thuật toán Monte Carlo, một quá trình liên quan đến số ngẫu nhiên để quyết định cao độ và nhịp độ trong khuôn khổ của lý thuyết âm nhạc truyền thống và xác suất thống kê.

Hình ảnh được tạo bởi tác giả sử dụng Midjourney

Hình ảnh được tạo bởi tác giả sử dụng Midjourney

Trong thời gian này, một người tiên phong khác, Iannis Xenakis, đã sử dụng các quá trình ngẫu nhiên, một khái niệm liên quan đến phân bố xác suất ngẫu nhiên, để tạo ra âm nhạc. Ông đã sử dụng máy tính và ngôn ngữ FORTRAN để kết nối nhiều hàm xác suất, tạo ra một mẫu nơi các biểu diễn đồ họa khác nhau tương ứng với các không gian âm thanh đa dạng.

Sự phức tạp của việc dịch văn bản thành âm nhạc

Âm nhạc được lưu trữ trong một định dạng dữ liệu phong phú và đa chiều bao gồm các yếu tố như giai điệu, hòa âm, nhịp độ và tốc độ, khiến cho việc dịch văn bản thành âm nhạc trở nên cực kỳ phức tạp. Một bài hát tiêu chuẩn được đại diện bởi gần một triệu số trong máy tính, một con số đáng kể cao hơn so với các định dạng dữ liệu khác như hình ảnh, văn bản, v.v.

Lĩnh vực tạo âm thanh đang chứng kiến những cách tiếp cận sáng tạo để vượt qua thách thức của việc tạo ra âm thanh thực tế. Một phương pháp liên quan đến việc tạo ra một bản đồ quang phổ, và sau đó chuyển đổi nó trở lại thành âm thanh.

Một chiến lược khác tận dụng việc đại diện biểu tượng của âm nhạc, như bản nhạc, có thể được diễn giải và chơi bởi các nhạc sĩ. Phương pháp này đã được số hóa thành công, với các công cụ như Chamber Ensemble Generator của Magenta tạo ra âm nhạc trong định dạng MIDI, một giao thức cho phép giao tiếp giữa máy tính và các nhạc cụ.

Mặc dù những cách tiếp cận này đã thúc đẩy lĩnh vực này, chúng cũng đi kèm với những hạn chế riêng, nhấn mạnh tính chất phức tạp của việc tạo âm thanh.

Mô hình tự hồi quy dựa trên Transformer và mô hình khúc xạ khuếch tán dựa trên U-Net đang ở tiền phong của công nghệ, tạo ra kết quả tốt nhất trong việc tạo âm thanh, văn bản, âm nhạc và nhiều hơn nữa. Dòng GPT của OpenAI và hầu như tất cả các mô hình ngôn ngữ lớn khác hiện nay đều được hỗ trợ bởi các bộ chuyển đổi, sử dụng kiến trúc mã hóa, giải mã hoặc cả hai. Về phía nghệ thuật/hình ảnh, MidJourney, Stability AI và DALL-E 2 đều tận dụng các khuôn khổ khuếch tán. Hai công nghệ cốt lõi này đã đóng vai trò quan trọng trong việc đạt được kết quả tốt nhất trong lĩnh vực âm thanh.

MusicLM của Google

MusicLM của Google (GOOGL ) được phát hành vào tháng 5 năm nay. MusicLM có thể tạo ra các bản nhạc có độ trung thực cao, phù hợp với cảm xúc chính xác được mô tả trong văn bản. Sử dụng mô hình trình tự-hướng-dẫn phân cấp, MusicLM có khả năng biến đổi các mô tả văn bản thành âm nhạc vang vọng ở tần số 24 kHz trong thời gian dài.

Mô hình hoạt động trên nhiều cấp độ, không chỉ tuân theo các đầu vào văn bản mà còn thể hiện khả năng được điều kiện hóa trên các giai điệu. Điều này có nghĩa là nó có thể lấy một giai điệu được hát hoặc thổi và biến đổi nó theo phong cách được mô tả trong chú thích văn bản.

Các thông tin kỹ thuật

MusicLM tận dụng các nguyên tắc của AudioLM, một khuôn khổ được giới thiệu vào năm 2022 cho việc tạo âm thanh. AudioLM tổng hợp âm thanh như một nhiệm vụ mô hình hóa ngôn ngữ trong không gian đại diện rời rạc, sử dụng một hệ thống cấp bậc từ thô đến tinh của các đơn vị âm thanh rời rạc, cũng được gọi là token. Cách tiếp cận này đảm bảo độ trung thực cao và sự nhất quán trong thời gian dài.

Để thúc đẩy quá trình tạo ra, MusicLM mở rộng khả năng của AudioLM để kết hợp điều kiện văn bản, một kỹ thuật giúp căn chỉnh âm thanh được tạo ra với các sắc thái của văn bản đầu vào. Điều này được thực hiện thông qua không gian nhúng chung được tạo bằng MuLan, một mô hình âm nhạc-văn bản chung được đào tạo để chiếu âm nhạc và mô tả văn bản tương ứng gần nhau trong không gian nhúng. Chiến lược này hiệu quả loại bỏ nhu cầu về chú thích trong quá trình đào tạo, cho phép mô hình được đào tạo trên các tập dữ liệu âm thanh chỉ có âm thanh lớn.

Mô hình MusicLM cũng sử dụng SoundStream làm bộ mã hóa âm thanh, có thể tái tạo âm nhạc 24 kHz tại 6 kbps với độ trung thực ấn tượng, tận dụng vector lượng tử dư (RVQ) cho việc nén và giải nén âm thanh hiệu quả và chất lượng cao.

Một minh họa về quá trình tiền đào tạo độc lập cho các mô hình cơ bản của MusicLM: SoundStream, w2v-BERT và MuLan

Một minh họa về quá trình tiền đào tạo của MusicLM: SoundStream, w2v-BERT và MuLan | Nguồn hình ảnh: tại đây

Hơn nữa, MusicLM mở rộng khả năng của mình bằng cách cho phép điều kiện hóa giai điệu. Cách tiếp cận này đảm bảo rằng thậm chí một giai điệu đơn giản có thể đặt nền móng cho một trải nghiệm âm thanh tuyệt vời, được tinh chỉnh theo các mô tả phong cách văn bản chính xác.

Các nhà phát triển của MusicLM cũng đã mở nguồn MusicCaps, một tập dữ liệu bao gồm 5.5k cặp âm nhạc-văn bản, mỗi cặp đi kèm với các mô tả văn bản phong phú được tạo bởi các chuyên gia con người. Bạn có thể xem nó tại đây: MusicCaps trên Hugging Face.

Sẵn sàng tạo soundtrack bằng AI với MusicLM của Google? Dưới đây là cách bắt đầu:

  1. Truy cập trang web chính thức của MusicLM và nhấp vào “Bắt đầu.”
  2. Đăng ký danh sách chờ bằng cách chọn “Đăng ký quan tâm.”
  3. Đăng nhập bằng tài khoản Google của bạn.
  4. Sau khi được cấp quyền truy cập, nhấp vào “Thử ngay” để bắt đầu.

Dưới đây là một số ví dụ về các lời nhắc mà tôi đã thử nghiệm:

“Bài hát thiền, êm ái và làm dịu, với sáo và guitar. Nhạc chậm, tập trung vào việc tạo ra cảm giác hòa bình và yên tĩnh.”

“Jazz với saxophone”

Khi so sánh với các mô hình SOTA trước đó như Riffusion và Mubert trong một đánh giá định tính, MusicLM được ưa chuộng hơn so với các mô hình khác, với các tham gia đánh giá cao sự tương thích của các chú thích văn bản với các đoạn âm thanh 10 giây.

So sánh hiệu suất của MusicLM

So sánh hiệu suất của MusicLM, Nguồn hình ảnh: tại đây

Stability Audio

Stability AI vừa giới thiệu “Stable Audio“, một kiến trúc mô hình khuếch tán tiềm ẩn được điều kiện hóa trên siêu dữ liệu văn bản cùng với thời gian và độ dài của tệp âm thanh. Cách tiếp cận này, giống như MusicLM của Google, cho phép kiểm soát nội dung và độ dài của âm thanh được tạo ra, cho phép tạo ra các đoạn âm thanh có độ dài được chỉ định lên đến kích thước cửa sổ đào tạo.

Các thông tin kỹ thuật

Stable Audio bao gồm một số thành phần, bao gồm một mã hóa tự động Variational (VAE) và một mô hình khuếch tán có điều kiện dựa trên U-Net, hoạt động cùng với một mã hóa văn bản.

Một minh họa cho thấy sự tích hợp của một mã hóa tự động Variational (VAE), một mã hóa văn bản và một mô hình khuếch tán có điều kiện dựa trên U-Net

Kiến trúc của Stable Audio, Nguồn hình ảnh: tại đây

Mã hóa tự động VAE cho phép tạo ra nhanh hơn và đào tạo bằng cách nén âm thanh stereo thành một mã hóa lossy tiềm ẩn, không thể đảo ngược và có khả năng chống nhiễu, vượt qua nhu cầu làm việc với các mẫu âm thanh thô.

Mã hóa văn bản, được dẫn xuất từ mô hình CLAP, đóng vai trò quan trọng trong việc hiểu các mối quan hệ tinh tế giữa từ và âm thanh, cung cấp một biểu diễn thông tin về văn bản đầu vào được mã hóa. Điều này được thực hiện thông qua việc sử dụng các tính năng văn bản từ lớp cuối cùng của mã hóa văn bản CLAP, sau đó được tích hợp vào mô hình khuếch tán U-Net thông qua các lớp chú ý chéo.

Một khía cạnh quan trọng là việc kết hợp các mã hóa thời gian, được tính toán dựa trên hai thuộc tính: giây bắt đầu của đoạn âm thanh và độ dài tổng thể của tệp âm thanh gốc. Những giá trị này, được dịch thành các mã hóa rời rạc học được mỗi giây, được kết hợp với các token lời nhắc và đưa vào các lớp chú ý chéo của U-Net, cho phép người dùng chỉ định độ dài tổng thể của âm thanh đầu ra.

Mô hình Stable Audio được đào tạo bằng cách sử dụng một tập dữ liệu lớn gồm hơn 800.000 tệp âm thanh, thông qua sự hợp tác với nhà cung cấp âm thanh cổ phiếu AudioSparx.

Quảng cáo âm thanh ổn định

Quảng cáo âm thanh ổn định

Stable Audio cung cấp một phiên bản miễn phí, cho phép 20 lần tạo ra các bản nhạc lên đến 20 giây mỗi tháng, và một kế hoạch Pro với giá 12 đô la mỗi tháng, cho phép 500 lần tạo ra các bản nhạc lên đến 90 giây.

Dưới đây là một đoạn âm thanh mà tôi đã tạo bằng cách sử dụng âm thanh ổn định.

Hình ảnh được tạo bởi tác giả sử dụng Midjourney

Hình ảnh được tạo bởi tác giả sử dụng Midjourney

“Cinematic, Nhạc nền Mưa nhẹ, Âm thanh, Dịu dàng, Tiếng chó sủa xa, Tiếng lá rì rào, Gió nhẹ, 40 BPM”

 

Các ứng dụng của những đoạn âm thanh được tạo ra tinh tế như vậy là vô tận. Các nhà làm phim có thể tận dụng công nghệ này để tạo ra các không gian âm thanh phong phú và nhập vai. Trong lĩnh vực thương mại, các nhà quảng cáo có thể sử dụng các bản nhạc âm thanh tùy chỉnh này. Hơn nữa, công cụ này mở ra các con đường cho các nhà sáng tạo và nghệ sĩ cá nhân để thử nghiệm và đổi mới, cung cấp một không gian vô tận để tạo ra các đoạn âm thanh kể chuyện, evokes cảm xúc và tạo ra bầu không khí với một độ sâu mà trước đây khó có thể đạt được mà không cần một ngân sách lớn hoặc chuyên môn kỹ thuật.

Lời nhắc tạo âm thanh

Tạo âm thanh hoàn hảo bằng cách sử dụng lời nhắc văn bản. Dưới đây là một hướng dẫn nhanh để bắt đầu:

  1. Chi tiết: Chỉ định thể loại, tâm trạng và nhạc cụ. Ví dụ: Điện ảnh, Tây du ký, Trống, Căng thẳng, Không khí
  2. Cài đặt tâm trạng: Kết hợp các thuật ngữ âm nhạc và cảm xúc để truyền đạt tâm trạng mong muốn.
  3. Lựa chọn nhạc cụ: Tăng cường tên nhạc cụ với tính từ, như “Guitar vang” hoặc “Dàn hợp xướng mạnh mẽ”.
  4. BPM: Đồng bộ hóa nhịp độ với thể loại để có một đầu ra hài hòa, chẳng hạn như “170 BPM” cho một bản nhạc Drum và Bass.

Lời kết

Hình ảnh được tạo bởi tác giả sử dụng Midjourney

Hình ảnh được tạo bởi tác giả sử dụng Midjourney

Trong bài viết này, chúng ta đã khám phá âm nhạc được tạo ra bằng AI, từ các sáng tác thuật toán đến các khuôn khổ sinh mô hình hóa tinh vi của ngày nay như MusicLM của Google và Stability Audio. Những công nghệ này, tận dụng học sâu và các mô hình nén SOTA, không chỉ nâng cao việc tạo ra âm nhạc mà còn tinh chỉnh trải nghiệm của người nghe.

Mặc dù đây là một lĩnh vực đang不断 phát triển, với những thách thức như duy trì sự nhất quán trong thời gian dài và cuộc tranh luận về tính xác thực của âm nhạc được tạo ra bằng AI, đang thách thức những người tiên phong trong lĩnh vực này. Chỉ mới tuần trước, sự chú ý là tất cả về một bài hát được tạo ra bằng AI, mô phỏng theo phong cách của Drake và The Weeknd, đã ban đầu gây sốt trực tuyến vào đầu năm nay. Tuy nhiên, nó đã bị loại khỏi danh sách đề cử Grammy, thể hiện cuộc tranh luận đang diễn ra về tính hợp pháp của âm nhạc được tạo ra bằng AI trong ngành công nghiệp (nguồn). Khi AI tiếp tục bắc cầu giữa âm nhạc và người nghe, nó chắc chắn đang thúc đẩy một hệ sinh thái nơi công nghệ cùng tồn tại với nghệ thuật, thúc đẩy sự đổi mới trong khi tôn trọng truyền thống.

Tôi đã dành 5 năm qua để đắm mình trong thế giới hấp dẫn của Máy học và Học sâu. Đam mê và chuyên môn của tôi đã dẫn tôi đến việc đóng góp vào hơn 50 dự án kỹ thuật phần mềm đa dạng, với sự tập trung đặc biệt vào AI/ML. Sự tò mò liên tục của tôi cũng đã thu hút tôi đến với Xử lý Ngôn ngữ Tự nhiên, một lĩnh vực tôi渴望 khám phá thêm.