Mô hình và nền tảng AI

Google Mang Công Cụ Tạo Nhạc Lyria 3.5 Đến Ứng Dụng Gemini và API

mm
Thêm Unite.AI vào các nguồn ưu tiên của bạn trên Google

Vào ngày 4 tháng 9 năm 2026, Google đã đưa Lyria 3.5, mô hình tạo nhạc của mình, lên sẵn trong ứng dụng Gemini và API Gemini, mở rộng mô hình này ra ngoài công cụ Google Flow Music, nơi nó lần đầu xuất hiện vào đầu năm nay. Công ty cho biết mô hình này hiện đã có sẵn cho tất cả người dùng Gemini trên toàn cầu, cả trên web và trong ứng dụng di động, trong thông báo của họ trên The Keyword.

Google mô tả Lyria 3.5 là mô hình tạo nhạc nghe tốt nhất của mình và cho biết nó mang lại giọng hát biểu cảm hơn và các sắp xếp âm nhạc phong phú hơn so với các phiên bản trước, tạo ra các bản nhạc với độ trung thực cao hơn. Mô hình này lần đầu được ra mắt trên Google Flow Music vào ngày 29 tháng 7 năm 2026, khi Google cho biết nó đã cải thiện toàn diện về âm nhạc, lời bài hát và chất lượng giọng hát.

Các Điều Khiển Tạo Mới trong Ứng Dụng Gemini

Phiên bản Lyria 3.5 trong ứng dụng Gemini bổ sung một loạt tính năng tạo có hướng dẫn. Người dùng có thể chọn hoặc mô tả thể loại và lựa chọn giữa phong cách vocal hoặc nhạc cụ. Các mẫu mới được thiết kế để khởi động các dự án từ nhạc nền đến bản nhạc sinh nhật tùy chỉnh, và người dùng hiện có thể chọn giữa các bản nhạc ngắn hoặc dài hơn.

Google cho biết tính năng này hướng tới các trường hợp sử dụng như bản nhạc nền tùy chỉnh cho video, giai điệu thương hiệu và nhạc chuông cá nhân hoá. Ngoài ứng dụng, Lyria 3.5 còn có sẵn cho các nghệ sĩ và nhà sáng tạo AI trong Google Flow Music, và cho các nhà phát triển và chuyên gia công nghệ thông qua Google AI Studio và Google Vids.

Trang mô hình của Google DeepMind dành cho dòng Lyria mô tả mô hình này hỗ trợ độ dài bài hát thay đổi lên tới ba phút, với khả năng tạo ra các bản nhạc liền mạch phù hợp với thời lượng yêu cầu, từ đoạn clip 60 giây đến một bài hát đầy đủ ba phút. Trang này cho biết người dùng có thể tự viết lời hoặc tạo lời dựa trên các chủ đề hoặc đề tài cụ thể, và có thể xác định phong cách giọng hát cũng như sở thích âm học. Nó cũng mô tả việc sáng tác bằng hình ảnh: người dùng có thể tải lên một hình ảnh và để mô hình biến nó thành một bản nhạc.

Truy Cập Dành Cho Nhà Phát Triển Thông Qua API Gemini

Theo tài liệu dành cho nhà phát triển về tạo nhạc của Google, cập nhật ngày 4 tháng 9 năm 2026, Lyria 3.5 tạo ra âm thanh stereo 44.1 kHz từ các lời nhắc bằng văn bản hoặc hình ảnh, với tính nhất quán cấu trúc bao gồm giọng hát, lời bài hát có thời gian và các sắp xếp nhạc cụ đầy đủ. Tài liệu liệt kê hai mô hình: Lyria 3 Clip, với ID mô hình lyria-3-clip-preview, luôn tạo ra các đoạn clip 30 giây cho vòng lặp và bản xem trước, và Lyria 3.5, với ID mô hình lyria-3.5, tạo ra các bài hát toàn bộ với các đoạn verse, chorus và bridge kéo dài vài phút.

Cả hai mô hình đều được truy cập qua Interactions API của Google và xuất âm thanh MP3 theo mặc định, với tùy chọn xuất WAV cho Lyria 3.5. Tài liệu cho biết các nhà phát triển có thể cung cấp tối đa 10 hình ảnh cùng với lời nhắc văn bản, và mô hình sẽ sáng tác nhạc lấy cảm hứng từ nội dung hình ảnh. Họ cũng có thể cung cấp lời bài hát tùy chỉnh bằng cách sử dụng các thẻ phần như Verse, Chorus và Bridge, và dùng dấu thời gian để chỉ định những gì xảy ra tại các khoảnh khắc cụ thể trong bài hát, chẳng hạn khi các nhạc cụ vào. Việc đưa lời nhắc bằng một ngôn ngữ nào đó sẽ tạo ra lời bài hát bằng ngôn ngữ đó, tài liệu cho biết, với mô hình điều chỉnh phong cách giọng hát và cách phát âm cho phù hợp. Trước khi âm thanh được tạo ra, mô hình sẽ suy luận về cấu trúc âm nhạc dựa trên lời nhắc.

Các Giới Hạn Được Nêu và Đánh Dấu Nước

Tài liệu dành cho nhà phát triển liệt kê một số giới hạn. Tất cả các lời nhắc đều đi qua bộ lọc an toàn, và các yêu cầu về giọng nói của nghệ sĩ cụ thể hoặc việc tạo lời có bản quyền bị chặn. Quá trình tạo nhạc là một lượt duy nhất, vì vậy việc chỉnh sửa lặp lại một đoạn clip đã tạo qua nhiều lời nhắc không được hỗ trợ trong phiên bản hiện tại. Kết quả có thể khác nhau giữa các lần gọi ngay cả khi sử dụng cùng một lời nhắc.

Mọi âm thanh được tạo đều mang dấu nước SynthID để nhận dạng, mà Google mô tả là không thể cảm nhận được bằng tai người. Trang mô hình của DeepMind cho biết tất cả các bản nhạc đều được đánh dấu SynthID một cách không thể cảm nhận được, giúp người nghe và các nền tảng phát hiện liệu âm nhạc có được tạo ra hoặc chỉnh sửa bằng AI hay không, và Google sử dụng bộ lọc và gắn nhãn dữ liệu rộng rãi để giảm nội dung gây hại trong bộ dữ liệu huấn luyện và khả năng xuất hiện lời bài hát gây hại. Trang này còn bổ sung rằng Google vẫn đang nỗ lực cải thiện các khả năng quan trọng và khuyên người dùng kiểm tra xem các bản nhạc được tạo có phù hợp với tầm nhìn của họ hay không.

Trang của DeepMind cũng lưu ý rằng dòng Lyria được phát triển với sự đóng góp của các nhà sản xuất và nhạc sĩ, và liệt kê các thí nghiệm của nghệ sĩ trước đây với các công cụ âm nhạc của Google, bao gồm công việc của nhà sản xuất Wyclef Jean với Music AI Sandbox và việc Yung Spielburg sử dụng Lyria để soạn nhạc cho đoạn phim hoạt hình ngắn Dear Upstairs Neighbors. Lyria 3.5 hiện có sẵn qua ứng dụng Gemini, Google Flow Music, Google AI Studio và Google Vids kể từ ngày 4 tháng 9 năm 2026.

Luca Ren là một nhà phân tích do AI tạo ra tại Unite.AI, chuyên đưa tin về trí tuệ nhân tạo trong lĩnh vực giải trí, truyền thông và kể chuyện kỹ thuật số. Công việc của anh khám phá cách các hệ thống AI tuyển chọn nội dung, ảnh hưởng đến sản xuất phim, truyền hình, âm nhạc và trò chơi, đồng thời cá nhân hoá trải nghiệm truyền thông cho khán giả toàn cầu.

Với góc nhìn sáng tạo và nhạy bén với xu hướng, Luca xem xét cách các công cụ đề xuất, công cụ sinh tạo và phân tích khán giả đang tái định hình quy trình sáng tạo và mô hình phân phối. Anh đặc biệt quan tâm đến việc AI ảnh hưởng đến cấu trúc câu chuyện, quyền tự chủ của người sáng tạo, và cân bằng giữa tối ưu hoá dựa trên dữ liệu và biểu hiện nghệ thuật trong hệ sinh thái truyền thông hiện đại.

Những bài viết do Luca Ren viết là do AI tạo ra và được đội ngũ biên tập của Unite.AI kiểm duyệt để đảm bảo độ chính xác, bối cảnh văn hoá và việc đưa tin có trách nhiệm về vai trò ngày càng phát triển của AI trong giải trí và truyền thông.