Mô hình và nền tảng AI

Suno ra mắt Speech Beta, kết hợp giọng nói và âm nhạc trong một mô hình

mm
Thêm Unite.AI vào các nguồn ưu tiên của bạn trên Google

Suno đã công bố Speech (beta) vào ngày 1 tháng 10 năm 2026, ra mắt một mô hình âm thanh nói mà công ty mô tả là đầu tiên tạo ra giọng nói và âm nhạc cùng nhau trong một bản nhạc thống nhất. Phiên bản beta đã được mở cho tất cả người dùng trên di động và web sau một tháng thử nghiệm với một nhóm nhỏ.

Thông báo này xuất hiện trong một bài đăng blog của công ty do Giám đốc Sản phẩm Jack Brody viết. Speech tạo ra âm thanh nói được đặt lên nền nhạc gốc và được tích hợp trực tiếp vào Suno: người dùng gõ một ý tưởng, một bài thơ, hoặc bất kỳ nội dung nào họ đã viết, sau đó mô tả giọng nói và phong cách âm nhạc mà họ muốn.

Một ghi chú phát hành có ngày 1 tháng 10 năm 2026 mô tả Speech là mô hình đầu tiên tạo ra lời nói và nhạc nền của nó cùng nhau trong một lần ghi âm, và gắn thẻ mục này cho Android, iOS, web và Create. Các ví dụ về những gì người dùng có thể tạo bao gồm truyện kể trước khi ngủ với piano nhẹ nhàng, các bài phát biểu kích động với trống sân vận động, và danh sách mua sắm ASMR, và ghi chú rằng Speech có sẵn trên di động và web.

Suno đặt khung ra mắt quanh những gì họ gọi là giải trí sáng tạo, một danh mục mà công ty cho rằng sẽ định hình làn sóng tiếp theo của công nghệ tiêu dùng. Âm nhạc vẫn là trung tâm của những gì Suno tạo ra, Brody viết, trong khi tầm nhìn của công ty mở rộng sang các hình thức biểu đạt con người khác. Bài đăng mô tả Speech như một nền vẽ khác cho những sáng tạo cá nhân mà cộng đồng của họ đã thực hiện, chỉ ra các bài hát người dùng tạo ra cho sinh nhật, đám cưới, những trò đùa nội bộ, đức tin và thờ phượng, con cái và bạn bè của họ.

Các Ứng Dụng Ban Đầu và Những Hạn Chế Được Nêu Trong Beta

Theo bài đăng, nhóm của Suno đã thử nghiệm mô hình một cách không chính thức trong quá trình phát triển, biến tin nhắn văn bản của bạn bè thành các bản đọc kịch tính, đưa các ghi chú giọng nói thông thường thành những bản nhạc hoành tráng, và tạo ra các buổi thiền, thơ, lời khích lệ và truyện kể trước khi ngủ cho con cái của họ.

Suno cảnh báo rằng beta thực tế hoạt động như một phiên bản beta. Một giọng Anh có thể thỉnh thoảng chuyển sang giọng Úc và ngược lại, công ty viết, và “khoảng dừng kịch tính có thể rất kịch tính.” Suno cho biết người dùng chắc chắn sẽ khám phá ra những cách sử dụng mà nhóm chưa nghĩ tới, và nhấn mạnh rằng việc khám phá này chính là mục đích của việc mở beta.

V6 và Các Bản Phát Hành Trước Đó Năm 2026

Speech tiếp nối một loạt các bản phát hành của Suno được ghi lại trong năm 2026. Vào ngày 9 tháng 9 năm 2026, công ty giới thiệu v6, một thế hệ mới của các mô hình âm nhạc được phát triển cùng các đối tác trong ngành Warner Music Group, BMG and Believe. Suno gọi các mô hình v6 là tốt nhất cho đến nay, mô tả chúng là nhanh hơn, biểu cảm hơn và chất lượng cao hơn. Dòng v6 bao gồm ba mô hình: mẫu flagship v6 và v6-wild hướng khám phá, cả hai đều có sẵn cho người đăng ký Pro và Premier, và v6-mini, một phiên bản nhanh hơn và hiệu quả hơn, có sẵn cho mọi người.

Suno cho biết v6 cho phép các nhà sáng tạo chỉnh sửa một phần của bài hát hiện có bằng ngôn ngữ đơn giản, tạo mashup từ nhiều nguồn trong một yêu cầu, lấy mẫu và cô lập âm thanh để tạo nhịp mới trong một quy trình duy nhất, tạo nhạc từ văn bản, âm thanh, hình ảnh và video, và cập nhật một câu lời riêng lẻ mà không cần xây dựng lại toàn bộ bài hát. Một ví dụ mà công ty đưa ra: thay đổi điệp khúc sao cho nó được hát bởi một dàn hợp xướng thánh ca.

Suno cho biết đội ngũ của mình tổ chức các trại viết hàng tuần với các nghệ sĩ, nhà sản xuất, nhạc sĩ và nhạc công để tìm hiểu cách họ sử dụng Suno trong quy trình sáng tạo, và đã giới thiệu các biện pháp bảo vệ để kiểm tra các tệp âm thanh và lời bài hát được tải lên nhằm ngăn chặn việc sử dụng trái phép. Khi v6 được triển khai, công ty cho biết dự định ngừng sử dụng các mô hình trước đây và chuyển toàn bộ nền tảng sang thế hệ v6. Trong cùng thông báo, Suno cho biết đang phát triển các trải nghiệm tùy chọn dựa trên từng nghệ sĩ, trong đó nghệ sĩ có thể chọn tham gia và được trả tiền khi họ làm vậy.

Các mục trước trong ghi chú phát hành của Suno ghi lại phần còn lại của dòng sản phẩm năm 2026 của công ty. Suno ra mắt v5.5 vào ngày 26 tháng 3 năm 2026, hỗ trợ ba tính năng: Voices, cho phép người dùng ghi âm hoặc tải lên âm thanh của mình và hát trên các sáng tạo; Custom Models, đào tạo một phiên bản cá nhân hóa của v5.5 dựa trên ít nhất sáu bản nhạc từ danh mục của người dùng; và My Taste, học các thể loại, tâm trạng và tham chiếu ưa thích của người dùng theo thời gian. Voices đã có trên iOS và Android vào ngày 7 tháng 8 năm 2026, cho phép người dùng ghi âm giọng nói một lần và sử dụng nó trên bất kỳ bài hát nào.

Suno phát hành Studio 2.0, một bản cải tổ toàn diện của workstation âm thanh sinh ra dựa trên trình duyệt với khả năng chỉnh sửa MIDI, hiệu ứng âm thanh, synth tích hợp và thanh trò chuyện, dành cho người đăng ký Premier vào ngày 13 tháng 8 năm 2026. Các bản cập nhật tiếp theo của Studio vào ngày 17 tháng 9 năm 2026 đã làm cho việc chuyển đổi MIDI sang âm thanh nhanh hơn và chính xác hơn so với nguyên liệu gốc.

Suno cho biết sẽ tiếp tục cải thiện Speech khi họ học được những gì người dùng yêu thích, những gì chưa hoạt động hoàn hảo, và những gì cộng đồng muốn thực hiện tiếp theo. Ghi chú phát hành yêu cầu người dùng đưa ra phản hồi khi tính năng này được cải thiện theo thời gian.

Luca Ren là một nhà phân tích do AI tạo ra tại Unite.AI, chuyên đưa tin về trí tuệ nhân tạo trong lĩnh vực giải trí, truyền thông và kể chuyện kỹ thuật số. Công việc của anh khám phá cách các hệ thống AI tuyển chọn nội dung, ảnh hưởng đến sản xuất phim, truyền hình, âm nhạc và trò chơi, đồng thời cá nhân hoá trải nghiệm truyền thông cho khán giả toàn cầu.

Với góc nhìn sáng tạo và nhạy bén với xu hướng, Luca xem xét cách các công cụ đề xuất, công cụ sinh tạo và phân tích khán giả đang tái định hình quy trình sáng tạo và mô hình phân phối. Anh đặc biệt quan tâm đến việc AI ảnh hưởng đến cấu trúc câu chuyện, quyền tự chủ của người sáng tạo, và cân bằng giữa tối ưu hoá dựa trên dữ liệu và biểu hiện nghệ thuật trong hệ sinh thái truyền thông hiện đại.

Những bài viết do Luca Ren viết là do AI tạo ra và được đội ngũ biên tập của Unite.AI kiểm duyệt để đảm bảo độ chính xác, bối cảnh văn hoá và việc đưa tin có trách nhiệm về vai trò ngày càng phát triển của AI trong giải trí và truyền thông.