Mô hình và nền tảng AI
Các Nhà Phát Triển Trò Chơi Tìm Kiếm Trí Tuệ Nhân Tạo Giọng Nói Để Tạo Ra Cơ Hội Sáng Tạo Mới
Công nghệ tổng hợp âm thanh, đặc biệt là tổng hợp giọng nói, đã trở nên tinh vi hơn rất nhiều trong những năm gần đây. Mặc dù công nghệ văn bản thành giọng nói đã tồn tại từ hàng thập kỷ, nhưng công nghệ này đã trở nên tự nhiên hơn rất nhiều. Các thuật toán gần đây có thể chỉ cần vài giờ âm thanh và tổng hợp các mẫu âm thanh rất thực tế. Khi công nghệ tiến bộ, nhiều ứng dụng mở ra, bao gồm cả khả năng trong phương tiện truyền thông sáng tạo. Gần đây, theo báo cáo của VentureBeat, các công ty trò chơi điện tử đã bắt đầu điều tra việc sử dụng trí tuệ nhân tạo tạo giọng nói để sản xuất hội thoại cho trò chơi điện tử.
Một công ty, Leviathan Games, đã bắt đầu triển khai trí tuệ nhân tạo giọng nói trong các trò chơi mà họ đang phát triển. Wyeth Ridgway, chủ sở hữu của Leviathan Games, giải thích rằng trí tuệ nhân tạo giọng nói có thể thay đổi thiết kế trò chơi một cách đáng kể. Ridgway giải thích rằng việc sử dụng trí tuệ nhân tạo giọng nói trong thiết kế trò chơi là một xu hướng mới nổi, và so sánh nó với cách phần mềm hoạt hình 3D đã thay đổi trong suốt thập kỷ qua, với các công ty như Pixar tạo ra phần mềm độc quyền nhằm tạo điều kiện cho hoạt hình và mô hình hóa.
Phương pháp truyền thống để tạo ra giọng nói hoạt động bằng cách gắn các tệp âm thanh đã được ghi trước vào nhau, khâu các câu lại với nhau từ các từ và cụm từ đã tồn tại. Phương pháp tạo giọng nói này đòi hỏi phải ghi lại hàng trăm giờ hội thoại và gắn nhãn thủ công cho các đoạn âm thanh. Nó cũng nghe có vẻ không tự nhiên vì sự nhấn mạnh và cảm xúc có xu hướng thay đổi trên các từ. So sánh, trí tuệ nhân tạo giọng nói hiện đại nghe có vẻ tự nhiên hơn rất nhiều và hoạt động theo một cách khác.
Trí tuệ nhân tạo giọng nói dựa trên mạng nơ-ron sâu. WaveNet là một trong những trí tuệ nhân tạo đầu tiên có thể tạo ra các mẫu âm thanh tự nhiên và thuyết phục. Vì các mẫu âm thanh được tạo ra từ đầu, không cần phải ghi lại hàng trăm giờ hội thoại, miễn là có đủ dữ liệu đào tạo. Các mô hình GAN và LSTM tối ưu hóa có thể tạo ra âm thanh sau khi được đào tạo trên chỉ một vài giờ âm thanh được gắn nhãn. Kết quả có thể rất thuyết phục, chẳng hạn như khi thí nghiệm Duplex của Google (GOOGL ) gọi điện đến một tiệm cắt tóc để đặt lịch hẹn.
Khi các công nghệ này trở nên mạnh mẽ, tiêu chuẩn hóa và dễ tiếp cận hơn thông qua điện toán đám mây, có thể nhiều nhà phát triển trò chơi sẽ chuyển sang sử dụng trí tuệ nhân tạo giọng nói để giảm thời gian sản xuất và chi phí. Một số công ty đã tạo ra các mô hình có thể được sử dụng bởi các nhà phát triển trò chơi. Replica Studios chuyên về công nghệ giọng nói trí tuệ nhân tạo, và một số mẫu âm thanh được tạo ra bởi công nghệ của họ có thể được nghe tại các liên kết đây và đây.
Không chắc rằng các nhà phát triển trò chơi sẽ chọn bỏ qua việc sử dụng diễn viên lồng tiếng qua trí tuệ nhân tạo. Trên thực tế, trí tuệ nhân tạo giọng nói có thể mở ra nhiều cơ hội hơn cho diễn viên lồng tiếng. Hiện tại, nhiều công ty phát triển trò chơi thường bỏ qua việc có hội thoại được lồng tiếng vì đầu tư thời gian và chi phí liên quan đến việc tạo ra hội thoại được lồng tiếng. Diễn viên lồng tiếng thường cần phải quay lại cho các phiên ghi âm khác nếu có thay đổi trong kịch bản hoặc nếu các giám đốc trò chơi muốn một loại biểu diễn khác. Trí tuệ nhân tạo giọng nói có thể được sử dụng để thử nghiệm/thiết kế hội thoại, cảm nhận loại thay đổi kịch bản và sửa đổi cần được thực hiện trước khi gọi một diễn viên lồng tiếng chuyên nghiệp để ghi lại kịch bản. Điều này có thể dẫn đến nhiều công ty có nguồn lực để đầu tư vào việc tạo ra hội thoại được lồng tiếng.
Các mô hình giọng nói trí tuệ nhân tạo thậm chí có thể được đào tạo trên giọng nói của một diễn viên lồng tiếng cụ thể, và trí tuệ nhân tạo có thể được sử dụng để tạo ra các đoạn hội thoại không quan trọng, miễn là diễn viên được trả tiền cho việc sử dụng giọng nói của họ. Theo báo cáo của VentureBeat, các diễn viên lồng tiếng như Simon J. Smith, lạc quan về việc sử dụng ngày càng nhiều mô hình giọng nói trí tuệ nhân tạo và tiềm năng của chúng trong việc mở ra cơ hội lồng tiếng mới.
Bên cạnh việc sử dụng trí tuệ nhân tạo giọng nói để thiết kế kịch bản hoặc tạo ra dòng hội thoại cho các nhân vật phụ, các nhà phát triển trò chơi cũng có thể sử dụng trí tuệ nhân tạo giọng nói để cung cấp cho người chơi nhiều tùy chọn tùy chỉnh hơn cho các trò chơi điện tử nhập vai. Hiện tại, ngay cả những trò chơi cho phép người chơi chọn giọng nói cho các nhân vật của họ thường chỉ có một số lựa chọn hạn chế. Với việc sử dụng trí tuệ nhân tạo giọng nói, các lựa chọn có thể gần như vô tận.












