Modele i platformy AI
Zespół badaczy tworzy model AI potrafiący śpiewać w języku chińskim i angielskim
Zespół badaczy z Microsoftu i Uniwersytetu Zhajiang niedawno stworzył model AI potrafiący śpiewać w wielu językach. Jak donosi VentureBeat, model DeepSinger opracowany przez zespół został opracowany na podstawie danych z różnych stron internetowych z muzyką, wykorzystując algorytmy, które pochwyciły barwę głosu śpiewaka.
Wygenerowanie “głosu” śpiewającego AI wymaga algorytmów, które są w stanie przewidzieć i kontrolować zarówno wysokość, jak i czas trwania dźwięku. Kiedy ludzie śpiewają, hałasy, które produkują, mają znacznie bardziej złożone rytm i wzory w porównaniu z prostą mową. Innym problemem, który zespół musiał pokonać, było to, że chociaż istnieje spory zbiór danych szkoleniowych do mówienia, zestawy danych szkoleniowych do śpiewu są dość rzadkie. Połączenie tych wyzwań z faktem, że piosenki muszą mieć zarówno dźwięk, jak i teksty analizowane, sprawia, że problem generowania śpiewu jest niezwykle złożony.
System DeepSinger stworzony przez badaczy pokonał te wyzwania, rozwijając potok danych, który wydobywał i przekształcał dane audio. Klipy śpiewu zostały wyodrębnione z różnych stron internetowych z muzyką, a następnie śpiew został odizolowany od reszty dźwięku i podzielony na zdania. Następnym krokiem było określenie czasu trwania każdego fonemu w tekście, w wyniku czego powstała seria próbek, z których każda reprezentowała unikalny fonem w tekście. Oczyszczanie danych jest wykonywane w celu rozwiązania problemu zniekształconych próbek szkoleniowych po posortowaniu tekstów i towarzyszących im próbek audio według oceny ufności.
Te same metody wydają się działać dla różnych języków. DeepSinger został opracowany na podstawie chińskich, kantońskich i angielskich próbek wokalnych, składających się z 89 różnych śpiewaków śpiewających przez ponad 92 godziny. Wyniki badania wykazały, że system DeepSinger był w stanie niezawodnie generować wysokiej jakości próbki “śpiewu” zgodnie z metrykami takimi jak dokładność wysokości i naturalność brzmienia śpiewu. Badacze poprosili 20 osób o ocenę piosenek wygenerowanych przez DeepSinger i piosenek szkoleniowych według tych metryk, a różnica między ocenami dla wygenerowanych próbek a autentycznymi nagraniami była dość mała. Uczestnicy przyznali DeepSinger średnią ocenę, która różniła się od 0,34 do 0,76.
Przewidując przyszłość, badacze chcą spróbować poprawić jakość generowanych głosów, łącząc szkolenie różnych podmodeli, które składają się na DeepSinger, z wykorzystaniem specjalistycznych technologii, takich jak WaveNet, zaprojektowanych specjalnie do generowania naturalnie brzmiącej mowy za pomocą fal dźwiękowych.
System DeepSinger może być wykorzystany do pomocy śpiewakom i innym artystom muzycznym w korekcji ich pracy bez konieczności powrotu do studia nagraniowego. Może być również wykorzystany do tworzenia audio deepfake, sprawiając, że wydaje się, iż artysta śpiewał piosenkę, której nigdy nie nagrał. Chociaż może być wykorzystany do parodii lub satyry, jest to również wątpliwej legalności.
DeepSinger jest tylko jednym z nowej fali AI-opartych systemów muzycznych i audio, które mogą zmienić sposób, w jaki muzyka i oprogramowanie wzajemnie na siebie wpływają. OpenAI niedawno wydał swój własny system AI, nazwany JukeBox, który jest w stanie produkować oryginalne utwory muzyczne w stylu określonego gatunku lub nawet konkretnego artysty. Inne narzędzia muzyczne AI obejmują Google Magenta (GOOGL ) i Amazon DeepComposer (AMZN ). Magenta to otwarta biblioteka manipulacji audio (i obrazu), która może być wykorzystana do tworzenia wszystkiego, od automatycznego podkładu perkusyjnego po proste gry wideo oparte na muzyce. Tymczasem Amazon DeepComposer jest skierowany do osób, które chcą szkolić i dostosowywać własne modele głębokiego uczenia oparte na muzyce, umożliwiając użytkownikom pobranie pre-trenowanych modeli próbek i dostosowanie ich do własnych potrzeb.
Możesz posłuchać niektórych próbek audio wygenerowanych przez DeepSinger pod tym linkiem.












