Wywiady

Jaime Bosch, CEO, Voicemod – Wywiad

mm
Dodaj Unite.AI do preferowanych źródeł w Google

Jaime Bosch jest CEO Voicemod, darmowego oprogramowania do zmiany głosu dla graczy, twórców treści i vtuberów.

Czy mógłbyś podzielić się historią powstania Voicemod?

Jako ósme z dziesięciorga dzieci, wyrastałem w środowisku, w którym mogłem w pełni rozwinąć swój przedsiębiorczy duch od bardzo młodego wieku, ponieważ zawsze było wsparcie ze strony podobnie myślących braci.

W związku z tym, było tylko kwestią czasu, gdy dwóch moich braci i ja, wszyscy dzieląc głęboką miłość do technologii i muzyki, zabawiliśmy się pomysłem stworzenia aplikacji, która połączy nasze zainteresowania. Więc w 2009 roku, zrobiliśmy to i stworzyliśmy aplikację muzyczną B2C jako poboczny interes do studia, które prowadziliśmy jako nasze główne zajęcie.

Ponieważ było to zajęcie poboczne, eksperymentowaliśmy z wieloma rzeczami, takimi jak modyfikacja głosu, co zainspirowało nas do stworzenia czegoś całkowicie nowego i nowatorskiego. Wynikiem tego była to, co nazwaliśmy “Doświadczeniem Voicemod” – całkowicie nowy sposób doświadczania własnego głosu – które stało się napędem ewolucji aplikacji. Niezależnie od tego, kto próbował naszego oprogramowania, spotykaliśmy te same reakcje u ludzi, którzy doświadczali aplikacji: śmiech i zdumienie, słysząc siebie w całkowicie inny sposób.

To skłoniło nas do przekształcenia naszej wizji dotyczącej produktu w coś, co mogłoby ostatecznie ewoluować ludzką łączność poprzez medium dźwięku. Więc przenieśliśmy doświadczenie z telefonu komórkowego na PC, gdzie zostało ono natychmiast podjęte przez ekspandującą się scenę gier i streamingu – i reszta, jak się mówi, jest “historią”.

Voicemod początkowo był projektem pobocznym — kiedy zdecydowałeś się na to, aby w pełni się nim zająć?

Początkowo, moi bracia i ja mieliśmy studio razem o nazwie 2taptap. Gdy wpadliśmy na pomysł stworzenia Voicemod, początkowo było to tylko zabawne zajęcie poboczne, ale z czasem zobaczyliśmy, jak ludzie wchodzą w interakcje z nim i jaki potencjał miała ta technologia. Do tego momentu większość technologii zmiany głosu była asynchroniczna, więc możliwość doświadczania bycia kimś innym w czasie rzeczywistym była nowatorska dla wielu ludzi. Decydującym momentem dla nas było zrozumienie, że ludzie używali naszej technologii nie tylko dla zabawy, ale również do kształtowania całego swojego sposobu wyrażania się w sieci. To było momentem, w którym zrozumieliśmy, że budujemy coś, co nie jest tylko rozrywką, ale może być następnym krokiem w ewolucji doświadczeń dźwiękowych.

Czy mógłbyś omówić niektóre technologie rozpoznawania głosu?

Z zakresem zmieniaczy głosu w naszym katalogu, istnieją procesy, które są przechodzone, aby wziąć zwykły ludzki głos i przekształcić go w coś nowego. Oczywiście, istnieją również aspekty w głosie, które muszą być brane pod uwagę, takie jak wiek, płeć, emocja i proste wahania w sposobie mówienia.

Te wahania przyczyniają się do tego, jak ktoś może brzmieć i wpływają na zmiany, które są stosowane. Wykorzystujemy elementy z najnowocześniejszej technologii rozpoznawania głosu, aby ułatwić konwersję głosu i transformację w sposób jak najbardziej dokładny — i stale poprawiamy ten proces. Chcemy dać ludziom możliwość kształtowania, jak są postrzegani, brzmieć tak, jak chcą być słyszani, i dać wspaniałe doświadczenie słuchowe ich publiczności.

Dlaczego tak ważne jest pomoc ludziom w wyrażaniu siebie poprzez dźwięk?

Od momentu, gdy się rodzimy, a pierwszy krzyk niemowlęcia, dźwięk jest naturalnym sposobem, w jaki uczymy się wyrażać siebie. Gdy dorastamy, znaczenie komunikacji dźwiękowej nadal rośnie, ponieważ uczymy się kształtować dźwięk w język i używać naszych głosów, aby dodać emocje i nuance do słów, które mówimy. Podnosząc ton naszego głosu, możemy sygnalizować ekscytację – lub używać efektów dźwiękowych, takich jak westchnienia lub jęki, aby podkreślić punkty, które chcemy zrobić.

Dla niektórych utalentowanych ludzi głos jest instrumentem nieograniczonej ekspresji – mogą oni tworzyć nieograniczoną ilość efektów dźwiękowych lub głosów. Większość z nas jednak nie jest tak szczęśliwa i naprawdę czuje się niekomfortowo ze swoim głosem (szczególnie, gdy słyszymy go nagrany). Niektórzy z naszych użytkowników mówią o tym, że czują się nerwowo, gdy mówią przed obcymi i są sfrustrowani, że nie mogą właściwie wyrazić siebie w sposób, w jaki by chcieli.

To jest miejsce, w którym widzimy ogromną okazję, aby pomóc ludziom. Z naszymi tożsamościami głosowymi, użytkownicy mogą kształtować swoje głosy, aby były czymś, z czym czują się komfortowo – lub nawet wśliznąć się w różne głosy dla konkretnych sytuacji. Chcemy również dać im możliwość używania efektów dźwiękowych, klipów muzycznych lub emoji audio, aby stworzyć atmosferę, przekazać kontekst lub wdrożyć efekty komediowe – podobnie jak to, jak emoji graficzne pomogły ukształtować komunikację tekstową.

Opisałeś Voicemod jako ewolucję ludzkiej łączności poprzez dźwięk, czy mógłbyś to wyjaśnić?

Poza uwolnieniem mówcy i usunięciem pewnego mentalnego bloku, który powstrzymuje ludzi od mówienia, pracujemy również nad tym, aby ta łączność była głębsza. Na przykład, nasza tablica dźwiękowa podnosi komunikację na wyższy poziom — myśl o tym jako o “audio-emoji”. Czy możesz wyobrazić sobie ludzi poniżej 35 lat rozmawiających bez użycia emoji? Chociaż ta technologia istnieje od czegoś, co wydaje się wiecznością, to naprawdę stała się głęboko osadzona w naszej komunikacji dopiero od około 2010 roku. Zobaczyliśmy podobny trend ze znacznikami na platformach komunikacyjnych, wzrostem wiadomości głosowych i notatek głosowych, a teraz pojawiającym się użyciem GIF-ów i Giphy. Z rozwojem ogólnoświatowej komunikacji audio, znaczenie tego, jak używamy dźwięku, rośnie. Wysłanie reakcji audio do żartu twojego przyjaciela może wiele powiedzieć o twojej prawdziwej, szczerej reakcji niż po prostu napisanie zdania. Wyobraź sobie różnicę między słuchaniem dźwięku świerszczy a ba dum tss! Wszystkie te rzeczy mają ogromnie różne znaczenia i nastroje, które możesz łatwo przekazać za pomocą jednego kliknięcia.

Chcemy uczynić to tak łatwym, jak to tylko możliwe, aby użytkownicy mogli wykorzystywać głosy, efekty głosowe i emoji audio, aby mieć bardziej angażujące rozmowy audio z przyjaciółmi, rodziną lub obcymi.

Jakie są niektóre technologie sztucznej inteligencji za Voicemod, w tym umożliwiające użytkownikom brzmieć lepiej i dostosowywać swój głos wokół swojego prawdziwego głosu?

Sztuczna inteligencja jest w sercu większości nowych funkcji Voicemod.

Jeśli chodzi o kreatywny aspekt, Voicelab Voicemod stworzył pierwszą w czasie rzeczywistym technologię konwersji głosu na rynku, która pozwoli użytkownikom wybrać swoją własną tożsamość dźwiękową, tworząc osobiste głosy dla każdego.

Z naszą nową, zaawansowaną technologią, która zostanie wydana wkrótce, tworzymy nigdy wcześniej nie słyszane głosy z unikalnymi cechami, które pomogą chronić prywatność i bezpieczeństwo użytkowników, jednocześnie pozwalając im tworzyć pożądaną osobowość poprzez dźwięk.

Obserwowaliśmy również pojawienie się metodologii głębokiego uczenia się opartych na danych w ostatnich latach. Pozwalają one nam nauczyć się abstrakcyjnych, ukrytych struktur w sygnałach mowy, odnoszących się do percepcyjnych cech głosu, takich jak fonologia, zawartość, tożsamość, intencja i nastrój. Wykorzystując te technologie, możemy kontrolować i modyfikować percepcyjne aspekty sygnału. Pozwala nam to na projektowanie technologii, które dają użytkownikom większą kontrolę nad ich postrzeganymi tożsamościami głosowymi w sposób, który nie był możliwy wcześniej.

Jakie są niektóre przypadki użycia Voicemod?

Wspaniałą rzeczą w Voicemod jest to, że jego narzędzia obsługują szeroki zakres potrzeb i scenariuszy. Najczęstsze sytuacje to tworzenie treści, granie z przyjaciółmi, rozmawianie z rodziną lub przyjaciółmi, tworzenie immersyjnych środowisk role-playingowych lub nawet do pracy i biznesu – gdzie użytkownicy głównie używają naszych narzędzi do anulowania szumu i poprawy audio.

Czy mógłbyś omówić niektóre wyzwania i korzyści związane z uruchomieniem startupu z braćmi?

Szczerze mówiąc, kochaję to i wiem, że każdy spotyka wyzwania w jakiejś formie, ale naprawdę nie pamiętam wielu w naszym przypadku. Powodem jest to, że pochodzimy z bardzo dużej rodziny. Zawsze robiliśmy coś razem, od projektów z dzieciństwa po granie na instrumentach i tworzenie. Było to naturalne, że ostatecznie zaczniemy wspólnie pracować. Moi bracia Fernando i Juan — którzy, jak wspomniałem, założyli Voicemod wraz ze mną — mieli już kilka firm razem, więc mieli sporo doświadczenia w tym zakresie. Dołączyłem do nich w 2010 roku w ich firmie, która była 2taptap, więc miałem poczucie, jak to jest. To oznacza, że gdy stworzyliśmy Voicemod, zrobiliśmy to w pełni zgodni co do tego, co chcemy osiągnąć, i co ważniejsze, jak chcemy to osiągnąć. To naprawdę pomogło wprowadzić silną kulturę zgodnych wartości do Voicemod, co było kluczem do naszego sukcesu.

Czy jest coś jeszcze, co chciałbyś podzielić się na temat Voicemod?

Wiele się dzieje za kulisami, ale zgodnie z naszym celem ewolucji dźwięku dla wszystkich, obecnie pracujemy nad czymś, aby nasza technologia była jeszcze bardziej… dostępna. Sposób, w jaki każdy deweloper może wykorzystywać naszą technologię w swoim produkcie

Wiemy, że ludzie spędzają większość swojego czasu na jawie online, podłączeni, wyrażając siebie na różnych platformach i aplikacjach. W środowiskach online twoja “awatar” jest twoim całkowitym przedstawieniem siebie. I naprawdę, kim jest ta osoba bez głosu?

Budowanie technologii zmiany głosu w czasie rzeczywistym i rozwijanie systemu w pełni dostosowywalnych wyrażeń dźwiękowych to wiele pracy. Nasz zespół wykonał ten krok, projektując cały zestaw, który może być łatwo zintegrowany przez deweloperów w dowolnym miejscu. Jesteśmy niezwykle podekscytowani, aby uczynić naszą technologię dostępną dla deweloperów i użytkowników na całym świecie, ponieważ kontynuujemy budowanie przyszłości doświadczeń audio społecznych!

Dziękujemy za wspaniały wywiad, czytelnicy, którzy chcą dowiedzieć się więcej, powinni odwiedzić Voicemod

Antoine jest wizjonerskim liderem i współzałożycielem Unite.AI, który jest zmotywowany niezachwianą pasją do kształtowania i promowania przyszłości sztucznej inteligencji i robotyki. Jako serialowy przedsiębiorca, wierzy, że sztuczna inteligencja będzie tak samo przełomowa dla społeczeństwa, jak elektryczność, i często jest złapany na tym, że zachwala potencjał przełomowych technologii i AGI.

Jako futurysta, jest poświęcony badaniu, jak te innowacje ukształtują nasz świat. Ponadto, jest założycielem Securities.io, platformy skupiającej się na inwestowaniu w najnowocześniejsze technologie, które zmieniają przyszłość i przebudowują całe sektory.