Wywiady
Matt Hocking, współzałożyciel WellSaid Labs – seria wywiadów

Matt Hocking jest współzałożycielem WellSaid Labs, wiodącego przedsiębiorstwa zajmującego się generatorem głosu AI. Ma ponad 15-letnie doświadczenie w kierowaniu zespołami i dostarczaniu rozwiązań technologicznych na dużą skalę.
Twoje tło jest dość przedsiębiorcze, jak zostałeś zaangażowany w AI?
Myślę, że zawsze uważałem się za przedsiębiorczego. Założyłem swoje pierwsze przedsiębiorstwo po ukończeniu studiów i dzięki tłu w dziedzinie projektowania produktów, znalazłem się w sytuacji, w której pomagałem ludziom z pomysłami na wczesnym etapie. W trakcie swojej kariery miałem okazję pracować z wieloma startupami, które odniosły ogromny sukces. Podczas tych doświadczeń miałem okazję poznać wielu wybitnych założycieli, co zainspirowało mnie do realizacji własnych pomysłów jako założyciel. AI było dla mnie nowe, gdy dołączyłem do AI2, jednak to doświadczenie dało mi okazję zastosować moje doświadczenie w dziedzinie produktów i startupów do badań nad tymi nowymi osiągnięciami i wyobrazić sobie, jak będą one mogły pomóc wielu ludziom w nadchodzących latach. Moim celem od samego początku było tworzenie prawdziwych biznesów dla prawdziwych ludzi, a uważam, że AI ma potencjał tworzenia wielu interesujących możliwości i efektywności w naszej przyszłości, jeśli zostanie zastosowane w sposób przemyślany.
Czy mógłbyś opowiedzieć o historii powstania WellSaid Labs, kiedy byłeś przedsiębiorcą w The Allen Institute for AI?
Dołączyłem do The Allen Institute for Artificial Intelligence (AI2) jako przedsiębiorca w 2018 roku. Jest to najbardziej innowacyjny inkubator na świecie, AI2 gromadzi najwybitniejsze umysły w dziedzinie AI, które stosują rozwiązania z granicy tego, co jest możliwe dzisiaj, do rozwiązań, które rozwiązują problemy na całym świecie. Moje doświadczenie w dziedzinie projektowania i technologii wykształciło we mnie długotrwałe zainteresowanie dziedziną kreatywną, a z uwagi na boom AI, który jesteśmy świadkami dzisiaj, chciałem zbadać sposób połączenia tych dwóch dziedzin. Poznałem Michaela Petrochuka (współzałożyciela i CTO WellSaid Labs) podczas tworzenia interaktywnej aplikacji opieki zdrowotnej, która prowadziła pacjenta przez różne wrażliwe sytuacje. W trakcie tworzenia treści dla tej aplikacji, moja ekipa pracowała z talentami wokalnymi, aby nagrywać tysiące linii voiceover dla awatara. Gdy zetknąłem się z przełomowymi osiągnięciami Michaela, szybko zobaczyliśmy wartość, jaką może mieć osiągnięcie równości między ludzkim a syntetycznym głosem (TTS) w transformacji nie tylko produktu, nad którym pracowałem, ale także w wpływie na wiele innych aplikacji i branż. Technologia i narzędzia miały trudności z nadążaniem za potrzebami producentów tworzących z głosem jako medium. Zobaczyliśmy drogę do umieszczenia tej technologii w rękach wszystkich twórców, pozwalając głosowi być integralną częścią wszystkich historii.
WellSaid Labs jest jedną z nielicznych firm, które zapewniają aktorom głosowym możliwość wejścia w przestrzeń głosów AI. Dlaczego uważałeś, że jest to ważne, aby zintegrować prawdziwe głosy z produktem?
Nasza odpowiedź na to jest dwutorowa: po pierwsze, chcieliśmy stworzyć rozwiązania, które uzupełniają możliwości profesjonalnych aktorów głosowych, rozszerzając możliwości głosu. A po drugie, dążymy do osiągnięcia najwyższego poziomu jakości ludzkiej w naszych produktach. Nasi aktorzy głosowi są długoterminowymi partnerami współpracy i otrzymują wynagrodzenie i udział w dochodach za swoje dane głosowe i powstałą z nimi treść. Każdy aktor głosowy, którego zatrudniamy do stworzenia awatara głosowego AI na podstawie podobieństwa jego głosu, jest wynagradzany w zależności od tego, jak często jego głos jest używany na naszej platformie. Zachęcamy talent do współpracy z nami; uczciwe wynagrodzenie za ich wkład jest dla nas niezwykle ważne.
Aby zapewnić najwyższy poziom jakości produktów na rynku, musimy być rygorystyczni w kwestii pozyskiwania danych. Proces ten daje nam więcej kontroli nad jakością, ponieważ trenujemy nasze modele głębokiego uczenia, aby mówiły z równością ludzką i stylami odniesienia do kontekstu. Nie tworzymy tylko głosu, który odczytuje podany tekst wejściowy. Nasze modele oferują różne style głosowe, które wykonują to, co jest na stronie. Niezależnie od tego, czy użytkownicy tworzą voiceover, używając awatara z naszej biblioteki, czy tworzą voiceover z głosem dostosowanym do ich marki, używamy prawdziwych danych głosowych, aby zapewnić płynny proces i łatwą w użyciu platformę. Jeśli nasi klienci musieliby manipulować i edytować nasze głosy w postprodukcji, proces uzyskania pożądanego wyniku byłby nieporęczny i długi. Nasze głosy biorą pod uwagę kontekst treści pisanej i zapewniają dokładne odczytanie.
WellSaid Labs jest firmą, która twierdzi, że jest pierwszą etyczną platformą głosów AI. Dlaczego etyka AI jest dla ciebie ważna?
Ponieważ wraz ze wzrostem popularności AI i jego rozpowszechnieniem, obawy dotyczące szkodliwych przypadków użycia i złych aktorów są w centrum każdej rozmowy – i te obawy są niestety potwierdzane przez przypadki w świecie rzeczywistym. Głos AI nie jest wyjątkiem; prawie każdego dnia pojawia się nowy raport o tym, że sławna osoba, postać publiczna lub polityk została sfabrykowana w reklamach lub celach politycznych. Chociaż formalne federalne regulacje dotyczące tej technologii są nadal w rozwoju, wykrywanie i zwalczanie nieuczciwych aktorów i przypadków użycia syntetycznego głosu będzie coraz trudniejsze, ponieważ technologia ta będzie się dalej rozwijać.
Jak rozwijasz etyczną platformę głosów AI?
WellSaid Labs jest zaangażowana w innowacje etyczne od samego początku. Centralizujemy zaufanie i przejrzystość za pomocą modeli danych wewnętrznych, jawnych wymagań zgody, programu moderacji treści i naszego zobowiązania do ochrony marki. W WellSaid opieramy się na zasadach odpowiedzialnego AI, aby kształtować nasze decyzje i projekty, a te zasady rozciągają się na użycie naszych głosów. Nasz kodeks etyki reprezentuje te zasady jako odpowiedzialność, przejrzystość, prywatność i bezpieczeństwo oraz sprawiedliwość.
Odpowiedzialność: Zachowujemy surowe standardy dla odpowiedniej treści, zabraniając użycia naszych głosów do treści, które są szkodliwe, nienawistne, oszukańcze lub mające na celu wywołanie przemocy. Nasz zespół ds. zaufania i bezpieczeństwa utrzymuje te standardy za pomocą rygorystycznego programu moderacji treści, blokując i usuwając użytkowników, którzy próbują naruszyć nasze warunki korzystania z usługi.
Przejrzystość: Wymagamy wyraźnej zgody przed zbudowaniem syntetycznego głosu z danymi głosowymi kogoś. Użytkownicy nie mogą przesłać danych głosowych od polityków, sławnych osób lub kogokolwiek innego, aby utworzyć klon ich głosu, chyba że mamy ich wyraźną, pisemną zgodę.
Prywatność i bezpieczeństwo: Chronimy tożsamości naszych aktorów głosowych, używając obrazów akcji i pseudonimów do reprezentowania syntetycznych głosów. Zachęcamy ich również do zachowania ostrożności w kwestii udostępniania ich powiązania z WellSaid Labs lub innymi firmami syntetycznych głosów, aby zmniejszyć możliwość nadużycia ich głosu.
Sprawiedliwość: Wynagradzamy wszystkich aktorów głosowych, którzy dostarczają dane głosowe dla naszej platformy, i zapewniamy im stały udział w dochodach za użycie syntetycznego głosu, który tworzymy z ich danymi.
Wraz z tymi zasadami przywiązujemy również dużą wagę do poszanowania własności intelektualnej. Nie rościmy sobie prawa własności do treści dostarczonych przez naszych użytkowników lub aktorów głosowych. Priorytetem jest dla nas integralność, sprawiedliwość i przejrzystość we wszystkim, co robimy, aby zapewnić, że nasza technologia syntetycznej mowy jest używana w sposób odpowiedzialny i etyczny. Aktywnie poszukujemy partnerstw z głosami z różnych środowisk, organizacji i doświadczeń, aby zapewnić, że nasza biblioteka głosów odzwierciedla twórców i publiczność.
Czy mógłbyś omówić niektóre wyzwania związane z budowaniem firmy TTS AI?
Rozwój technologii głosowej AI stworzył zupełnie nowy zestaw przeszkód dla producentów i konsumentów. Jednym z głównych wyzwań jest niezgubić się w hałasie i sensacji, które zalewają sektor AI. Jako nowa, buzująca technologia, wiele organizacji próbuje skorzystać na krótkoterminowych rozwojach głosowych AI. Chcemy zapewnić głos dla wszystkich, kierując się centralnymi zasadami etyki i autentyczności. To przestrzeganie autentyczności może opóźnić rozwój i wdrożenie naszych technologii, ale umacnia bezpieczeństwo i bezpieczeństwo głosów WellSaid i ich danych.
Jaki jest twój wizja przyszłości głosów AI?
Przez najdłuższy czas technologia głosowa AI nie osiągnęła wystarczającej jakości, aby umożliwić firmom tworzenie znaczącej treści na dużą skalę. Teraz, gdy technologia audio nie wymaga już drogiego sprzętu i oprogramowania, każda treść pisana może być produkowana i publikowana w formacie audio, tworząc angażujące, wielomodalne doświadczenia.
Dziś głosy AI mogą produkować audio podobne do ludzkiego i uchwycić nuans, który jest wymagany do uczynienia opowieści cyfrowych bardziej dostępnymi i naturalnymi. Przyszłość głosów AI będzie obejmować wszystkie doświadczenia słuchowe, które dotkną każdego aspektu naszego życia. Wraz z postępem technologii zobaczymy coraz bardziej naturalne i wyraziste syntetyczne głosy, które zacierają granicę między ludzkim a maszynowym głosem – otwierając nowe drzwi dla biznesu, komunikacji, dostępności i tego, jak wchodzimy w interakcje ze światem wokół nas.
Firmy będą znajdować wzmocnioną personalizację w interfejsach głosowych AI i będą je wykorzystywać do uczynienia interakcji z wirtualnymi asystentami bardziej immersyjnymi i przyjaznymi dla użytkownika. Te udoskonalenia już się dzieją, od inteligentnych agentów call center po szybkie jedzenie na drodze. Tworzenie treści, w tym reklama, marketing produktu, narracja wiadomości, podcasty, audiobooki i inne multimedia, zobaczą wzrost wydajności dzięki użyciu narzędzi do tworzenia angażującej treści – ostatecznie zwiększając podniesienie i przychody dla organizacji, zwłaszcza teraz, gdy modele wielojęzyczne mogą rozszerzyć zasięg firmy z jednego punktu pochodzenia do globalnej obecności. Zespoły produkcyjne znajdą duże korzyści w syntetycznych głosach, aby tworzyć głosy dostosowane do potrzeb marki lub dostosowane do słuchacza.
Przed wprowadzeniem AI, technologia TTS nie posiadała niezbędnych ludzkich emocji, intonacji i umiejętności wymowy, aby opowiedzieć pełną historię na dużą skalę i z łatwością. Teraz technologia TTS zasilana przez AI oferuje bardziej immersyjne i dostępne doświadczenia, w tym możliwości mowy w czasie rzeczywistym i interaktywne agenci konwersacyjni.
Osiągnięcie ludzkich możliwości mówienia było podróżą, ale teraz, gdy jest to osiągalne, świadkowie jesteśmy pełnego zakresu AI głosu, tworzącego prawdziwą wartość biznesową dla organizacji.
Dziękuję za wspaniały wywiad, czytelnicy, którzy chcą dowiedzieć się więcej, powinni odwiedzić WellSaid Labs.












