Wywiady
Tyler Weitzman, Współzałożyciel i Szef Działu Sztucznej Inteligencji w Speechify – Seria Wywiadów

Tyler Weitzman jest współzałożycielem, Szefem Działu Sztucznej Inteligencji i Prezesem w Speechify, najpopularniejszej aplikacji text-to-speech na świecie, z ponad 100 000 pięciogwiazdkowych recenzji. Weitzman jest absolwentem Uniwersytetu Stanforda, gdzie uzyskał tytuł licencjata z matematyki i magistra w dziedzinie informatyki na kierunku sztucznej inteligencji. Został wybrany przez magazyn Inc. jako jeden z 50 najlepszych przedsiębiorców i został przedstawiony w publikacjach takich jak Business Insider, TechCrunch, LifeHacker, CBS i innych. Praca magisterska Weitzmana dotyczyła sztucznej inteligencji i syntezatora mowy, a jego końcowy artykuł nosił tytuł: „CloneBot: Personalizowane prognozy odpowiedzi na dialog”.
Zacząłeś programować, gdy miałeś tylko 9 lat, co cię początkowo przyciągnęło do informatyki?
Byłem bardzo zafascynowany jako dziecko serialem Dragon Ball Z i chciałem nauczyć się animować. Nauczyłem się Adobe (ADBE ) Flash i Photoshop, a następnie stworzyłem własną stronę z animacjami Gokū. Wkrótce potem zacząłem uczyć się o systemach i algorytmach, a gdy dowiedziałem się, że mogę programować dla życia, było to naprawdę ekscytujące. Myślałem, że to tylko hobby, jak gra w gry.
Następnie zacząłeś tworzyć aplikacje na iPhone, gdy miałeś tylko 12 lat, jakie to były aplikacje?
Jedną z aplikacji jest Black SMS, która pozwala ludziom wysyłać szyfrowane wiadomości tekstowe. Inna aplikacja to Frontback, która umożliwia użytkownikom robienie zdjęć i selfie w tym samym czasie.
Czy mógłbyś opowiedzieć o swoich badaniach na Uniwersytecie Stanforda i jak były one związane z przetwarzaniem języka naturalnego i syntezą mowy?
Moje badania obejmowały wiele zastosowań sieci transformatorowych, w tym modele generowania języka dla czatu, oznaczania części mowy, predykcji znaków przestankowych i syntezatory mowy. Optymalizacja wnioskowania sieci neuronowych dla procesorów mobilnych była moim głównym celem i bezpośrednio przekładała się na głosy offline dostępne w Speechify, które działają nawet w trybie samolotu.
Czy mógłbyś opowiedzieć o historii powstania Speechify?
Jestem ślepy na jedno oko, a mój brat Cliff ma dysleksję. Od zawsze używaliśmy książek audio i technologii text-to-speech, aby przetrwać szkołę i czytać książki, takie jak Harry Potter. Gdy dorastaliśmy i zaczynaliśmy używać więcej produktów technologicznych, zaczęliśmy zdawać sobie sprawę, że istnieje okazja, aby stworzyć lepsze aplikacje text-to-speech na sieci i urządzeniach mobilnych z lepszymi głosami dzięki postępom w dziedzinie sztucznej inteligencji i lepszemu doświadczeniu użytkownika. Zdecydowaliśmy się więc zrobić to w Speechify.
Jakie są niektóre z różnych technologii machine learning, które są używane w Speechify?
Zastosowaliśmy najnowocześniejsze techniki dla zaawansowanych architektur generatywnych – transformatorów/konformatorów, dużych przeszkoleń, rozproszonych treningów, akumulacji gradientów, auto-kodowanych przestrzeni latentnych, dyfuzji, sieci przeciwnych i modelowania języka. Zastosowaliśmy również techniki wspierające przetwarzanie cech otoczenia fonemizacji, pitchu i emocji, aby lepiej modelować mowę.
Jakie są niektóre z wyzwań związanych z budową aplikacji text-to-speech?
Jednym z kluczowych wyzwań jest budowanie wysokiej jakości głosów, które brzmią jak prawdziwi ludzie, a nie roboty. Naszym celem jest, aby ludzie nie byli w stanie odróżnić, jak nasze głosy brzmią od głosów ludzi, aby nasi użytkownicy czuli się komfortowo, słuchając treści na Speechify przez dłuższy czas. Drugim wyzwaniem jest dystrybucja naszych modeli AI do milionów użytkowników. Jest to jedna rzecz, aby zbudować wysokiej jakości głosy AI, a inną, aby upewnić się, że miliony użytkowników na całym świecie dowiedzą się o nich i je użyją.
Speechify jest aplikacją nr 1 w swojej kategorii w sklepie z aplikacjami, co przypisujesz temu sukcesowi?
Uważamy, że zbudowaliśmy najlepsze produkty na rynku dla ludzi, którzy chcą słuchać tego, co muszą przeczytać – czy to studenci z zadaniem domowym, profesjonaliści, którzy czytają dla pracy, czy czytelnicy, którzy po prostu chcą się bawić. Mamy najlepszy wybór głosów, w tym gwiazdy, takie jak Snoop Dogg, i najlepszy interfejs użytkownika, aby ludzie mogli łatwo przesyłać i uzyskiwać dostęp do treści, które chcą przeczytać. A nasze doświadczenie użytkownika jest bezproblemowe w całym ekosystemie Speechify – możesz zacząć słuchać artykułu na komputerze, a następnie łatwo przenieść go, aby kontynuować słuchanie na telefonie.
Jakie są niektóre z największych przypadków użycia tej aplikacji?
Generatywna sztuczna inteligencja Speechify rozwiązuje prawdziwe problemy dla studentów, którzy chcą szybciej przeczytać wiele zadań domowych, prawdziwych osób z dysleksją i ADHD, które mają trudności z czytaniem, seniorów z niskim wzrokiem, profesjonalistów, którzy chcą czytać więcej i być bardziej produktywni, pisarzy, którzy chcą słuchać swojej pracy, osób uczących się słuchem i wielu innych.
Jakie jest twoje wizja przyszłości sztucznej inteligencji?
Chcemy, aby sztuczna inteligencja – a konkretnie głosy text-to-speech – wyeliminowała bariery w nauce, niezależnie od twojego poziomu dochodu, różnic w nauce, geografii czy języka. Widzimy sztuczną inteligencję jako narzędzie dobroczynne, które podnosi jakość życia ludzi poprzez poprawę ich edukacji.
Dziękujemy za wspaniały wywiad, czytelnicy, którzy chcą dowiedzieć się więcej, powinni odwiedzić Speechify.












