Wywiady
Dylan Fox, CEO & Founder of AssemblyAI – Wywiad

Dylan Fox jest CEO & Founder of AssemblyAI, platformy, która automatycznie konwertuje pliki audio i wideo oraz strumienie audio na tekst za pomocą API Speech-to-Text AssemblyAI.
Czym było to, co początkowo przyciągnęło Cię do machine learning?
Zacząłem od nauki programowania i uczestniczenia w spotkaniach Python Meetups w Waszyngtonie, gdzie studiowałem. Przez kursy uniwersyteckie, zacząłem się bardziej interesować algorytmicznymi problemami programistycznymi, co naturalnie doprowadziło mnie do machine learning i NLP.
Przed założeniem AssemblyAI, byłeś Starszym Inżynierem Oprogramowania w Cisco, nad czym pracowałeś?
W Cisco, byłem Starszym Inżynierem Oprogramowania, skupiając się na Machine Learning dla ich produktów współpracy.
Jak Twoja praca w Cisco i problem z źródłem technologii rozpoznawania mowy zainspirowały Cię do uruchomienia AssemblyAI?
W niektórych moich poprzednich pracach, miałem okazję pracować nad wieloma projektami AI, w tym kilkoma projektami, które wymagały rozpoznawania mowy. Ale wszystkie firmy oferujące rozpoznawanie mowy jako usługę były niezwykle przestarzałe, trudne do kupienia i korzystały z przestarzałej technologii AI.
Im bardziej interesowałem się badaniami AI, tym bardziej zauważałem, że jest wiele pracy w dziedzinie rozpoznawania mowy i jak szybko rozwija się ta dziedzina. Więc była to kombinacja czynników, która skłoniła mnie do myślenia: „Co się stanie, jeśli możesz zbudować firmę w stylu Twilio, wykorzystując najnowsze badania AI, aby uczynić dostęp do najnowocześniejszych modeli AI dla rozpoznawania mowy łatwiejszym dla deweloperów, z lepszym doświadczeniem dla deweloperów.”
I to było początkiem pomysłu na AssemblyAI.
Jakie jest największe wyzwanie związane z budowaniem dokładnej i niezawodnej technologii rozpoznawania mowy?
Koszt i talent to największe wyzwania dla każdej firmy, która chce zbudować dokładną i niezawodną technologię rozpoznawania mowy.
Dane są drogie w pozyskaniu, a typowo potrzeba setek tysięcy godzin, aby zbudować solidny system rozpoznawania mowy. Nie tylko to, wymagania obliczeniowe są ogromne, aby przeszkolić te modele. A także serwowanie tych modeli w produkcji jest kosztowne i wymaga specjalistycznych umiejętności, aby zoptymalizować i uczynić je ekonomicznymi.
Budowanie tych technologii wymaga także specjalistycznych umiejętności, które są trudne do znalezienia. To jest duży powód, dla którego klienci przychodzą do nas, aby uzyskać potężne modele AI, które badamy, trenujemy i wdrażamy wewnętrznie. Uzyskują oni dostęp do lat badań nad najnowocześniejszymi modelami AI dla ASR i NLP, wszystko to za pomocą prostego API.
Poza czystym transkrybowaniem treści audio i wideo, AssemblyAI oferuje dodatkowe modele, możesz omówić, co to są?
Nasze zestawienie modeli AI wykracza poza zwykłe transkrybowanie w czasie rzeczywistym i asynchroniczne. Nazywamy te dodatkowe modele modelami Audio Intelligence, ponieważ pomagają one klientom analizować i lepiej zrozumieć dane audio.
Nasz model Summarization zapewnia ogólny podsumowanie, a także podsumowanie z kodem czasowym, które automatycznie dzieli i generuje podsumowanie dla każdego „rozdziału”, gdy tematy w rozmowie się zmieniają (podobnie jak rozdziały w YouTube).
Nasz model Sentiment Analysis wykrywa nastawienie każdej wypowiedzi w plikach audio. Każda wypowiedź w transkrypcji może być oznaczona jako Pozytywna, Negatywna lub Neutralna.
Nasz model Entity Detection identyfikuje szeroki zakres encji, które są wymienione w plikach audio, takich jak nazwy osób lub firm, adresy e-mail, daty i lokalizacje.
Nasz model Topic Detection oznacza tematy, które są omawiane w plikach audio i wideo. Przewidywane etykiety tematów są zgodne z ujednoliconą taksonomią IAB, co sprawia, że są one odpowiednie do celów targetowania kontekstowego.
Nasz model Content Moderation wykrywa wrażliwe treści w plikach audio i wideo — takie jak mowa nienawiści, przemoc, wrażliwe problemy społeczne, alkohol, narkotyki i wiele innych.
Jakie są największe przypadki użycia AssemblyAI przez firmy?
Największe przypadki użycia AssemblyAI przez firmy obejmują cztery kategorie: telefonię, wideo, spotkania wirtualne i media.
CallRail jest doskonałym przykładem klienta w dziedzinie Telephony, który wykorzystuje modele AI AssemblyAI — Core Transcription, Automatic Transcript Highlights i PII Redaction — aby dostarczyć potężne rozwiązanie Conversational Intelligence swoim klientom.
Podstawowo, CallRail może teraz automatycznie wyświetlać i definiować kluczowe treści w swoich rozmowach telefonicznych dla swoich klientów w skali — kluczowe treści, takie jak konkretnie żądania klientów, często zadawane pytania i często używane słowa kluczowe i frazy. Nasz model PII Redaction pomaga im automatycznie wykryć i usunąć wrażliwe dane znalezione w tekście transkrypcji (np. numery bezpieczeństwa społecznego, numery kart kredytowych, adresy osobiste itp.).
Przypadki użycia wideo obejmują platformy przesyłania wideo i edytory wideo, takie jak Veed, które wykorzystują modele Core Transcription AssemblyAI do uproszczenia procesu edycji wideo dla użytkowników. Veed pozwala swoim użytkownikom transkrybować filmy wideo i edytować je bezpośrednio za pomocą napisów.
W spotkaniach wirtualnych, oprogramowanie do transkrypcji spotkań, takie jak Fathom, wykorzystuje AssemblyAI do budowy inteligentnych funkcji, które pomagają użytkownikom transkrybować i podkreślać kluczowe momenty z ich połączeń Zoom, co sprzyja lepszej interakcji podczas spotkań i eliminuje nudne zadania podczas i po spotkaniach (np. robienie notatek).
W mediach, widzimy, że platformy hostingowe podcastów wykorzystują nasze modele Content Moderation i Topic Detection, aby oferować lepsze narzędzia reklamowe dla przypadków użycia bezpieczeństwa marki i monetyzować treści generowane przez użytkowników za pomocą reklam dynamicznych.
AssemblyAI niedawno pozyskała 30 milionów dolarów w ramach rundy Series B. Jak to przyspieszy misję AssemblyAI?
Postępy w dziedzinie AI są niezwykle ekscytujące. Naszym celem jest udostępnienie tego postępu każdemu deweloperowi i zespołowi produktowemu w Internecie — za pomocą prostego zestawu API. Podczas gdy kontynuujemy badania i szkolenie modeli AI na poziomie stanu techniki dla zadań ASR i NLP (takich jak rozpoznawanie mowy, podsumowanie, identyfikacja języka i wiele innych zadań), będziemy kontynuować udostępnianie tych modeli AI deweloperom i zespołom produktowym za pomocą prostych API — dostępnych bezpłatnie.
AssemblyAI to miejsce, w którym deweloperzy i zespoły produktowe mogą przyjść, aby uzyskać łatwy dostęp do zaawansowanych modeli AI, których potrzebują, aby budować ekscytujące nowe produkty, usługi i całe firmy.
W ciągu ostatnich 6 miesięcy, uruchomiliśmy obsługę ASR dla 15 nowych języków — w tym hiszpańskiego, niemieckiego, francuskiego, włoskiego, hindi i japońskiego, wydaliśmy znaczne ulepszenia naszego modelu Summarization, modeli ASR w czasie rzeczywistym, modeli Content Moderation i liczne inne aktualizacje produktu.
Nie wykorzystaliśmy jeszcze naszych funduszy z rundy Series A, ale to nowe finansowanie da nam możliwość agresywnego zwiększenia naszych wysiłków — bez kompromisu w zakresie naszego zasięgu.
Z tym nowym finansowaniem, będziemy mogli przyspieszyć naszą mapę produktu, zbudować lepszą infrastrukturę AI, aby przyspieszyć nasze badania AI i silniki inferencyjne, oraz rozwijać nasz zespół badań AI — który obecnie obejmuje badaczy z DeepMind, Google (GOOGL ) Brain, Meta AI, BMW i Cisco.
Czy jest coś jeszcze, co chciałbyś podzielić się na temat AssemblyAI?
Nasza misja polega na tym, aby uczynić modele AI na poziomie stanu techniki dostępnymi dla deweloperów i zespołów produktowych w niezwykle dużej skali za pomocą prostego API.
Dziękujemy za wspaniały wywiad, czytelnicy, którzy chcą dowiedzieć się więcej, powinni odwiedzić AssemblyAI.












