Rozhovory
Dylan Fox, CEO & Founder of AssemblyAI – Rozhovorová série

Dylan Fox je CEO & zakladatel AssemblyAI, platformy, která automaticky převádí audio a video soubory a živé audio streamy na text pomocí Speech-to-Text API od AssemblyAI.
Co vás původně přitáhlo k strojovému učení?
Začal jsem se učit programovat a navštěvoval jsem Python Meetupy ve Washingtonu D.C., kde jsem studoval na univerzitě. Díky univerzitním kurzům jsem se více zaměřil na algoritmické typy programovacích problémů, které mě přirozeně vedly ke strojovému učení a NLP.
Předtím, než jste založil AssemblyAI, jste byl Senior Software Engineer u Cisco, na čem jste pracoval?
U Cisco jsem byl Senior Software Engineer se zaměřením na strojové učení pro jejich produkty pro spolupráci.
Jak vás vaše práce u Cisco a problém se zdrojem technologie rozpoznávání řeči inspirovaly k zahájení AssemblyAI?
V některých svých předchozích pracovních pozicích jsem měl příležitost pracovat na mnoha projektech AI, včetně několika projektů, které vyžadovaly rozpoznávání řeči. Ale všechny společnosti, které nabízely rozpoznávání řeči jako službu, byly neuvěřitelně zastaralé, obtížně dostupné a používaly zastaralou AI technologii.
Jako jsem se stal stále více zaujatý výzkumem AI, jsem si uvědomil, že je prováděno mnoho práce v oblasti rozpoznávání řeči a jak rychle se výzkum zlepšuje. Takže to byla kombinace faktorů, která mě inspirovala k myšlence, „Co kdybychom mohli postavit společnost typu Twilio s využitím nejnovějších výzkumů AI, která by byla mnohem snadněji dostupná pro vývojáře a nabízela state-of-the-art AI modely pro rozpoznávání řeči s mnohem lepším vývojářským prostředím.“
A právě odtud vyrostla myšlenka pro AssemblyAI.
Jaký je největší problém při budování přesné a spolehlivé technologie rozpoznávání řeči?
Náklady a talent jsou největšími problémy pro jakoukoli společnost, která se snaží budovat přesnou a spolehlivou technologii rozpoznávání řeči.
Data jsou drahá na získání a obvykle potřebujete stovky tisíc hodin, aby jste postavili robustní systém rozpoznávání řeči. Nejen to, ale požadavky na výpočetní výkon jsou enormní pro trénování. A poskytování těchto modelů v produkci je také nákladné a vyžaduje specializovaný talent pro optimalizaci a ekonomickou efektivitu.
Budování těchto technologií také vyžaduje specializované dovednosti, které jsou obtížně najít. To je velký důvod, proč zákazníci přicházejí k nám pro powerful AI modely, které jsme prozkoumali, vyškolili a nasadili v rámci naší společnosti. Získávají přístup k několikaletému výzkumu state-of-the-art AI modelů pro ASR a NLP, vše s jednoduchým API.
Mimo čistou transkripci audio a video obsahu nabízí AssemblyAI další modely, můžete diskutovat, co tyto modely jsou?
Naše sada AI modelů sahá za hranice pouze reálné a asynchronní transkripce. Označujeme tyto další modely jako Audio Intelligence modely, protože pomáhají zákazníkům analyzovat a lépe rozumět audio datům.
Náš model Summarizace poskytuje celkovou sumarizaci, stejně jako časově kódované sumarizace, které automaticky segmentují a generují sumarizaci pro každou „kapitolu“ v konverzaci, jak se mění témata (podobně jako kapitoly na YouTube).
Náš model Sentiment Analysis detekuje sentiment každého věty mluvené v audio souborech. Každá věta v transkriptu může být označena jako Pozitivní, Negativní nebo Neutrální.
Náš model Entity Detection identifikuje širokou škálu entit, které jsou mluveny v audio souborech, jako jsou jména osob nebo společností, e-mailové adresy, datumy a umístění.
Náš model Topic Detection označuje témata, která jsou mluvena v audio a video souborech. Předpokládaná témata následují standardizovanou IAB Taxonomii, která je činí vhodnými pro kontextuální cílení.
Náš model Content Moderation detekuje citlivý obsah v audio a video souborech — jako je hate speech, násilí, citlivá společenská témata, alkohol, drogy a další.
Jaké jsou některé z největších použití AssemblyAI pro společnosti?
Největší použití AssemblyAI pro společnosti sahají přes čtyři kategorie: telefony, video, virtuální setkání a média.
CallRail je skvělým příkladem zákazníka v telefonním prostoru, který využívá AI modely AssemblyAI — Core Transkripce, Automatické zvýraznění transkripce a PII Redakce — pro poskytování powerful Conversational Intelligence řešení svým zákazníkům.
V podstatě může CallRail nyní automaticky zobrazit a definovat klíčový obsah ve svých telefonních hovorech pro své zákazníky ve velkém měřítku — klíčový obsah, jako jsou konkrétní požadavky zákazníků, často kladené otázky a často používaná klíčová slova a fráze. Náš model PII Redakce jim pomáhá automaticky detekovat a odstranit citlivá data nalezená v transkriptu (například čísla sociálního zabezpečení, čísla kreditních karet, osobní adresy a další).
Video použití sahají od video streamovacích platforem až po video editory, jako je Veed, který využívá AI modely AssemblyAI — Core Transkripce — pro zjednodušení video editačního procesu pro uživatele. Veed umožňuje svým uživatelům transkribovat videa a editovat je přímo pomocí titulků.
V virtuálních setkáních společnosti, jako je Fathom, využívají AssemblyAI k budování inteligentních funkcí, které pomáhají uživatelům transkribovat a zvýraznit klíčové momenty ze svých setkání na Zoom, což zlepšuje zapojení do setkání a eliminuje únavné úkoly během a po setkání (například poznámky).
V médiích vidíme, že podcastové hostovací platformy, například, využívají naše modely Content Moderation a Topic Detection, aby mohli nabízet lepší reklamní nástroje pro brand safety použití a monetizovat uživatelsky generovaný obsah s dynamickými reklamami.
AssemblyAI nedávno získala 30 milionů dolarů v rámci Series B. Jak tohle urychlí misi AssemblyAI?
Pokrok, který je dělán v oblasti AI, je neuvěřitelně vzrušující. Naším cílem je zpřístupnit tento pokrok každému vývojáři a produktovému týmu na internetu — prostřednictvím jednoduchého souboru API. Když budeme pokračovat ve výzkumu a školení state-of-the-art AI modelů pro úkoly ASR a NLP (jako rozpoznávání řeči, sumarizace, identifikace jazyka a mnoho dalších úkolů), budeme pokračovat v poskytování těchto AI modelů vývojářům a produktovým týmům prostřednictvím jednoduchých API — dostupných zdarma.
AssemblyAI je místo, kde mohou vývojáři a produktoví týmy přijít pro snadný přístup k pokročilým AI modelům, které potřebují k budování zajímavých nových produktů, služeb a celých společností.
Za posledních šest měsíců jsme spustili podporu ASR pro 15 nových jazyků—včetně španělštiny, němčiny, francouzštiny, italštiny, hindštiny a japonštiny, vydali jsme významné zlepšení našeho modelu Sumarizace, modelu ASR v reálném čase, modelu Content Moderation a mnoha dalších produktových aktualizací.
Ještě jsme ani nevyčerpali naše Series A fondy, ale toto nové financování nám poskytne schopnost agresivně urychlit naše úsilí — bez kompromisů v našem rozpočtu.
S tímto novým financováním budeme moci urychlit náš produktový roadmap, vybudovat lepší AI infrastrukturu pro urychlení našeho AI výzkumu a inference engine a rozšířit náš AI výzkum tým — který dnes zahrnuje výzkumníky z DeepMind, Google (GOOGL ) Brain, Meta AI, BMW a Cisco.
Ještě něco, co byste chtěli sdílet o AssemblyAI?
Naší misí je zpřístupnit state-of-the-art AI modely vývojářům a produktovým týmům ve velmi velkém měřítku prostřednictvím jednoduchého API.
Děkuji za skvělý rozhovor, čtenáři, kteří chtějí se dozvědět více, by měli navštívit AssemblyAI.












