Interviews
Dylan Fox, administrerende direktør og grundlægger af AssemblyAI – Intervju-serie

Dylan Fox er administrerende direktør og grundlægger af AssemblyAI, en platform, der automatisk konverterer lyd- og videofiler samt live-lydstrømme til tekst med AssemblyAI’s Speech-to-Text-API’er.
Hvad var det, der oprindeligt tiltrak dig til maskinlæring?
Jeg startede med at lære at programmere og deltog i Python-møder i Washington DC, hvor jeg gik på college. Gennem collegekurser fandt jeg mig selv mere og mere tiltrukket af algorithmiske programmeringsproblemer, som naturligt ledte mig til maskinlæring og NLP.
Før du grundlagde AssemblyAI, var du senior software-ingeniør hos Cisco, hvad arbejdede du med?
Hos Cisco var jeg senior software-ingeniør med fokus på maskinlæring til deres samarbejdsprodukter.
Hvordan inspirerede dit arbejde hos Cisco og et problem med at finde talegenkendelsesteknologi dig til at lancere AssemblyAI?
I nogle af mine tidligere jobs havde jeg mulighed for at arbejde på mange AI-projekter, herunder flere projekter, der krævede talegenkendelse. Men alle virksomheder, der tilbød talegenkendelse som en service, var utroligt forældede, svære at købe noget fra og kørte forældet AI-teknologi.
Da jeg blev mere og mere interesseret i AI-forskning, lagde jeg mærke til, at der var meget arbejde, der blev gjort på talegenkendelsesområdet, og hvor hurtigt forskningen forbedredes. Så det var en kombination af faktorer, der inspirerede mig til at tænke: “Hvad nu, hvis man kunne bygge en Twilio-lignende API-virksomhed, der bruger den seneste AI-forskning, som blot er meget lettere for udviklere at få adgang til state-of-the-art AI-modeller for talegenkendelse med en langt bedre udvikleroplevelse.”
Og det var her, idéen til AssemblyAI voksede frem.
Hvad er den største udfordring bag opbygning af præcis og pålidelig talegenkendelsesteknologi?
Omkring og talent er de største udfordringer for enhver virksomhed, der skal bygge præcis og pålidelig talegenkendelsesteknologi.
Data er dyrt at erhverve, og man har normalt brug for hundredtusinder af timer for at bygge et robust talegenkendelsessystem. Ikke blot det, men kravene til beregning er enorme for at træne. Og at servere disse modeller i produktion er også dyrt og kræver specialiseret talent for at optimere og gøre det økonomisk.
Bygning af disse teknologier kræver også en specialiseret kompetence, som er svær at finde. Det er en stor grund til, at kunder kommer til os for kraftfulde AI-modeller, som vi forsker i, træner og udruller internt. De får adgang til års forskning i state-of-the-art AI-modeller for ASR og NLP, alle med en enkel API.
Uden for ren transskription af lyd- og videoindhold tilbyder AssemblyAI yderligere modeller, kan du diskutere, hvad disse modeller er?
Vores samling af AI-modeller strækker sig ud over blot realtids- og asynkron transskription. Vi kalder disse yderligere modeller for Audio Intelligence-modeller, da de hjælper kunder med at analysere og bedre forstå lyddata.
Vores Summarization-model giver en samlet sammenfatning, samt tidskodede sammenfatninger, der automatisk opdeler og genererer en sammenfatning for hver “kapitel”, som emner i en samtale ændrer (lignende YouTube-kapitler).
Vores Sentiment Analysis-model registrerer sentimentet af hver sætning i tale i lydfiler. Hver sætning i en transskription kan markeres som positiv, negativ eller neutral.
Vores Entity Detection-model identificerer et bredt udvalg af enheder, der nævnes i lydfiler, såsom person- eller virksomhedsnavne, e-mail-adresser, datoer og lokaliteter.
Vores Topic Detection-model mærker de emner, der tales om i lyd- og videofiler. De forudsagte emneetiketter følger den standardiserede IAB-taxonomi, som gør dem egnede til kontekstuel målretning.
Vores Content Moderation-model registrerer følsomt indhold i lyd- og videofiler – såsom hadefulde udtalelser, vold, følsomme sociale spørgsmål, alkohol, stoffer og mere.
Hvad er nogle af de største brugsområder for virksomheder, der bruger AssemblyAI?
De største brugsområder for virksomheder, der bruger AssemblyAI, omfatter fire kategorier: telefoni, video, virtuelle møder og medier.
CallRail er et godt eksempel på en kunde i telefoniområdet, der udnytter AssemblyAI’s AI-modeller – Core Transcription, Automatic Transcript Highlights og PII Redaction – til at levere en kraftfuld Conversational Intelligence-løsning til deres kunder.
Essentielt kan CallRail nu automatisk fremhæve og definere nøgleindhold i deres telefonopkald til deres kunder i stor målestok – nøgleindhold som bestemte kundeønsker, ofte stillede spørgsmål og hyppigt brugte nøgleord og fraser. Vores PII Redaction-model hjælper dem med at automatisk registrere og fjerne følsomme data, der findes i transskriptionstekst (f.eks. sociale sikkerhedsnumre, kreditkortnumre, personlige adresser osv.).
Video-brugsområder strækker sig fra video-streaming-platforme til video-redigeringssystemer som Veed, der bruger AssemblyAI’s Core Transcription-modeller til at forenkle video-redigeringsprocessen for brugerne. Veed tillader sine brugere at transkribere deres videoer og redigere dem direkte ved hjælp af underteksterne.
I virtuelle møder bruger møde-transskriptionssoftware-virksomheder som Fathom AssemblyAI til at bygge intelligente funktioner, der hjælper deres brugere med at transkribere og fremhæve de vigtigste øjeblikke fra deres Zoom-opkald, hvilket fremmer bedre mødeengagement og eliminerer kedelige opgaver under og efter møder (f.eks. at tage noter).
I medier ser vi podcast-værtselsesplatforme, der f.eks. bruger vores Content Moderation- og Topic Detection-modeller, så de kan tilbyde bedre annonceværktøjer til brand-sikkerhedsbrugsområder og monitere bruger-genereret indhold med dynamiske annoncer.
AssemblyAI har nyligt samlet 30 millioner dollars i serie B-runden. Hvordan vil dette accelerere AssemblyAI’s mission?
Fremgangen i AI-området er utroligt spændende. Vores mål er at eksponere denne fremgang for hver enkelt udvikler og produktteam på internettet – via en enkel API. Da vi fortsætter med at forskere i og træne state-of-the-art AI-modeller for ASR- og NLP-opgaver (såsom talegenkendelse, sammenfatning, sprogidentifikation og mange andre opgaver), vil vi fortsætte med at eksponere disse AI-modeller for udviklere og produktteams via enkle API’er – til rådighed gratis.
AssemblyAI er et sted, hvor både udviklere og produktteams kan komme for at få let adgang til de avancerede AI-modeller, de har brug for for at bygge spændende nye produkter, tjenester og hele virksomheder.
Over de sidste 6 måneder har vi lanceret ASR-understøttelse for 15 nye sprog – herunder spansk, tysk, fransk, italiensk, hindi og japansk, udgivet store forbedringer af vores Summarization-model, Real-Time ASR-modeller, Content Moderation-modeller og utallige andre produktopdateringer.
Vi har knap nok brugt noget af vores serie A-midler, men denne nye finansiering vil give os mulighed for at accelerere vores indsats – uden at kompromittere med vores løbebane.
Med denne nye finansiering vil vi kunne accelerere vores produktvejledning, bygge bedre AI-infrastruktur til at accelerere vores AI-forskning og inferensmotorer og udvide vores AI-forskningshold – som i dag inkluderer forskere fra DeepMind, Google (GOOGL ) Brain, Meta AI, BMW og Cisco.
Er der noget andet, du gerne vil dele om AssemblyAI?
Vores mission er at gøre state-of-the-art AI-modeller tilgængelige for udviklere og produktteams i ekstremt stor målestok via en enkel API.
Tak for det gode interview, læsere, der ønsker at lære mere, skal besøge AssemblyAI.












