Intervjuer
Dylan Fox, VD och grundare av AssemblyAI – Intervjuserie

Dylan Fox är VD och grundare av AssemblyAI, en plattform som automatiskt konverterar ljud- och videofiler och direktsända ljudströmmar till text med AssemblyAIs tal-till-text-API:er.
Vad var det som initialt drog dig till maskinlärning?
Jag började med att lära mig att programmera och deltog i Python-möten i Washington DC, där jag gick på college. Genom collegekurser upptäckte jag att jag lutade mer mot algoritmiska programmeringsproblem, vilket naturligt ledde mig till maskinlärning och NLP.
Innan du grundade AssemblyAI var du senior mjukvaruutvecklare på Cisco, vad arbetade du med?
På Cisco var jag senior mjukvaruutvecklare med fokus på maskinlärning för deras samarbetsprodukter.
Hur inspirerades du av ditt arbete på Cisco och ett problem med att hitta taligenkänningsteknologi att lansera AssemblyAI?
I några av mina tidigare jobb hade jag möjlighet att arbeta med många AI-projekt, inklusive flera projekt som krävde taligenkänning. Men alla företag som erbjöd taligenkänning som en tjänst var otroligt föråldrade, svåra att köpa något från och körde föråldrad AI-teknik.
Så jag blev mer och mer intresserad av AI-forskning och märkte att det var mycket arbete som gjordes inom området taligenkänning och hur snabbt forskningen förbättrades. Så det var en kombination av faktorer som inspirerade mig att tänka, “Tänk om du kunde bygga ett Twilio-liknande API-företag med den senaste AI-forskningen som var mycket lättare för utvecklare att komma åt state-of-the-art AI-modeller för taligenkänning, med en mycket bättre utvecklarupplevelse.”
Och det var från där idén för AssemblyAI växte.
Vad är den största utmaningen bakom att bygga exakt och tillförlitlig taligenkänningsteknologi?
Kostnad och talang är de största utmaningarna för alla företag att tackla när de bygger exakt och tillförlitlig taligenkänningsteknologi.
De data är dyra att skaffa, och du behöver vanligtvis hundratusentals timmar för att bygga ett robust taligenkänningssystem. Inte nog med det, kraven på beräkning är enorma för att träna. Och att betjäna dessa modeller i produktion är också dyrt och kräver specialiserad talang för att optimera och göra det ekonomiskt.
Att bygga dessa teknologier kräver också en specialiserad kompetens som är svår att hitta. Det är en stor anledning till varför kunder kommer till oss för kraftfulla AI-modeller som vi forskar, tränar och distribuerar internt. De får tillgång till år av forskning i state-of-the-art AI-modeller för ASR och NLP, allt med en enkel API.
Utöver att enbart transkribera ljud- och videoinnehåll erbjuder AssemblyAI ytterligare modeller, kan du diskutera vad dessa modeller är?
Vår svit av AI-modeller sträcker sig bortom bara realtids- och asynkron transkription. Vi kallar dessa ytterligare modeller för Audio Intelligence-modeller eftersom de hjälper kunder att analysera och bättre förstå ljuddata.
Vår Sammanfattningsmodell ger en övergripande sammanfattning, samt tidskodade sammanfattningar som automatiskt segmenterar och genererar en sammanfattning för varje “kapitel” när ämnen i en konversation ändras (liknande YouTube-kapitel).
Vår Sentimentanalysmodell upptäcker sentimentet för varje mening som talas i ljudfiler. Varje mening i en transkription kan markeras som Positiv, Negativ eller Neutral.
Vår Entitetsidentifieringsmodell identifierar en stor mängd entiteter som nämns i ljudfiler, såsom person- eller företagsnamn, e-postadresser, datum och platser.
Vår Ämnesidentifieringsmodell märker ämnena som diskuteras i ljud- och videofiler. De förutsagda ämnesetiketterna följer den standardiserade IAB-taxonomin, vilket gör dem lämpliga för kontextuell målning.
Vår Innehållsmoderingsmodell upptäcker känsligt innehåll i ljud- och videofiler – såsom hatprat, våld, känsliga sociala frågor, alkohol, droger och mer.
Vilka är några av de största användningsfallen för företag som använder AssemblyAI?
De största användningsfallen för företag som använder AssemblyAI spänner över fyra kategorier: telefoni, video, virtuella möten och media.
CallRail är ett bra exempel på en kund i telefonikategorin som använder AssemblyAIs AI-modeller – Core Transkription, Automatisk Transkriptshöjdpunkter och PII-radering – för att leverera en kraftfull konversationsintelligenslösning till sina kunder.
I princip kan CallRail nu automatiskt yta och definiera nyckelinnehåll i sina telefonsamtal till sina kunder i stor skala – nyckelinnehåll som specifika kundförfrågningar, vanligt ställda frågor och ofta använda nyckelord och fraser. Vår PII-raderingsmodell hjälper dem att automatiskt upptäcka och ta bort känslig data som finns i transkriptionstext (t.ex. socialförsäkringsnummer, kreditkortsnummer, personliga adresser och mer).
Video-användningsfall sträcker sig från videostreamingplattformar till videoredigerare som Veed, som använder AssemblyAIs Core Transkriptionsmodeller för att förenkla videoredigeringsprocessen för användare. Veed tillåter sina användare att transkribera sina videor och redigera dem direkt med hjälp av undertexterna.
I virtuella möten använder mötes-transkriptionsprogramvaruföretag som Fathom AssemblyAI för att bygga intelligenta funktioner som hjälper deras användare att transkribera och markera de viktigaste ögonblicken från sina Zoom-samtal, vilket främjar bättre mötesengagemang och eliminerar tråkiga uppgifter under och efter möten (t.ex. att ta anteckningar).
I media ser vi podcast-värdplattformar till exempel, som använder våra Innehållsmoderings- och Ämnesidentifieringsmodeller så att de kan erbjuda bättre annonsverktyg för varumärkessäkerhetsanvändningsfall och monetisera användargenererat innehåll med dynamiska annonser.
AssemblyAI har nyligen höjt 30 miljoner dollar i en serie B-runda. Hur kommer detta att accelerera AssemblyAIs uppdrag?
Framstegen inom AI-området är otroligt spännande. Vårt mål är att exponera detta framsteg för varje utvecklare och produktteam på internet – via en enkel uppsättning API:er. Medan vi fortsätter att forska och träna state-of-the-art AI-modeller för ASR- och NLP-uppgifter (såsom taligenkänning, sammanfattning, språkidentifiering och många andra uppgifter), kommer vi att fortsätta att exponera dessa AI-modeller för utvecklare och produktteam via enkla API:er – tillgängliga gratis.
AssemblyAI är en plats där både utvecklare och produktteam kan komma till för enkel åtkomst till de avancerade AI-modellerna de behöver för att bygga spännande nya produkter, tjänster och hela företag.
Under de senaste 6 månaderna har vi lanserat ASR-stöd för 15 nya språk – inklusive spanska, tyska, franska, italienska, hindi och japanska, släppt betydande förbättringar av vår Sammanfattningsmodell, Real-Time ASR-modeller, Innehållsmoderingsmodeller och otroligt många andra produktuppdateringar.
Vi har knappt använt våra Series A-medel, men denna nya finansiering kommer att ge oss möjlighet att aggressivt skala upp våra ansträngningar – utan att kompromissa med vår löptid.
Med denna nya finansiering kommer vi att kunna accelerera vår produktväg, bygga ut bättre AI-infrastruktur för att accelerera vår AI-forskning och inferensmotorer och växa vår AI-forskningsgrupp – som idag inkluderar forskare från DeepMind, Google (GOOGL ) Brain, Meta AI, BMW och Cisco.
Finns det något annat du vill dela om AssemblyAI?
Vårt uppdrag är att göra state-of-the-art AI-modeller tillgängliga för utvecklare och produktteam i extremt stor skala via en enkel API.
Tack för den underbara intervjun, läsare som vill lära sig mer kan besöka AssemblyAI.












