Interviews
Dylan Fox, CEO & Oprichter van AssemblyAI – Interviewreeks

Dylan Fox is de CEO & Oprichter van AssemblyAI, een platform dat automatisch audio- en videobestanden en live audiostreams omzet in tekst met AssemblyAI’s Speech-to-Text APIs.
Wat trok je aanvankelijk aan naar machine learning?
Ik begon met het leren van programmeren en bezocht Python-bijeenkomsten in Washington DC, waar ik naar college ging. Door middel van collegecursussen kwam ik meer in aanraking met algoritme-achtige programmeerproblemen, wat me natuurlijk naar machine learning en NLP leidde.
Voor het oprichten van AssemblyAI was je Senior Software Engineer bij Cisco, waaraan werkte je?
Bij Cisco was ik Senior Software Engineer en richtte me op Machine Learning voor hun collaboratieproducten.
Hoe inspireerde je werk bij Cisco en een probleem met het vinden van spraakherkenningstechnologie je om AssemblyAI op te richten?
In enkele van mijn vorige banen had ik de kans om te werken aan veel AI-projecten, waaronder verschillende projecten die spraakherkenning vereisten. Maar alle bedrijven die spraakherkenning als dienst aanboden, waren ontzettend verouderd, moeilijk om iets van te kopen en gebruikten verouderde AI-technologie.
Naarmate ik me meer en meer interesseerde in AI-onderzoek, merkte ik dat er veel werk werd gedaan op het gebied van spraakherkenning en hoe snel het onderzoek verbeterde. Dus het was een combinatie van factoren die me inspireerde om te denken: “Wat als je een Twilio-achtig API-bedrijf kon bouwen met de nieuwste AI-onderzoek dat veel gemakkelijker voor ontwikkelaars was om toegang te krijgen tot state-of-the-art AI-modellen voor spraakherkenning, met een veel betere ontwikkelaarservaring.”
En van daaruit groeide het idee voor AssemblyAI.
Wat is de grootste uitdaging achter het bouwen van nauwkeurige en betrouwbare spraakherkenningstechnologie?
Kosten en talent zijn de grootste uitdagingen voor elk bedrijf om aan te pakken bij het bouwen van nauwkeurige en betrouwbare spraakherkenningstechnologie.
De gegevens zijn duur om te verkrijgen, en je hebt meestal honderdduizenden uren nodig om een robuust spraakherkenningsysteem te bouwen. Niet alleen dat, de compute-eisen zijn enorm om te trainen. En het serveren van deze modellen in productie is ook duur en vereist gespecialiseerd talent om te optimaliseren en economisch te maken.
Het bouwen van deze technologieën vereist ook een gespecialiseerde vaardigheid die moeilijk te vinden is. Dat is een grote reden waarom klanten naar ons komen voor krachtige AI-modellen die we onderzoeken, trainen en in-house implementeren. Ze krijgen toegang tot jaren van onderzoek naar state-of-the-art AI-modellen voor ASR en NLP, allemaal met een eenvoudige API.
Buiten het puur transcriberen van audio- en videoinhoud biedt AssemblyAI extra modellen, kun je hierover praten?
Onze suite van AI-modellen gaat verder dan alleen real-time en asynchrone transcriptie. We noemen deze extra modellen Audio Intelligence-modellen, omdat ze klanten helpen om audio-gegevens te analyseren en beter te begrijpen.
Ons Summarization-model biedt een algemene samenvatting, evenals tijdsgecodeerde samenvattingen die automatisch segmenteren en een samenvatting genereren voor elk “hoofdstuk” wanneer onderwerpen in een conversatie veranderen (soortgelijk aan YouTube-hoofdstukken).
Ons Sentiment Analysis-model detecteert de sentiment van elke zin van gesproken tekst in audio-bestanden. Elke zin in een transcript kan worden gemarkeerd als Positief, Negatief of Neutraal.
Ons Entity Detection-model identificeert een breed scala aan entiteiten die in audio-bestanden worden genoemd, zoals persoon- of bedrijfsnamen, e-mailadressen, datums en locaties.
Ons Topic Detection-model labelt de onderwerpen die in audio- en videobestanden worden besproken. De voorspelde onderwerpen volgen de gestandaardiseerde IAB-Taxonomie, waardoor ze geschikt zijn voor contextuele doelstelling.
Ons Content Moderation-model detecteert gevoelige inhoud in audio- en videobestanden — zoals haatzaaiende taal, geweld, gevoelige sociale kwesties, alcohol, drugs en meer.
Wat zijn enkele van de grootste use cases voor bedrijven die AssemblyAI gebruiken?
De grootste use cases voor bedrijven die AssemblyAI gebruiken, zijn verdeeld over vier categorieën: telefoon, video, virtuele bijeenkomsten en media.
CallRail is een goed voorbeeld van een klant in de Telephony-ruimte, die AssemblyAI’s AI-modellen gebruikt — Core Transcription, Automatic Transcript Highlights en PII Redaction — om een krachtige Conversational Intelligence-oplossing aan zijn klanten te bieden.
In wezen kan CallRail nu automatisch belangrijke inhoud in hun telefoongesprekken naar hun klanten schalen — belangrijke inhoud zoals specifieke klantverzoeken, veelgestelde vragen en vaak gebruikte trefwoorden en zinnen. Ons PII Redaction-model helpt hen om automatisch gevoelige gegevens te detecteren en te verwijderen die in transcripttekst worden gevonden (bijv. socialezekerheidsnummers, creditcardnummers, persoonlijke adressen en meer).
Video-use cases variëren van videostreamingplatforms tot videobewerkers zoals Veed, die AssemblyAI’s Core Transcription-modellen gebruiken om het videobewerkingsproces voor gebruikers te vereenvoudigen. Veed laat zijn gebruikers toe om hun video’s te transcriberen en rechtstreeks te bewerken met de ondertiteling.
In Virtuele bijeenkomsten gebruiken bijeenkomsttranscriptiesoftwarebedrijven zoals Fathom AssemblyAI om intelligente functies te bouwen die hun gebruikers helpen om hun Zoom-bijeenkomsten te transcriberen en te markeren, waardoor betere bijeenkomstengagement en het elimineren van saaie taken tijdens en na bijeenkomsten (bijv. notities maken).
In Media zien we podcasthostingplatforms bijvoorbeeld, die onze Content Moderation- en Topic Detection-modellen gebruiken zodat ze betere advertentiehulpmiddelen voor merkveiligheidsuse cases kunnen aanbieden en gebruikers gegenereerde inhoud kunnen monetizeren met dynamische advertenties.
AssemblyAI heeft onlangs een $30M Series B-rondes opgehaald. Hoe zal dit de AssemblyAI-missie versnellen?
De vorderingen in het veld van AI zijn ontzettend spannend. Ons doel is om deze vorderingen aan elke ontwikkelaar en productteam op internet bloot te stellen — via een eenvoudige set APIs. Terwijl we blijven onderzoeken en trainen State-of-the-Art AI-modellen voor ASR- en NLP-taken (zoals spraakherkenning, samenvatting, taalidentificatie en veel andere taken), zullen we deze AI-modellen aan ontwikkelaars en productteams via eenvoudige APIs ter beschikking stellen — beschikbaar voor gratis.
AssemblyAI is een plek waar zowel ontwikkelaars als productteams naartoe kunnen gaan voor eenvoudige toegang tot de geavanceerde AI-modellen die ze nodig hebben om spannende nieuwe producten, diensten en hele bedrijven te bouwen.
In de afgelopen 6 maanden hebben we ASR-ondersteuning gelanceerd voor 15 nieuwe talen—waaronder Spaans, Duits, Frans, Italiaans, Hindi en Japans, en hebben we belangrijke verbeteringen aangebracht in onze Summarization-modellen, Real-Time ASR-modellen, Content Moderation-modellen en ontelbare andere productupdates.
We hebben nog maar nauwelijks onze Series A-fondsen aangeraakt, maar deze nieuwe financiering geeft ons de mogelijkheid om onze inspanningen agressief op te schalen — zonder ons rendement te compromitteren.
Met deze nieuwe financiering zullen we onze productroadmap kunnen versnellen, beter AI-infrastructuur kunnen opbouwen om ons AI-onderzoek en inferentiemotoren te versnellen, en ons AI-onderzoekteam kunnen uitbreiden — dat vandaag onderzoekers van DeepMind, Google (GOOGL ) Brain, Meta AI, BMW en Cisco omvat.
Is er nog iets anders dat je over AssemblyAI wilt delen?
Onze missie is om State-of-the-Art AI-modellen toegankelijk te maken voor ontwikkelaars en productteams op extreem grote schaal via een eenvoudige API.
Bedankt voor het geweldige interview, lezers die meer willen leren, moeten AssemblyAI bezoeken.












