Intervjuer

Dylan Fox, CEO og grunnlegger av AssemblyAI – Intervju-serie

mm
Legg til Unite.AI blant dine foretrukne kilder på Google

Dylan Fox er CEO og grunnlegger av AssemblyAI, en plattform som automatisk konverterer lyd- og videofiler og direkte lydstrømmer til tekst med AssemblyAIs tale-til-tekst-APIer.

Hva var det som først tiltalte deg til maskinlæring?

Jeg startet med å lære å programmere og deltok i Python-møter i Washington DC, der jeg gikk på college. Gjennom college-kursene, fant jeg meg selv mer og mer tiltrukket av algoritme-typer programmeringsproblemer, som naturlig ledet meg til maskinlæring og NLP.

Før du grunnla AssemblyAI, var du senior programvare-ingeniør hos Cisco, hva jobbet du med?

Hos Cisco, var jeg senior programvare-ingeniør med fokus på maskinlæring for deres samarbeidsprodukter.

Hvordan inspirerte ditt arbeid hos Cisco og et problem med å finne tale-gjenkjenningsteknologi deg til å lansere AssemblyAI?

I noen av mine tidligere jobber, hadde jeg mulighet til å jobbe med mange AI-prosjekter, inkludert flere prosjekter som krevde tale-gjenkjenning. Men alle selskapene som tilbød tale-gjenkjenning som en tjeneste, var utdaterte, vanskelige å kjøpe fra, og kjørte gamle AI-teknologier.

Ettersom jeg ble mer og mer interessert i AI-forskning, la jeg merke til at det var mye arbeid som ble gjort i feltet tale-gjenkjenning og hvor raskt forskningen forbedret seg. Så det var en kombinasjon av faktorer som inspirerte meg til å tenke: “Hva hvis du kunne bygge et Twilio-lignende API-selskap som bruker den nyeste AI-forskningen, som var mye enklere for utviklere å få tilgang til state-of-the-art AI-modeller for tale-gjenkjenning, med en mye bedre utvikler-erfaring.”

Og det var fra der at ideen for AssemblyAI vokste.

Hva er den største utfordringen bak å bygge nøyaktig og pålitelig tale-gjenkjenningsteknologi?

Kostnad og talent er de største utfordringene for noen selskap å takle når det gjelder å bygge nøyaktig og pålitelig tale-gjenkjenningsteknologi.

Dataene er dyre å innhente, og du trenger vanligvis hundredtusener av timer for å bygge et robust tale-gjenkjenningssystem. Ikke bare det, kravene til beregning er enorme for å trene. Og å kjøre disse modellene i produksjon er også dyrt, og krever spesialisert talent for å optimalisere og gjøre det økonomisk.

Bygging av disse teknologiene krever også en spesialisert ferdighetssett som er vanskelig å finne. Det er en stor grunn til at kunder kommer til oss for kraftfulle AI-modeller som vi forsker, trener og deployer internt. De får tilgang til år med forskning i state-of-the-art AI-modeller for ASR og NLP, alle med en enkel API.

Utenfor ren transkripsjon av lyd- og videoinnhold tilbyr AssemblyAI også andre modeller, kan du diskutere hva disse modellene er?

Vår samling av AI-modeller går ut over bare sanntids- og asynkron transkripsjon. Vi omtaler disse ekstra modellene som Audio Intelligence-modeller, fordi de hjelper kunder å analysere og bedre forstå lyddata.

Vår Sammendragsmodell gir en sammenfatning, samt tidskodede sammendrag som automatisk segmenterer og genererer en sammenfatning for hver “kapittel” som emner i en samtale endrer seg (liknende YouTube-kapitler).

Vår Sentiment Analyse-modell detekterer sentimentet til hver setning som uttales i lydfiler. Hver setning i en transkripsjon kan markeres som Positiv, Negativ eller Nøytral.

Vår Entitet-gjenkjenning-modell identifiserer et bredt spekter av entiteter som uttales i lydfiler, som person- eller selskapsnavn, e-postadresser, datoer og steder.

Vår Emne-gjenkjenning-modell merker emnene som diskuteres i lyd- og videofiler. De forutsagte emne-merkene følger den standardiserte IAB-taksonomien, som gjør dem egnet for kontekstuell måling.

Vår Innhold-modereringsmodell detekterer sensitivt innhold i lyd- og videofiler – som hate-tale, vold, sensitive sosiale problemer, alkohol, narkotika og mer.

Hva er noen av de største bruksområdene for selskaper som bruker AssemblyAI?

De største bruksområdene selskaper har for AssemblyAI dekker fire kategorier: telefoni, video, virtuelle møter og media.

CallRail er et godt eksempel på en kunde i Telefoni-rommet, som utnytter AssemblyAIs AI-modeller – Core Transkripsjon, Automatisk Transkripsjonshøydepunkter og PII-utradning – for å levere en kraftfull Conversational Intelligence-løsning til sine kunder.

Essensielt, kan CallRail nå automatisk fremheve og definere nøkkelinnhold i sine telefoniske samtaler til sine kunder i stor skala – nøkkelinnhold som bestemte kundeforespørsler, ofte stilte spørsmål og hyppig brukte nøkkelord og fraser. Vår PII-utradningsmodell hjelper dem å automatisk detektere og fjerne sensitiv data funnet i transkripsjonstekst (f.eks. personnummer, kredittkortnummer, personlige adresser og mer).

Video-bruksområder går fra videostrømmingtjenester til videoeditorer som Veed, som bruker AssemblyAIs Core Transkripsjonsmodeller til å forenkle videoeditingsprosessen for brukerne. Veed lar sine brukere transkribere videoer og redigere dem direkte ved hjelp av undertekstene.

I Virtuelle møter, bruker møte-transkripsjonsprogramvare-selskaper som Fathom AssemblyAI til å bygge intelligente funksjoner som hjelper deres brukere å transkribere og fremheve de viktigste øyeblikkene fra sine Zoom-samtaler, og fremmer bedre møte-engasjement og eliminerer kjedelige oppgaver under og etter møter (f.eks. å ta notater).

I Media, ser vi podcast-vertsselskaper for eksempel, som bruker våre Innhold-modererings- og Emne-gjenkjenning-modeller, så de kan tilby bedre annonse-verktøy for merke-sikkerhets-tilfeller og moneterer bruker-generert innhold med dynamiske annonser.

AssemblyAI har nylig samlet inn 30 millioner dollar i en Series B-runde. Hvordan vil dette akselerere AssemblyAIs misjon?

Fremgangen som gjøres i feltet AI er usedvanlig spennende. Vårt mål er å eksponere denne fremgangen til hver enkelt utvikler og produkt-team på internettet – via en enkel sett med API-er. Ettersom vi fortsetter å forskere og trene State-of-the-Art AI-modeller for ASR- og NLP-oppgaver (som tale-gjenkjenning, sammenfatting, språk-identifikasjon og mange andre oppgaver), vil vi fortsette å eksponere disse AI-modellene til utviklere og produkt-team via enkle API-er – tilgjengelig gratis.

AssemblyAI er et sted hvor både utviklere og produkt-team kan komme for å få enkel tilgang til de avanserte AI-modellene de trenger for å bygge spennende nye produkter, tjenester og hele selskaper.

Over de siste 6 månedene, har vi lansert ASR-støtte for 15 nye språk – inkludert spansk, tysk, fransk, italiensk, hindi og japansk, og har gjort store forbedringer av våre Sammendragsmodeller, Sanntids-ASR-modeller, Innhold-modereringsmodeller og utallige andre produktoppdateringer.

Vi har knapt berørt våre Series A-midler, men denne nye finansieringen vil gi oss mulighet til å aggressivt skalle opp våre bestrebelser – uten å kompromittere med vår løpebane.

Med denne nye finansieringen, vil vi kunne akselerere vår produkt-vei, bygge ut bedre AI-infrastruktur for å akselerere vår AI-forskning og inferens-motorer, og vokse vårt AI-forsknings-team – som i dag inkluderer forskere fra DeepMind, Google (GOOGL ) Brain, Meta AI, BMW og Cisco.

Er det noe annet du ønsker å dele om AssemblyAI?

Vår misjon er å gjøre State-of-the-Art AI-modeller tilgjengelige for utviklere og produkt-team på ekstremt stor skala gjennom en enkel API.

Takk for det flotte intervjuet, lesere som ønsker å lære mer, bør besøke AssemblyAI.

Antoine er en visjonær leder og medgrunnlegger av Unite.AI, drevet av en urokkelig lidenskap for å forme og fremme fremtiden for AI og robotikk. En serial entrepreneur, han tror at AI vil være like disruptiv for samfunnet som elektrisitet, og blir ofte fanget i å prise potensialet for disruptive teknologier og AGI.

Som en futurist, er han dedikert til å utforske hvordan disse innovasjonene vil forme vår verden. I tillegg er han grunnlegger av Securities.io, en plattform som fokuserer på å investere i banebrytende teknologier som definerer fremtiden og omformer hele sektorer.