Interviuri
Dylan Fox, CEO și fondator al AssemblyAI – Seria de interviuri

Dylan Fox este CEO și fondator al AssemblyAI, o platformă care convertește automat fișiere audio și video și fluxuri audio live în text cu ajutorul API-urilor Speech-to-Text de la AssemblyAI.
Ce v-a atras inițial către învățarea mașinilor?
Am început prin a învăța să programez și am participat la întâlnirile Python din Washington DC, unde am studiat. Prin cursurile universitare, m-am îndreptat mai mult către probleme de programare de tip algoritmic, ceea ce m-a condus în mod natural către învățarea mașinilor și NLP.
Înainte de a fonda AssemblyAI, ați fost inginer software senior la Cisco, la ce lucrați?
La Cisco, am fost inginer software senior, axat pe învățarea mașinilor pentru produsele lor de colaborare.
Cum a inspirat munca dvs. la Cisco și o problemă cu sursa tehnologiei de recunoaștere a vorbirii să lansați AssemblyAI?
În unele dintre joburile mele anterioare, am avut ocazia să lucrez la multe proiecte AI, inclusiv proiecte care necesitau recunoaștere a vorbirii. Dar toate companiile care oferă recunoaștere a vorbirii ca serviciu erau extrem de învechite, greu de cumpărat și rulează tehnologie AI învechită.
Pe măsură ce m-am interesat mai mult de cercetarea AI, am observat că există multă muncă în domeniul recunoașterii vorbirii și cu ce viteză se îmbunătățește cercetarea. Așa că a fost o combinație de factori care m-a inspirat să gândesc: “Ce-ar fi dacă ai putea construi o companie de tip Twilio, folosind cercetarea AI cea mai recentă, care să fie mult mai ușor de accesat de către dezvoltatori pentru modele AI de recunoaștere a vorbirii, cu o experiență mult mai bună pentru dezvoltatori.”
Și de acolo a crescut ideea pentru AssemblyAI.
Care este cea mai mare provocare din spatele construirii tehnologiei de recunoaștere a vorbirii precise și de încredere?
Costul și talentul sunt cele mai mari provocări pentru orice companie care abordează construirea tehnologiei de recunoaștere a vorbirii precise și de încredere.
Datele sunt scumpe de achiziționat, și de obicei aveți nevoie de sute de mii de ore pentru a construi un sistem robust de recunoaștere a vorbirii. Nu numai atât, cerințele de calcul sunt uriașe pentru a antrena. Și pentru a furniza aceste modele în producție este, de asemenea, costisitor și necesită talent specializat pentru a optimiza și a face acest lucru economic.
Construirea acestor tehnologii necesită, de asemenea, un set de abilități specializate, care este greu de găsit. Acesta este un motiv mare pentru care clienții vin la noi pentru modele AI puternice pe care le cercetăm, antrenăm și implementăm intern. Ei au acces la ani de cercetare în modele AI de ultimă generație pentru ASR și NLP, toate prin intermediul unui API simplu.
În afara transcrierii pure a conținutului audio și video, AssemblyAI oferă modele suplimentare, puteți discuta despre ce sunt acestea?
Suite-ul nostru de modele AI se extinde dincolo de transcrierea în timp real și asincronă. Ne referim la aceste modele suplimentare ca modele de inteligență audio, deoarece acestea ajută clienții să analizeze și să înțeleagă mai bine datele audio.
Modelul nostru de rezumat oferă un rezumat general, precum și rezumate codate în timp, care segmentează și generează automat un rezumat pentru fiecare “capitol” pe măsură ce subiectele dintr-o conversație se schimbă (similar cu capitolele de pe YouTube).
Modelul nostru de analiză a sentimentului detectează sentimentul fiecărei propoziții dintr-un fișier audio. Fiecare propoziție dintr-un transcript poate fi marcată ca Pozitiv, Negativ sau Neutru.
Modelul nostru de detectare a entităților identifică o gamă largă de entități care sunt menționate în fișiere audio, cum ar fi nume de persoane sau companii, adrese de e-mail, date și locații.
Modelul nostru de detectare a subiectelor etichetează subiectele care sunt discutate în fișiere audio și video. Etichetele de subiect prevăzute urmează taxonomia standardizată IAB, ceea ce le face potrivite pentru țintirea contextuală.
Modelul nostru de moderare a conținutului detectează conținut sensibil în fișiere audio și video — cum ar fi discursul urât, violența, problemele sociale sensibile, alcoolul, drogurile și multe altele.
Care sunt cele mai mari cazuri de utilizare pentru companiile care utilizează AssemblyAI?
Cele mai mari cazuri de utilizare pentru companiile care utilizează AssemblyAI se împart în patru categorii: telefonia, video, reuniuni virtuale și mass-media.
CallRail este un exemplu excelent de client în spațiul telefoniei, care utilizează modelele AI de la AssemblyAI — Transcriere de bază, Evidențiere automată a transcrierii și Redactarea PII — pentru a oferi o soluție puternică de inteligență conversațională clienților săi.
În esență, CallRail poate acum să suprafețeze și să definească conținutul cheie din apelurile telefonice ale clienților săi la scară — conținut cheie, cum ar fi cererile specifice ale clienților, întrebările frecvente și cuvintele și frazele frecvent utilizate. Modelul nostru de redactare PII ajută la detectarea și eliminarea automată a datelor sensibile găsite în textul transcrierii (de exemplu, numere de securitate socială, numere de card de credit, adrese personale și multe altele).
Cazurile de utilizare video variază de la platforme de streaming video la editori de video, cum ar fi Veed, care utilizează modelele noastre de transcriere pentru a simplifica procesul de editare video pentru utilizatori. Veed permite utilizatorilor săi să transcrie videoclipurile și să le editeze direct utilizând subtitrările.
În reuniuni virtuale, companiile de software pentru transcrierea reuniunilor, cum ar fi Fathom, utilizează AssemblyAI pentru a construi funcții inteligente care ajută utilizatorii să transcrie și să evidențieze momentele cheie din apelurile Zoom, promovând o implicare mai bună a reuniunilor și eliminând sarcinile tedioase din timpul și după reuniuni (de exemplu, luarea notițelor).
În mass-media, vedem platforme de găzduire a podcasturilor, de exemplu, care utilizează modelele noastre de moderare a conținutului și detectare a subiectelor, astfel încât acestea să poată oferi unelte publicitare mai bune pentru cazurile de siguranță a brandului și să monetizeze conținutul generat de utilizatori cu reclame dinamice.
AssemblyAI a strâns recent o rundă de finanțare de 30 de milioane de dolari. Cum va accelera această finanțare misiunea AssemblyAI?
Progresul realizat în domeniul inteligenței artificiale este incredibil de interesant. Scopul nostru este de a expune acest progres tuturor dezvoltatorilor și echipelor de produse de pe internet — prin intermediul unui set simplu de API-uri. Pe măsură ce continuăm să cercetăm și să antrenăm modele AI de ultimă generație pentru sarcinile ASR și NLP (cum ar fi recunoașterea vorbirii, rezumatul, identificarea limbii și multe alte sarcini), vom continua să expunem aceste modele AI dezvoltatorilor și echipelor de produse prin API-uri simple — disponibile gratuit.
AssemblyAI este un loc în care atât dezvoltatorii, cât și echipele de produse pot veni pentru a avea acces ușor la modelele avansate de inteligență artificială de care au nevoie pentru a construi produse, servicii și companii noi interesante.
În ultimele 6 luni, am lansat suport ASR pentru 15 limbi noi — incluzând spaniolă, germană, franceză, italiană, hindi și japoneză, am lansat îmbunătățiri majore pentru modelul nostru de rezumat, modelele noastre de recunoaștere a vorbirii în timp real, modelele noastre de moderare a conținutului și numeroase alte actualizări de produs.
Abia am atins fondurile noastre din seria A, dar această nouă finanțare ne va oferi capacitatea de a ne extinde eforturile fără a compromite durata de viață a companiei.
Cu această nouă finanțare, vom putea accelera drumul nostru de produs, vom construi o infrastructură de inteligență artificială mai bună pentru a accelera cercetarea noastră și motoarele de inferență și vom extinde echipa noastră de cercetare AI — care include în prezent cercetători de la DeepMind, Google (GOOGL ) Brain, Meta AI, BMW și Cisco.
Există altceva pe care ați dori să îl împărtășiți despre AssemblyAI?
Misiunea noastră este de a face modelele de inteligență artificială de ultimă generație accesibile dezvoltatorilor și echipelor de produse la scară extrem de mare prin intermediul unui API simplu.
Mulțumim pentru acest interviu minunat, cititorii care doresc să afle mai multe despre AssemblyAI ar trebui să viziteze AssemblyAI.












