Interviste

Dylan Fox, CEO e Fondatore di AssemblyAI – Serie di Interviste

mm
Aggiungi Unite.AI alle tue fonti preferite su Google

Dylan Fox è il CEO e Fondatore di AssemblyAI, una piattaforma che converte automaticamente file audio e video e flussi audio live in testo con gli API di Speech-to-Text di AssemblyAI.

Cosa ti ha inizialmente attratto verso il machine learning?

Ho iniziato imparando a programmare e partecipando a incontri Python a Washington DC, dove ho frequentato il college. Attraverso corsi universitari, mi sono trovato a inclinarmi sempre più verso problemi di programmazione di tipo algoritmo, che naturalmente mi hanno portato al machine learning e al NLP.

Prima di fondare AssemblyAI, eri un Senior Software Engineer presso Cisco, su cosa stavi lavorando?

Presso Cisco, ero un Senior Software Engineer che si concentrava sul machine learning per i loro prodotti di collaborazione.

Come ha lavorato presso Cisco e un problema con la tecnologia di riconoscimento vocale ti ha ispirato a lanciare AssemblyAI?

In alcuni dei miei precedenti lavori, ho avuto l’opportunità di lavorare su molti progetti di intelligenza artificiale, compresi progetti che richiedevano il riconoscimento vocale. Ma tutte le aziende che offrivano il riconoscimento vocale come servizio erano incredibilmente obsolete, difficili da acquistare e utilizzavano tecnologie di intelligenza artificiale superate.

Man mano che mi interessavo sempre di più alla ricerca sull’intelligenza artificiale, notai che c’era molto lavoro in corso nel campo del riconoscimento vocale e quanto rapidamente la ricerca stava migliorando. Quindi è stata una combinazione di fattori che mi ha ispirato a pensare: “E se potessi costruire un’azienda di tipo Twilio che utilizza le ultime ricerche sull’intelligenza artificiale per rendere più facile per gli sviluppatori accedere ai modelli di intelligenza artificiale di stato dell’arte per il riconoscimento vocale, con una molto migliore esperienza per gli sviluppatori?”

E da lì è nata l’idea di AssemblyAI.

Qual è la sfida più grande dietro la costruzione di tecnologie di riconoscimento vocale accurate e affidabili?

I costi e il talento sono le sfide più grandi per qualsiasi azienda che affronti la costruzione di tecnologie di riconoscimento vocale accurate e affidabili.

I dati sono costosi da acquisire e di solito sono necessarie centinaia di migliaia di ore per costruire un sistema di riconoscimento vocale robusto. Inoltre, le esigenze di calcolo sono enormi per l’addestramento e la messa in produzione di questi modelli è anche costosa e richiede talenti specializzati per ottimizzarli e renderli economici.

La costruzione di queste tecnologie richiede anche un set di competenze specializzate che è difficile da trovare. Questo è un grande motivo per cui i clienti vengono da noi per ottenere modelli di intelligenza artificiale potenti che noi ricerciamo, addestriamo e distribuiamo in-house. Essi ottengono accesso a anni di ricerca sui modelli di intelligenza artificiale di stato dell’arte per ASR e NLP, tutti con un’API semplice.

Oltre alla semplice trascrizione di contenuti audio e video, AssemblyAI offre modelli aggiuntivi, puoi discutere cosa sono questi modelli?

La nostra suite di modelli di intelligenza artificiale si estende oltre la semplice trascrizione in tempo reale e asincrona. Ci riferiamo a questi modelli aggiuntivi come modelli di Intelligenza Audio, poiché aiutano i clienti ad analizzare e comprendere meglio i dati audio.

Il nostro modello di Riepilogo fornisce un riepilogo generale, nonché riepiloghi con codice temporale che segmentano automaticamente e generano un riepilogo per ogni “capitolo” man mano che i temi di una conversazione cambiano (simile ai capitoli di YouTube).

Il nostro modello di Analisi del Sentimento rileva il sentimento di ogni frase di discorso parlato in file audio. Ogni frase in una trascrizione può essere contrassegnata come Positiva, Negativa o Neutrale.

Il nostro modello di Rilevamento di Entità identifica una vasta gamma di entità che vengono pronunciate in file audio, come nomi di persone o aziende, indirizzi e-mail, date e luoghi.

Il nostro modello di Rilevamento di Argomenti etichetta gli argomenti che vengono discussi in file audio e video. Le etichette di argomento previste seguono la tassonomia IAB standardizzata, che le rende adatte per il targeting contestuale.

Il nostro modello di Moderazione dei Contenuti rileva contenuti sensibili in file audio e video – come discorsi d’odio, violenza, questioni sociali sensibili, alcol, droghe e molto altro.

Quali sono i principali casi d’uso per le aziende che utilizzano AssemblyAI?

I principali casi d’uso per le aziende che utilizzano AssemblyAI si estendono su quattro categorie: telefonia, video, riunioni virtuali e media.

CallRail è un ottimo esempio di cliente nello spazio Telephony, che utilizza i modelli di intelligenza artificiale di AssemblyAI – Trascrizione Core, Evidenziazione Automatica della Trascrizione e Redazione PII – per offrire una soluzione di Intelligenza Conversazionale potente ai propri clienti.

In sostanza, CallRail può ora automaticamente portare in superficie e definire contenuti chiave nelle loro chiamate ai propri clienti su larga scala – contenuti chiave come richieste specifiche dei clienti, domande frequenti e parole chiave e frasi comunemente utilizzate. Il nostro modello di Redazione PII aiuta a rilevare e rimuovere automaticamente dati sensibili trovati nel testo della trascrizione (ad esempio numeri di sicurezza sociale, numeri di carta di credito, indirizzi personali e altro).

I casi d’uso Video vanno dalle piattaforme di streaming video a editor video come Veed, che utilizzano i modelli di Trascrizione Core di AssemblyAI per semplificare il processo di editing video per gli utenti. Veed consente ai propri utenti di trascrivere i propri video e modificarli direttamente utilizzando le didascalie.

Nelle Riunioni Virtuali, le aziende di software per la trascrizione di riunioni come Fathom stanno utilizzando AssemblyAI per costruire funzionalità intelligenti che aiutano gli utenti a trascrivere e evidenziare i momenti chiave dalle loro chiamate Zoom, favorendo un miglior coinvolgimento delle riunioni e eliminando compiti tediosi durante e dopo le riunioni (ad esempio prendere appunti).

Nel settore Media, vediamo piattaforme di hosting di podcast che utilizzano i nostri modelli di Moderazione dei Contenuti e Rilevamento di Argomenti in modo che possano offrire strumenti pubblicitari migliori per casi d’uso di sicurezza del marchio e monetizzare il contenuto generato dagli utenti con annunci dinamici.

AssemblyAI ha recentemente raccolto un finanziamento di 30 milioni di dollari nella serie B. Come questo accelererà la missione di AssemblyAI?

I progressi che si stanno facendo nel campo dell’intelligenza artificiale sono incredibilmente emozionanti. Il nostro obiettivo è esporre questo progresso a ogni sviluppatore e team di prodotto su Internet – tramite un set semplice di API. Man mano che continuiamo a ricercare e addestrare modelli di intelligenza artificiale di stato dell’arte per compiti ASR e NLP (come il riconoscimento vocale, la sommarizzazione, l’identificazione della lingua e molti altri compiti), continueremo a esporre questi modelli di intelligenza artificiale agli sviluppatori e ai team di prodotto tramite API semplici – disponibili gratuitamente.

AssemblyAI è un luogo in cui sia gli sviluppatori che i team di prodotto possono venire per accedere facilmente ai modelli di intelligenza artificiale avanzati di cui hanno bisogno per costruire prodotti, servizi e intere aziende emozionanti.

Negli ultimi 6 mesi, abbiamo lanciato il supporto ASR per 15 nuove lingue – tra cui spagnolo, tedesco, francese, italiano, hindi e giapponese, abbiamo rilasciato importanti miglioramenti per il nostro modello di Sommarizzazione, i modelli ASR in tempo reale, i modelli di Moderazione dei Contenuti e numerosi altri aggiornamenti del prodotto.

Abbiamo appena iniziato a utilizzare i fondi della serie A, ma questo nuovo finanziamento ci darà la capacità di aumentare aggressivamente i nostri sforzi – senza compromettere la nostra corsia.

Con questo nuovo finanziamento, potremo accelerare la nostra roadmap del prodotto, costruire una migliore infrastruttura di intelligenza artificiale per accelerare i nostri motori di ricerca e inferenza e crescere il nostro team di ricerca sull’intelligenza artificiale – che oggi include ricercatori di DeepMind, Google (GOOGL ) Brain, Meta AI, BMW e Cisco.

C’è qualcos’altro che vorresti condividere su AssemblyAI?

La nostra missione è rendere i modelli di intelligenza artificiale di stato dell’arte accessibili agli sviluppatori e ai team di prodotto su larga scala attraverso un’API semplice.

Grazie per la grande intervista, i lettori che desiderano saperne di più possono visitare AssemblyAI.

Antoine è un leader visionario e socio fondatore di Unite.AI, guidato da una passione incrollabile per plasmare e promuovere il futuro dell'AI e della robotica. Un imprenditore seriale, crede che l'AI sarà così disruptiva per la società come l'elettricità, e spesso si lascia trasportare dall'entusiasmo per il potenziale delle tecnologie disruptive e dell'AGI.

Come futurista, è dedicato a esplorare come queste innovazioni plasmeranno il nostro mondo. Inoltre, è il fondatore di Securities.io, una piattaforma focalizzata sugli investimenti in tecnologie all'avanguardia che stanno ridefinendo il futuro e riplasmando interi settori.