Interviste
Tyler Weitzman, Co-Fondatore e Responsabile dell’Intelligenza Artificiale di Speechify – Serie di Interviste

Tyler Weitzman è il Co-Fondatore, Responsabile dell’Intelligenza Artificiale e Presidente di Speechify, l’app di testo-voce numero 1 al mondo, con oltre 100.000 recensioni a 5 stelle. Weitzman è un laureato dell’Università di Stanford, dove ha ottenuto un BS in matematica e un MS in Informatica nel percorso di Intelligenza Artificiale. È stato selezionato da Inc. Magazine come uno dei 50 migliori imprenditori e ha sido pubblicato su Business Insider, TechCrunch, LifeHacker, CBS, tra altre pubblicazioni. La ricerca per il master di Weitzman si è concentrata sull’intelligenza artificiale e sulla sintesi vocale, con una tesi finale intitolata: “CloneBot: predizioni personalizzate di risposte al dialogo”.
Ha iniziato a programmare all’età di 9 anni, cosa l’ha inizialmente attratto verso l’informatica?
Ero piuttosto ossessionato da bambino con Dragon Ball Z e volevo imparare ad animare da solo. Ho imparato Adobe (ADBE ) Flash e Photoshop e ho creato le mie stesse animazioni di Goku su una pagina web di fan che avevo costruito. Subito dopo ho iniziato a imparare sui sistemi e gli algoritmi e quando ho scoperto che potevo effettivamente programmare per vivere, è stato abbastanza emozionante. Pensavo che fosse solo un hobby come giocare ai videogiochi.
Poi ha iniziato a costruire app per iPhone all’età di 12 anni, quali sono state alcune di queste app?
Un’app si chiama Black SMS che consente alle persone di inviare messaggi di testo crittografati tra loro. Un’altra app si chiama Frontback che consente agli utenti di scattare selfie e foto di ciò che si trova davanti a loro allo stesso tempo.
Può discutere la sua ricerca all’Università di Stanford e come si è concentrata sulla elaborazione del linguaggio naturale e sulla sintesi vocale?
La mia ricerca ha coperto più utilizzi delle reti di trasformatori, tra cui modelli di generazione del linguaggio per chat, etichettatura delle parti del discorso, predizione della punteggiatura e testo-voce. L’ottimizzazione dell’inferenza delle reti neurali per CPU mobili è stata una priorità principale e ciò si è tradotto direttamente nelle voci offline disponibili su Speechify, che funzionano anche in modalità aereo.
Può condividere la storia dietro la creazione di Speechify?
Sono cieco da un occhio e mio fratello Cliff è dislessico. Abbiamo utilizzato libri audio e tecnologia di testo-voce per quanto possiamo ricordare per superare la scuola e quando eravamo giovani per leggere libri come Harry Potter. Man mano che crescevamo e iniziavamo a utilizzare più prodotti tecnologici, abbiamo iniziato a renderci conto che c’era l’opportunità di costruire migliori app di testo-voce su web e mobile con voci migliori grazie ai progressi dell’IA e a una migliore esperienza utente. Quindi abbiamo deciso di procedere con Speechify.
Quali sono alcune delle diverse tecnologie di apprendimento automatico utilizzate in Speechify?
Abbiamo adottato tecniche all’avanguardia per architetture generative avanzate – trasformatori/conformatori, pre-addestramento su larga scala, addestramento distribuito, accumulo del gradiente, spazi latenti auto-encodati, diffusione, reti avversarie e modellazione del linguaggio. Utilizziamo tecniche di supporto per l’elaborazione delle caratteristiche che circondano la fonemizzazione, l’intonazione e l’emozione, per modellare meglio la voce in particolare.
Quali sono alcune delle sfide dietro la costruzione di un’app di testo-voce?
Una delle sfide principali è costruire voci di alta qualità che suonino come esseri umani reali e non come robot. Il nostro obiettivo è che le persone non possano distinguere come suonano le nostre voci e come suonano gli esseri umani, in modo che i nostri utenti siano a loro agio ascoltando contenuti su Speechify per lunghi periodi di tempo. Una seconda sfida è distribuire i nostri modelli di IA a milioni di utenti. È una cosa costruire voci di alta qualità e un’altra assicurarsi che milioni di utenti in tutto il mondo li scoprono e li utilizzino.
Speechify è l’app numero 1 nella sua categoria nell’app store, a cosa attribuisce questo successo?
Crediamo di aver costruito i migliori prodotti sul mercato per le persone che vogliono ascoltare ciò che devono leggere – sia che si tratti di studenti con i compiti, professionisti che leggono per lavoro o lettori che semplicemente vogliono essere intrattenuti. Abbiamo la migliore selezione di voci, tra cui celebrità come Snoop Dogg, e la migliore interfaccia utente per consentire alle persone di caricare e accedere facilmente al contenuto che desiderano consumare. E la nostra esperienza utente è senza soluzione di continuità in tutto l’ecosistema Speechify – puoi iniziare ad ascoltare un articolo sul tuo computer e poi facilmente passare ad ascoltarlo sul tuo telefono.
Quali sono alcuni dei più grandi casi d’uso per questa app?
Il generativo AI di Speechify risolve problemi reali per gli studenti che vogliono superare i compiti più velocemente, persone con dislessia e ADHD che hanno difficoltà a leggere, anziani con bassa vista, professionisti che vogliono leggere di più e essere più produttivi, scrittori che vogliono ascoltare il loro lavoro, apprendisti uditivi e molti altri.
Qual è la sua visione per il futuro dell’IA?
Vogliamo che l’IA – e in particolare le voci di testo-voce AI – eliminino le barriere all’apprendimento indipendentemente dal livello di reddito, dalle differenze di apprendimento, dalla geografia o dalla lingua. Vediamo l’IA come uno strumento per il bene sociale per elevare la qualità della vita che gli esseri umani possono vivere migliorando la loro educazione.
Grazie per la grande intervista, i lettori che desiderano saperne di più possono visitare Speechify.












