Interviste
Matt Hocking, Co-Fondatore di WellSaid Labs – Serie di Interviste

Matt Hocking è il co-fondatore di WellSaid Labs, un’azienda leader nel settore delle tecnologie di generazione di voci artificiali di alta qualità. Ha più di 15 anni di esperienza nella gestione di team e nella fornitura di soluzioni tecnologiche su larga scala.
Il tuo background è piuttosto imprenditoriale, come sei entrato nel mondo dell’AI?
Credo di essermi sempre considerato un imprenditore. Ho iniziato la mia prima attività dopo il college e, con una formazione in design del prodotto, mi sono trovato a gravitare verso l’aiuto di persone con idee in fase di avvio. Nel corso della mia carriera, sono stato fortunato a lavorare con diverse startup che hanno avuto un grande successo. Durante queste esperienze, ho avuto modo di conoscere molti fondatori di grande talento e questo mi ha ispirato a perseguire le mie idee come fondatore. L’AI era relativamente nuova per me quando mi sono unito ad AI2; tuttavia, quest’esperienza mi ha offerto l’opportunità di applicare la mia prospettiva sui prodotti e le startup a ricerche davvero eccezionali e di immaginare come questi nuovi progressi avrebbero potuto aiutare molte persone negli anni a venire. Il mio obiettivo fin dall’inizio è stato quello di sviluppare vere aziende per persone reali e credo che l’AI abbia il potenziale di creare molte opportunità emozionanti e di efficienza nel nostro futuro, se applicata con saggezza.
Potresti condividere la storia di come l’idea di WellSaid Labs è nata quando eri imprenditore in residenza presso The Allen Institute for AI?
Ho aderito a The Allen Institute for Artificial Intelligence (AI2) come imprenditore in residenza nel 2018. Probabilmente l’incubatore più innovativo al mondo, AI2 ospita le menti più brillanti nell’AI che applicano soluzioni dalla frontiera di ciò che è possibile oggi a prodotti tangibili che risolvono problemi in tutto il mondo. La mia formazione in design e tecnologia ha nutrito un lungo interesse per i campi creativi e, con l’esplosione dell’AI che stiamo tutti testimoniando oggi, volevo esplorare un modo per collegare i due. Ho conosciuto Michael Petrochuk (co-fondatore e CTO di WellSaid Labs) mentre sviluppavo un’applicazione sanitaria interattiva che guidava il paziente attraverso varie situazioni sensibili. Durante il processo di sviluppo del contenuto per l’esperienza, il mio team ha lavorato con talenti vocali per registrare precedentemente migliaia di linee di voce fuori campo per l’avatara. Quando sono stato esposto a alcuni dei progressi che Michael aveva raggiunto durante la sua ricerca, abbiamo entrambi rapidamente visto il valore di come la tecnologia di sintesi vocale di pari umana potesse trasformare non solo il prodotto su cui stavo lavorando, ma anche avere un impatto su numerose altre applicazioni e settori. La tecnologia e gli strumenti avevano faticato a stare al passo con le esigenze dei produttori che creavano con la voce come mezzo. Abbiamo visto un percorso per mettere questa tecnologia nelle mani di tutti i creatori, permettendo alla voce di essere una parte integrante di tutte le storie.
WellSaid Labs è una delle poche aziende che fornisce ai doppiatori una via di accesso allo spazio della voce artificiale. Perché hai ritenuto importante integrare voci reali nel prodotto?
La nostra risposta è duplice: in primo luogo, volevamo creare soluzioni che complementassero le capacità dei doppiatori professionisti, ampliando le opportunità per la voce. E in secondo luogo, ci impegniamo ad avere il più alto livello di qualità umana nei nostri prodotti. I nostri doppiatori sono partner collaborativi a lungo termine e ricevono compensi e una quota dei ricavi sia per i dati vocali che per il contenuto successivamente prodotto con essi. Ogni doppiatore che assumiamo per creare un avatar vocale AI basato sulla somiglianza della sua voce viene pagato in base a quanto la sua voce viene utilizzata sulla nostra piattaforma. Incentiviamo i talenti a collaborare con noi; una compensazione equa per i loro contributi è incredibilmente importante per noi.
Per offrire il più alto livello di prodotti di qualità umana sul mercato, dobbiamo essere rigorosi su dove otteniamo i nostri dati. Questo processo ci dà un maggiore controllo sulla qualità, poiché addestriamo i nostri modelli di apprendimento profondo per parlare sia alla pari umana che a stili contestualmente rilevanti. Non creiamo solo una voce che recita l’input fornito. I nostri modelli offrono una varietà di stili vocali che eseguono ciò che è scritto sulla pagina. Sia che gli utenti stiano creando voce fuori campo utilizzando un avatar dalla nostra libreria o creando voce fuori campo con una voce personalizzata per il loro marchio, utilizziamo dati vocali reali per garantire un processo senza soluzione di continuità e una piattaforma facile da usare. Se i nostri clienti dovessero manipolare e modificare le nostre voci in post-produzione, il processo per ottenere l’output desiderato sarebbe goffo e lungo. Le nostre voci prendono il contesto del contenuto scritto e forniscono una lettura contestualmente accurata. Offriamo voci per tutti i tipi di casi d’uso – sia che si tratti di leggere le notizie, creare un annuncio audio o supporto per call center automatizzato – quindi la collaborazione con talenti vocali professionisti specifici per ogni caso d’uso ci fornisce sia il contesto che i dati vocali di alta qualità.
Aggiorniamo regolarmente e aggiungiamo nuovi stili e accenti alla nostra libreria di avatar per assicurarci di rappresentare le voci dei nostri clienti. Nello Studio di WellSaid Labs, i clienti e i marchi possono provinare diverse voci in base alla regione, allo stile e al caso d’uso, consentendo una produzione di contenuti audio più fluida e unificata personalizzata alle esigenze del produttore. Una volta che una registrazione iniziale è stata campionata, gli utenti possono richiamare parole, ortografie e pronunce specifiche per assicurarsi che l’AI parli costantemente in base alle loro esigenze.
WellSaid Labs sta affermando la sua posizione come prima piattaforma etica di voce artificiale. Perché l’etica dell’AI è importante per te?
Man mano che l’adozione dell’AI aumenta e diventa più mainstream, le paure di casi d’uso dannosi e di attori malintenzionati sono al centro di ogni conversazione – e queste preoccupazioni sono purtroppo validate da eventi reali. La voce artificiale dell’AI non fa eccezione; quasi ogni giorno, un nuovo rapporto su un personaggio famoso, una figura pubblica o un politico che viene deepfaked per pubblicità o scopi politici fa notizia. Sebbene la regolamentazione federale formale su questa tecnologia sia ancora in evoluzione, rilevare e combattere gli attori malintenzionati e gli usi dannosi della voce sintetica diventerà sempre più difficile man mano che la tecnologia continuerà ad avanzare.
Provenendo da AI2, dove l’etica dell’AI è un principio fondamentale, Michael e io abbiamo avuto queste conversazioni fin dal primo giorno. Sviluppare tecnologia di sintesi vocale dell’AI comporta responsabilità significative riguardo al consenso, alla privacy e alla sicurezza generale. Sappiamo che, in quanto sviluppatori, dobbiamo costruire la nostra tecnologia in modo sicuro, affrontare le preoccupazioni etiche e gettare le basi per lo sviluppo futuro di voci sintetiche. Riconosciamo il potenziale della tecnologia di sintesi vocale dell’AI per un uso improprio e accettiamo la responsabilità di ridurre il potenziale uso improprio del nostro prodotto. Dobbiamo gettare queste basi fin dal primo giorno, piuttosto che correre velocemente e fare errori lungo la strada. Ciò non sarebbe fare ciò che è giusto per i nostri clienti aziendali e per i doppiatori, che contano su di noi per costruire un prodotto di alta qualità e affidabile.
Sosteniamo appieno l’appello per una legislazione in questo settore; tuttavia, non aspetteremo che le norme federali siano promulgate. Abbiamo sempre dato priorità e continueremo a dare priorità a pratiche che supportano la privacy, la sicurezza, la trasparenza e la responsabilità.
Ci atteniamo strettamente al nostro codice di intenti etici aziendale, che si basa sulla costruzione di innovazioni responsabili in ogni decisione che prendiamo. Ciò è nell’interesse dei nostri clienti aziendali globali.
Come sviluppi una piattaforma di voce artificiale etica?
WellSaid Labs si è impegnata fin dall’inizio nell’innovazione etica. Centralizziamo la fiducia e la trasparenza attraverso l’uso di modelli di dati interni, requisiti di consenso espliciti, il nostro programma di moderazione dei contenuti e il nostro impegno per la protezione del marchio. In WellSaid, ci appoggiamo ai principi di AI Responsabile per plasmare le nostre decisioni e progetti, e questi principi si estendono all’uso delle nostre voci. Il nostro codice di etica rappresenta questi principi come Responsabilità, Trasparenza, Privacy e Sicurezza, e Equità.
Responsabilità: Manteniamo standard rigorosi per contenuti appropriati, vietando l’uso delle nostre voci per contenuti dannosi, odiosi, fraudolenti o intesi a incitare alla violenza. Il nostro team di Fiducia e Sicurezza sostiene questi standard con un rigoroso programma di moderazione dei contenuti, bloccando e rimuovendo gli utenti che tentano di violare i nostri Termini di Servizio.
Trasparenza: Richiediamo il consenso esplicito prima di costruire una voce sintetica con i dati vocali di qualcuno. Gli utenti non possono caricare dati vocali di politici, celebrità o chiunque altro per creare un clone della loro voce a meno che non abbiamo il consenso scritto esplicito di quella persona.
Privacy e Sicurezza: Proteggiamo le identità dei nostri doppiatori utilizzando immagini stock e alias per rappresentare le voci sintetiche. Incentiviamo anche a esercitare la cautela su come e con chi condividono la loro associazione con WellSaid Labs o altre aziende di voci sintetiche per ridurre le opportunità di abuso della loro voce.
Equità: Compensiamo tutti i doppiatori che forniscono dati vocali per la nostra piattaforma e forniamo loro una quota dei ricavi continuativa per l’uso della voce sintetica che costruiamo con i loro dati.
Insieme a questi principi, rispettiamo anche strettamente la proprietà intellettuale. Non rivendichiamo la proprietà del contenuto fornito dai nostri utenti o doppiatori. Priorizziamo l’integrità, l’equità e la trasparenza in tutto ciò che facciamo, garantendo che la nostra tecnologia di sintesi vocale dell’AI venga utilizzata in modo responsabile ed etico. Cerchiamo attivamente partnership con voci provenienti da background, organizzazioni ed esperienze diverse per garantire che la nostra libreria di voci rifletta i suoi creatori e il pubblico.
Il nostro impegno per l’innovazione responsabile e lo sviluppo della tecnologia di voce artificiale dell’AI con un’etica in mente ci distingue da altri nel settore che cercano di capitalizzare un’industria nuova e non regolamentata con qualsiasi mezzo. I nostri investimenti precoci in etica, sicurezza e privacy stabiliscono la fiducia e la lealtà all’interno dei nostri doppiatori e clienti, che cercano sempre più prodotti e servizi eticamente realizzati dalle aziende all’avanguardia dell’innovazione.
WellSaid Labs ha creato il proprio modello AI interno che ha consentito alle voci AI di raggiungere la parità umana e ciò è stato possibile introducendo le imperfezioni umane nelle conversazioni. Cosa c’è in queste imperfezioni che rende l’AI migliore e come vengono implementate?
WellSaid Labs non è solo un altro generatore di sintesi vocale. Mentre le prime tecnologie di sintesi vocale non riuscivano a riconoscere le qualità del linguaggio umano come il tono, il timbro e il dialetto che trasmettono il contesto e l’emozione dietro le parole, le voci di WellSaid hanno raggiunto la parità umana, portando uniche imperfezioni umane alla parlata generata dall’AI.
La nostra misura principale della qualità della voce è e sarà sempre la naturalità umana. Questa convinzione guida ha plasmato la nostra tecnologia in ogni fase, dalle librerie di script che abbiamo costruito alle istruzioni che diamo ai talenti e, più recentemente, a come iteriamo sui nostri algoritmi di sintesi vocale di base.
Addestriamo su vocalizzazioni umane autentiche. I nostri talenti vocali leggono i loro script in modo autentico e coinvolgente quando registrano per noi. La perfezione della parlata, d’altra parte, è un concetto meccanico che porta a un output roboticamente perfetto e innaturale. Quando i talenti vocali professionisti si esibiscono, la loro velocità di parlata fluttua. La loro sonorità si muove in concomitanza con il contenuto che stanno leggendo. Il loro tono vocale può salire in un passaggio che richiede una lettura emozionata e scendere di nuovo in una linea più sobria. Queste variazioni dinamiche compongono una performance vocale umana coinvolgente.
Costruendo processi AI che lavorano in coordinamento con le performance dinamiche dei nostri talenti, abbiamo costruito una piattaforma di sintesi vocale veramente naturale. Abbiamo sviluppato il primo sistema di sintesi vocale a lungo termine con controlli predittivi in tutto il processo creativo. La nostra libreria fonetica contiene una collezione diversificata di dati audio, consentendo agli utenti di incorporare suggerimenti vocali specifici, come la guida alla pronuncia o la controllabilità, nel modello durante la fase di produzione. Su una sola piattaforma, gli utenti di WellSaid possono registrare, modificare e personalizzare la loro voce fuori campo senza dover importare dati esterni.
Potresti discutere alcune delle sfide dietro la costruzione di un’azienda di sintesi vocale AI?
Lo sviluppo della tecnologia di voce artificiale dell’AI ha creato un insieme completamente nuovo di ostacoli per i suoi produttori e consumatori. Una delle principali sfide è non farsi travolgere dal rumore e dall’ipnosi che inonda il settore dell’AI. Come tecnologia nuova e di tendenza, molte organizzazioni stanno cercando di capitalizzare gli sviluppi a breve termine della voce artificiale dell’AI. Vogliamo fornire una voce per tutti, guidati da principi etici centrali e autenticità. Questa adesione all’autenticità può ritardare lo sviluppo e il deploy delle nostre tecnologie, ma consolida la sicurezza e la sicurezza delle voci di WellSaid e dei loro dati.
Un’altra sfida nello sviluppo della nostra piattaforma di sintesi vocale è stata quella di sviluppare linee guida di consenso specifiche per assicurarsi che le organizzazioni o gli attori individuali non abusino della nostra tecnologia. Per affrontare questa sfida, cerchiamo partnership collaborative e a lungo termine e siamo pienamente coinvolti nello sviluppo della voce per aumentare la responsabilità, la trasparenza e la sicurezza degli utenti. Cerchiamo attivamente partnership con talenti vocali provenienti da background, organizzazioni ed esperienze diverse per assicurarci che la libreria di voci di WellSaid Labs rifletta i suoi creatori e il pubblico. Questi processi sono progettati per essere intenzionali e dettagliati per garantire che la nostra tecnologia venga utilizzata in modo il più sicuro e etico possibile, il che può rallentare lo sviluppo e il lancio.
Qual è la tua visione per il futuro della voce artificiale generativa?
Per molto tempo, la tecnologia di sintesi vocale dell’AI non ha raggiunto una qualità sufficientemente alta per consentire alle aziende di creare contenuti significativi su larga scala. Ora che la tecnologia audio non richiede più attrezzature costose e hardware, tutti i contenuti scritti possono essere prodotti e pubblicati in formato audio per creare esperienze coinvolgenti e multimodali.
Oggi, le voci AI possono produrre audio umanoide e catturare le sfumature necessarie per rendere la narrazione digitale più accessibile e naturale. Il futuro della voce artificiale generativa sarà un’esperienza udibile onnicomprensiva che toccherà ogni aspetto della nostra vita. Man mano che la tecnologia continuerà ad avanzare, vedremo voci sintetiche sempre più naturali e espressive che sfumano i confini tra la parlata generata dall’uomo e dalla macchina – aprendo nuove porte per le aziende, le comunicazioni, l’accessibilità e il modo in cui interagiamo con il mondo intorno a noi.
Le aziende troveranno una maggiore personalizzazione nelle interfacce vocali AI e le useranno per rendere le interazioni con gli assistenti virtuali più immersive e user-friendly. Questi miglioramenti stanno già accadendo, dalle agenzie di call center intelligenti ai drive-thru del fast food. La creazione di contenuti, compresa la pubblicità, il marketing dei prodotti, la narrazione delle notizie, i podcast, gli audiolibri e altri media multimediali, vedrà un aumento dell’efficienza grazie all’uso di strumenti per sviluppare contenuti coinvolgenti – aumentando in definitiva il lift e i ricavi per le organizzazioni, specialmente ora che i modelli multilingue possono espandere la presenza di un’azienda da un singolo punto di origine a una presenza globale. I team di produzione troveranno un grande beneficio nelle voci sintetiche per creare voci su misura per le esigenze del marchio o personalizzate per l’ascoltatore.
Prima dell’introduzione dell’AI, la tecnologia di sintesi vocale mancava della cruciale emozione umana, intonazione e capacità di pronuncia necessarie per raccontare una storia completa su larga scala e con facilità. Ora, la sintesi vocale alimentata dall’AI offre esperienze più immersive e accessibili, comprese le capacità di parlata in tempo reale e gli agenti conversazionali interattivi.
Avere raggiunto capacità di parlata umanoide è stato un viaggio, ma ora che è raggiungibile, stiamo assistendo alla portata completa della voce AI per creare un reale valore aziendale per le organizzazioni.
Grazie per la grande intervista, i lettori che desiderano saperne di più possono visitare WellSaid Labs.












