Interviste

Jaime Bosch, CEO, Voicemod – Intervista alla serie

mm
Aggiungi Unite.AI alle tue fonti preferite su Google

Jaime Bosch è il CEO di Voicemod un software gratuito per cambiare la voce per gamer, creatori di contenuti e vtuber.

Potresti condividere la storia di genesi dietro Voicemod?

Sono l’ottavo di 10 figli, sono cresciuto in un ambiente in cui potevo sviluppare appieno il mio spirito imprenditoriale fin da molto giovane, poiché c’era sempre il sostegno di fratelli e sorelle con mentalità simili.

Di conseguenza, era solo questione di tempo che due dei miei fratelli e io, tutti condividendo un profondo amore per la tecnologia e la musica, giocassimo con l’idea di creare un’app che combinasse i nostri interessi. Quindi, nel 2009, lo facemmo e creammo un’app di musica B2C come attività secondaria all’attività principale dello studio che stavamo gestendo.

Essendo un progetto secondario, sperimentammo molto con cose come la modulazione della voce, che ci ispirò a creare qualcosa di completamente nuovo e originale. Il risultato di ciò fu ciò che chiamammo l'”esperienza Voicemod” – un modo completamente nuovo di sperimentare la propria voce – che divenne la forza trainante dell’evoluzione dell’app. Indipendentemente da chi provava il nostro software, continuavamo a incontrare le stesse reazioni dalle persone che sperimentavano l’app: risate e meraviglia nel sentire se stessi in un modo completamente diverso.

Questo ci portò a ridefinire la nostra visione del prodotto, in qualcosa che potesse alla fine evolvere la connessione umana attraverso il mezzo del suono. Quindi, portammo l’esperienza dal mobile al PC, dove fu immediatamente adottata dalla scena di gioco e streaming in espansione – e il resto, come si dice, è “storia”.

Voicemod era inizialmente un progetto secondario — quando ti sei reso conto che volevi dedicarti a tempo pieno?

Inizialmente, i miei fratelli e io avevamo uno studio insieme chiamato 2taptap. Quando abbiamo avuto l’idea di creare Voicemod, all’inizio era solo un divertente progetto secondario, ma con il passare del tempo, vedemmo come le persone interagivano con esso e il tipo di potenziale che la tecnologia aveva. Fino a quel punto, la maggior parte della tecnologia di modifica della voce era asincrona, quindi essere in grado di sperimentare di essere qualcun altro in un ambiente in tempo reale era una novità per molte persone. Il momento decisivo per noi, tuttavia, fu la realizzazione che le persone stavano utilizzando la nostra tecnologia non solo per divertirsi, ma per plasmare il loro intero modo di esprimersi online. Questo è quando ci rendemmo conto che stavamo costruendo qualcosa che non era solo questione di intrattenimento, ma forse il prossimo passo nell’evoluzione delle esperienze audio sociali.

Potresti discutere alcune delle tecnologie di riconoscimento vocale?

Con la gamma di cambiatori di voce nel nostro catalogo, ci sono processi che vengono eseguiti per prendere una voce umana normale e trasformarla in qualcosa di nuovo. Naturalmente, ci sono anche aspetti nella voce di una persona che devono essere presi in considerazione, come l’età, il genere, l’emozione e le semplici variazioni nel modo in cui una persona parla.

Queste variazioni contribuiscono a come qualcuno possa suonare e influenzare i cambiamenti che vengono applicati. Sfruttiamo elementi dalle tecnologie di riconoscimento vocale all’avanguardia per facilitare la conversione e la trasformazione della voce in modo il più preciso possibile — e stiamo continuamente migliorando questo processo. Vogliamo dare alle persone l’opportunità di strutturare come sono percepiti, suonare come desiderano essere ascoltati e offrire una grande esperienza di ascolto al loro pubblico.

Perché è importante aiutare le persone a esprimersi attraverso il suono?

Dal momento in cui nasciamo e il primo urlo di un bambino, il suono è il modo naturale attraverso il quale impariamo a esprimerci. Man mano che cresciamo, l’importanza della comunicazione audio continua a crescere, poiché impariamo a plasmare il suono nel linguaggio e a utilizzare le nostre voci per aggiungere emozione e sfumatura alle parole che parliamo. Alzando il tono della voce, possiamo segnalare eccitazione – o utilizzare effetti sonori come sospiri o gemiti per mettere particolare enfasi sui punti che vogliamo fare.

Per alcune persone veramente talentuose, la voce è uno strumento per un’espressione illimitata – poiché possono creare un numero illimitato di effetti sonori o voci. La maggior parte di noi, tuttavia, non è così fortunata e in realtà si sente a disagio con la propria voce (soprattutto quando la si ascolta registrata). Alcuni dei nostri utenti parlano di sentirsi nervosi quando parlano di fronte a estranei e sono frustrati per non essere in grado di esprimersi correttamente nel modo in cui vorrebbero.

Questo è dove vediamo un’enorme opportunità per aiutare le persone. Con le nostre identità vocali, gli utenti possono plasmare le loro voci per essere qualcosa con cui si sentono a loro agio – o anche scivolare in diverse voci per situazioni specifiche. Vogliamo anche potenziarli per utilizzare effetti sonori, clip musicali o emoji audio per creare un’atmosfera, trasmettere il contesto o implementare effetti comici – simili a come gli emoji grafici hanno aiutato a plasmare la comunicazione testuale.

Hai descritto Voicemod come l’evoluzione della connessione umana attraverso il suono, potresti elaborare su questo?

Oltre a liberare il relatore e rimuovere un certo blocco mentale che impedisce alle persone di parlare, stiamo anche lavorando per rendere questa connessione più profonda. Ad esempio, la nostra soundboard prende la comunicazione e la eleva al livello successivo — pensala come un “emoji audio”. Puoi immaginare persone sotto i 35 anni che chiacchierano senza utilizzare gli emoji? Mentre questa tecnologia esiste da quello che sembra un’eternità, è veramente diventata profondamente radicata nella nostra comunicazione solo da circa il 2010. Abbiamo visto una tendenza simile con gli adesivi sulle piattaforme di messaggistica, l’ascesa della messaggistica vocale e delle note vocali, e ora l’uso emergente di GIF e Giphy. Con la scalabilità delle comunicazioni audio in tutto il mondo, l’importanza di come utilizziamo il suono sta aumentando. Inviare una reazione audio alla battuta di un amico può dire molto di più sulla tua reazione onesta rispetto a digitare una frase. Immagina la differenza tra sentire il suono dei grilli e ba dum tss! Tutti hanno significati e sentimenti molto diversi che puoi facilmente comunicare con un solo clic.

Vogliamo rendere il più facile possibile per gli utenti utilizzare voci, effetti vocali e emoji audio per avere conversazioni audio più coinvolgenti con amici, familiari o estranei.

Quali sono alcune delle tecnologie di apprendimento automatico dietro l’app Voicemod, compreso il permettere agli utenti di suonare meglio e personalizzare la loro voce intorno alla loro voce reale?

L’apprendimento automatico è al cuore della maggior parte delle nuove funzionalità di Voicemod.

Per quanto riguarda il lato creativo, Voicelab di Voicemod ha creato la prima tecnologia di conversione vocale in tempo reale sul mercato che consentirà agli utenti di scegliere la propria identità sonica, creando voci personalizzate per ciascuno.

Con la nostra nuova tecnologia avanzata che verrà rilasciata presto, creiamo voci mai sentite prima con caratteristiche uniche che aiuteranno a proteggere la privacy e la sicurezza degli utenti, consentendo loro allo stesso tempo di creare la personalità desiderata attraverso il suono.

Abbiamo anche osservato l’emergere di metodologie di apprendimento profondo basate sui dati negli ultimi anni. Questi consentono di apprendere strutture nascoste astratte all’interno dei segnali di parlato relative a caratteristiche percettive della voce come fonologia, contenuto, identità, intenzione e umore. Sfruttando queste tecnologie, possiamo controllare e modificare gli aspetti percettivi del segnale. Ciò ci consente di progettare tecnologie che danno agli utenti un maggiore controllo sulle loro identità vocali percepite in un modo che non era possibile prima.

Quali sono alcuni dei casi d’uso per l’app Voicemod?

La grande cosa di Voicemod è che i suoi strumenti servono una vasta gamma di esigenze e scenari. Le situazioni più comuni sarebbero per la creazione di contenuti, il gioco con gli amici, il chiacchierare con la famiglia o gli amici, la creazione di ambienti di role-playing immersivi o anche per il lavoro e gli affari – dove gli utenti utilizzano principalmente i nostri strumenti di cancellazione del rumore e miglioramento audio.

Potresti discutere alcune delle sfide e dei benefici di lanciare una startup con i fratelli?

Onestamente, mi piacerebbe, e so che naturalmente tutti affrontano sfide in qualche modo, ma in realtà non ricordo molte nel nostro caso. Il motivo è che proveniamo da una famiglia molto grande. Stavamo sempre facendo qualcosa insieme, dai progetti dell’infanzia al gioco e alla creazione. Era solo naturale che alla fine finissimo per lavorare insieme. I miei fratelli Fernando e Juan — che, come ho menzionato, hanno cofondato Voicemod con me — avevano già diverse aziende insieme, quindi avevano molta esperienza in tal senso. Mi unii a loro nel 2010 nella loro azienda, che era 2taptap, quindi ebbi un’idea di cosa significasse. Ciò significa che quando creammo Voicemod, lo facemmo completamente allineati su ciò che volevamo realizzare e, cosa più importante, su come volevamo realizzarlo. Di conseguenza, ha veramente aiutato a portare una forte cultura di valori allineati in Voicemod, che è stata una chiave fondamentale per il nostro successo.

C’è qualcos’altro che ti piacerebbe condividere su Voicemod?

C’è molto in corso dietro le quinte, ma in linea con il nostro desiderio di evolvere il suono per tutti, stiamo attualmente lavorando su qualcosa per rendere la nostra tecnologia ancora più… accessibile. Un modo per qualsiasi sviluppatore di utilizzare la nostra tecnologia nel proprio prodotto

Sappiamo che le persone trascorrono la maggior parte del loro tempo di veglia online, collegati, esprimendosi su varie piattaforme e applicazioni. In ambienti online, il tuo “avatar” è la tua intera rappresentazione. E realmente, chi è quella persona senza una voce?

Costruire tecnologia di modifica vocale in tempo reale e sviluppare un sistema di espressioni soniche completamente personalizzabili è un lavoro molto impegnativo. Il nostro team ha preso quel passo fuori dall’equazione progettando un intero kit che può essere facilmente integrato dagli sviluppatori ovunque. Siamo estremamente entusiasti di rendere la nostra tecnologia accessibile agli sviluppatori e agli utenti di tutto il mondo, poiché continuiamo a costruire il futuro delle esperienze audio sociali!

Grazie per la grande intervista, i lettori che desiderano saperne di più possono visitare Voicemod

Antoine è un leader visionario e socio fondatore di Unite.AI, guidato da una passione incrollabile per plasmare e promuovere il futuro dell'AI e della robotica. Un imprenditore seriale, crede che l'AI sarà così disruptiva per la società come l'elettricità, e spesso si lascia trasportare dall'entusiasmo per il potenziale delle tecnologie disruptive e dell'AGI.

Come futurista, è dedicato a esplorare come queste innovazioni plasmeranno il nostro mondo. Inoltre, è il fondatore di Securities.io, una piattaforma focalizzata sugli investimenti in tecnologie all'avanguardia che stanno ridefinendo il futuro e riplasmando interi settori.