Interviste

Nick Lahoika, Co-Fondatore e Amministratore Delegato di Vocal Image – Serie di Interviste

mm
Aggiungi Unite.AI alle tue fonti preferite su Google

Nick Lahoika è il co-fondatore e amministratore delegato di Vocal Image, una startup di coaching che aiuta le persone a sviluppare abilità sociali. Un imprenditore seriale con più di 10 anni di esperienza nel settore IT e nello sviluppo aziendale, Nick ha avuto successo con due precedenti imprese prima di creare Vocal Image. Il percorso di Nick è profondamente personale; è stato vittima di bullismo per la sua dizione poco chiara a scuola, ciò lo ha ispirato a aiutare le persone a comunicare meglio.

Dopo essere stato costretto a fuggire dal suo paese natale a seguito della rivoluzione del 2020, Nick è arrivato in Estonia con una conoscenza limitata dell’inglese e ha utilizzato la sua stessa app per allenare la sua voce, ottenendo il suo primo round di finanziamenti in soli sei mesi. Il vincitore della sfida AWS AI e del programma di startup AI europeo Meta x Hugging Face, Vocal Image ha recentemente raccolto un finanziamento di 3,6 milioni di dollari nella sua prima fase di finanziamento, guidato da Educapital (Francia) e ha raggiunto un fatturato annuo di 14 milioni di dollari.

Hai fondato Vocal Image nel 2021. Cosa ti ha ispirato a creare un coach di abilità sociali basato sull’intelligenza artificiale e quale problema stavi cercando di risolvere all’inizio?

L’ansia da parlare è stata una parte della mia vita per molto tempo. Sono stato vittima di bullismo a scuola per la mia dizione poco chiara e quell’esperienza mi è rimasta impressa. In seguito, come studente di ingegneria informatica, ho dovuto presentarmi a clienti di alto livello e la stessa paura è tornata.

Poi, nel 2021, dopo la fallita rivoluzione in Bielorussia, ho dovuto trasferirmi in Europa da un giorno all’altro. Improvvisamente, mi sono trovato a presentare a investitori in inglese, una lingua che parlavo a malapena. È stato terrificante, ma non c’era scelta. Ho trascorso ore ogni giorno a praticare la mia pronuncia utilizzando una versione molto precoce di ciò che sarebbe diventata Vocal Image. Mi ci sono volute anche settimane solo per imparare a pronunciare correttamente il suono “V” in modo da poter dire il nome della mia stessa azienda.

Abbiamo iniziato con un’app che era essenzialmente come YouTube, ma con un registratore vocale integrato e una funzione di commento. Gli utenti potevano guardare video, praticare ripetendo le linee e poi ascoltare le proprie registrazioni. Osservando come le persone utilizzavano l’app, ci siamo resi conto rapidamente che avevano disperatamente bisogno di feedback. I nostri primi utenti ci hanno mostrato che semplicemente consumare contenuti non era sufficiente per ottenere risultati reali; avevano bisogno di feedback immediati. Abbiamo provato a fornire feedback attraverso coach umani, ma quell’approccio non era scalabile, ed è così che siamo arrivati all’utilizzo dell’intelligenza artificiale.

È stata la mia intuizione personale che mi ha fatto capire che era più facile per me praticare i miei primi discorsi con la nostra piattaforma invece che con una persona. Non c’era pressione, non c’era giudizio. Quella libertà ha cambiato tutto per me. Una volta che ho risolto il mio problema, mi sono reso conto di quanti altri affrontano lo stesso problema. Più di 200 milioni di persone lottano con l’ansia da parlare.

Prima di Vocal Image, gestivi uno studio di danza. Come ha influito la tua esperienza nel movimento e nell’espressione sul tuo approccio alla comunicazione e alla fiducia vocale?

Non ero un ballerino; in realtà, ho costruito un’azienda incentrata sull’espressione di sé e sulle persone. È stato attraverso quel lavoro che mi sono reso conto che puoi capire molto di una persona solo guardandola ballare.

Il movimento gioca anche un ruolo enorme nel modo in cui ti esprimi. Il modo in cui ti muovi, la tua postura, il tuo respiro, tutto fa parte della comunicazione. È lì che l’allenamento con l’intelligenza artificiale diventa potente, poiché può aiutare le persone ad allenarsi in tutte quelle aree in un unico luogo.

Prima, le aziende dovevano assumere diversi coach. Uno per la comunicazione pubblica, uno per il linguaggio del corpo, uno per la fiducia. Ora, con l’intelligenza artificiale, tutto è connesso. Puoi costruire l’intero quadro della comunicazione, non solo un pezzo di essa.

A differenza della maggior parte degli strumenti di comunicazione basati sull’intelligenza artificiale, hai deciso di non utilizzare ChatGPT come base per il tuo coach. Cosa ti ha portato a questa decisione?

L’entusiasmo intorno a ChatGPT è diventato un punto di svolta importante per noi. Quando è diventato mainstream, ha creato un’enorme ondata di fiducia nell’intelligenza artificiale, e siamo stati in grado di sfruttarla per far credere alle persone nella nostra tecnologia.

Ma ecco il punto: non volevamo assolutamente utilizzarlo come base. Il nostro obiettivo fin dall’inizio era utilizzare il nostro modello unico per valutare le voci e i modelli di parlato delle persone. Utilizziamo grandi modelli linguistici come Gemini, Claude e ChatGPT, e conoscenze, suggerimenti e trucchi dalla letteratura sulla comunicazione nei nostri modelli attuali, ma non sono il nucleo del nostro meccanismo di feedback. La vera base del nostro feedback è l’input umano.

La paura che l’allenamento con l’intelligenza artificiale possa sembrare robotico è reale. Per contrastare questo, abbiamo creato una comunità all’interno di Vocal Image dove gli utenti possono connettersi istantaneamente, condividere l’obiettivo comune di migliorare la loro comunicazione e sostenere a vicenda il loro percorso. E questa comunità cresce costantemente e migliora la nostra intelligenza artificiale.

Puoi spiegare come l’allenamento del tuo modello di intelligenza artificiale esclusivamente su voci umane differisce dagli approcci tradizionali basati sui grandi modelli linguistici in termini di risultati e autenticità?

Utilizziamo grandi modelli linguistici come parte del processo di valutazione e contesto, ma la vera base del nostro sistema è il dato che lo sostiene. Il nostro modello principale è stato addestrato sulla nostra comunità, composta da persone che si sono unite specificamente per migliorare le loro abilità di comunicazione.

L’intelligenza artificiale è solo buona quanto gli esseri umani da cui impara. Il nostro set di dati proprietario include ora oltre un milione di voci umane uniche, ognuna con tono, ritmo ed emozione, tutte rappresentanti l’essenza reale della comunicazione.

Il tuo set di dati include oltre un milione di voci umane. Quali sfide hai affrontato nella cura e nell’etichettatura di un corpus così unico?

Non puoi affidarti ugualmente a ogni punto dati. Alcuni utenti valutano con attenzione, altri semplicemente cliccano. Abbiamo dovuto progettare un sistema che distingua i feedback pensati dal rumore. Nel tempo, abbiamo imparato a dare più peso agli utenti con una partecipazione coerente e un giudizio affidabile, filtrando fuori l’input casuale.

La parte più difficile è stata operativa, che ha comportato la costruzione di un ecosistema di valutazione che premia la qualità sulla quantità. È lì che la nostra comunità è diventata inestimabile. Queste non sono utenti internet casuali, sono persone che cercano sinceramente di migliorare le loro abilità sociali e aiutare gli altri a fare lo stesso. Tutte le valutazioni sono anonime, il che aiuta a mantenere i feedback imparziali e autentici.

Il meccanismo di valutazione “simile a Tinder” basato sulla comunità è affascinante — come funziona questo ciclo di feedback per plasmare l’apprendimento continuo del tuo modello di intelligenza artificiale?

Ogni valutazione, in ogni lingua, diventa un piccolo pezzo di intelligenza che raffina il nostro modello. È un ciclo di feedback vivo. Più le persone si allenano e valutano, più il sistema diventa intelligente nel riconoscere le sfumature del parlato e dell’emozione, imparando come le persone percepiscono realmente la fiducia, la calma o l’autorità attraverso le culture.

Quali sono state le lezioni chiave apprese durante lo sviluppo di un modello di intelligenza artificiale incentrato sulle abilità sociali piuttosto che sulle competenze tecniche?

La sfida principale è stata la misurazione. Non c’è un metro universale per “degno di fiducia” o “carismatico”. Abbiamo dovuto crearne uno nostro.

È qui che entra in gioco la Legge dei grandi numeri. Se 100.000 persone concordano che una certa voce suona fiduciosa o empatica, puoi iniziare a fidarti di quella percezione collettiva. Nel tempo, abbiamo insegnato al nostro modello di intelligenza artificiale a prevedere qualità soggettive, cose che non possono essere valutate con un semplice giusto o sbagliato. Quella è stata la svolta: imparare a quantificare ciò che era sempre stato considerato intangibile.

Con 14 milioni di dollari di entrate annuali ricorrenti e un nuovo finanziamento di 3,6 milioni di dollari nella prima fase, quali sono le tue principali priorità per la prossima fase di crescita — se si tratta di avanzare il modello di intelligenza artificiale, espandere la base di utenti o approfondire l’esperienza della comunità?

La nostra missione è sempre stata incentrata sull’essere umano. Aiutiamo le persone a comunicare con più fiducia e autenticità.

La prossima fase è quella di scalare quell’impatto a livello globale. Stiamo espandendo in nuove lingue e geografie, e sviluppando nuovi moduli di abilità sociali come la negoziazione, l’ascolto attivo e l’eloquenza.

Molti utenti dicono che i coach di intelligenza artificiale sembrano robotici o impersonali. Come assicuri che Vocal Image fornisca feedback emotivamente risonanti e consapevoli del contesto?

Ci concentriamo sull’iper-personalizzazione. Dalla prima interazione, impariamo chi sei, inclusi il tuo accento, la tua età, il tuo contesto professionale e i tuoi modelli di parlato. Nel tempo, abbiamo memoria, ricordando come hai migliorato, dove lotti e quale feedback risuona di più.

Ciò consente all’intelligenza artificiale di adattarsi dinamicamente. L’esperienza sembra personale perché lo è. È plasmata interamente dai tuoi dati e dal tuo percorso, non da uno script generico.

Guardando avanti, come vedi l’evoluzione della formazione alle abilità sociali basata sull’intelligenza artificiale mentre l’intelligenza artificiale generativa e emotiva continua a maturare?

Lo sviluppo umano è sempre stato un mix di natura e cultura. La scienza ci dice che il leadership è approssimativamente metà innata, metà appresa. La parte appresa un tempo era riservata agli esecutivi che potevano permettersi coach costosi. Per lungo tempo, le aziende hanno dovuto spendere tra i 7.000 e i 25.000 dollari all’anno per la formazione di un singolo leader. L’intelligenza artificiale cambia questo.

Inoltre, interagire con trainer umani richiederebbe il mantenimento di molti coach separati, mentre un coach di intelligenza artificiale può sostituirli tutti.

Al momento, utilizziamo una pipeline di diversi modelli per analizzare diversi aspetti della comunicazione, ma il futuro è un sistema unificato che valuta e guida in modo olistico. Questa tecnologia democratizzerà la crescita. Non avrai bisogno di essere nato carismatico o avere un grande budget aziendale per padroneggiare la comunicazione. Avrai solo bisogno di curiosità e accesso, e creare l’ambiente perché questo fiorisca è ciò che mi guida ogni giorno.

Grazie per la grande intervista, i lettori che desiderano saperne di più possono visitare Vocal Image.

Antoine è un leader visionario e socio fondatore di Unite.AI, guidato da una passione incrollabile per plasmare e promuovere il futuro dell'AI e della robotica. Un imprenditore seriale, crede che l'AI sarà così disruptiva per la società come l'elettricità, e spesso si lascia trasportare dall'entusiasmo per il potenziale delle tecnologie disruptive e dell'AGI.

Come futurista, è dedicato a esplorare come queste innovazioni plasmeranno il nostro mondo. Inoltre, è il fondatore di Securities.io, una piattaforma focalizzata sugli investimenti in tecnologie all'avanguardia che stanno ridefinendo il futuro e riplasmando interi settori.