Intervjuer

Jaime Bosch, VD, Voicemod – Intervju-serie

mm
Lägg till Unite.AI bland dina föredragna källor på Google

Jaime Bosch är VD för Voicemod, ett gratis program för röstförändring för spelare, innehållsskapare och vtubers.

Kan du dela med dig av Voicemods ursprungshistoria?

Jag växte upp som det åttonde av tio barn i en miljö där jag kunde utveckla min entreprenöriella anda från en mycket ung ålder, eftersom det alltid fanns stöd från likasinnade syskon.

Som sådan var det bara en tidsfråga innan två av mina bröder och jag, alla med en djup kärlek till teknik och musik, lekte med idén att skapa en app som kombinerade våra intressen. Så, 2009, gjorde vi just det och skapade en B2C-musikapp som en sidoverksamhet till studion som vi drev som vår huvudsakliga sysselsättning.

Som det var en sidoverksamhet, experimenterade vi mycket med saker som röstmodulering, vilket inspirerade oss att skapa något helt nytt och banbrytande. Resultatet av detta var vad vi kallade “Voicemod-upplevelsen” – ett helt nytt sätt att uppleva din egen röst – som blev den drivande kraften bakom appens utveckling. Oavsett vem som testade vår programvara, mötte vi alltid samma sorts reaktioner från människor som upplevde appen: skratt och förvåning över att höra sig själv på ett helt annat sätt.

Detta ledde oss att omforma vår vision för produkten till något som kunde utveckla mänsklig kontakt genom ljudmediet. Så vi förde över upplevelsen från mobil till PC, där den direkt togs upp av den exploderande spelande- och strömningsscenen – och resten, som man säger, är “historia”.

Voicemod var initialt ett sidoprojekt – när förstod du att du ville satsa allt på det?

Initialt hade mina bröder och jag ett studio tillsammans som hette 2taptap. När vi kom på idén att skapa Voicemod var det initialt bara ett roligt sidoprojekt, men med tiden såg vi hur människor interagerade med det och den sorts potential som tekniken hade. Fram till den punkten var de flesta röstförändringsteknologier asynkrona, så att kunna uppleva att vara någon annan i en realtidsmiljö var nytt för många människor. Den avgörande ögonblicket för oss var insikten att människor använde vår teknik inte bara för att ha kul, utan för att forma hela sitt sätt att uttrycka sig online. Det var då vi förstod att vi byggde något som inte bara handlade om underhållning, utan möjligen om nästa steg i utvecklingen av sociala ljudupplevelser.

Kan du diskutera några av de röstigenkänningsteknologier som används?

Med den mängd röstförändrare i vår katalog, finns det processer som genomförs för att ta en vanlig mänsklig röst och förvandla den till något nytt. Naturligtvis finns det också aspekter i en persons röst som måste beaktas, såsom ålder, kön, känsla och enkla variationer i hur man talar.

De här variationerna bidrar till hur någon kan låta och påverkar de förändringar som appliceras. Vi använder inslag från den senaste röstigenkänningsteknologin för att underlätta röstomvandling och transformation så exakt som möjligt – och vi förbättrar kontinuerligt den här processen. Vi vill ge människor möjligheten att strukturera hur de uppfattas, låta som de vill bli hörda och ge en bra lyssnarupplevelse för deras publik.

Varför är det viktigt att hjälpa människor uttrycka sig genom ljud?

Från den stund vi föds och ett barns första skrik, är ljud det naturliga sättet genom vilket vi lär oss att uttrycka oss. När vi blir äldre fortsätter ljudkommunikationens betydelse att växa, eftersom vi lär oss att forma ljudet till språk och använda vår röst för att lägga känsla och nyanser i de ord vi talar. Genom att höja röstens tonhöjd kan vi signalera upphetsning – eller använda ljud som suckar eller stön för att lägga särskild betoning på de punkter vi vill göra.

För vissa extremt begåvade människor är rösten ett instrument för obegränsad uttrycksförmåga – de kan skapa ett obegränsat antal ljud eller röster. De flesta av oss är dock inte så lyckliga och känner oss faktiskt obekväma med våra röster (särskilt när vi hör dem inspelade). Några av våra användare pratar om att känna sig nervösa när de talar inför främlingar och är frustrerade över att inte kunna uttrycka sig på det sätt de vill.

Det är här vi ser en enorm möjlighet att hjälpa människor. Med våra röstidentiteter kan användarna forma sina röster till något de känner sig bekväma med – eller till och med glida in i olika röster för specifika situationer. Vi vill också ge dem möjlighet att använda ljud, musikklipp eller ljud-emojis för att skapa atmosfär, förmedla sammanhang eller implementera komiska effekter – liknande hur grafiska emojis har hjälpt forma textkommunikation.

Du har beskrivit Voicemod som en utveckling av mänsklig kontakt genom ljud, kan du utveckla det?

Förutom att befria talaren och ta bort en viss mental blockering som hindrar människor från att tala, arbetar vi också med att göra den här kontakten djupare. Till exempel tar vår ljudpanel kommunikationen och höjer den till nästa nivå – tänk på det som en “ljud-emoji”. Kan du föreställa dig människor under 35 år som chattar utan att använda emojis? Medan den här tekniken har funnits i vad som känns som en evighet, har den verkligen bara blivit djupt inbäddad i vår kommunikation sedan cirka 2010. Vi såg en liknande trend med stickers på meddelandeprogram, uppkomsten av röstmeddelanden och röstnoter, och nu den framväxande användningen av GIF och Giphy. Med den globala ökningen av ljudkommunikation, ökar betydelsen av hur vi använder ljud. Att skicka en ljudreaktion på en vänns skämt kan berätta mycket mer om din äkta, ärliga reaktion än att bara skriva en mening. Tänk på skillnaden mellan att höra ljudet av cikador och ba dum tss! De bär alla på väldigt olika betydelser och känslor som du kan enkelt kommunicera med bara ett klick.

Vi vill göra det så enkelt som möjligt för användare att använda röster, rösteffekter och ljud-emojis för att ha mer engagerande ljudkonversationer med vänner, familj eller främlingar.

Vilka är några av de maskinlärningsteknologier som ligger bakom Voicemod-appen, inklusive möjligheten att låta bättre och anpassa sin röst utifrån den verkliga rösten?

Maskinlärning ligger i hjärtat av de flesta av Voicemods nya funktioner.

När det gäller den kreativa sidan, har Voicemods Voicelab skapat den första realtidsröstkonverteringsteknologin på marknaden som kommer att låta användare välja sin egen ljudidentitet, skapa personliga röster för var och en.

Med vår nya, avancerade teknik som snart kommer att släppas, skapar vi aldrig tidigare hörda röster med unika egenskaper som kommer att hjälpa till att skydda användarnas integritet och säkerhet, samtidigt som de låter dem skapa sin önskade personlighet genom ljud.

Vi har också observerat data-drivna djupinlärningsmetoder som har dykt upp under de senaste åren. Dessa möjliggör för oss att lära oss abstrakta, dolda strukturer inom tal-signalerna som rör perceptuella egenskaper hos rösten, såsom fonologi, innehåll, identitet, avsikt och humör. Genom att utnyttja dessa teknologier kan vi kontrollera och modifiera de perceptuella aspekterna av signalen. Detta låter oss designa teknologier som ger användarna mer kontroll över sina upplevda röstidentiteter på ett sätt som inte var möjligt tidigare.

Vilka är några av användningsområdena för Voicemod-appen?

Det fantastiska med Voicemod är att dess verktyg tjänar en stor variation av behov och scenarier. De vanligaste situationerna skulle vara för innehållsskapande, spelande med vänner, chattande med familj eller vänner, skapande av immersiva rollspelsmiljöer eller till och med för arbete och företag – där användare främst använder våra brusreducerings- och ljudförbättringsverktyg.

Kan du diskutera några av utmaningarna och fördelarna med att starta ett företag med syskon?

Ärligt talat skulle jag älska att, och jag vet att alla naturligtvis står inför utmaningar på något sätt, men jag kan faktiskt inte komma ihåg många i vårt fall. Anledningen är att vi kommer från en mycket stor familj. Vi gjorde alltid något tillsammans, från barndomsprojekt till att spela musik och skapa. Det var bara naturligt att vi skulle hamna i ett läge där vi arbetar tillsammans. Mina bröder Fernando och Juan – som jag nämnde var med och grundade Voicemod tillsammans med mig – hade redan flera företag tillsammans, så de hade gott om erfarenhet i det avseendet. Jag anslöt mig till dem 2010 i deras företag, som hette 2taptap, så jag fick en känsla för det också. Det betyder att när vi skapade Voicemod gjorde vi det helt i linje med vad vi ville uppnå och, ännu viktigare, hur vi ville uppnå det. Det har verkligen hjälpt till att skapa en stark kultur av samstämmiga värderingar i Voicemod, vilket har varit en verklig nyckel till vår framgång.

Finns det något annat du skulle vilja dela om Voicemod?

Det händer mycket bakom kulisserna, men i linje med att vi vill utveckla ljud för alla, arbetar vi just nu med något som kommer att göra vår teknik ännu… tillgängligare. Ett sätt för alla utvecklare att använda vår teknik i sina produkter

Vi vet att människor tillbringar större delen av sin vakna tid online, anslutna, uttrycker sig på olika plattformar och applikationer. I online-miljöer är din “avatar” din helhetliga självrepresentation. Och vem är den personen utan en röst?

Att bygga realtidsröstförändringsteknik och utveckla ett system för fullt anpassningsbara ljuduttryck är ett stort arbete. Vårt team har tagit det steget ur ekvationen genom att designa en hel uppsättning som lätt kan integreras av utvecklare var som helst. Vi är extremt glada över att göra vår teknik tillgänglig för utvecklare och användare över hela världen, samtidigt som vi fortsätter att bygga framtiden för sociala ljudupplevelser!

Tack för det underbara samtalet, läsare som vill lära sig mer kan besöka Voicemod.

Antoine är en visionär ledare och medgrundare av Unite.AI, driven av en outtröttlig passion för att forma och främja framtidens AI och robotik. En serieentreprenör, han tror att AI kommer att vara lika störande för samhället som elektricitet, och han fångas ofta i att prata om potentialen för störande teknologier och AGI.

Som en futurist är han dedikerad till att utforska hur dessa innovationer kommer att forma vår värld. Dessutom är han grundare av Securities.io, en plattform som fokuserar på att investera i banbrytande teknologier som omdefinierar framtiden och omformar hela sektorer.