Interviews

Jaime Bosch, CEO, Voicemod – Interviewserie

mm
Føj Unite.AI til dine foretrukne kilder på Google

Jaime Bosch er administrerende direktør for Voicemod, et gratis stemmeændringssoftware til gamere, indholdsskabere og vtubere.

Kan du dele historien om Voicemods oprindelse?

Da jeg var det 8. af 10 børn, voksede jeg op i en omgang, hvor jeg kunne udfolde min iværksætterånd fra en meget ung alder, da der altid var støtte fra ligesindede søskende.

Som sådan var det kun et spørgsmål om tid, før to af mine brødre og jeg, alle med en dyb kærlighed til teknologi og musik, legede med idéen om at skabe en app, der kombinerede vores interesser. Så i 2009 gjorde vi det og skabte en B2C-musikapp som en sideløbende virksomhed til studieforretningen, vi drev som vores hovedbeskæftigelse.

Da det var en sideløbende virksomhed, eksperimenterede vi meget med ting som stemmeændring, som inspirerede os til at skabe noget helt nyt og nyt. Resultatet af dette var, hvad vi kaldte “Voicemod-oplevelsen” – en helt ny måde at opleve din egen stemme på – som blev drivkraften bag appens udvikling. Uanset hvem der prøvede vores software, mødte vi altid den samme type reaktioner fra folk, der oplevede appen: latter og forundring over at høre sig selv på en helt anden måde.

Dette førte os til at omforme vores vision for produktet til noget, der kunne udvikle menneskelig forbindelse gennem lyden. Så vi bragte oplevelsen fra mobil til PC, hvor den straks blev optaget af det eksploderende gaming- og streaming-scene – og resten er, som man siger, “historie”.

Voicemod var oprindeligt et sideløbende projekt – hvornår indså du, at du ville satse alt på det?

Initialt havde mine brødre og jeg et studie sammen kaldet 2taptap. Da vi fik idéen til at skabe Voicemod, var det initialt kun et sjovt sideløbende projekt, men efterhånden som tiden gik, så vi, hvordan folk interagerede med det, og den slags potentiale, teknologien havde. Indtil da var de fleste stemmeændrings-teknologier asynkrone, så at kunne opleve at være nogen andre i en realtidsindstilling var nyt for mange mennesker. Det afgørende øjeblik for os var indsigt i, at folk brugte vores teknologi til ikke kun at have det sjovt, men til at forme deres hele måde at udtrykke sig online på. Dette var, da vi indså, at vi byggede noget, der ikke kun handlede om underholdning, men muligvis det næste skridt i fremtiden for sociale lydoplevelser.

Kan du diskutere nogle af de stemme-genkendelsesteknologier?

Med vores udvalg af stemmeændrere i vores katalog er der processer, der gennemføres for at tage en almindelig menneskestemme og forvandle den til noget nyt. Selvfølgelig er der også aspekter i en persons stemme, der skal tages i betragtning, såsom alder, køn, følelse og blot enkle variationer i, hvordan man taler.

Disse variationer bidrager til, hvordan nogen kan lyde, og påvirker ændringerne, der anvendes. Vi udnytter elementer fra state-of-the-art stemme-genkendelsesteknologi til at faciliterer stemmeomdannelse og -transformation så nøjagtigt som muligt – og vi arbejder løbende på at forbedre denne proces. Vi vil give folk mulighed for at strukturere, hvordan de opfattes, lyde, som de ønsker at blive hørt, og give en god lytteroplevelse til deres publikum.

Hvorfor er det vigtigt at hjælpe folk med at udtrykke sig gennem lyd?

Fra det øjeblik, vi er født, og et barns første skrig, er lyd den naturlige måde, vi lærer at udtrykke os på. Da vi bliver ældre, fortsætter lydkommunikationens betydning med at vokse, da vi lærer at forme lyden til sprog og bruge vores stemmer til at give følelse og nuance til de ord, vi taler. Ved at hæve tonelejet på vores stemme kan vi signalere begejstring – eller bruge lydeffekter som suk eller støn til at give særlig vægt til punkter, vi vil fremhæve.

For nogle virkelig talentfulde mennesker er stemmen et instrument for ubegrænset udtryk – de kan skabe en ubegrænset mængde lydeffekter eller stemmer. De fleste af os er dog ikke så heldige og føler os faktisk ubekvemt med vores stemmer (især når vi hører dem optaget). Nogle af vores brugere taler om, at de føler sig nervøse, når de taler foran fremmede, og er frustrerede over ikke at kunne udtrykke sig ordentligt på den måde, de gerne vil.

Dette er, hvor vi ser en enorm mulighed for at hjælpe folk. Med vores stemmeidentiteter kan brugerne forme deres stemmer til noget, de føler sig komfortable med – eller endda glide ind i forskellige stemmer til bestemte situationer. Vi vil også gerne give dem mulighed for at bruge lydeffekter, musikklip eller lyd-emojis til at skabe atmosfære, give kontekst eller implementere komiske effekter – ligesom grafiske emojis har hjulpet med at forme tekstkommunikation.

Du har beskrevet Voicemod som udvikling af menneskelig forbindelse gennem lyd – kan du uddybe dette?

Ud over at frigøre taleren og fjerne en vis mental blokering, der stopper folk fra at tale, arbejder vi også på at gøre denne forbindelse dybere. For eksempel tager vores lydpanel kommunikation og hæver den til næste niveau – tænk på det som en “lyd-emoji”. Kan du forestille dig, at folk under 35 år chatter uden at bruge emojis? Mens denne teknologi har eksisteret i, hvad der føles som en evighed, er det først for nylig blevet dybt integreret i vores kommunikation. Vi så en lignende trend med stickers på messagingsplatforme, opkomsten af stemmebeskeder og stemmenoter, og nu det opblomstrende brug af GIF’er og Giphy. Med skalaen af verdensomspændende lydkommunikation øges betydningen af, hvordan vi bruger lyd. At sende en lydreaktion på en vittighed kan fortælle meget mere om din ærlige reaktion end blot at skrive en sætning. Forestil dig forskellen på at høre lyden af cikader og ba dum tss! De holder alle forskellige betydninger og følelser, som du let kan kommunikere med et klik.

Vi vil gøre det så let som muligt for brugerne at bruge stemmer, stemmeeffekter og lyd-emojis til at have mere engagerende lydkommunikation med venner, familie eller fremmede.

Hvad er nogle af de maskinlærings-teknologier bag Voicemod-appen, herunder muligheden for brugere for at lyde bedre og tilpasse deres stemme efter deres virkelige stemme?

Maskinlæring er i hjertet af de fleste af de nye Voicemod-funktioner.

Med hensyn til den kreative side har Voicemods Voicelab skabt den første realtids stemmeomdannelsesteknologi på markedet, der giver brugerne mulighed for at vælge deres egen lydidentitet, og skabe personlige stemmer til hver enkelt.

Med vores nye, avancerede teknologi, der snart vil blive udgivet, skaber vi aldrig set før hørt stemmer med unikke karakteristika, der vil hjælpe med at beskytte brugernes privatliv og sikkerhed, samtidig med at de giver dem mulighed for at skabe deres ønskede personlighed gennem lyd.

Vi har også observeret data-drevne dybde-læringsmetoder, der er opstået i de seneste år. Disse metoder giver os mulighed for at lære abstrakte, skjulte strukturer inden for tale-signaler, der vedrører perceptuelle karakteristika af stemmen, såsom fonologi, indhold, identitet, intention og humør. Ved at udnytte disse teknologier kan vi kontrollere og modificere de perceptuelle aspekter af signalet. Dette giver os mulighed for at designe teknologier, der giver brugerne mere kontrol over deres opfattede stemmeidentiteter på en måde, der ikke var mulig før.

Hvad er nogle af brugsændelserne for Voicemod-appen?

Det fantastiske ved Voicemod er, at dens værktøjer kan tilgodese en bred vifte af behov og scenarier. De mere almindelige situationer ville være til indholdsskabelse, gaming med venner, snak med familie eller venner, skabelse af immersiv rollespils-miljøer eller endda til arbejde og forretning – hvor brugerne primært bruger vores støjreducering og lydforbedringsværktøjer.

Kan du diskutere nogle af udfordringerne og fordelene ved at lancere en startup med søskende?

Ærligt talt ville jeg elske at, og jeg ved, at alle står over for udfordringer på en eller anden måde, men jeg kan faktisk ikke huske mange i vores tilfælde. Årsagen er, at vi kommer fra en meget stor familie. Vi har altid gjort noget sammen, fra barndomsprojekter til at spille musik og skabe. Det var kun naturligt, at vi endte med at arbejde sammen. Mine brødre Fernando og Juan – som jeg nævnte medstiftede Voicemod sammen med mig – havde allerede flere virksomheder sammen, så de havde masser af erfaring på det område. Jeg sluttede mig til dem tilbage i 2010 i deres virksomhed, som var 2taptap, så jeg fik en fornemmelse af det. Dette betyder, at da vi skabte Voicemod, gjorde vi det fuldstændigt i overensstemmelse med, hvad vi ville opnå, og endnu vigtigere, hvordan vi ville opnå det. Dette har virkelig hjulpet med at bringe en stærk kultur af samstemte værdier ind i Voicemod, hvilket har været en sand nøgle til vores succes.

Er der noget andet, du gerne vil dele om Voicemod?

Der sker en masse bag kulisserne, men i overensstemmelse med vores ønske om at udvikle lyd til alle, arbejder vi i øjeblikket på noget, der kan gøre vores teknologi endnu mere… tilgængelig. En måde for enhver udvikler at bruge vores teknologi i deres produkt

Vi ved, at folk tilbringer det meste af deres vågne tid online, tilsluttet, og udtrykker sig på forskellige platforme og applikationer. I online-miljøer er din “avatar” din hele selvrepræsentation. Og hvem er den person uden en stemme?

At bygge realtids stemmeændringsteknologi og udvikle et system af fuldt tilpasselige lydudtryk er en masse arbejde. Vores team har taget det skridt ud af ligningen ved at designe en hel samling, der let kan integreres af udviklere overalt. Vi er ekstremt begejstret for at gøre vores teknologi tilgængelig for udviklere og brugere over hele verden, da vi fortsætter med at bygge fremtiden for sociale lydoplevelser!

Tak for det gode interview, læsere, der ønsker at lære mere, skal besøge Voicemod

Antoine er en visionær leder og medstifter af Unite.AI, drevet af en urokkelig passion for at forme og fremme fremtiden for AI og robotteknologi. En serieiværksætter, han tror, at AI vil være lige så omvæltende for samfundet som elektricitet, og han bliver ofte fanget i at tale om potentialet for omvæltende teknologier og AGI.

Som en futurist, er han dedikeret til at udforske, hvordan disse innovationer vil forme vores verden. Derudover er han grundlægger af Securities.io, en platform, der fokuserer på at investere i skarp teknologi, der gendefinerer fremtiden og omformer hele sektorer.