Intervjuer

Jaime Bosch, CEO, Voicemod – Intervju-serie

mm
Legg til Unite.AI blant dine foretrukne kilder på Google

Jaime Bosch er administrerende direktør i Voicemod, et gratis programvare for å endre stemme for spillere, innholdsskapere og vtubere.

Kunne du dele opphavet til Voicemod?

Da jeg var den 8. av 10 barn, vokste jeg opp i en omgang hvor jeg kunne utvikle min entreprenørånd fra en svært ung alder, da det alltid var støtte fra like-minded søsken.

Som sådan var det bare et spørsmål om tid før to av mine brødre og jeg, alle med en dyp kjærlighet til teknologi og musikk, lekte med tanken på å lage en app som kombinerte våre interesser. Så, i 2009, gjorde vi nettopp det og lagde en B2C-musikkapp som en sidebeskjeftigelse til studiovirksomheten vi drev som vår hovedbeskjeftigelse.

Da det var en sideprosjekt, eksperimenterte vi mye med ting som stemme-modulering, som inspirerte oss til å lage noe helt nytt og nytt. Resultatet av dette var det vi kalte “Voicemod-erfaringen” – en helt ny måte å oppleve din egen stemme – som ble drivkraften bak appens utvikling. Uansett hvem som prøvde vår programvare, møtte vi alltid på samme type reaksjoner fra menneskene som opplevde appen: latter og forbauselse over å høre seg selv på en helt annen måte.

Dette ledet oss til å omdefinere vår visjon for produktet, til noe som kunne ultimate menneskelig tilknytning gjennom lydmediet. Så vi tok erfaringen fra mobil til PC, der den ble straks plukket opp av det eksploderende spill- og strømmingscenen – og resten er, som man sier, “historie”.

Voicemod var opprinnelig et sideprosjekt — når innser du at du ville satse alt på det?

Opprinnelig hadde mine brødre og jeg et studio sammen kalt 2taptap. Da vi kom opp med ideen om å lage Voicemod, var det opprinnelig bare et morsomt sideprosjekt, men etter hvert så vi hvordan menneskene interagerte med det og hvilken potensiale teknologien hadde. Inntil den tid var de fleste stemme-endrings-teknologier asynkrone, så å kunne oppleve å være noen andre i et sanntidsmiljø var nytt for mange mennesker. Det avgjørende øyeblikket for oss var da vi innser at menneskene brukte vår teknologi ikke bare for å ha det gøy, men for å forme hele måten de uttrykte seg på nettet. Dette var da vi innser at vi bygget noe som ikke bare var om underholdning, men muligens det neste skrittet i fremtiden for sosiale lydopplevelser.

Kunne du diskutere noen av tale-gjenkjenningsteknologiene?

Med utvalget av stemmeskiftere i vår katalog, er det prosesser som gjennomføres for å ta en vanlig menneskestemme og forvandle den til noe nytt. Selvfølgelig er det også aspekter i en persons stemme som må tas med i betraktning, som alder, kjønn, emosjon og enkle variasjoner i hvordan en snakker.

Disse variasjonene bidrar til hvordan noen kan høres og påvirker endringene som gjøres. Vi utnytter elementer fra state-of-the-art tale-gjenkjenningsteknologi for å fasilitere stemmeomforming og -transformasjon så nøyaktig som mulig — og er kontinuerlig i ferd med å forbedre denne prosessen. Vi vil gi menneskene muligheten til å strukturere hvordan de oppfattes, høres ut som de ønsker å bli hørt, og gi en god lytteropplevelse for deres publikum.

Hvorfor er det viktig å hjelpe menneskene med å uttrykke seg gjennom lyd?

Fra det øyeblikk vi er født og et barns første skrik, er lyd den naturlige måten vi lærer å uttrykke oss på. Etter hvert som vi blir eldre, fortsetter lydkommunikasjonens betydning å vokse, da vi lærer å forme lyden til språk og å bruke våre stemmer til å legge følelse og nuanser i ordene vi snakker. Ved å heve tonehøyden på vår stemme, kan vi signalisere begeistring – eller bruke lydeffekter som suk eller stønn til å legge spesiell vekt på punkter vi ønsker å fremheve.

For noen virkelig talentfulle mennesker er stemmen et instrument for ubegrenset uttrykk – da de kan lage et ubegrenset antall lydeffekter eller stemmer. De fleste av oss er imidlertid ikke så heldige og føler oss faktisk ubekvem med våre stemmer (spesielt når vi hører dem innspilt). Noen av våre brukere snakker om å føle seg nervøse når de snakker foran fremmede og er frustrerte over å ikke kunne uttrykke seg på den måten de ønsker.

Dette er der vi ser en enorm mulighet til å hjelpe menneskene. Med våre stemme-identiteter kan brukerne forme sine stemmer til å bli noe de føler seg komfortable med – eller til og med gli inn i forskjellige stemmer for bestemte situasjoner. Vi vil også gi dem muligheten til å bruke lydeffekter, musikkklipp eller lyd-emojier til å skape atmosfære, konveyere kontekst eller implementere komiske effekter – lignende hvordan grafiske emojier har hjulpet å forme tekstkommunikasjon.

Du har beskrevet Voicemod som å utvikle menneskelig tilknytning gjennom lyd, kunne du utdype på dette?

Bortsett fra å frigjøre taleren og fjerne en viss mental blokkering som stopper menneskene fra å snakke, arbeider vi også med å gjøre denne tilknytningen dypere. For eksempel tar vår lydpanel kommunikasjon og løfter den til neste nivå — tenk på det som en “lyd-emoji”. Kan du forestille deg mennesker under 35 år som chatter uten å bruke emojier? Mens denne teknologien har eksistert i hva som føles som en evighet nå, er det faktisk bare blitt dypt innarbeidet i vår kommunikasjon siden ca. 2010. Vi så en lignende trend med stikkere på meldingsplattformer, oppblomstringen av tale-meldinger og tale-notater, og nå den fremvoksende bruken av GIF’er og Giphy. Med skaleringen av verdensomspennende lydkommunikasjon, øker betydningen av hvordan vi bruker lyd. Å sende en lydreaksjon til vennens vits kan si mye mer om din raw, ærlige reaksjon enn bare å skrive en setning. Forestill deg forskjellen på å høre lyden av cikader og ba dum tss! De holder alle forskjellige betydninger og følelser som du lett kan kommunisere med bare et klikk.

Vi vil gjøre det så enkelt som mulig for brukerne å bruke stemmer, stemme-effekter og lyd-emojier til å ha mer engasjerende lydkommunikasjon med venner, familie eller fremmede.

Hva er noen av maskinlærings-teknologiene bak Voicemod-appen, inkludert å la brukerne høres bedre og tilpasse sin stemme rundt deres virkelige stemme?

Maskinlæring er i hjertet av de fleste av de nye Voicemod-funksjonene.

Med hensyn til den kreative siden, har Voicemods Voicelab laget den første sanntids stemmeomformings-teknologien på markedet som vil la brukerne velge sin egen lyd-identitet, og lage personlige stemmer for hver enkelt.

Med vår nye, avanserte teknologi som skal lanseres snart, lager vi aldri hørt stemmer med unike egenskaper som vil hjelpe til å beskytte brukernes privatliv og sikkerhet, samtidig som de lar dem lage sin ønskede personlighet gjennom lyd.

Vi har også observert data-drevne dypt-lærings-metodologier som har oppstått de siste årene. Disse muliggjør oss å lære abstrakte, skjulte strukturer innen tale-signaler som omfatter perseptuelle egenskaper ved stemmen, som fonologi, innhold, identitet, intensjon og humør. Ved å utnytte disse teknologiene, kan vi kontrollere og modifisere de perseptuelle aspektene ved signalet. Dette lar oss designe teknologier som gir brukerne mer kontroll over deres opplevde stemme-identiteter på en måte som ikke var mulig tidligere.

Hva er noen av bruksområdene for Voicemod-appen?

Det store med Voicemod er at dens verktøy betjener en stor variasjon av behov og scenarioer. De vanligste situasjonene ville være for innholdsskapning, spill med venner, chatte med familie eller venner, lage immersive rollespill-miljøer, eller til og med for arbeid og forretning – hvor brukerne hovedsakelig bruker våre støymøllerings- og lydforbedrings-verktøy.

Kunne du diskutere noen av utfordringene og fordelen med å lansere en startup med søsken?

Ærlig talt ville jeg elske å, og jeg vet at selvfølgelig alle møter utfordringer på noen måter, men jeg kan faktisk ikke huske mange i vårt tilfelle. Grunnen til dette er at vi kommer fra en svært stor familie. Vi gjorde alltid noe sammen, fra barndomsprosjekter til å spille musikk og skape. Det var bare naturlig at vi skulle ende opp med å jobbe sammen. Mine brødre Fernando og Juan — som jeg nevnte grunnla Voicemod sammen med meg — hadde allerede flere selskaper sammen, så de hadde mye erfaring i den sammenhengen. Jeg sluttet meg til dem i 2010 i deres selskap, som var 2taptap, så jeg fikk en følelse av det også. Dette betyr at når vi lagde Voicemod, gjorde vi det fullstendig i linje med hva vi ville oppnå og hvordan vi ville oppnå det. Som sådan har det virkelig hjulpet å bringe en svært sterk kultur av samsvarende verdier inn i Voicemod, som har vært en virkelig nøkkel til vår suksess.

Er det noe annet du ville like å dele om Voicemod?

Det skjer mye bak kulissene, men i linje med vårt ønske om å utvikle lyd for alle, jobber vi for tiden med noe som skal gjøre vår teknologi enda mer… tilgjengelig. En måte for enhver utvikler å bruke vår teknologi i deres produkt

Vi vet at menneskene tilbringer det meste av sin våken tid online, koblet til, og uttrykker seg på ulike plattformer og applikasjoner. I nett-miljøer er din “avatar” din hele selv-representasjon. Og hvem er den personen uten en stemme?

Å bygge sanntids stemme-endrings-teknologi og utvikle et system for fullstendig tilpassbare lyd-uttrykk er mye arbeid. Vårt team har tatt det steget ut av ligningen ved å designe en hel pakke som kan lett integreres av utviklere overalt. Vi er ekstremt glade for å gjøre vår teknologi tilgjengelig for utviklere og brukere over hele verden, samtidig som vi fortsetter å bygge fremtiden for sosiale lydopplevelser!

Takk for det flotte intervjuet, lesere som ønsker å lære mer kan besøke Voicemod

Antoine er en visjonær leder og medgrunnlegger av Unite.AI, drevet av en urokkelig lidenskap for å forme og fremme fremtiden for AI og robotikk. En serial entrepreneur, han tror at AI vil være like disruptiv for samfunnet som elektrisitet, og blir ofte fanget i å prise potensialet for disruptive teknologier og AGI.

Som en futurist, er han dedikert til å utforske hvordan disse innovasjonene vil forme vår verden. I tillegg er han grunnlegger av Securities.io, en plattform som fokuserer på å investere i banebrytende teknologier som definerer fremtiden og omformer hele sektorer.