Interviews

Jaime Bosch, CEO van Voicemod – Interviewreeks

mm
Voeg Unite.AI toe aan je voorkeursbronnen op Google

Jaime Bosch is de CEO van Voicemod, een gratis stemveranderingssoftware voor gamers, content creators en vtubers.

Kunt u het verhaal achter Voicemod delen?

Als achtste van tien kinderen groeide ik op in een omgeving waarin ik mijn ondernemingsgeest al op jonge leeftijd kon ontwikkelen, omdat er altijd steun was van broers en zussen met dezelfde interesses.

Zo was het slechts een kwestie van tijd voordat twee van mijn broers en ik, die allemaal een diepe liefde voor technologie en muziek deelden, speelden met het idee om een app te maken die onze interesses combineerde. Dus, in 2009, deden we dat en maakten we een B2C-muziekapp als een bijbaan naast de studio die we als onze hoofdactiviteit uitvoerden.

Aangezien het een bijbaan was, experimenteerden we veel met dingen als stemmodulatie, wat ons inspireerde om iets compleet nieuw en origineel te creëren. Het resultaat hiervan was wat we de “Voicemod-ervaring” noemden – een compleet nieuwe manier om je eigen stem te ervaren – die de drijvende kracht achter de evolutie van de app werd. Het maakte niet uit wie onze software probeerde, we bleven steeds dezelfde soort reacties zien van de mensen die de app ervoeren: lachen en verbazing over het horen van jezelf op een compleet andere manier.

Dit leidde ertoe dat we onze visie voor het product herschreven, tot iets dat uiteindelijk de menselijke verbinding via het medium van geluid kon evolueren. Dus brachten we de ervaring van mobiel naar pc, waar het onmiddellijk werd opgepikt door de exploderende gamingscène en streaming – en de rest is, zoals men zegt, “geschiedenis”.

Voicemod was aanvankelijk een bijbaan — wanneer realiseerde u zich dat u fulltime aan Voicemod wilde werken?

Aanvankelijk hadden mijn broers en ik een studio samen genaamd 2taptap. Toen we het idee kregen om Voicemod te maken, was het aanvankelijk alleen maar een leuk bijbaantje, maar naarmate de tijd verstreek, zagen we hoe mensen ermee omgingen en het soort potentieel dat de technologie had. Tot dat moment was de meeste stemveranderingsTechnologie asynchroon, dus om in een real-time omgeving iemand anders te kunnen zijn, was nieuw voor veel mensen. Het bepalende moment voor ons was de realisatie dat mensen onze technologie gebruikten om niet alleen plezier te hebben, maar om hun hele manier van zichzelf online uitdrukken te vormen. Dit is wanneer we realiseerden dat we iets bouwden dat niet alleen over entertainment ging, maar mogelijk de volgende stap in de toekomst van sociale audio-ervaringen.

Kunt u enkele van de spraakherkenningstechnologieën bespreken?

Met het bereik van stemveranderingsmogelijkheden in onze catalogus, zijn er processen die worden doorlopen om een gewone menselijke stem te nemen en te transformeren in iets nieuws. Natuurlijk zijn er ook aspecten in iemands stem die moeten worden meegenomen, zoals leeftijd, geslacht, emotie en eenvoudige variaties in hoe iemand spreekt.

Deze variaties dragen bij aan hoe iemand klinkt en beïnvloeden de veranderingen die worden toegepast. We gebruiken elementen uit state-of-the-art spraakherkenningstechnologie om zo nauwkeurig mogelijk stemomzetting en transformatie te faciliteren — en zijn voortdurend bezig om dit proces te verbeteren. We willen mensen de kans geven om te bepalen hoe ze worden waargenomen, om te klinken zoals ze gehoord willen worden en om een geweldige luisterervaring te bieden aan hun publiek.

Waarom is het belangrijk om mensen te helpen zich via geluid uit te drukken?

Vanaf het moment dat we geboren worden en een baby’s eerste kreet, is geluid de natuurlijke manier waarop we leren ons uit te drukken. Naarmate we ouder worden, blijft de belangrijkheid van audio communicatie groeien, omdat we leren om geluid om te vormen tot taal en om onze stemmen te gebruiken om emotie en nuances toe te voegen aan de woorden die we spreken. Door de toon van onze stem te verhogen, kunnen we opwinding signaleren – of geluidseffecten zoals zuchten of kreunen gebruiken om speciale nadruk te leggen op punten die we willen maken.

Voor sommige echt getalenteerde mensen is de stem een instrument voor onbeperkte expressie – ze kunnen een onbeperkt aantal geluidseffecten of stemmen creëren. De meesten van ons zijn daar echter niet zo gelukkig en voelen ons eigenlijk ongemakkelijk met onze stemmen (vooral wanneer we ze opgenomen horen). Sommige van onze gebruikers praten over het gevoel nerveus wanneer ze voor vreemden spreken en zijn gefrustreerd omdat ze zich niet op de manier kunnen uitdrukken die ze willen.

Dit is waar we een enorme kans zien om mensen te helpen. Met onze stemidentiteiten kunnen gebruikers hun stemmen vormen tot iets waar ze zich prettig bij voelen – of zelfs in verschillende stemmen voor specifieke situaties kunnen glippen. We willen ze ook empoweren om geluidseffecten, muziekclips of audio-emoji’s te gebruiken om sfeer te creëren, context over te brengen of komische effecten te implementeren – net zoals grafische emoji’s hebben geholpen om tekstcommunicatie vorm te geven.

U hebt Voicemod beschreven als de evolutie van menselijke verbinding via geluid, kunt u hierop uitbreiden?

Naast het bevrijden van de spreker en het verwijderen van een bepaalde mentale blokkade die mensen tegenhoudt om te spreken, werken we eraan om deze verbinding dieper te maken. Onze soundboard neemt communicatie en brengt het naar een hoger niveau – denk aan het als een “audio-emoji”. Kun je je voorstellen dat mensen onder de 35 jaar oud chatten zonder emoji’s te gebruiken? Terwijl deze technologie al een tijdje bestaat, is het pas sinds ongeveer 2010 echt diep geworteld in onze communicatie geraakt. We zagen een soortgelijke trend met stickers op messaging-platforms, de opkomst van spraakberichten en spraaknotities, en nu het opkomende gebruik van GIF’s en Giphy. Met de schaal van wereldwijde audio communicatie, neemt de belangrijkheid van hoe we geluid gebruiken toe. Het verzenden van een audio-reactie op een grap van een vriend kan veel meer over je raw, eerlijke reactie zeggen dan alleen een zin typen. Stel je de verschillen voor tussen het horen van het geluid van krekels en ba dum tss! Ze hebben allemaal heel verschillende betekenissen en sentimenten die je gemakkelijk kunt communiceren met één klik.

We willen het zo gemakkelijk mogelijk maken voor gebruikers om stemmen, stemeffecten en audio-emoji’s te gebruiken om meer boeiende audio-conversaties te hebben met vrienden, familie of vreemden.

Wat zijn enkele van de machine learning-technologieën achter de Voicemod-app, waaronder het mogelijk maken dat gebruikers beter klinken en hun stem aanpassen op basis van hun echte stem?

Machine learning is het hart van de meeste nieuwe Voicemod-functies.

Met betrekking tot de creatieve kant heeft Voicemod’s Voicelab de eerste real-time stemomzettingstechnologie op de markt gemaakt die gebruikers in staat stelt om hun eigen sonische identiteit te kiezen, waardoor persoonlijke stemmen voor elk van hen kunnen worden gemaakt.

Met onze nieuwe, geavanceerde technologie die binnenkort wordt uitgebracht, creëren we nooit eerder gehoorde stemmen met unieke kenmerken die helpen om gebruikersprivacy en -beveiliging te beschermen, terwijl ze tegelijkertijd de mogelijkheid bieden om hun gewenste persoonlijkheid via geluid te creëren.

We hebben ook data-gedreven diepe leermethoden gezien ontstaan in recente jaren. Deze maken het mogelijk om abstracte verborgen structuren binnen spraaksignalen te leren met betrekking tot perceptuele kenmerken van de stem, zoals fonologie, inhoud, identiteit, intentie en stemming. Door deze technologieën te gebruiken, kunnen we de perceptuele aspecten van het signaal controleren en modificeren. Dit stelt ons in staat om technologieën te ontwerpen die gebruikers meer controle geven over hun waargenomen stemidentiteiten op een manier die eerder niet mogelijk was.

Wat zijn enkele van de use cases voor de Voicemod-app?

Het geweldige aan Voicemod is dat zijn tools een breed scala aan behoeften en scenario’s bedienen. De meest voorkomende situaties zouden zijn voor contentcreatie, gamen met vrienden, chatten met familie of vrienden, het creëren van immersieve roleplaying-omgevingen, of zelfs voor werk en bedrijf – waar gebruikers voornamelijk onze ruisannulering en audio-versterkingstools gebruiken.

Kunt u enkele van de uitdagingen en voordelen van het lanceren van een startup met broers en zussen bespreken?

Eerlijk gezegd zou ik dat graag doen, en ik weet dat iedereen op de een of andere manier uitdagingen tegenkomt, maar ik kan me eigenlijk niet veel herinneren in ons geval. De reden is dat we uit een heel groot gezin komen. We deden altijd iets samen, van kinderprojecten tot het spelen van muziek en het creëren. Het was alleen maar natuurlijk dat we uiteindelijk samen zouden gaan werken. Mijn broers Fernando en Juan – die, zoals ik al zei, samen met mij Voicemod hebben opgericht – hadden al verschillende bedrijven samen, dus ze hadden al veel ervaring op dat gebied. Ik voegde me bij hen in 2010 in hun bedrijf, dat 2taptap was, dus ik kreeg een gevoel voor het bedrijf. Dit betekent dat toen we Voicemod creëerden, we dat deden met een heel sterke cultuur van uitgelijnde waarden, wat de sleutel tot ons succes is geweest.

Is er nog iets anders dat u over Voicemod wilt delen?

Er gebeurt veel achter de schermen, maar in overeenstemming met onze wens om geluid voor iedereen te evolueren, werken we momenteel aan iets om onze technologie nog toegankelijker te maken. Een manier voor elke ontwikkelaar om onze technologie in hun product te gebruiken

We weten dat mensen de meeste tijd die ze wakker zijn online doorbrengen, aangesloten, en zichzelf op verschillende platforms en applicaties uiten. In online-omgevingen is uw ‘avatar’ uw hele zelfrepresentatie. En wie is die persoon zonder stem?

Het bouwen van real-time stemveranderingsTechnologie en het ontwikkelen van een systeem van volledig aanpasbare sonische expressies is veel werk. Ons team heeft die stap uit het proces gehaald door een hele kit te ontwerpen die gemakkelijk door ontwikkelaars overal kan worden geïntegreerd. We zijn enorm enthousiast om onze technologie toegankelijker te maken voor ontwikkelaars en gebruikers over de hele wereld, terwijl we de toekomst van sociale audio-ervaringen blijven bouwen!

Bedankt voor het geweldige interview, lezers die meer willen leren, moeten Voicemod bezoeken.

Antoine is een visionaire leider en medeoprichter van Unite.AI, gedreven door een onwankelbare passie voor het vormgeven en promoten van de toekomst van AI en robotica. Een serieondernemer, hij gelooft dat AI net zo disruptief voor de samenleving zal zijn als elektriciteit, en wordt vaak betrapt op het prijzen van de potentie van disruptieve technologieën en AGI.

Als een futurist, hij is toegewijd aan het onderzoeken van hoe deze innovaties onze wereld zullen vormgeven. Bovendien is hij de oprichter van Securities.io, een platform dat zich richt op het investeren in cutting-edge technologieën die de toekomst herdefiniëren en hele sectoren herschikken.