Entretiens
Jaime Bosch, PDG de Voicemod – Série d’entretiens

Jaime Bosch est le PDG de Voicemod, un logiciel de modification de voix gratuit pour les gamers, les créateurs de contenu et les vtubers.
Pouvez-vous partager l’histoire de la création de Voicemod ?
En tant que huitième d’une fratrie de dix enfants, j’ai grandi dans un environnement où j’ai pu développer mon esprit d’entrepreneur dès très jeune âge, car il y avait toujours un soutien de la part de mes frères et sœurs qui partageaient les mêmes intérêts.
Comme tel, il n’a pas fallu longtemps pour que deux de mes frères et moi, qui partagions tous une grande passion pour la technologie et la musique, nous amusions avec l’idée de créer une application qui combinait nos intérêts. Nous avons donc créé en 2009 une application de musique B2C comme projet secondaire par rapport à l’entreprise de studio que nous dirigeions comme activité principale.
Comme c’était un projet secondaire, nous avons expérimenté beaucoup de choses comme la modulation de voix, ce qui nous a inspirés pour créer quelque chose de complètement nouveau et original. Le résultat de cela a été ce que nous avons appelé l'”expérience Voicemod” – une façon complètement nouvelle d’expérimenter sa propre voix – qui est devenue le moteur de l’évolution de l’application. Quiconque essayait notre logiciel, nous rencontrions toujours les mêmes réactions de la part des gens qui expérimentaient l’application : rires et émerveillement en entendant sa propre voix d’une manière complètement différente.
Cela nous a amenés à revoir notre vision pour le produit, pour quelque chose qui pourrait finalement évoluer la connexion humaine à travers le médium du son. Nous avons donc apporté l’expérience du mobile au PC, où elle a été instantanément adoptée par la scène de jeu et de streaming en plein essor – et le reste, comme on dit, est « l’histoire ».
Voicemod était initialement un projet secondaire — quand avez-vous réalisé que vous vouliez vous y consacrer entièrement ?
Au départ, mes frères et moi avions un studio ensemble appelé 2taptap. Lorsque nous avons eu l’idée de créer Voicemod, c’était initialement juste un projet amusant, mais avec le temps, nous avons vu comment les gens interagissaient avec lui et le potentiel que la technologie avait. Jusqu’à ce moment-là, la plupart des technologies de modification de voix étaient asynchrones, donc être capable d’expérimenter être quelqu’un d’autre en temps réel était nouveau pour de nombreuses personnes. Le moment déterminant pour nous, cependant, a été la réalisation que les gens utilisaient notre technologie pour ne pas seulement s’amuser, mais pour façonner leur manière d’expression en ligne. C’est à ce moment-là que nous avons réalisé que nous construisions quelque chose qui n’était pas seulement lié au divertissement, mais peut-être à l’avenir des expériences audio sociales.
Pouvez-vous discuter des technologies de reconnaissance vocale ?
Avec la gamme de changements de voix dans notre catalogue, il y a des processus qui sont suivis pour prendre une voix humaine normale et la transformer en quelque chose de nouveau. Bien sûr, il y a également des aspects de la voix qui doivent être pris en compte, tels que l’âge, le sexe, l’émotion et les simples variations dans la façon dont on parle.
Ces variations contribuent à la façon dont quelqu’un peut sonner et affectent les changements qui sont appliqués. Nous utilisons des éléments de la technologie de reconnaissance vocale de pointe pour faciliter la conversion et la transformation vocale de manière aussi précise que possible — et nous améliorons continuellement ce processus. Nous voulons donner aux gens l’opportunité de structurer la façon dont ils sont perçus, sonner comme ils veulent être entendus et offrir une grande expérience d’écoute à leur audience.
Pourquoi est-il important d’aider les gens à s’exprimer à travers le son ?
Dès le moment où nous naissons et que le premier cri d’un bébé, le son est la façon naturelle par laquelle nous apprenons à nous exprimer. À mesure que nous grandissons, l’importance de la communication audio continue de croître, car nous apprenons à façonner le son en langage et à utiliser notre voix pour mettre de l’émotion et de la nuance dans les mots que nous prononçons. En élevant le ton de notre voix, nous pouvons signaler l’excitation – ou utiliser des effets sonores tels que des soupirs ou des grognements pour mettre une emphase particulière sur les points que nous voulons faire.
Pour certaines personnes vraiment talentueuses, la voix est un instrument pour une expression illimitée – car ils peuvent créer une quantité illimitée d’effets sonores ou de voix. La plupart d’entre nous, cependant, ne sont pas si chanceux et ressentent réellement un malaise avec leur voix (surtout lorsqu’ils l’entendent enregistrée). Certains de nos utilisateurs parlent de leur nervosité lorsqu’ils parlent devant des étrangers et sont frustrés de ne pas pouvoir s’exprimer correctement de la manière dont ils le souhaitent.
C’est là que nous voyons une énorme opportunité pour aider les gens. Avec nos identités vocales, les utilisateurs peuvent façonner leur voix pour qu’elle soit quelque chose avec quoi ils se sentent à l’aise – ou même glisser dans différentes voix pour des situations spécifiques. Nous voulons également les habiliter à utiliser des effets sonores, des extraits de musique ou des émojis audio pour créer une ambiance, transmettre un contexte ou mettre en œuvre des effets comiques – similaires à la façon dont les émojis graphiques ont aidé à façonner la communication textuelle.
Vous avez décrit Voicemod comme évoluant la connexion humaine à travers le son, pouvez-vous élargir sur cela ?
Outre la libération du locuteur et la suppression d’un certain blocage mental qui empêche les gens de parler, nous travaillons également pour rendre cette connexion plus profonde. Par exemple, notre soundboard prend la communication et l’élève au niveau suivant — pensez-y comme un “émoji audio”. Pouvez-vous imaginer des personnes de moins de 35 ans discutant sans utiliser d’émojis ? Bien que cette technologie existe depuis ce qui semble être des âges, elle n’a vraiment commencé à s’enraciner profondément dans notre communication qu’à partir de 2010 environ. Nous avons vu une tendance similaire avec les autocollants sur les plateformes de messagerie, l’essor des messages vocaux et des notes vocales, et maintenant l’utilisation émergente des GIF et de Giphy. Avec la montée en puissance des communications audio mondiales, l’importance de la façon dont nous utilisons le son augmente. Envoyer une réaction audio à la blague de votre ami peut en dire beaucoup plus sur votre réaction honnête que de simplement taper une phrase. Imaginez la différence entre entendre le son des grillons et ba dum tss ! Ils ont tous des significations et des sentiments très différents que vous pouvez facilement communiquer avec un simple clic.
Nous voulons rendre il aussi facile que possible pour les utilisateurs d’utiliser des voix, des effets vocaux et des émojis audio pour avoir des conversations audio plus engageantes avec des amis, de la famille ou des étrangers.
Quelles sont certaines des technologies d’apprentissage automatique derrière l’application Voicemod, y compris la possibilité pour les utilisateurs de sonner mieux et de personnaliser leur voix autour de leur voix réelle ?
L’apprentissage automatique est au cœur de la plupart des nouvelles fonctionnalités de Voicemod.
En ce qui concerne le côté créatif, Voicemod’s Voicelab a créé la première technologie de conversion vocale en temps réel sur le marché qui permettra aux utilisateurs de choisir leur propre identité sonore, en créant des voix personnelles pour chacun.
Avec notre nouvelle technologie avancée qui sera bientôt publiée, nous créons des voix inédites avec des caractéristiques uniques qui aideront à protéger la vie privée et la sécurité des utilisateurs, tout en leur permettant de créer la personnalité souhaitée à travers le son.
Nous avons également observé l’émergence de méthodologies d’apprentissage automatique basées sur les données au cours des dernières années. Ces méthodes nous permettent d’apprendre des structures cachées abstraites au sein des signaux de parole liés aux caractéristiques perceptuelles de la voix, telles que la phonologie, le contenu, l’identité, l’intention et l’humeur. En exploitant ces technologies, nous pouvons contrôler et modifier les aspects perceptuels du signal. Cela nous permet de concevoir des technologies qui donnent aux utilisateurs un contrôle plus important sur leurs identités vocales perçues d’une manière qui n’était pas possible auparavant.
Quelles sont certaines des utilisations de l’application Voicemod ?
La grande chose à propos de Voicemod est que ses outils servent un large éventail de besoins et de scénarios. Les situations les plus courantes seraient pour la création de contenu, le jeu avec des amis, la discussion avec la famille ou des amis, la création d’environnements de jeu de rôle immersifs ou même pour le travail et les affaires – où les utilisateurs utilisent principalement nos outils de suppression de bruit et d’amélioration audio.
Pouvez-vous discuter des défis et des avantages de lancer une startup avec des frères et sœurs ?
Honnêtement, j’aimerais le faire, et je sais que tout le monde rencontre des défis d’une manière ou d’une autre, mais je ne me souviens pas de beaucoup dans notre cas. La raison en est que nous venons d’une très grande famille. Nous faisions toujours quelque chose ensemble, des projets d’enfance à la musique et à la création. Il était donc naturel que nous finissions par travailler ensemble. Mes frères Fernando et Juan — qui, comme je l’ai mentionné, ont cofondé Voicemod avec moi — avaient déjà plusieurs entreprises ensemble, ils avaient donc une grande expérience à cet égard. Je les ai rejoints en 2010 dans leur entreprise, qui s’appelait 2taptap, donc j’ai eu un aperçu de cela. Cela signifie que lorsque nous avons créé Voicemod, nous l’avons fait entièrement alignés sur ce que nous voulions accomplir et, plus important encore, sur la façon dont nous voulions l’accomplir. Cela a vraiment aidé à apporter une forte culture de valeurs alignées dans Voicemod, qui a été une clé de notre succès.
Y a-t-il autre chose que vous aimeriez partager à propos de Voicemod ?
Il y a beaucoup de choses qui se passent en coulisses, mais en ligne avec notre volonté d’évoluer le son pour tout le monde, nous travaillons actuellement sur quelque chose pour rendre notre technologie encore plus… accessible. Un moyen pour tout développeur d’utiliser notre technologie dans son produit
Nous savons que les gens passent la majeure partie de leur temps éveillé en ligne, connectés, en s’exprimant sur diverses plateformes et applications. Dans les environnements en ligne, votre “avatar” est votre représentation de soi tout entière. Et qui est cette personne sans voix ?
Construire une technologie de modification de voix en temps réel et développer un système d’expressions sonores entièrement personnalisables est beaucoup de travail. Notre équipe a pris cette étape en compte en concevant un entire kit that can easily be integrated by developers anywhere. Nous sommes extrêmement excités de rendre notre technologie accessible aux développeurs et aux utilisateurs du monde entier, car nous continuons à construire l’avenir des expériences audio sociales !
Merci pour cette grande interview, les lecteurs qui souhaitent en savoir plus peuvent visiter Voicemod.












