Entrevistas
Jaime Bosch, CEO de Voicemod – Serie de entrevistas

Jaime Bosch es el CEO de Voicemod, un software gratuito de cambio de voz para gamers, creadores de contenido y vtubers.
¿Podrías compartir la historia detrás de Voicemod?
Crecí en un entorno donde pude desarrollar mi espíritu empresarial desde muy joven, ya que era el octavo de diez hijos y siempre había apoyo de hermanos con mentalidad similar.
Así que, dos de mis hermanos y yo, que compartimos un profundo amor por la tecnología y la música, jugamos con la idea de crear una aplicación que combinara nuestros intereses. Entonces, en 2009, lo hicimos y creamos una aplicación de música B2C como un side-hustle para el negocio de estudio que estábamos llevando a cabo como nuestra ocupación principal.
Como era un proyecto secundario, experimentamos mucho con cosas como la modulación de voz, lo que nos inspiró a crear algo completamente nuevo y novedoso. El resultado de esto fue lo que llamamos la “Experiencia Voicemod” – una forma completamente nueva de experimentar tu propia voz – que se convirtió en la fuerza impulsora de la evolución de la aplicación. No importa quién probara nuestro software, siempre nos encontrábamos con las mismas reacciones de las personas que experimentaban la aplicación: risa y asombro al escucharse de una manera completamente diferente.
Esto nos llevó a replantear nuestra visión para el producto, en algo que podría evolucionar la conexión humana a través del medio del sonido. Así que trajimos la experiencia de móvil a PC, donde fue recogida instantáneamente por la escena de juegos y transmisión en explosión – y el resto es, como se dice, “historia”.
Voicemod inicialmente era un proyecto secundario — ¿cuándo te diste cuenta de que querías ir a por todas?
Inicialmente, mis hermanos y yo teníamos un estudio juntos llamado 2taptap. Cuando se nos ocurrió la idea de crear Voicemod, inicialmente era solo un proyecto divertido, pero con el tiempo vimos cómo la gente interactuaba con él y el tipo de potencial que la tecnología tenía. Hasta ese momento, la mayoría de la tecnología de cambio de voz era asíncrona, así que poder experimentar ser alguien más en un entorno en tiempo real era novedoso para mucha gente. El momento definitorio para nosotros, sin embargo, fue la realización de que la gente estaba utilizando nuestra tecnología para no solo divertirse, sino para moldear su forma de expresarse en línea. Esto es cuando nos dimos cuenta de que estábamos construyendo algo que no solo se trataba de entretenimiento, sino posiblemente del próximo paso en la evolución de las experiencias de audio sociales.
¿Podrías discutir algunas de las tecnologías de reconocimiento de voz?
Con la gama de cambiadores de voz en nuestro catálogo, hay procesos que se llevan a cabo para tomar una voz humana regular y transformarla en algo nuevo. Por supuesto, también hay aspectos en la voz de uno que deben ser tenidos en cuenta, como la edad, el género, la emoción y las simples variaciones en cómo se habla.
Estas variaciones contribuyen a cómo alguien puede sonar y afectan los cambios que se aplican. Nosotros aprovechamos elementos de la tecnología de reconocimiento de voz de vanguardia para facilitar la conversión y transformación de la voz de la manera más precisa posible – y estamos mejorando constantemente este proceso. Queremos dar a la gente la oportunidad de estructurar cómo son percibidos, sonar como desean ser escuchados y dar una gran experiencia de escucha a su audiencia.
¿Por qué es importante ayudar a las personas a expresarse a través del sonido?
Desde el momento en que nacemos y el primer grito de un bebé, el sonido es la forma natural a través de la cual aprendemos a expresarnos. A medida que crecemos, la importancia de la comunicación auditiva continúa creciendo, ya que aprendemos a moldear el sonido en lenguaje y a utilizar nuestras voces para poner emoción y matices en las palabras que hablamos. Al elevar el tono de nuestra voz, podemos señalarizar la emoción – o utilizar efectos de sonido como suspiros o gemidos para poner énfasis particular en los puntos que queremos hacer.
Para algunas personas verdaderamente talentosas, la voz es un instrumento para una expresión ilimitada – ya que pueden crear una cantidad ilimitada de efectos de sonido o voces. La mayoría de nosotros, sin embargo, no somos tan afortunados y realmente nos sentimos incómodos con nuestras voces (especialmente cuando las escuchamos grabadas). Algunos de nuestros usuarios hablan sobre sentirse nerviosos cuando hablan frente a desconocidos y se frustran por no poder expresarse adecuadamente de la manera que desean.
Esto es donde vemos una gran oportunidad para ayudar a las personas. Con nuestras identidades de voz, los usuarios pueden moldear sus voces para que sean algo con lo que se sientan cómodos – o incluso deslizarse en diferentes voces para situaciones específicas. También queremos empoderarlos para que utilicen efectos de sonido, clips de música o emojis de audio para crear ambiente, transmitir contexto o implementar efectos cómicos – similar a cómo los emojis gráficos han ayudado a dar forma a la comunicación de texto.
Has descrito Voicemod como la evolución de la conexión humana a través del sonido, ¿podrías elaborar sobre esto?
Además de liberar al hablante y eliminar un cierto bloqueo mental que evita que las personas hablen, también estamos trabajando para hacer que esta conexión sea más profunda. Por ejemplo, nuestra soundboard toma la comunicación y la eleva al siguiente nivel – piensa en ello como un “emoji de audio”. ¿Puedes imaginar a personas menores de 35 años charlando sin utilizar emojis? Mientras esta tecnología ha existido durante lo que se siente como una eternidad, realmente solo se ha vuelto profundamente arraigada en nuestra comunicación desde alrededor de 2010. Vimos una tendencia similar con pegatinas en plataformas de mensajería, el auge de la mensajería y las notas de voz, y ahora el uso emergente de GIFs y Giphy. Con la escalada de las comunicaciones de audio en todo el mundo, la importancia de cómo utilizamos el sonido está aumentando. Enviar una reacción de audio a la broma de un amigo puede decir mucho más sobre tu reacción honesta y cruda que solo escribir una oración. Imagina la diferencia entre escuchar el sonido de los grillos y ba dum tss! Todos ellos tienen significados y sentimientos muy diferentes que puedes comunicar fácilmente con solo un clic.
Queremos hacer que sea lo más fácil posible para que los usuarios utilicen voces, efectos de voz y emojis de audio para tener conversaciones de audio más atractivas con amigos, familiares o desconocidos.
¿Cuáles son algunas de las tecnologías de aprendizaje automático detrás de la aplicación Voicemod, incluyendo permitir a los usuarios sonar mejor y personalizar su voz alrededor de su voz real?
El aprendizaje automático está en el corazón de la mayoría de las nuevas características de Voicemod.
En cuanto al lado creativo, Voicelab de Voicemod ha creado la primera tecnología de conversión de voz en tiempo real en el mercado que permitirá a los usuarios elegir su propia identidad sonora, creando voces personales para cada uno.
Con nuestra nueva tecnología avanzada que se lanzará pronto, creamos voces nunca antes escuchadas con características únicas que ayudarán a proteger la privacidad y la seguridad de los usuarios, al mismo tiempo que les permiten crear su personalidad deseada a través del sonido.
También hemos observado que han surgido metodologías de aprendizaje profundo basadas en datos en los últimos años. Estas permiten aprender estructuras ocultas abstractas dentro de las señales de habla relacionadas con características perceptuales de la voz, como la fonología, el contenido, la identidad, la intención y el estado de ánimo. Aprovechando estas tecnologías, podemos controlar y modificar los aspectos perceptuales de la señal. Esto nos permite diseñar tecnologías que den a los usuarios más control sobre sus identidades de voz percibidas de una manera que no era posible antes.
¿Cuáles son algunos de los casos de uso para la aplicación Voicemod?
Lo genial de Voicemod es que sus herramientas sirven a una amplia variedad de necesidades y escenarios. Los casos más comunes serían para la creación de contenido, juegos con amigos, charlar con familiares o amigos, crear entornos de rol inmersivos o incluso para el trabajo y los negocios – donde los usuarios principalmente utilizan nuestras herramientas de cancelación de ruido y mejora de audio.
¿Podrías discutir algunos de los desafíos y beneficios de lanzar una startup con hermanos?
Honestamente, me encantaría, y sé que todos enfrentan desafíos de alguna manera, pero en realidad no recuerdo muchos en nuestro caso. La razón es que venimos de una familia muy grande. Siempre estábamos haciendo algo juntos, desde proyectos de la infancia hasta tocar música y crear. Fue solo natural que termináramos trabajando juntos. Mis hermanos Fernando y Juan – que, como mencioné, cofundaron Voicemod conmigo – ya tenían varias empresas juntos, así que tenían mucha experiencia en ese sentido. Me uní a ellos en 2010 en su empresa, que era 2taptap, así que tuve una idea de cómo era. Esto significa que cuando creamos Voicemod, lo hicimos completamente alineados en lo que queríamos lograr y, lo más importante, cómo queríamos lograrlo. Así que realmente ha ayudado a traer una cultura fuerte de valores alineados a Voicemod, lo que ha sido una clave verdadera para nuestro éxito.
¿Hay algo más que te gustaría compartir sobre Voicemod?
Hay mucho sucediendo detrás de escena, pero en línea con nuestro deseo de evolucionar el sonido para todos, estamos trabajando en algo para hacer que nuestra tecnología sea aún más… accesible. Una forma para que cualquier desarrollador pueda utilizar nuestra tecnología en su producto
Sabemos que la gente pasa la mayoría de su tiempo despierta en línea, conectada, expresándose en varias plataformas y aplicaciones. En entornos en línea, tu ‘avatar’ es tu representación completa. Y realmente, ¿quién es esa persona sin una voz?
Construir tecnología de cambio de voz en tiempo real y desarrollar un sistema de expresiones sonoras completamente personalizables es mucho trabajo. Nuestro equipo ha sacado ese paso de la ecuación al diseñar un kit completo que puede ser integrado fácilmente por desarrolladores en cualquier lugar. Estamos extremadamente emocionados de hacer que nuestra tecnología sea accesible a desarrolladores y usuarios de todo el mundo, mientras continuamos construyendo el futuro de las experiencias de audio sociales. ¡Gracias por la gran entrevista, lectores que deseen aprender más pueden visitar Voicemod!












