Entrevistas

Jaime Bosch, CEO, Voicemod – Série de Entrevistas

mm
Adicione Unite.AI às suas fontes preferidas no Google

Jaime Bosch é o CEO da Voicemod, um software gratuito de alteração de voz para jogadores, criadores de conteúdo e vtubers.

Poderia compartilhar a história por trás da criação da Voicemod?

Como o oitavo de 10 filhos, cresci em um ambiente onde pude desenvolver meu espírito empreendedor desde muito jovem, pois sempre havia apoio de irmãos com mentalidade semelhante.

Como tal, era apenas uma questão de tempo até que dois de meus irmãos e eu, todos compartilhando um amor profundo por tecnologia e música, brincássemos com a ideia de criar um aplicativo que combinasse nossos interesses. Então, em 2009, fizemos exatamente isso e criamos um aplicativo de música B2C como um side-hustle para o estúdio que estávamos administrando como nossa ocupação principal.

Como era um projeto paralelo, experimentamos muito com coisas como modulação de voz, o que nos inspirou a criar algo completamente novo e inovador. O resultado disso foi o que chamamos de “Experiência Voicemod” – uma maneira completamente nova de experimentar sua própria voz – que se tornou a força motriz da evolução do aplicativo. Não importa quem experimentasse nosso software, continuávamos encontrando as mesmas reações das pessoas que experimentavam o aplicativo: risos e admiração ao ouvir a si mesmo de uma maneira completamente diferente.

Isso nos levou a redefinir nossa visão para o produto, em algo que pudesse, em última análise, evoluir a conexão humana por meio do som. Então, trouxemos a experiência do mobile para o PC, onde foi instantaneamente adotada pela cena de jogos e transmissões em explosão – e o resto, como se diz, é “história”.

Voicemod foi inicialmente um projeto paralelo — quando você percebeu que queria se dedicar integralmente a ele?

Inicialmente, meus irmãos e eu tínhamos um estúdio juntos chamado 2taptap. Quando criamos a ideia de criar a Voicemod, era apenas um projeto paralelo divertido, mas à medida que o tempo passava, vimos como as pessoas interagiam com ele e o tipo de potencial que a tecnologia tinha. Até aquele ponto, a maioria das tecnologias de alteração de voz era assíncrona, então poder experimentar ser alguém mais em um ambiente em tempo real era novidade para muitas pessoas. O momento definidor para nós, no entanto, foi a realização de que as pessoas estavam usando nossa tecnologia não apenas para se divertir, mas para moldar sua forma de se expressar online. Foi quando percebemos que estávamos construindo algo que não era apenas sobre entretenimento, mas possivelmente o próximo passo no futuro das experiências de áudio social.

Poderia discutir algumas das tecnologias de reconhecimento de voz?

Com a gama de alteradores de voz em nosso catálogo, há processos que são realizados para pegar uma voz humana regular e transformá-la em algo novo. Claro, também há aspectos na voz de alguém que precisam ser considerados, como idade, gênero, emoção e apenas variações simples em como alguém fala.

Essas variações contribuem para como alguém pode soar e afetam as alterações aplicadas. Nós aproveitamos elementos da tecnologia de reconhecimento de voz de ponta para facilitar a conversão e transformação de voz com a maior precisão possível — e estamos continuamente melhorando esse processo. Queremos dar às pessoas a oportunidade de estruturar como elas são percebidas, soar como elas desejam ser ouvidas e dar uma grande experiência de audição para seu público.

Por que é importante ajudar as pessoas a se expressarem por meio do som?

Desde o momento em que nascemos e o primeiro grito de um bebê, o som é a maneira natural pela qual aprendemos a nos expressar. À medida que crescemos, a importância da comunicação por áudio continua a crescer, pois aprendemos a moldar o som em linguagem e a usar nossas vozes para colocar emoção e nuances nas palavras que falamos. Aumentando o tom de nossa voz, podemos sinalizar excitação – ou usar efeitos sonoros, como suspiros ou gemidos, para dar ênfase particular aos pontos que queremos fazer.

Para algumas pessoas verdadeiramente talentosas, a voz é um instrumento para expressão ilimitada – como elas podem criar uma quantidade ilimitada de efeitos sonoros ou vozes. A maioria de nós, no entanto, não é tão sortuda e, na verdade, se sente desconfortável com nossas vozes (especialmente quando as ouvimos gravadas). Alguns de nossos usuários falam sobre se sentirem nervosos ao falar em frente a estranhos e ficarem frustrados por não conseguirem se expressar adequadamente da maneira que desejam.

É aqui que vemos uma oportunidade enorme para ajudar as pessoas. Com nossas identidades de voz, os usuários podem moldar suas vozes para ser algo com que se sintam confortáveis – ou até mesmo entrar em diferentes vozes para situações específicas. Também queremos empoderá-los a usar efeitos sonoros, cliques de música, ou emojis de áudio para criar atmosfera, transmitir contexto ou implementar efeitos cômicos – semelhante à forma como emojis gráficos ajudaram a moldar a comunicação por texto.

Você descreveu a Voicemod como evoluindo a conexão humana por meio do som; poderia elaborar sobre isso?

Além de libertar o falante e remover um certo bloqueio mental que impede as pessoas de falar, também estamos trabalhando para tornar essa conexão mais profunda. Por exemplo, nossa soundboard leva a comunicação e a eleva ao próximo nível — pense nisso como um “emoji de áudio”. Você pode imaginar pessoas com menos de 35 anos conversando sem usar emojis? Embora essa tecnologia exista há o que parece ser uma eternidade, ela realmente apenas se tornou profundamente enraizada em nossa comunicação desde cerca de 2010. Vimos uma tendência semelhante com adesivos em plataformas de mensagens, o surgimento de mensagens e notas de voz, e agora o uso emergente de GIFs e Giphy. Com a escalada das comunicações de áudio em todo o mundo, a importância de como usamos o som está aumentando. Enviar uma reação de áudio à piada de um amigo pode dizer muito mais sobre sua reação bruta e honesta do que apenas digitar uma frase. Imagine a diferença entre ouvir o som de grilos e ba dum tss! Eles todos têm significados e sentimentos muito diferentes que você pode facilmente se comunicar com apenas um clique.

Queremos tornar o mais fácil possível para os usuários utilizarem vozes, efeitos de voz e emojis de áudio para ter conversas de áudio mais envolventes com amigos, familiares ou estranhos.

Quais são algumas das tecnologias de aprendizado de máquina por trás do aplicativo Voicemod, incluindo permitir que os usuários soem melhor e personalizem sua voz em torno de sua voz real?

O aprendizado de máquina está no coração da maioria dos novos recursos do Voicemod.

Com relação ao lado criativo, o Voicelab do Voicemod criou a primeira tecnologia de conversão de voz em tempo real no mercado que permitirá que os usuários escolham sua própria identidade sonora, criando vozes pessoais para cada um.

Com nossa nova tecnologia avançada que será lançada em breve, criamos vozes nunca antes ouvidas com características únicas que ajudarão a proteger a privacidade e segurança dos usuários, enquanto lhes permitem criar a personalidade desejada por meio do som.

Também observamos a emergência de metodologias de aprendizado profundo baseadas em dados nos últimos anos. Essas permitem que aprendamos estruturas ocultas abstratas dentro de sinais de fala relacionados a características perceptuais da voz, como fonologia, conteúdo, identidade, intenção e humor. Aproveitando essas tecnologias, podemos controlar e modificar os aspectos perceptuais do sinal. Isso nos permite projetar tecnologias que dão aos usuários mais controle sobre suas identidades de voz percebidas de uma maneira que não era possível antes.

Quais são alguns dos casos de uso para o aplicativo Voicemod?

A grande coisa sobre o Voicemod é que suas ferramentas atendem a uma ampla variedade de necessidades e cenários. As situações mais comuns seriam para criação de conteúdo, jogos com amigos, conversas com familiares ou amigos, criação de ambientes de roleplaying imersivos ou até mesmo para trabalho e negócios – onde os usuários principalmente usam nossas ferramentas de cancelamento de ruído e melhoria de áudio.

Poderia discutir alguns dos desafios e benefícios de lançar uma startup com irmãos?

Honestamente, eu adoraria, e sei que, é claro, todos enfrentam desafios de alguma forma, mas eu realmente não consigo me lembrar de muitos em nosso caso. O motivo é que viemos de uma família muito grande. Sempre estávamos fazendo algo juntos, desde projetos de infância até tocar música e criar. Foi apenas natural que acabássemos trabalhando juntos. Meus irmãos Fernando e Juan — que, como mencionei, co-fundaram a Voicemod comigo — já tinham várias empresas juntos, então tinham muita experiência nesse sentido. Eu me juntei a eles em 2010 em sua empresa, que era a 2taptap, então eu tive uma ideia disso. Isso significa que, quando criamos a Voicemod, o fizemos completamente alinhados com o que queríamos alcançar e, mais importante, como queríamos alcançar. Como tal, isso realmente ajudou a trazer uma cultura de valores alinhados muito forte para a Voicemod, o que foi uma chave verdadeira para o nosso sucesso.

Há algo mais que você gostaria de compartilhar sobre a Voicemod?

Há muito acontecendo nos bastidores, mas em linha com o nosso desejo de evoluir o som para todos, estamos atualmente trabalhando em algo para tornar nossa tecnologia ainda mais… acessível. Uma maneira para que qualquer desenvolvedor possa usar nossa tecnologia em seu produto

Sabemos que as pessoas passam a maior parte do seu tempo acordado online, conectadas, se expressando em várias plataformas e aplicativos. Em ambientes online, seu ‘avatar’ é sua representação completa. E, realmente, quem é essa pessoa sem uma voz?

Construir tecnologia de alteração de voz em tempo real e desenvolver um sistema de expressões sonoras personalizáveis é muito trabalho. Nossa equipe tirou esse passo da equação, projetando um kit completo que pode ser facilmente integrado por desenvolvedores em qualquer lugar. Estamos extremamente animados para tornar nossa tecnologia acessível a desenvolvedores e usuários em todo o mundo, à medida que continuamos a construir o futuro das experiências de áudio social!

Obrigado pela grande entrevista, leitores que desejam aprender mais devem visitar Voicemod

Antoine é um líder visionário e sócio-fundador da Unite.AI, impulsionado por uma paixão inabalável por moldar e promover o futuro da IA e da robótica. Um empreendedor serial, ele acredita que a IA será tão disruptiva para a sociedade quanto a eletricidade, e é frequentemente pego falando sobre o potencial das tecnologias disruptivas e da AGI.

Como um futurista, ele está dedicado a explorar como essas inovações moldarão nosso mundo. Além disso, ele é o fundador da Securities.io, uma plataforma focada em investir em tecnologias de ponta que estão redefinindo o futuro e remodelando setores inteiros.