Entrevistas
Tyler Weitzman, Co-Fundador e Diretor de Inteligência Artificial da Speechify – Série de Entrevistas

Tyler Weitzman é o Co-Fundador, Diretor de Inteligência Artificial e Presidente da Speechify, o aplicativo de texto-para-voz número 1 do mundo, com mais de 100.000 avaliações de 5 estrelas. Weitzman é formado pela Universidade de Stanford, onde recebeu um BS em matemática e um MS em Ciência da Computação na trilha de Inteligência Artificial. Ele foi selecionado pela Revista Inc. como um dos 50 principais empreendedores e foi destaque em publicações como Business Insider, TechCrunch, LifeHacker, CBS, entre outras. A pesquisa de mestrado de Weitzman se concentrou em inteligência artificial e texto-para-voz, onde seu trabalho final foi intitulado: “CloneBot: Previsões de Respostas de Diálogo Personalizadas.”
Você começou a programar quando tinha apenas 9 anos de idade, o que o atraiu inicialmente para a ciência da computação?
Eu era um garoto bastante obcecado por Dragon Ball Z e queria aprender a criar animações sozinho. Apreendi Adobe (ADBE ) Flash e Photoshop e coloquei minhas próprias animações de Goku em uma página de fãs que eu criei. Logo após, comecei a aprender sobre sistemas e algoritmos, e quando descobri que podia programar para ganhar a vida, foi muito emocionante. Pensei que era apenas um hobby, como jogar games.
Em seguida, você começou a criar aplicativos para iPhone quando tinha apenas 12 anos de idade, quais foram alguns desses aplicativos?
Um aplicativo se chamava Black SMS, que permitia que as pessoas enviassem mensagens de texto criptografadas umas para as outras. Outro aplicativo se chamava Frontback, que permitia que os usuários tirassem selfies e fotos do que estava à frente deles ao mesmo tempo.
Pode discutir sua pesquisa na Universidade de Stanford e como ela se concentrou em processamento de linguagem natural e síntese de fala?
Minha pesquisa abrangeu vários usos para redes transformer, incluindo modelos de geração de linguagem para chat, marcação de parte da fala, previsão de pontuação e texto-para-voz. A otimização da inferência de redes neurais para CPUs móveis foi um foco principal e isso se traduziu diretamente para as vozes offline disponíveis no Speechify, que funcionam mesmo no modo avião.
Pode compartilhar a história por trás da criação da Speechify?
Eu sou cego de um olho e meu irmão Cliff é disléxico. Nós usamos livros de áudio e tecnologia de texto-para-voz para nos ajudar a estudar e a ler livros como Harry Potter desde que éramos jovens. À medida que crescemos e começamos a usar mais produtos de tecnologia, começamos a perceber que havia uma oportunidade para criar aplicativos de texto-para-voz melhores na web e em dispositivos móveis, com vozes melhores graças aos avanços na IA e uma melhor experiência do usuário. Então, decidimos criar a Speechify.
Quais são algumas das diferentes tecnologias de aprendizado de máquina utilizadas na Speechify?
Nós adotamos técnicas de ponta para arquiteturas geradoras avançadas — transformadores/conformadores, pré-treinamento em larga escala, treinamento distribuído, acumulação de gradientes, espaços latentes auto-codificados, difusão, redes adversárias e modelagem de linguagem. Nós empregamos técnicas de processamento de recursos para fonemização, tom e emoção, para melhor modelar a fala especificamente.
Quais são alguns dos desafios por trás da criação de um aplicativo de texto-para-voz?
Um dos principais desafios é criar vozes de alta qualidade que soem como humanos reais, e não como robôs. Nosso objetivo é que as pessoas não consigam distinguir como nossas vozes soam em comparação com as vozes humanas, para que nossos usuários se sintam confortáveis ouvindo conteúdo no Speechify por longos períodos de tempo. Outro desafio é distribuir nossos modelos de IA para milhões de usuários. É uma coisa construir vozes de IA de alta qualidade e outra garantir que milhões de usuários em todo o mundo descubram e usem essas vozes.
A Speechify é o aplicativo número 1 em sua categoria na loja de aplicativos, a que você atribui esse sucesso?
Acreditamos que criamos os melhores produtos no mercado para pessoas que desejam ouvir o que precisam — seja para estudantes com lições de casa, profissionais que leem para o trabalho ou leitores de lazer que apenas querem se divertir. Nós temos a melhor seleção de vozes, incluindo celebridades como Snoop Dogg, e a melhor interface de usuário para que as pessoas possam facilmente carregar e acessar o conteúdo que desejam consumir. E nossa experiência do usuário é perfeita em todo o ecossistema da Speechify — você pode começar a ouvir um artigo no seu computador e então facilmente continuar ouvindo no seu telefone.
Quais são alguns dos principais casos de uso para esse aplicativo?
A IA geradora da Speechify resolve problemas reais para estudantes que desejam terminar a lição de casa mais rapidamente, pessoas reais com dislexia e TDAH que têm dificuldade em ler, idosos com visão baixa, profissionais que desejam ler mais e ser mais produtivos, escritores que desejam ouvir seu trabalho, aprendizes auditivos e muitos outros.
Qual é sua visão para o futuro da IA?
Queremos que a IA — e especificamente as vozes de texto-para-voz da IA — eliminem barreiras para o aprendizado, independentemente do nível de renda, diferenças de aprendizado, geografia ou idioma. Vemos a IA como uma ferramenta para o bem social, para elevar a qualidade de vida que os humanos podem ter, melhorando sua educação.
Obrigado pela grande entrevista, leitores que desejam aprender mais devem visitar Speechify.












