Entrevistas
Thuy Le, Diretora de Produto da Speechmatics – Série de Entrevistas

Thuy Le é a Diretora de Produto da Speechmatics, Thuy tem mais de duas décadas de experiência em tecnologia e desenvolvimento de ideias inovadoras, bem como um BS em Engenharia Mecânica do MIT e um MS em Design de Produto de Stanford. Thuy tem uma ampla gama de experiência em gestão de produtos, design e desenvolvimento, bem como P&D, engenharia, desenvolvimento de mídia e estratégia de negócios. Na Speechmatics, ela é responsável por lançar produtos e serviços inovadores para garantir que a empresa permaneça líder de mercado em tudo o que faz.
Você se juntou à Speechmatics em novembro de 2019, após ter trabalhado em uma variedade de indústrias, incluindo veículos autônomos e software de análise de negócios B2B. O que o atraiu para trabalhar em reconhecimento de fala?
Eu sempre fui atraído pela aplicação de novas tecnologias para casos de uso interessantes e impacto significativo. O reconhecimento de fala, especialmente na Speechmatics, atende a esses critérios. Com certeza, foi ótimo ajudar a habilitar nossos clientes a aproveitar o valor da tecnologia de fala-para-texto em suas próprias ofertas de produtos variadas.
Como Diretora de Produto da Speechmatics, o que consiste o seu dia a dia?
A Speechmatics é uma empresa em crescimento e nossa equipe de Produto é pequena (e em crescimento!), então não há dois dias iguais e todos contribuem onde e quando necessário. Como Diretora de Produto, tudo, desde a estratégia de empresa e produto de alto nível até as típicas funções de produto de priorização de roadmap e interações com clientes até a resolução de problemas detalhados e práticos de entrega, são todos parte do jogo. Obviamente, a construção de relacionamentos em todo o organograma da empresa e o recrutamento também são partes importantes do papel.
Pode discutir os desafios de acessar conjuntos de dados com diferentes dialetos e sotaques?
Na tecnologia de fala, o motor é geralmente construído treinando-o em um dialeto de uma língua, tornando esse dialeto o que ele mais reconhece e transcreve com precisão. Em inglês, é o inglês americano, e as taxas de erro são geralmente mais altas para sotaques australianos, britânicos, jamaicanos, etc. Então, para empresas que utilizam a tecnologia para interagir com uma base de clientes global, isso apresenta um desafio enorme. Três anos atrás, em 2018, lançamos o Global English, nosso pacote de idioma líder de mercado que entende todos os sotaques e dialetos em inglês, e no ano passado, continuamos essa missão com o lançamento do Global Spanish. Acreditamos que, para a tecnologia de fala atingir seu potencial máximo, ela precisa entender todos com quem está interagindo. Estamos ansiosos para fechar ainda mais a lacuna de “sotaque” da IA com mais inovações que virão mais tarde este ano.
Quais são algumas das metodologias de aprendizado de máquina utilizadas para treinar esses conjuntos de dados?
Utilizamos técnicas de aprendizado profundo supervisionado e redes neurais familiares em nosso motor. Também pesquisamos continuamente novas abordagens, notadamente, como diminuir a quantidade de dados rotulados necessários nos modelos de ASR. Os dados são fundamentais ao construir tecnologia de reconhecimento de fala, então avançar na pesquisa que nos permite ampliar nosso alcance de dados é essencial. O uso de redes neurais em nosso motor nos permite generalizar melhor em diferentes contextos e idiomas.
A Speechmatics é atualmente líder de mercado, com testes mostrando que o Global Spanish é 3-20% mais preciso do que a oferta do Google (GOOGL ) e 4-13% mais preciso do que o produto comparável da Microsoft (MSFT ). O que você atribui a esse sucesso?
Como mencionei anteriormente, para a tecnologia de fala ser realmente um ativo para as empresas, ela precisa ajudá-las a entender toda a sua base de clientes, independentemente do idioma que estejam falando ou do dialeto que estejam usando. Isso está no cerne das inovações da Speechmatics, e estamos comprometidos em resolver esses desafios complexos. E temos uma equipe incrível que é apaixonada, motivada e investida em utilizar as últimas técnicas de aprendizado profundo para oferecer aos nossos clientes a melhor tecnologia do mercado.
Quais são os idiomas atuais oferecidos e quais idiomas estão sendo pesquisados para serem adicionados?
Atualmente, oferecemos mais de 30 idiomas comerciais, desde árabe até mandarim, polonês até português, e muitos mais. Mas são nossos pacotes de idioma em inglês e espanhol que são Globais. Olhando para o futuro, estamos explorando novas técnicas que não apenas nos permitirão adicionar novos idiomas mais rapidamente, mas também melhorar nossos idiomas existentes de forma mais regular.
Quais são suas visões sobre um futuro habilitado para fala, onde a voz é a forma primária de comunicação?
As empresas estão cada vez mais vendo valor na tecnologia de reconhecimento de fala: 2020 viu um aumento marcado na adoção da tecnologia entre as empresas, com 68% dos respondentes relatando que sua empresa tem uma estratégia de tecnologia de voz — um aumento de 18% em relação ao ano anterior. Mas, para atingir seu potencial de valor máximo, a tecnologia está pronta para um upgrade. Uma conversa é mais do que apenas palavras – é também feita de pistas contextuais como sentimento, cadência, pontuação, ruído de fundo, tom, mudanças de falante e mais. Embora o texto de tecnologia de reconhecimento de fala sozinho permita muito valor em si mesmo, quando se trata de arquivos de áudio ou até mesmo arquivos de vídeo, a fala real registrada pode agora estender-se além das palavras. O futuro da tecnologia de reconhecimento de fala considerará todos esses outros fatores. Somente então não será apenas sobre converter fala em texto, mas converter fala em valor e realmente entender cada voz.
Há algo mais que você gostaria de compartilhar sobre a Speechmatics?
Temos algumas inovações emocionais que serão lançadas mais tarde este ano, então fiquem atentos para elas!
Obrigado pela grande entrevista, leitores que desejam aprender mais devem visitar Speechmatics.












