Entrevistas
Dylan Fox, CEO e Fundador da AssemblyAI – Série de Entrevistas

Dylan Fox é o CEO e Fundador da AssemblyAI, uma plataforma que converte automaticamente arquivos de áudio e vídeo e transmissões de áudio ao vivo em texto com os APIs de Speech-to-Text da AssemblyAI.
O que o atraiu inicialmente para a aprendizagem de máquina?
Eu comecei aprendendo a programar e participei de reuniões de Python em Washington DC, onde cursei a faculdade. Através de cursos de faculdade, eu me inclinei mais para problemas de programação do tipo algoritmo, o que me levou naturalmente à aprendizagem de máquina e NLP.
Antes de fundar a AssemblyAI, você era um Engenheiro de Software Sênior na Cisco, no que você estava trabalhando?
Na Cisco, eu era um Engenheiro de Software Sênior me concentrando em Aprendizagem de Máquina para seus produtos de colaboração.
Como o seu trabalho na Cisco e um problema com a tecnologia de reconhecimento de fala o inspiraram a lançar a AssemblyAI?
Em alguns dos meus trabalhos anteriores, tive a oportunidade de trabalhar em muitos projetos de IA, incluindo vários projetos que exigiam reconhecimento de fala. Mas todas as empresas que ofereciam reconhecimento de fala como um serviço eram incrivelmente ultrapassadas, difíceis de comprar algo, e estavam executando tecnologia de IA desatualizada.
À medida que me tornei mais e mais interessado em pesquisas de IA, notei que havia muito trabalho sendo feito no campo do reconhecimento de fala e como rapidamente a pesquisa estava melhorando. Então, foi uma combinação de fatores que me inspirou a pensar: “E se você pudesse construir uma empresa de API do tipo Twilio usando a última pesquisa de IA que fosse muito mais fácil para os desenvolvedores acessarem modelos de IA de ponta para reconhecimento de fala, com uma experiência de desenvolvedor muito melhor.”
E foi daí que a ideia para a AssemblyAI cresceu.
Qual é o maior desafio por trás da construção de tecnologia de reconhecimento de fala precisa e confiável?
Custo e talento são os maiores desafios para qualquer empresa abordar ao construir tecnologia de reconhecimento de fala precisa e confiável.
Os dados são caros para adquirir, e você normalmente precisa de centenas de milhares de horas para construir um sistema de reconhecimento de fala robusto. Além disso, os requisitos de computação são enormes para treinar. E servir esses modelos em produção também é caro e requer talento especializado para otimizar e torná-los econômicos.
Construir essas tecnologias também exige uma habilidade especializada que é difícil de encontrar. É um grande motivo pelo qual os clientes vêm até nós para modelos de IA poderosos que pesquisamos, treinamos e implantamos internamente. Eles obtêm acesso a anos de pesquisa em modelos de IA de ponta para ASR e NLP, tudo com uma API simples.
Além de transcrever apenas conteúdo de áudio e vídeo, a AssemblyAI oferece modelos adicionais, pode discutir o que esses modelos são?
Nossa suíte de modelos de IA se estende além da transcrição em tempo real e assíncrona. Nós nos referimos a esses modelos adicionais como Modelos de Inteligência de Áudio, pois eles ajudam os clientes a analisar e entender melhor os dados de áudio.
Nosso modelo de Sumarização fornece um resumo geral, bem como resumos codificados por tempo que segmentam automaticamente e geram um resumo para cada “capítulo” à medida que os tópicos em uma conversa mudam (semelhante a capítulos do YouTube).
Nosso modelo de Análise de Sentimento detecta o sentimento de cada sentença de fala falada em arquivos de áudio. Cada sentença em uma transcrição pode ser marcada como Positiva, Negativa ou Neutra.
Nosso modelo de Detecção de Entidades identifica uma ampla gama de entidades que são faladas em arquivos de áudio, como nomes de pessoas ou empresas, endereços de e-mail, datas e locais.
Nosso modelo de Detecção de Tópicos rotula os tópicos que são falados em arquivos de áudio e vídeo. As etiquetas de tópico previstas seguem a taxonomia padrão IAB, o que as torna adequadas para direcionamento contextual.
Nosso modelo de Moderação de Conteúdo detecta conteúdo sensível em arquivos de áudio e vídeo — como discurso de ódio, violência, questões sociais sensíveis, álcool, drogas e mais.
Quais são alguns dos maiores casos de uso para as empresas que usam a AssemblyAI?
Os maiores casos de uso que as empresas têm para a AssemblyAI abrangem quatro categorias: telefonia, vídeo, reuniões virtuais e mídia.
CallRail é um excelente exemplo de um cliente no espaço de Telefonia, que aproveita os modelos de IA da AssemblyAI — Transcrição Core, Destaques de Transcrição Automáticos e Redação de PII — para entregar uma solução poderosa de Inteligência Conversacional para seus clientes.
Basicamente, o CallRail agora pode automaticamente superfície e definir conteúdo-chave em suas chamadas para seus clientes em escala — conteúdo-chave como solicitações de clientes específicas, perguntas frequentemente feitas e palavras-chave e frases frequentemente usadas. Nosso modelo de Redação de PII ajuda a detectar e remover automaticamente dados sensíveis encontrados no texto da transcrição (por exemplo, números de seguridade social, números de cartão de crédito, endereços pessoais e mais).
Casos de uso de Vídeo variam de plataformas de streaming de vídeo a editores de vídeo como Veed, que usam os modelos de Transcrição Core da AssemblyAI para simplificar o processo de edição de vídeo para os usuários. O Veed permite que seus usuários transcrevam seus vídeos e os editem diretamente usando as legendas.
Em Reuniões Virtuais, empresas de software de transcrição de reuniões como Fathom estão usando a AssemblyAI para construir recursos inteligentes que ajudam seus usuários a transcrever e destacar os momentos-chave de suas chamadas do Zoom, promovendo melhor engajamento de reunião e eliminando tarefas tediosas durante e após as reuniões (por exemplo, tomar notas).
Na Mídia, vemos plataformas de hospedagem de podcast, por exemplo, usam nossos modelos de Moderação de Conteúdo e Detecção de Tópicos para que possam oferecer melhores ferramentas de anúncios para casos de uso de segurança de marca e monetizar conteúdo gerado pelo usuário com anúncios dinâmicos.
A AssemblyAI recentemente arrecadou uma rodada de US$ 30 milhões em série B. Como isso acelerará a missão da AssemblyAI?
O progresso que está sendo feito no campo da IA é incrivelmente emocionante. Nosso objetivo é expor esse progresso a todos os desenvolvedores e equipes de produtos na internet — por meio de um conjunto simples de APIs. À medida que continuamos a pesquisar e treinar modelos de IA de ponta para tarefas de ASR e NLP (como reconhecimento de fala, resumo, identificação de idioma e muitas outras tarefas), continuaremos a expor esses modelos de IA a desenvolvedores e equipes de produtos por meio de APIs simples — disponíveis gratuitamente.
A AssemblyAI é um lugar onde tanto desenvolvedores quanto equipes de produtos podem vir para ter acesso fácil aos modelos de IA avançados de que precisam para construir produtos, serviços e empresas novos e emocionais.
Nos últimos 6 meses, lançamos suporte ASR para 15 novos idiomas — incluindo espanhol, alemão, francês, italiano, hindi e japonês, lançamos melhorias significativas em nosso modelo de Sumarização, modelos de ASR em tempo real, modelos de Moderação de Conteúdo e inúmeras outras atualizações de produto.
Nós mal utilizamos nossos fundos da Série A, mas esse novo financiamento nos dará a capacidade de aumentar agressivamente nossos esforços — sem comprometer nossa autonomia.
Com esse novo financiamento, seremos capazes de acelerar nossa estrada de produto, construir melhor infraestrutura de IA para acelerar nossos motores de pesquisa e inferência de IA e crescer nossa equipe de pesquisa de IA — que hoje inclui pesquisadores da DeepMind, Google (GOOGL ) Brain, Meta AI, BMW e Cisco.
Há algo mais que você gostaria de compartilhar sobre a AssemblyAI?
Nossa missão é tornar modelos de IA de ponta acessíveis a desenvolvedores e equipes de produtos em escala extremamente grande por meio de uma API simples.
Obrigado pela grande entrevista, leitores que desejam aprender mais devem visitar AssemblyAI.












