Entrevistas

Matt Hocking, Co-Fundador da WellSaid Labs – Série de Entrevistas

mm
Adicione Unite.AI às suas fontes preferidas no Google

Matt Hocking é o co-fundador da WellSaid Labs, uma líder em geradores de voz de IA de nível empresarial. Ele tem mais de 15 anos de experiência liderando equipes e entregando soluções de tecnologia em larga escala.

Sua formação é bastante empreendedora, como você se envolveu inicialmente com a IA?

Eu acho que sempre me considerei um empreendedor. Eu comecei meu primeiro negócio após a faculdade e, com uma formação em design de produtos, encontrei-me gravitando em direção a ajudar pessoas com ideias em estágio inicial. Ao longo da minha carreira, tive a sorte de trabalhar com várias startups que tiveram corridas incríveis. Durante essas experiências, tive exposição a muitos grandes fundadores em primeira mão, o que me inspirou a perseguir minhas próprias ideias como fundador. A IA era relativamente nova para mim quando me juntei à AI2; no entanto, essa experiência me proporcionou a oportunidade de aplicar minha lente de produtos e startups a algumas pesquisas incríveis e imaginar como esses novos avanços seriam capazes de ajudar muitas pessoas nos anos seguintes. Meu objetivo desde o início tem sido desenvolver negócios reais para pessoas reais, e acredito que a IA tem o potencial de criar muitas oportunidades e eficiências emocionais em nosso futuro, se aplicada de forma reflexiva.

Poderia compartilhar a história de como a ideia para a WellSaid Labs foi concebida quando você era empreendedor residente no Instituto Allen para IA?

Eu me juntei ao Instituto Allen para Inteligência Artificial (AI2) como Empreendedor Residente em 2018. Sem dúvida, o incubador mais inovador do mundo, o AI2 abriga as mentes mais brilhantes em IA que aplicam soluções da borda do que é possível hoje a produtos tangíveis que resolvem problemas em todo o mundo. Minha formação em design e tecnologia nutriu um interesse de longa data nos campos criativos, e com o boom de IA que estamos presenciando hoje, eu queria explorar uma maneira de conectar os dois. Fui apresentado a Michael Petrochuk (co-fundador e CTO da WellSaid Labs) enquanto desenvolvia um aplicativo de saúde interativo que guiava o paciente por meio de vários cenários sensíveis. Durante o processo de desenvolvimento do conteúdo para a experiência, minha equipe trabalhou com talentos de voz para gravar milhares de linhas de voz para o avatar. Quando fui exposto a algumas das conquistas que Michael havia alcançado durante sua pesquisa, nós dois rapidamente vimos o valor de como a fala de paridade humana poderia transformar não apenas o produto em que eu estava trabalhando, mas também impactar uma série de outras aplicações e indústrias. A tecnologia e a ferramenta lutaram para acompanhar as necessidades dos produtores que criam com a voz como meio. Vimos um caminho para colocar essa tecnologia nas mãos de todos os criadores, permitindo que a voz seja uma parte integral de todas as histórias.

A WellSaid Labs é uma das poucas empresas que fornece aos atores de voz uma oportunidade de entrar no espaço de voz de IA. Por que você acreditou que era importante integrar vozes reais ao produto?

Nossa resposta é dupla: primeiro, queríamos criar soluções que complementassem as capacidades dos atores de voz profissionais, expandindo oportunidades para a voz. E segundo, nos esforçamos para ter o mais alto nível de qualidade humana em nossos produtos. Nossos atores de voz são parceiros de colaboração de longo prazo e recebem compensação e participação nos lucros por ambos os dados de voz e o conteúdo subsequente produzido com ele. Cada ator de voz que contratamos para criar um avatar de voz de IA baseado na semelhança de sua voz é pago com base em quanto sua voz é usada em nossa plataforma. Encorajamos o talento a se associar conosco; a compensação justa por suas contribuições é incrivelmente importante para nós.

Para oferecer o mais alto nível de produtos de qualidade humana no mercado, devemos ser rigorosos sobre onde obtemos nossos dados. Esse processo nos dá mais controle sobre a qualidade, pois treinamos nossos modelos de aprendizado profundo para falar tanto para a paridade humana quanto para estilos relevantes contextualmente. Não criamos apenas uma voz que recita a entrada fornecida. Nossos modelos oferecem uma variedade de estilos de voz que realizam o que está na página. Seja criando voz por meio de um avatar de nossa biblioteca ou criando voz com uma voz personalizada para a marca deles, usamos dados de voz reais para garantir um processo sem problemas e uma plataforma fácil de usar. Se nossos clientes tivessem que manipular e editar nossas vozes em pós-produção, o processo de obter a saída desejada seria desajeitado e longo. Nossas vozes capturam o contexto do conteúdo escrito e fornecem uma leitura contextualmente precisa. Oferecemos vozes para todos os tipos de casos de uso – seja lendo as notícias, criando um anúncio de áudio ou suporte de call center automatizado –, então, associar-se a talentos de voz profissionais para cada caso de uso nos fornece tanto o contexto quanto os dados de voz de alta qualidade.

Atualizamos regularmente e adicionamos novos estilos e sotaques à nossa biblioteca de avatares para garantir que representemos as vozes de nossos clientes. No Estúdio da WellSaid Labs, os clientes e marcas podem audicionar diferentes vozes com base na região, estilo e caso de uso, permitindo uma produção de conteúdo de áudio mais unificada e personalizada às necessidades do criador. Uma vez que uma gravação inicial é amostrada, os usuários podem acionar palavras específicas, grafias e pronúncias para garantir que a IA fale consistentemente de acordo com as suas necessidades.

A WellSaid Labs está reivindicando seu lugar como a primeira plataforma de voz de IA ética. Por que a ética da IA é importante para você?

À medida que a adoção de IA aumenta e se torna mais mainstream, os medos de casos de uso prejudiciais e atores ruins estão no centro de todas as conversas – e essas preocupações são infelizmente validadas por ocorrências do mundo real. A voz de IA não é exceção; quase todos os dias, um novo relatório de um celebridade, figura pública ou político sendo deepfaked para anúncios ou propósitos políticos faz manchetes. Embora a regulação federal formal sobre essa tecnologia ainda esteja evoluindo, detectar e combater atores e usos mal-intencionados de voz sintética se tornará cada vez mais difícil à medida que a tecnologia continuar a avançar.

Vindo do AI2, onde a ética da IA é um princípio fundamental, Michael e eu tivemos essas conversas no primeiro dia. Desenvolver tecnologia de fala de IA vem com responsabilidades significativas em relação ao consentimento, privacidade e segurança geral. Sabemos que, como desenvolvedores, devemos construir nossa tecnologia de forma segura, abordar preocupações éticas e estabelecer as bases para o desenvolvimento futuro de vozes sintéticas. Reconhecemos o potencial da tecnologia de fala de IA para uso indevido e abraçamos nossa responsabilidade por reduzir o potencial de uso indevido de nosso produto. Precisamos estabelecer essa base desde o início, em vez de correr rápido e cometer erros pelo caminho. Isso não seria fazer o que é certo por nossos clientes e atores de voz, que contam conosco para construir um produto de alta qualidade e confiável.

Apoiamos totalmente o apelo à legislação nesse campo; no entanto, não esperaremos por regulamentações federais para serem promulgadas. Sempre priorizamos e continuaremos a priorizar práticas que apoiam a privacidade, a segurança, a transparência e a responsabilidade.

Seguimos estritamente o nosso código de ética de intenção, que se baseia na construção de inovação responsável em cada decisão que tomamos. Isso é do melhor interesse de nossos clientes globais – marcas empresariais.

Como você desenvolve uma plataforma de voz de IA ética?

A WellSaid Labs está comprometida com a inovação ética desde o início. Centralizamos a confiança e a transparência por meio do uso de modelos de dados internos, requisitos de consentimento explícito, nosso programa de moderação de conteúdo e nosso compromisso com a proteção de marcas. Na WellSaid, nos apoiamos nos princípios de IA Responsável para moldar nossas decisões e designs, e esses princípios se estendem ao uso de nossas vozes. Nosso código de ética representa esses princípios como Responsabilidade, Transparência, Privacidade e Segurança, e Justiça.

Responsabilidade: Mantemos padrões rigorosos para conteúdo apropriado, proibindo o uso de nossas vozes para conteúdo que seja prejudicial, odioso, fraudulento ou destinado a incitar violência. Nossa equipe de Confiança e Segurança mantém esses padrões com um programa rigoroso de moderação de conteúdo, bloqueando e removendo usuários que tentam violar nossos Termos de Serviço.

Transparência: Exigimos consentimento explícito antes de construir uma voz sintética com os dados de voz de alguém. Os usuários não podem carregar dados de voz de políticos, celebridades ou qualquer outra pessoa para criar um clone de sua voz, a menos que tenhamos o consentimento explícito e por escrito dessa pessoa.

Privacidade e Segurança: Protegemos as identidades de nossos atores de voz usando imagens em estoque e pseudônimos para representar as vozes sintéticas. Também encorajamos que eles exerçam cautela sobre como e com quem compartilham sua associação com a WellSaid Labs ou outras empresas de voz sintética para reduzir a oportunidade de uso indevido de sua voz.

Justiça: Compensamos todos os atores de voz que fornecem dados de voz para nossa plataforma e fornecemos a eles uma participação contínua nos lucros pelo uso da voz sintética que construímos com seus dados.

Além desses princípios, também respeitamos estritamente a propriedade intelectual. Não reivindicamos a propriedade sobre o conteúdo fornecido por nossos usuários ou atores de voz. Priorizamos a integridade, a justiça e a transparência em tudo o que fazemos, garantindo que nossa tecnologia de fala sintética seja usada de forma responsável e ética. Procuramos ativamente parcerias com vozes de diversos contextos e experiências para garantir que a WellSaid Labs forneça uma voz para todos.

Nosso compromisso com a inovação responsável e o desenvolvimento de tecnologia de voz de IA com ética em mente nos distingue de outros no espaço que buscam capitalizar em uma nova indústria não regulamentada por meio de qualquer meio. Nossos investimentos iniciais em ética, segurança e privacidade estabelecem confiança e lealdade dentro de nossos atores de voz e clientes, que cada vez mais buscam produtos e serviços feitos eticamente pelas empresas à frente da inovação.

A WellSaid Labs criou seu próprio modelo de IA interno que permitiu que suas vozes de IA atingissem a paridade humana, e isso foi alcançado trazendo as imperfeições humanas para as conversas. O que é sobre essas imperfeições que tornam a IA melhor, e como essas imperfeições são implementadas?

A WellSaid Labs não é apenas outro gerador de TTS. Onde a tecnologia de TTS inicial não conseguia reconhecer qualidades de fala humana, como tom, entonação e dialeto que transmitem o contexto e a emoção por trás das palavras, as vozes da WellSaid alcançaram a paridade humana, trazendo imperfeições humanas únicas para a fala gerada por IA.

Nossa medida principal de qualidade de voz é e sempre foi a naturalidade humana. Essa crença orientadora moldou nossa tecnologia em todas as etapas, desde as bibliotecas de scripts que construímos até as instruções que damos ao talento e, mais recentemente, como iteramos sobre nossos algoritmos de TTS principais.

Treinamos em vocalizações humanas autênticas. Nossos talentos de voz lêem seus scripts de forma autêntica e envolvente quando gravam para nós. A perfeição da fala, por outro lado, é um conceito mecânico que leva a uma saída robótica e não natural. Quando os talentos de voz profissionais se apresentam, sua taxa de fala flutua. Sua sonoridade se move em conjunto com o conteúdo que estão lendo. Sua altura vocal pode subir em uma passagem que exige uma leitura animada e cair novamente em uma linha mais sombria. Essas variações dinâmicas compõem um desempenho vocal humano envolvente.

Ao construir processos de IA que funcionam em coordenação com os desempenhos dinâmicos de nossos talentos profissionais, construímos uma plataforma de TTS verdadeiramente natural. Desenvolvemos o primeiro sistema de TTS de longa forma com controles preditivos em todo o processo criativo. Nossa biblioteca fonética contém uma coleção diversificada de dados de áudio, permitindo que os usuários incorporem dicas vocais específicas, como orientação de pronúncia ou controllabilidade, no modelo durante a fase de produção. Em uma plataforma, os usuários da WellSaid podem gravar, editar e estilizar sua voz sem precisar importar dados externos.

Poderia discutir alguns dos desafios por trás da construção de uma empresa de TTS de IA?

O desenvolvimento da tecnologia de voz de IA criou um conjunto completamente novo de obstáculos para ambos os produtores e consumidores. Um dos principais desafios é não se deixar levar pelo barulho e pela histeria que inunda o setor de IA. Como uma tecnologia nova e badalada, muitas organizações estão tentando capitalizar em desenvolvimentos de voz de IA de curto prazo. Queremos fornecer uma voz para todos, guiados por princípios éticos centrais e autenticidade. Essa adesão à autenticidade pode atrasar o desenvolvimento e a implantação de nossas tecnologias, mas solidifica a segurança e a segurança das vozes da WellSaid e de seus dados.

Outro desafio no desenvolvimento de nossa plataforma de TTS foi desenvolver diretrizes de consentimento específicas para garantir que organizações ou atores individuais não abusem de nossa tecnologia. Para combater esse desafio, buscamos parcerias colaborativas e de longo prazo e estamos completamente envolvidos com o desenvolvimento de voz para aumentar a responsabilidade, a transparência e a segurança do usuário. Procuramos ativamente parcerias com talentos de voz de diversos contextos, organizações e experiências para garantir que a biblioteca de vozes da WellSaid Labs reflita seus criadores e audiência. Esses processos são projetados para ser intencionais e detalhados para garantir que nossa tecnologia seja usada da forma mais segura e ética possível, o que pode retardar o desenvolvimento e o lançamento.

Qual é sua visão para o futuro da IA de voz gerativa?

Por muito tempo, a tecnologia de fala de IA não alcançou a qualidade necessária para permitir que as empresas criem conteúdo significativo em larga escala. Agora que a tecnologia de áudio não exige mais equipamentos e hardware caros, todo o conteúdo escrito pode ser produzido e publicado em um formato de áudio para criar experiências multimodais envolventes e naturais.

Hoje, as vozes de IA podem produzir áudio humano e capturar a nuances necessárias para tornar a narrativa digital mais acessível e natural. O futuro da IA de voz gerativa será uma experiência auditiva abrangente que tocará todos os aspectos de nossas vidas. À medida que a tecnologia continuar a avançar, veremos vozes sintéticas cada vez mais naturais e expressivas que borrará a linha entre a fala humana e a máquina – abrindo novas portas para negócios, comunicações, acessibilidade e como interagimos com o mundo ao nosso redor.

As empresas encontrarão personalização aprimorada em interfaces de voz de IA e as usarão para tornar interações com assistentes virtuais mais imersivas e fáceis de usar. Essas melhorias já estão acontecendo, desde agentes de call center inteligentes até drive-thrus de fast-food. A criação de conteúdo, incluindo publicidade, marketing de produtos, narração de notícias, podcasts, livros de áudio e outros multimídia, verá uma eficiência aumentada usando ferramentas para desenvolver conteúdo envolvente – eventualmente aumentando o levantamento e a receita para as organizações, especialmente agora que os modelos multilíngues podem expandir a presença de uma empresa de um único ponto de origem para uma presença global. As equipes de produção encontrarão um grande benefício em vozes sintéticas para criar vozes personalizadas para as necessidades da marca ou personalizadas para o ouvinte.

Antes da introdução da IA, a tecnologia de TTS carecia da emoção humana crucial, entonação e habilidades de pronúncia necessárias para contar uma história completa em larga escala e com facilidade. Agora, a TTS alimentada por IA oferece experiências mais imersivas e acessíveis, incluindo capacidades de fala em tempo real e agentes conversacionais interativos.

Atingir capacidades de fala humanas tem sido uma jornada, mas agora que é alcançável, estamos testemunhando o escopo completo da IA de voz para criar valor comercial real para as organizações.

Obrigado pela grande entrevista, leitores que desejam aprender mais devem visitar WellSaid Labs.

Antoine é um líder visionário e sócio-fundador da Unite.AI, impulsionado por uma paixão inabalável por moldar e promover o futuro da IA e da robótica. Um empreendedor serial, ele acredita que a IA será tão disruptiva para a sociedade quanto a eletricidade, e é frequentemente pego falando sobre o potencial das tecnologias disruptivas e da AGI.

Como um futurista, ele está dedicado a explorar como essas inovações moldarão nosso mundo. Além disso, ele é o fundador da Securities.io, uma plataforma focada em investir em tecnologias de ponta que estão redefinindo o futuro e remodelando setores inteiros.