Líderes de pensamento

Encontrando Sua Voz Autêntica: Como a Voz Sintética Pode Compartilhar Histórias de Marcas Com Públicos Globais Diversos

mm
Adicione Unite.AI às suas fontes preferidas no Google

Quase dois terços das pessoas que se identificam com uma minoria racial ou étnica dizem que são mais propensos a se envolver com marcas que incluem perspectivas diversificadas. Mas ser diverso é mais do que permitir que os clientes vejam a si mesmos em sua marca, é sobre deixá-los ouvir a si mesmos também.

No ano passado, o número de marcas que lançaram identidades de áudio pela primeira vez aumentou 22%. As empresas estão literalmente tentando cortar o barulho em sua indústria e melhorar sua mensagem para todos os indivíduos que atendem. Mas enquanto as marcas sabem os motivos éticos e econômicos para promover a diversidade, independentemente do meio, elas não sempre sabem as ferramentas para ajudá-las a fazer isso em escala.

Aqui entra a voz sintética. A tecnologia permite que as marcas se comuniquem com os públicos de forma mais inclusiva – e sem comprometer sua autenticidade. Além disso, a facilidade de uso da voz sintética significa que mais marcas podem utilizá-la e representar mais pessoas. Aqui está por que a voz sintética será o alto-falante para mais marcas diversificadas e suas histórias.

Empresas globais precisam de vozes globais

A transformação digital em massa impulsionou as marcas a serem globais desde o início. Em uma esfera de negócios predominantemente online, as empresas têm que atender a clientes em várias localizações e falando várias línguas com diferentes sotaques, dialetos e vocabulário. Independentemente do vertical em que você está, sua base de usuários provavelmente se diversificou nos últimos anos, e você tem que ecoar essa expansão em sua marca sonora.

As startups baseadas na Europa e na Ásia estão talvez mais preparadas para se diversificar do que seus equivalentes nos EUA. As empresas nos Estados Unidos tendem a se concentrar principalmente no mercado doméstico devido ao tamanho e ao escopo da oportunidade lá, diversificando-se em um estágio posterior quando vão além do país. As startups europeias e asiáticas se diversificam mais cedo porque elas cruzam uma gama de fronteiras e culturas. Operar em um mercado menor vem com a vantagem de um mercado mais multi-voz.

A tecnologia de voz é principalmente construída para falantes de inglês – em parte devido às suas raízes de desenvolvimento nos Estados Unidos, mas mais porque é a língua mais falada do mundo. No entanto, mais de um bilhão de pessoas falam inglês como segunda língua e raramente ouvem vozes de marcas que refletem seu sotaque como falante estrangeiro.

Com a voz sintética, as marcas podem trabalhar com atores de voz que falam inglês como segunda língua, capturar facilmente e com precisão suas nuances vocais e implantar esse áudio em suas campanhas de marketing. As marcas não apenas representarão mais grupos sociais, mas também poderão capitalizar sotaques distintos e fortes, como os das personalidades do entretenimento Sofía Vergara (colombiana) e Arnold Schwarzenegger (austríaco).

Replicar sotaques mais diversificados

Embora o pool de atores de voz tenha crescido nos últimos anos, a demografia dos atores ainda é uma maioria branca e masculina. Portanto, é difícil encontrar vozes com sotaques de locais menores ou mais remotos do mundo, por exemplo, a ilha de Malta.

Com a tecnologia de clonagem de voz personalizada sofisticada, atores de voz desses lugares (ou mesmo pessoas comuns de lá) podem ler um roteiro específico em um tom específico e ter as nuances sutis em seu sotaque gravadas. Esses sotaques podem então ser replicados no áudio da marca, permitindo que as empresas localizem seu conteúdo e tragam maneiras menos conhecidas de falar para seus públicos.

Naturalmente, a tecnologia ainda está em desenvolvimento e precisa de horas de gravações de áudio para ser robusta e soar natural. Os modelos de voz funcionam melhor quando são construídos para casos de uso específicos, como rádio, narração ou publicidade, então as marcas têm que levar em conta o contexto em que a voz será aplicada e aprimorar seu processo de acordo. O ciclo é ainda mais sutil quando sotaques raros estão sendo produzidos, pois as marcas podem não ser capazes de confirmar que a entonação e a velocidade são apropriadas para o cenário.

Há um motivo pelo qual o mercado de voz sintética é previsto ser de $36B até 2025; é sua capacidade de (literalmente) falar com as pessoas, dando às marcas uma linha direta para a vida diária de seus clientes. E em 2022, quando as pessoas querem que as marcas pareçam e soem como elas, a voz sintética permite que as empresas transmitam mais vozes, mais alto, e sem perder seu som original.

Tornar personagens de marca em vida

A marca sonora é uma ferramenta poderosa, especialmente entre os públicos mais jovens e tecnicamente astutos (que também são alguns dos mais vocais em chamar a atenção para as marcas que não são diversificadas). De fato, uma pesquisa do Reino Unido mostra que mais de 1 em 5 adultos abaixo de 35 anos são mais propensos a comprar um produto de uma marca, quanto mais ouvem o som associado a essa marca.

Mas o áudio não precisa ser de pessoas reais para ser considerado diverso. A voz sintética pode tornar personagens fictícios que falam a grupos de nicho, encapsulam certos traços de personalidade ou são simplesmente uma extensão divertida e instantaneamente reconhecível da marca. Basta olhar para os likes de Tony the Tiger, Mrs Butterworth e a Laughing Cow.

A voz sintética pode ser projetada com base em um conjunto de credenciais que constroem um personagem desejado. Por exemplo, se um personagem é feito de chocolate e deve soar doce, mas também um pouco ofegante, como se estivesse derretendo. A amplitude da tecnologia dá às marcas muita flexibilidade criativa e é benéfica para construir uma presença mais forte em plataformas de mídia social, como Instagram e TikTok, onde os usuários do Gen Z esperam por marcações mais únicas e artísticas.

Dr. Timo Kunz é o co-fundador e CEO da Aflorithmic - a primeira solução totalmente automatizável do mundo para criação de voz e áudio de ponta a ponta a partir de texto.