Entrevistas

Simon Poghosyan, Fundador e CEO da GSpeech – Série de Entrevistas

mm
Adicione Unite.AI às suas fontes preferidas no Google

Simon Poghosyan é o fundador e CEO da GSpeech, uma plataforma baseada na web que ajuda a tornar o conteúdo online mais acessível, convertendo texto em áudio natural em mais de 70 idiomas. Com uma formação em VLSI Design e um forte interesse em programação e experiência do usuário, Simon criou a GSpeech para simplificar a forma como os sites podem oferecer conteúdo com voz ativada.

Hoje, a GSpeech gera cerca de 200 milhões de caracteres de áudio por mês e é usada em mais de 70 países, com seus jogadores de áudio personalizáveis servindo mais de 200.000 reproduções mensais. Após ultrapassar 1 bilhão de caracteres de áudio gerados no total, a GSpeech continua a crescer rapidamente. A plataforma é projetada para ser fácil de integrar — exigindo apenas uma linha de código — e apoia criadores, educadores e empresas para tornar seu conteúdo mais inclusivo e atraente.

A GSpeech também é usada em todas as nossas páginas em inglês, você pode ouvir este artigo e ver como a GSpeech se sai bem, clicando no botão de reprodução.

Sua formação em VLSI Design (Integração em Grande Escala) e sua experiência inicial em programação criaram uma base técnica sólida. O que inspirou sua mudança de microeletrônica para o desenvolvimento de software com IA, e como isso levou à criação da GSpeech?

Minha paixão por resolver problemas começou no ensino médio, impulsionada por um amor por matemática e física. Isso me levou a obter um bacharelado (2009) e mestrado (2011) em VLSI Design pela Universidade Estadual de Engenharia da Armênia, em colaboração com a Synopsys Armênia. Estudar física me treinou em pensamento preciso e analítico, mas foi durante meu segundo ano que descobri a programação — começando com a linguagem Pascal — e imediatamente me apaixonei por ela. Meu amigo e eu completávamos os trabalhos de curso assim que os recebíamos, embora tivéssemos seis meses para terminar. Então, por diversão, começamos a fazer os trabalhos de outros alunos.

Essa paixão me levou mais a fundo no desenvolvimento de software. Comecei com a criação de sites, então construí meu próprio CMS. Após completar vários projetos em automação de processos e design de arquiteturas de gerenciamento de dados, percebi o quanto eu amava construir soluções digitais para interfaces da web. Através do projeto 2GLux, colaborei com Edvard Ananyan — criador do popular serviço de tradução GTranslate e um amigo da escola do Quant Gymnasium. Ele me apresentou aos ecossistemas WordPress e Joomla, e o conceito para a GSpeech surgiu com ele. Esse trabalho inicial levou à primeira versão de nossa ferramenta, permitindo que os usuários ouvissem texto em uma página da web, plantando a semente do que mais tarde se tornaria uma plataforma de IA completa. Em 2023, estabeleci a Smarts Club LLC para escalar a GSpeech em uma solução de áudio de IA global, suportando 70+ idiomas. O elogio da Humanity Union pelo papel da GSpeech na melhoria da acessibilidade de sua plataforma de engajamento cívico reflete minha missão de pontuar as divisões digitais por meio da IA — uma visão enraizada em meus primeiros dias de programação.

A GSpeech originalmente começou como uma ferramenta para apoiar usuários com deficiência visual. Como essa missão inicial influenciou a evolução da plataforma em uma solução de texto-para-voz de IA completa?

O foco na acessibilidade impulsionou o desenvolvimento de áudio de IA de alta qualidade em tempo real, tradução para 70+ idiomas e integração de site simples via um snippet de código. Essa missão levou a recursos como jogadores de áudio personalizáveis, painéis de seleção de idioma e voz, reprodução sensível ao contexto, downloads de áudio e estatísticas de uso detalhadas — incluindo dados de país, cidade, dispositivo e análise de reprodução ao longo do tempo — todos projetados para tornar o conteúdo mais inclusivo e atraente. Após escrever mais de 100.000 linhas de código, lança a GSpeech Cloud Console em 2023 — uma solução escalável que equilibra inclusividade com funcionalidade avançada, capacitando empresas e criadores a tornar seu conteúdo acessível, multilíngue e interativo em toda a web.

Quais foram alguns dos maiores desafios técnicos que você enfrentou durante o desenvolvimento da GSpeech Cloud Console?

Um dos maiores desafios no desenvolvimento da GSpeech Cloud Console foi projetar uma arquitetura escalável para geração de áudio de IA em tempo real, segura e de alta qualidade. Isso exigiu soluções inovadoras para buscar conteúdo relevante da web, processar áudio em nossos servidores e armazená-lo na nuvem para entrega rápida e confiável. Implementar medidas de segurança robustas, como criptografia e controles de acesso, foi crítico para proteger conteúdo dinâmico gerado pelo usuário.

Outro obstáculo foi habilitar a tradução em tempo real usando motores neurais avançados. Tivemos que garantir traduções de baixa latência e precisas, enquanto construíamos uma interface intuitiva que permitisse aos usuários selecionar idiomas e perfis de voz preferidos para reprodução, priorizando o conforto e a personalização do usuário. Finalmente, desenvolvemos um criador de modelos de áudio com múltiplas visualizações de jogador personalizáveis, permitindo que os usuários projetassem jogadores únicos e visualmente atraentes adaptados a seus sites. Equilibrar flexibilidade, desempenho e facilidade de uso em dispositivos foi um desafio gratificante.

Com tradução em tempo real em 70+ idiomas e mais de 230 vozes naturais. Como você garante a qualidade da voz e mantém a precisão em todo o conjunto de idiomas diversificado?

Para manter a qualidade consistente da voz, integramos vários modelos de texto-para-voz (TTS) avançados que são continuamente otimizados e atualizados. Esses motores multilíngues lidam com conteúdo de idiomas mistos com alta precisão. Estamos também lançando mais de 100 novos estilos de voz para dar aos usuários opções ainda mais expressivas e naturais. Todo mês, a GSpeech gera mais de 200 milhões de caracteres de áudio, atendendo usuários em mais de 70 países, com nossos jogadores online sendo usados mais de 200.000 vezes por mês — e crescendo. Essa escala garante feedback e testes do mundo real contínuos, que informam diretamente nossos controles de ajuste e qualidade.

Pode nos guiar sobre como a GSpeech aproveita a IA e o aprendizado de máquina para entregar síntese de voz realista? Como você acompanha os avanços rápidos na tecnologia de voz neural?

A GSpeech usa IA avançada e aprendizado de máquina, integrando vários modelos de texto-para-voz de ponta para produzir síntese de voz realista. Esses modelos, otimizados para naturalidade e suporte multilíngue, processam entradas de texto para gerar áudio de alta qualidade com entonação e ritmo realistas, mesmo para conteúdo de idiomas mistos. Aprimoramos a experiência do usuário oferecendo estilos de voz personalizáveis para idiomas diversos. Também integramos aliases de TTS, que permitem que os usuários definam regras personalizadas para como certas palavras ou frases são renderizadas em áudio — por exemplo, substituindo termos específicos para alcançar pronúncia ou frasing mais precisa. Para acompanhar a tecnologia de voz neural, continuamente avaliamos e integramos os últimos avanços, colaboramos com líderes da indústria e planejamos desenvolver modelos proprietários no futuro, garantindo que a GSpeech permaneça à frente da inovação em síntese de voz.

Quão importante é o ajuste de voz, controle de tom e personalização de reprodução para seus usuários — e qual é o caso de uso que você está mais orgulhoso onde esses recursos realmente brilham?

O ajuste de voz, controle de tom e personalização de reprodução são críticos para nossos usuários, permitindo que eles criem estilos de voz únicos de alta qualidade adaptados às suas necessidades específicas, desde sites de notícias e blogs até conteúdo de aprendizado acessível. A integração contínua de mais de 100 novos estilos de voz melhora ainda mais isso, oferecendo aos usuários flexibilidade sem precedentes para criar locuções verdadeiramente distintas. Estou mais orgulhoso do GSpeech Studio, uma nova plataforma de edição e geração de áudio que estou desenvolvendo. Ela permite que os usuários criem múltiplos canais de áudio, misturem com música de fundo e exportem locuções polidas, capacitando criadores a produzir áudio de qualidade profissional para aplicações diversas. Uma carta de um estudante com deficiência visual, agradecendo a GSpeech por permitir estudo independente por meio de áudio personalizado, me tocou profundamente. Esse caso de uso mostra como esses recursos tornam o conteúdo acessível e transformador, um objetivo que eu persegui desde meus primeiros dias de programação.

A GSpeech oferece integrações perfeitas com WordPress, Shopify , Wix e mais. Qual foi sua estratégia para tornar a plataforma plug-and-play para criadores e empresas em diferentes ecossistemas?

Nossa estratégia para as integrações plug-and-play da GSpeech com plataformas como WordPress, Shopify e Wix se concentrou na simplicidade, compatibilidade e escalabilidade. Desenvolvemos plugins e snippets de código leves e modulares que se integram de forma transparente, exigindo configuração mínima — frequentemente apenas alguns cliques. Isso significa que milhares de artigos e blocos de conteúdo dinâmico podem ganhar suporte a voz instantaneamente — sem esforço manual. Oferecemos jogadores de alta flexibilidade e beleza, que se adaptam a dispositivos, incluindo mobile, tablets e desktops. Nossos jogadores não são apenas personalizáveis, mas também otimizados para acessibilidade e engajamento do usuário. Para o WordPress, incorporamos o painel de controle da GSpeech diretamente no painel de administração por meio do nosso plugin, simplificando a gestão para os usuários. Documentação detalhada e painéis intuitivos guiam usuários não técnicos por meio da instalação e personalização. Testes regulares garantem desempenho consistente em ecossistemas diversos, capacitando criadores e empresas a adicionar texto-para-voz de IA sem esforço.

Olhando para a jornada desde 2012 até hoje, qual foi o maior marco para você pessoal ou profissionalmente na construção da GSpeech?

O maior marco para a GSpeech foi gerar 1 bilhão de caracteres de áudio de IA de alta qualidade, demonstrando nosso impacto global na acessibilidade. Igualmente significativo foi o feedback que recebemos de organizações como a Humanity Union, que elogiou a GSpeech por melhorar a acessibilidade de sua plataforma de engajamento cívico, e de proprietários de blogs que a chamaram de “um divisor de águas” para o engajamento do usuário. Mais de 110 avaliações com 5 estrelas em plataformas como WordPress e AppSumo nos últimos meses refletem isso, mostrando confiança crescente.

A GSpeech agora também é usada ativamente pelo departamento de estatísticas regionais de Namangan no Uzbequistão — uma instituição governamental com tráfego significativo e visibilidade nacional. Ver uma entidade pública adotar nossa tecnologia de forma tão ampla foi um marco significativo e um sinal poderoso de confiança em nossa solução.

Como cristão e alguém que serve na igreja armênia, também tento apoiar outras iniciativas baseadas na fé sempre que possível. Muitas vezes, ofereço a GSpeech gratuitamente a sites cristãos como uma forma de ajudar a espalhar sua mensagem de forma mais eficaz e tornar as Escrituras mais acessíveis por meio do áudio. É minha pequena contribuição para algo maior. Ao mesmo tempo, estou honrado em trabalhar com ministérios dedicados como The Cord — uma congregação messiânica e valioso cliente da GSpeech — cuja missão e conteúdo refletem o poder das Escrituras em ação.

Esses momentos — quando a tecnologia se torna uma ponte para a fé, compreensão e inclusão — me lembram por que construímos a GSpeech em primeiro lugar.

Qual papel você vê a GSpeech desempenhando no futuro da mídia digital, especialmente à medida que o conteúdo de áudio e as interfaces de voz se tornam mais dominantes?

Eu imagino a GSpeech como uma líder em tornar a mídia digital mais acessível e atraente, habilitando o acesso de voz de IA à web. Nosso objetivo é transformar a experiência online como um todo, para que os sites se tornem naturalmente interativos, inclusivos e multilíngues por padrão. Com apenas uma linha de código, os proprietários de sites podem transformar milhares de artigos em conteúdo com voz. Olhando para o futuro, estamos desenvolvendo o GSpeech Studio em uma plataforma poderosa e única para geração e edição de áudio, permitindo que os usuários criem conteúdo de voz em camadas com música de fundo, efeitos e ajustes precisos. Queremos tornar a web verdadeiramente audível, intuitiva e universalmente acessível.

A GSpeech foi recentemente lançada no AppSumo e já conquistou uma classificação quase perfeita dos primeiros adotantes. Qual foi o significado da resposta da comunidade do AppSumo para você, e como você planeja construir sobre esse momentum?

O lançamento no AppSumo apresentou a GSpeech a milhões e sua classificação quase perfeita é extremamente gratificante. Usuários, como aqueles que executam cursos online, elogiam nossas ferramentas intuitivas e suporte responsivo, ecoando feedback da Humanity Union. Um proprietário de blog chamou nossas vozes de “genuinamente envolventes” e traduções “impressionantes”. Seu feedback positivo confirma o valor de nossa solução de texto-para-voz de IA e alimenta minha paixão pelo projeto. Apoiar clientes durante o lançamento também inspirou novas ideias, particularmente para o GSpeech Studio, que foi inspirado por solicitações de usuários para recursos de edição e exportação de áudio avançados. Prosseguindo, planejo construir sobre esse momentum ouvindo ativamente nossa comunidade, integrando seu feedback e desenvolvendo recursos inovadores para melhorar a acessibilidade e o engajamento, garantindo que a GSpeech continue a evoluir como uma ferramenta transformadora para criadores e empresas.

Por fim, qual conselho você daria a jovens desenvolvedores ou empreendedores que desejam construir ferramentas acessíveis e impulsionadas por IA no cenário de tecnologia em rápida evolução de hoje?

Para jovens desenvolvedores e empreendedores, meu conselho é colocar seu coração no trabalho e identificar um problema real onde você pode oferecer uma solução única e inteligente. Comece pequeno, dê passos firmes para a frente e ouça atentamente o feedback dos clientes — eles guiarão seu caminho. Trate seus usuários como amigos confiáveis, dê seu tudo e permaneça paciente. Abrace as tecnologias de IA como aliados poderosos; quando usadas sabiamente, elas ampliam sua capacidade de criar ferramentas acessíveis e impactantes. Construa com paixão, persistência e um compromisso em fazer a diferença, e você criará soluções que realmente importam.

Obrigado pela grande entrevista, escolhemos a solução GSpeech para nosso site devido à integração fácil. Para saber mais, visite GSpeech.

Antoine é um líder visionário e sócio-fundador da Unite.AI, impulsionado por uma paixão inabalável por moldar e promover o futuro da IA e da robótica. Um empreendedor serial, ele acredita que a IA será tão disruptiva para a sociedade quanto a eletricidade, e é frequentemente pego falando sobre o potencial das tecnologias disruptivas e da AGI.

Como um futurista, ele está dedicado a explorar como essas inovações moldarão nosso mundo. Além disso, ele é o fundador da Securities.io, uma plataforma focada em investir em tecnologias de ponta que estão redefinindo o futuro e remodelando setores inteiros.