Entrevistas

Simon Poghosyan, Fundador y CEO de GSpeech – Serie de Entrevistas

mm
Añade Unite.AI a tus fuentes preferidas en Google

Simon Poghosyan es el fundador y CEO de GSpeech, una plataforma web basada en IA que ayuda a hacer que el contenido en línea sea más accesible convirtiendo texto en audio de sonido natural en más de 70 idiomas. Con una formación en diseño de VLSI y un fuerte interés en programación y experiencia del usuario, Simon creó GSpeech para simplificar la forma en que los sitios web pueden ofrecer contenido con voz habilitada.

Hoy en día, GSpeech genera alrededor de 200 millones de caracteres de audio cada mes y se utiliza en más de 70 países, con sus reproductores de audio personalizables que sirven más de 200.000 reproducciones mensuales. Después de superar los 1.000 millones de caracteres de audio generados en total, GSpeech sigue creciendo rápidamente. La plataforma está diseñada para ser fácil de integrar, requiriendo solo una línea de código, y apoya a creadores, educadores y empresas para hacer que su contenido sea más inclusivo y atractivo.

GSpeech también se utiliza en todas nuestras páginas en inglés, puedes escuchar este artículo y cómo funciona GSpeech haciendo clic en el botón de reproducción.

Su formación en diseño de VLSI (Very Large Scale Integration) y su experiencia temprana en programación sentaron una base técnica sólida. ¿Qué inspiró su cambio de la microelectrónica a la creación de software con IA, y cómo llevó eso a la creación de GSpeech?

Mi pasión por la resolución de problemas comenzó en la escuela secundaria, impulsada por el amor a las matemáticas y la física. Ese interés me llevó a obtener un título de Bachelor (2009) y Master (2011) en diseño de VLSI de la Universidad Estatal de Ingeniería de Armenia, en colaboración con Synopsys Armenia. Estudiar física me entrenó en pensamiento preciso y analítico, pero fue durante mi segundo año que descubrí la programación, comenzando con el lenguaje Pascal, y me enamoré de ella inmediatamente. Mi amigo y yo completábamos los trabajos de la clase tan pronto como los recibíamos, aunque teníamos seis meses para terminar. Luego, por diversión, comenzamos a hacer los trabajos de otros estudiantes.

Esta pasión me llevó más a fondo en el desarrollo de software. Comencé con la creación de sitios web, luego construí mi propio CMS. Después de completar varios proyectos en automatización de procesos y diseño de arquitecturas de gestión de datos, me di cuenta de cuánto me gustaba construir soluciones digitales para interfaces web. A través del proyecto 2GLux, colaboré con Edvard Ananyan, creador del popular servicio de traducción GTranslate y un amigo de la escuela de Quant Gymnasium. Él me presentó a los ecosistemas de WordPress y Joomla, y el concepto de GSpeech se originó con él. Ese trabajo temprano llevó a la primera versión de nuestra herramienta, que permitía a los usuarios escuchar texto en una página web, plantando la semilla de lo que más tarde se convertiría en una plataforma de IA completa. En 2023, establecí Smarts Club LLC para escalar GSpeech a una solución de audio de IA global, que admite 70+ idiomas. Los elogios de la Unión de la Humanidad por el papel de GSpeech en la mejora de la plataforma de participación cívica accesible reflejan mi misión de tender puentes digitales a través de la IA, una visión arraigada en mis primeros días de programación.

GSpeech originalmente comenzó como una herramienta para apoyar a los usuarios con discapacidad visual. ¿Cómo influyó esa misión temprana en la evolución de la plataforma a una solución de texto a voz de IA completa?

El enfoque en la accesibilidad impulsó el desarrollo de audio de IA de alta calidad en tiempo real, la traducción a 70+ idiomas y la integración sin problemas en sitios web a través de un código simple. Esta misión llevó a características como reproductores de audio personalizables, paneles de selección de idioma y voz, reproducción contextual, descargas de audio y estadísticas de uso detalladas, incluyendo datos de país, ciudad, dispositivo y análisis de reproducción en el tiempo, todas diseñadas para hacer que el contenido sea más inclusivo y atractivo. Después de escribir más de 100.000 líneas de código, lancé la consola de GSpeech Cloud en 2023, una solución escalable que equilibra la inclusión con la funcionalidad avanzada, permitiendo a empresas y creadores hacer que su contenido sea accesible, multilingüe e interactivo en toda la web.

¿Cuáles fueron algunos de los mayores desafíos técnicos que enfrentó durante el desarrollo de la consola de GSpeech Cloud?

Uno de los mayores desafíos en el desarrollo de la consola de GSpeech Cloud fue diseñar una arquitectura escalable para la generación de audio de IA en tiempo real y de alta calidad. Esto requirió soluciones innovadoras para recuperar contenido relevante de la web, procesar audio en nuestros servidores y almacenarlo en la nube para una entrega rápida y confiable. La implementación de medidas de seguridad sólidas, como la cifrado y el control de acceso, fue fundamental para proteger el contenido dinámico generado por el usuario.

Otro obstáculo fue habilitar la traducción en tiempo real utilizando motores neurales avanzados. Teníamos que asegurarnos de que las traducciones fueran de baja latencia y precisas, al mismo tiempo que construíamos una interfaz intuitiva que permitiera a los usuarios seleccionar idiomas y perfiles de voz preferidos para la reproducción, priorizando la comodidad y la personalización del usuario. Finalmente, desarrollamos un asistente de creación de plantillas de audio con múltiples vistas de reproductor personalizables, lo que permite a los usuarios diseñar reproductores únicos y visualmente atractivos adaptados a sus sitios web. Equilibrar la flexibilidad, el rendimiento y la facilidad de uso en diferentes dispositivos fue un desafío gratificante.

Con traducción en tiempo real en 70+ idiomas y más de 230 voces de sonido natural. ¿Cómo garantiza la calidad de la voz y mantiene la precisión en un conjunto de idiomas tan diverso?

Para mantener una calidad de voz consistente, integramos múltiples modelos de texto a voz (TTS) avanzados que se optimizan y actualizan continuamente. Estos motores multilingües manejan contenido de lenguaje mixto con alta precisión. También estamos lanzando más de 100 nuevos estilos de voz para dar a los usuarios opciones aún más expresivas y de sonido natural. Cada mes, GSpeech genera más de 200 millones de caracteres de audio, sirviendo a usuarios en más de 70 países, y nuestros reproductores en línea se utilizan más de 200.000 veces al mes, y creciendo. Esta escala garantiza una retroalimentación continua y pruebas en el mundo real, que informan directamente nuestros controles de ajuste y calidad.

¿Puede explicarnos cómo GSpeech aprovecha la IA y el aprendizaje automático para ofrecer síntesis de voz realista? ¿Cómo se mantiene al día con los avances rápidos en la tecnología de voz neural?

GSpeech utiliza IA y aprendizaje automático avanzados, integrando múltiples modelos de texto a voz de última generación para producir síntesis de voz realista. Estos modelos, optimizados para naturalidad y soporte multilingüe, procesan las entradas de texto para generar audio de alta calidad con entonación y ritmo realistas, incluso para contenido de lenguaje mixto. Mejoramos la experiencia del usuario ofreciendo estilos de voz personalizables para diferentes idiomas. También hemos integrado alias de TTS, que permiten a los usuarios definir reglas personalizadas para cómo se representan ciertas palabras o frases en audio, por ejemplo, reemplazando términos específicos para lograr una pronunciación o fraseo más precisos. Para mantenernos al día con la tecnología de voz neural, evaluamos y integramos continuamente los últimos avances, colaboramos con líderes de la industria y planeamos desarrollar modelos propietarios en el futuro, asegurando que GSpeech permanezca a la vanguardia de la innovación en síntesis de voz.

¿Cuán importante es el ajuste de voz, el control de tono y la personalización de la reproducción para sus usuarios, y qué caso de uso es el que más se enorgullece donde estas características realmente brillan?

El ajuste de voz, el control de tono y la personalización de la reproducción son fundamentales para nuestros usuarios, permitiéndoles crear estilos de voz únicos y de alta calidad adaptados a sus necesidades específicas, desde sitios web de noticias y blogs hasta contenido de aprendizaje accesible. La integración continua de más de 100 nuevos estilos de voz mejora aún más esto, ofreciendo a los usuarios una flexibilidad sin precedentes para crear voces personalizadas. Me enorgullezco especialmente de GSpeech Studio, una nueva plataforma de edición y generación de audio que estoy desarrollando. Permite a los usuarios crear múltiples canales de audio, mezclarlos con música de fondo y exportar voces profesionales, permitiendo a los creadores producir audio de calidad profesional para diversas aplicaciones. Una carta de un estudiante con discapacidad visual, agradeciendo a GSpeech por permitirle estudiar de forma independiente a través de audio personalizado, me conmovió profundamente. Este caso de uso muestra cómo estas características hacen que el contenido sea accesible y transformador, un objetivo que he perseguido desde mis primeros días de programación.

GSpeech ofrece integraciones sin problemas con WordPress, Shopify , Wix y más. ¿Cuál ha sido su estrategia para hacer que la plataforma sea plug-and-play para creadores y empresas en diferentes ecosistemas?

Nuestra estrategia para las integraciones de GSpeech con plataformas como WordPress, Shopify y Wix se centró en la simplicidad, la compatibilidad y la escalabilidad. Desarrollamos plugins y fragmentos de código ligeros y modulares que se integran de forma transparente, requiriendo una configuración mínima, a menudo solo unos pocos clics. Esto significa que miles de artículos y bloques de contenido dinámicos pueden ganar instantáneamente soporte de voz sin esfuerzo manual. Ofrecemos reproductores de audio altamente personalizables y diseñados para adaptarse a diferentes dispositivos, incluyendo móviles, tabletas y escritorios. Nuestros reproductores no solo son personalizables, sino también optimizados para la accesibilidad y la participación del usuario. Para WordPress, incorporamos el panel de control de GSpeech Cloud directamente en el panel de administración a través de nuestro plugin, simplificando la gestión para los usuarios. La documentación detallada y los paneles intuitivos guían a los usuarios no técnicos a través de la instalación y la personalización. Las pruebas regulares garantizan un rendimiento consistente en diversos ecosistemas, permitiendo a creadores y empresas agregar texto a voz de IA sin esfuerzo.

Mirando hacia atrás en el viaje desde 2012 hasta hoy, ¿cuál ha sido el hito más grande para usted personal o profesionalmente en la construcción de GSpeech?

El hito más grande para GSpeech fue generar 1.000 millones de caracteres de audio de IA de alta calidad, mostrando nuestro impacto global en la accesibilidad. Igualmente significativo ha sido la retroalimentación que hemos recibido de organizaciones como la Unión de la Humanidad, que elogió a GSpeech por mejorar su plataforma de responsabilidad social, y de propietarios de blogs que lo llamaron “un juego cambiadro” para la participación del usuario. Más de 110 reseñas de cinco estrellas en plataformas como WordPress y AppSumo en los últimos meses reflejan esta creciente confianza.

GSpeech también se utiliza activamente por el Departamento de Estadísticas Regionales de Namangan en Uzbekistán, una institución gubernamental con un tráfico significativo y visibilidad a nivel nacional. Ver a un organismo público adoptar nuestra tecnología de manera tan amplia ha sido un hito significativo y un signo poderoso de confianza en nuestra solución.

Como cristiano y alguien que sirve en la iglesia armenia, también trato de apoyar otras iniciativas basadas en la fe siempre que sea posible. A menudo ofrezco GSpeech de forma gratuita a sitios web cristianos como una forma de ayudar a difundir su mensaje de manera más efectiva y hacer que las Escrituras sean más accesibles a través del audio. Es mi pequeña contribución a algo más grande. Al mismo tiempo, me siento honrado de trabajar con ministerios dedicados como The Cord, una congregación mesiánica y valioso cliente de GSpeech, cuya misión y contenido reflejan el poder de las Escrituras en acción.

Estos momentos, cuando la tecnología se convierte en un puente para la fe, la comprensión y la inclusión, me recuerdan por qué construimos GSpeech en primer lugar.

¿Qué papel ve para GSpeech en el futuro de los medios digitales, particularmente a medida que el contenido de audio y las interfaces de voz se vuelven más dominantes?

Me imagino a GSpeech como un líder en hacer que los medios digitales sean más accesibles y atractivos, permitiendo el acceso a la web a través de la voz habilitada por IA. Nuestro objetivo es transformar toda la experiencia en línea, para que los sitios web se vuelvan naturalmente interactivos, inclusivos y multilingües por defecto. Con solo una línea de código, los propietarios de sitios pueden convertir miles de artículos en contenido con voz. Mirando hacia adelante, estamos desarrollando GSpeech Studio en una plataforma poderosa y única para la generación y edición de audio, permitiendo a los usuarios crear contenido de voz multicanal con música de fondo, efectos y ajuste preciso. Queremos hacer que la web sea verdaderamente audible, intuitiva y universalmente accesible.

GSpeech se lanzó recientemente en AppSumo y ya ha ganado una calificación casi perfecta de los primeros adoptantes. ¿Qué ha significado para usted la respuesta de la comunidad de AppSumo, y cómo planea construir sobre este impulso en el futuro?

El lanzamiento de AppSumo presentó a GSpeech a millones de personas, y su calificación casi perfecta es increíblemente gratificante. Los usuarios, como aquellos que ejecutan cursos en línea, elogian nuestras herramientas intuitivas y nuestro soporte receptivo, lo que refleja la retroalimentación de la Unión de la Humanidad. Un propietario de un blog llamó a nuestras voces “auténticamente atractivas” y las traducciones “impresionantes”. Su retroalimentación positiva confirma el valor de nuestra solución de texto a voz de IA y alimenta mi pasión por el proyecto. Apoyar a los clientes durante el lanzamiento también generó nuevas ideas, particularmente para GSpeech Studio, que fue inspirado por las solicitudes de los usuarios de características de edición y exportación de audio avanzadas. En el futuro, planeo construir sobre este impulso escuchando activamente a nuestra comunidad, integrando su retroalimentación y desarrollando características innovadoras para mejorar la accesibilidad y la participación, asegurando que GSpeech siga evolucionando como una herramienta transformadora para creadores y empresas.

Finalmente, ¿qué consejo daría a jóvenes desarrolladores o empresarios que desean construir herramientas de IA accesibles en el panorama tecnológico en constante evolución de hoy en día?

A los jóvenes desarrolladores y empresarios, mi consejo es que dediquen su corazón a su trabajo y identifiquen un problema real donde puedan ofrecer una solución única y astuta. Comiencen de a poco, den pasos firmes hacia adelante y escuchen atentamente la retroalimentación de los clientes; ellos guiarán su camino. Traten a sus usuarios como amigos de confianza, den todo de sí y sean pacientes. Acepten las tecnologías de IA como aliados poderosos; cuando se utilizan sabiamente, amplifican su capacidad para crear herramientas accesibles e impactantes. Construyan con pasión, persistencia y un compromiso para hacer una diferencia, y crearán soluciones que realmente importan.

Gracias por la gran entrevista, elegimos la solución GSpeech para nuestro sitio web debido a la integración sencilla. Para obtener más información, visite GSpeech.

Antoine es un líder visionario y socio fundador de Unite.AI, impulsado por una pasión inquebrantable por dar forma y promover el futuro de la IA y la robótica. Como empresario serial, cree que la IA será tan disruptiva para la sociedad como la electricidad, y a menudo se le escucha hablando con entusiasmo sobre el potencial de las tecnologías disruptivas y la AGI.

Como futurista, está dedicado a explorar cómo estas innovaciones darán forma a nuestro mundo. Además, es el fundador de Securities.io, una plataforma enfocada en invertir en tecnologías de vanguardia que están redefiniendo el futuro y remodelando sectores enteros.