Interviews

Simon Poghosyan, Oprichter en CEO van GSpeech – Interviewreeks

mm
Voeg Unite.AI toe aan je voorkeursbronnen op Google

Simon Poghosyan is de oprichter en CEO van GSpeech, een webgebaseerd AI-platform dat online inhoud toegankelijker maakt door tekst om te zetten in natuurlijk klinkende audio in meer dan 70 talen. Met een achtergrond in VLSI-ontwerp en een sterke interesse in programmeren en gebruikerservaring, creëerde Simon GSpeech om de manier waarop websites voice-enabled inhoud kunnen aanbieden te vereenvoudigen.

Vandaag genereert GSpeech ongeveer 200 miljoen tekens aan audio per maand en wordt het gebruikt in meer dan 70 landen, met zijn aanpasbare audiospelers die meer dan 200.000 keer per maand worden afgespeeld. Na het overschrijden van 1 miljard tekens aan gegenereerde audio, blijft GSpeech snel groeien. Het platform is ontworpen om gemakkelijk te integreren – slechts één regel code is nodig – en ondersteunt creators, educators en bedrijven bij het maken van hun inhoud toegankelijker en interactiever.

GSpeech wordt ook gebruikt op al onze Engelstalige pagina’s, u kunt dit artikel beluisteren en zien hoe goed GSpeech presteert door op de play-knop te klikken.

Uw achtergrond in VLSI-ontwerp (Very Large Scale Integration) en vroege programmeringservaring legden een sterke technische basis. Wat inspireerde uw overstap van micro-elektronica naar het bouwen van AI-gepowered software, en hoe leidde dat tot de creatie van GSpeech?

Mijn passie voor probleemoplossing begon op de middelbare school, gedreven door een liefde voor wiskunde en natuurkunde. Die interesse leidde me naar een Bachelor (2009) en Master (2011) in VLSI-ontwerp van de State Engineering University of Armenia, in samenwerking met Synopsys Armenia. Het studeren van natuurkunde trainde me in precisie en analytisch denken, maar het was tijdens mijn tweede jaar dat ik programmeren ontdekte – beginnend met de Pascal-taal – en er meteen van hield. Mijn vriend en ik zouden onze opdrachten voor de cursus zo snel mogelijk voltooien, zelfs als we zes maanden de tijd hadden om ze af te maken. Toen, voor de lol, begonnen we de opdrachten van andere studenten te doen.

Deze passie leidde me dieper in software-ontwikkeling. Ik begon met het maken van websites, toen bouwde ik mijn eigen CMS. Na het voltooien van verschillende projecten in procesautomatisering en het ontwerpen van databeheerarchitecturen, realiseerde ik me hoeveel ik van het bouwen van digitale oplossingen voor webinterfaces hield. Via het 2GLux-project werkte ik samen met Edvard Ananyan – de maker van de populaire GTranslate-vertaaldienst en een schoolvriend van Quant Gymnasium. Hij introduceerde me bij de WordPress- en Joomla-ecosystemen, en het concept voor GSpeech ontstond bij hem. Die vroege werk leidde tot de eerste versie van ons instrument, waarmee gebruikers naar tekst op een webpagina konden luisteren, het zaad plantend voor wat later een volwaardig AI-platform zou worden. In 2023 richtte ik Smarts Club LLC op om GSpeech uit te breiden tot een wereldwijd AI-audio-oplossing, ondersteunend meer dan 70 talen. De lof van de Humanity Union voor de rol van GSpeech bij het verbeteren van hun platform voor burgerlijke verantwoordelijkheid weerspiegelt mijn missie om digitale kloven te overbruggen met AI – een visie die geworteld is in mijn vroege programmeringsdagen.

GSpeech begon oorspronkelijk als een instrument om visueel gehandicapte gebruikers te ondersteunen. Hoe heeft die vroege missie de evolutie van het platform beïnvloed tot een volwaardige AI-tekst-naar-spraakoplossing?

De focus op toegankelijkheid dreef de ontwikkeling van hoogwaardige, real-time AI-audio, vertaling in meer dan 70 talen en naadloze website-integratie via een eenvoudige code-snippet. Deze missie leidde tot functies zoals aanpasbare audiospelers, taal- en stemselectiepanelen, contextueel afspelen, audiogeluiden en gedetailleerde gebruiksstatistieken – inclusief land, stad, apparaatgegevens en afspelanalyses over tijd – allemaal ontworpen om inhoud toegankelijker en interactiever te maken. Na het schrijven van meer dan 100.000 regels code, lanceerde ik de GSpeech Cloud Console in 2023 – een schaalbare oplossing die toegankelijkheid combineert met geavanceerde functionaliteit, waarmee bedrijven en creators hun inhoud toegankelijker, meertalig en interactief kunnen maken over het web.

Wat waren enkele van de grootste technische uitdagingen die u tegenkwam tijdens de ontwikkeling van de GSpeech Cloud Console?

Een van de grootste uitdagingen bij de ontwikkeling van de GSpeech Cloud Console was het ontwerpen van een schaalbare architectuur voor real-time, beveiligde, hoogwaardige AI-audio-generatie. Dit vereiste innovatieve oplossingen om relevante inhoud van het web op te halen, audio op onze servers te verwerken en op te slaan in de cloud voor snelle, betrouwbare levering. Het implementeren van robuuste beveiligingsmaatregelen, zoals encryptie en toegangscontroles, was kritiek om dynamische, door de gebruiker gegenereerde inhoud te beschermen.

Een andere hindernis was het inschakelen van real-time vertaling met geavanceerde neurale motoren. We moesten ervoor zorgen dat de vertalingen laagdrempelig en nauwkeurig waren, terwijl we een intuïtieve interface bouwden die gebruikers in staat stelde om talen en voorkeursstemprofielen voor afspelen te selecteren, met prioriteit voor gebruikerscomfort en personalisatie. Ten slotte ontwikkelden we een audioteamplate-creator-wizard met meerdere aanpasbare spelerweergaven, waarmee gebruikers unieke, visueel aantrekkelijke spelers konden ontwerpen die waren aangepast aan hun websites. Het balanceren van flexibiliteit, prestaties en gebruiksgemak over apparaten was een lonende uitdaging.

Met real-time vertaling in meer dan 70 talen en meer dan 230 natuurlijk klinkende stemmen. Hoe zorgt u ervoor dat de stemkwaliteit consistent is en de nauwkeurigheid over een dergelijke diverse taalenset behoudt?

Om een consistente stemkwaliteit te behouden, integreren we meerdere geavanceerde tekst-naar-spraakmodellen die continu worden geoptimaliseerd en bijgewerkt. Deze meertalige motoren behandelen gemengde taalinhoud met hoge nauwkeurigheid. We rollen ook meer dan 100 nieuwe stemvibes uit om gebruikers nog meer expressieve en natuurlijk klinkende opties te geven. Elke maand genereert GSpeech meer dan 200 miljoen tekens aan audio, waarmee gebruikers in meer dan 70 landen worden bediend, en onze online spelers worden meer dan 200.000 keer per maand gebruikt – en groeien. Deze schaal zorgt voor continue feedback en real-world testing, die rechtstreeks onze afstemming en kwaliteitscontroles informeert.

Kunt u ons door het proces leiden van hoe GSpeech AI en machine learning gebruikt om levensechte stemsynthese te leveren? Hoe houdt u de snelle vooruitgang in neurale stemtechnologie bij?

GSpeech gebruikt geavanceerde AI en machine learning, waarbij meerdere state-of-the-art tekst-naar-spraakmodellen worden geïntegreerd om levensechte stemsynthese te produceren. Deze modellen, geoptimaliseerd voor naturaliteit en meertalige ondersteuning, verwerken tekstinput om hoogwaardige audio te genereren met realistische intonatie en ritme, zelfs voor gemengde taalinhoud. We verbeteren de gebruikerservaring door aanpasbare stemstijlen voor diverse talen aan te bieden. We hebben ook TTS-aliassen geïntegreerd, die gebruikers in staat stellen om aangepaste regels te definiëren voor hoe bepaalde woorden of zinnen in audio worden weergegeven – bijvoorbeeld door specifieke termen te vervangen om een nauwkeurigere uitspraak of zinsopbouw te bereiken. Om bij te blijven met de neurale stemtechnologie, evalueren we continu de nieuwste vooruitgang en integreren we deze, we werken samen met brancheleiders en we zijn van plan om in de toekomst eigen modellen te ontwikkelen, waardoor GSpeech blijft vooroplopen in de innovatie van stemsynthese.

Hoe belangrijk is stemafstemming, toonregeling en afspel aanpassing voor uw gebruikers – en wat is het gebruiksscenario waar u het meest trots op bent waar deze functies echt uitblinken?

Stemafstemming, toonregeling en afspel aanpassing zijn kritiek voor onze gebruikers, waardoor ze unieke, hoogwaardige stemstijlen kunnen maken die zijn aangepast aan hun specifieke behoeften, van nieuws- en blogwebsites tot toegankelijke e-learninginhoud. De voortdurende integratie van meer dan 100 nieuwe stemvibes versterkt dit nog meer, waardoor gebruikers ongekende flexibiliteit krijgen om echt unieke voice-overs te creëren. Ik ben het meest trots op GSpeech Studio, een nieuwe audiobewerkings- en generatieplatform dat ik ontwikkel. Het staat gebruikers toe om meerdere audio-kanalen te maken, deze te mengen met achtergrondmuziek en gepolijste voice-overs te exporteren, waardoor creators professioneel klinkende audio kunnen produceren voor diverse toepassingen. Een brief van een visueel gehandicapt student die GSpeech bedankt voor het mogelijk maken van onafhankelijke studie via aangepaste audio, raakte me diep. Dit gebruiksscenario toont hoe deze functies inhoud toegankelijker en transformatief maken, een doel dat ik al sinds mijn vroege programmeringsdagen nastreef.

GSpeech biedt naadloze integraties met WordPress, Shopify , Wix en meer. Wat is uw strategie geweest om het platform plug-and-play te maken voor creators en bedrijven over verschillende ecosystemen?

Onze strategie voor de plug-and-play-integraties van GSpeech met platforms zoals WordPress, Shopify en Wix was gericht op eenvoud, compatibiliteit en schaalbaarheid. We ontwikkelden lichtgewicht, modulaire plugins en code-snippets die naadloos integreren, met minimale instellingen – vaak slechts een paar klikken. Dit betekent dat duizenden artikelen en dynamische inhoudsblokken onmiddellijk stemondersteuning kunnen krijgen – zonder handmatige inspanning. We bieden zeer flexibele, mooi ontworpen spelers die zich aanpassen over apparaten, inclusief mobiel, tablets en desktops. Onze spelers zijn niet alleen aanpasbaar, maar ook geoptimaliseerd voor toegankelijkheid en gebruikersbetrokkenheid. Voor WordPress hebben we het GSpeech-cloud-dashboard rechtstreeks in het beheerpaneel geïntegreerd via onze plugin, waardoor het beheer voor gebruikers wordt gestroomlijnd. Gedetailleerde documentatie en intuïtieve dashboards leiden niet-technische gebruikers door de installatie en aanpassing. Regelmatig testen zorgt voor consistent presteren over diverse ecosystemen, waardoor creators en bedrijven AI-gepowered tekst-naar-spraak moeiteloos kunnen toevoegen.

Terugkijkend op de reis van 2012 tot vandaag, wat is de grootste mijlpaal voor u persoonlijk of professioneel in het opbouwen van GSpeech?

De grootste mijlpaal voor GSpeech was het genereren van 1 miljard tekens aan hoogwaardige AI-audio, wat onze wereldwijde impact op toegankelijkheid aantoont. Even belangrijk is de feedback die we hebben ontvangen van organisaties zoals de Humanity Union, die GSpeech prees voor het verbeteren van hun platform voor burgerlijke verantwoordelijkheid, en van blog-eigenaren die het een “game-changer” noemden voor gebruikersbetrokkenheid. Meer dan 110 vijfsterrenbeoordelingen over platforms zoals WordPress en AppSumo in recente maanden weerspiegelen deze groeiende vertrouwen.

GSpeech wordt nu ook actief gebruikt door de Namangan regionale statistiekafdeling in Oezbekistan – een overheidsinstelling met aanzienlijk verkeer en nationale zichtbaarheid. Het zien van een openbaar lichaam dat onze technologie zo breed overneemt, is een betekenisvolle mijlpaal en een krachtig teken van vertrouwen in onze oplossing.

Als christen en iemand die dient in de Armeense kerk, probeer ik ook om andere geloofsgemeenschappen te ondersteunen waar mogelijk. Ik bied GSpeech vaak kosteloos aan aan christelijke websites als een manier om hun boodschap effectiever te verspreiden en Schrift toegankelijker te maken via audio. Het is mijn kleine bijdrage aan iets groters. Tegelijkertijd ben ik vereerd om te werken met toegewijde initiatieven zoals The Cord – een messiaanse gemeente en gewaardeerde GSpeech-klant – wiens missie en inhoud de kracht van Schrift in actie weerspiegelen.

Deze momenten – wanneer technologie een brug wordt voor geloof, begrip en inclusie – herinneren me waarom we GSpeech in de eerste plaats hebben gebouwd.

Wat is de rol die u ziet voor GSpeech in de toekomst van digitale media, met name nu audio-inhoud en steminterfaces meer dominant worden?

Ik zie GSpeech als een leider in het maken van digitale media toegankelijker en interactiever door AI-gepowered stemtoegang tot het web mogelijk te maken. Ons doel is om de hele online-ervaring te transformeren, zodat websites van nature stem-geactiveerd, inclusief en meertalig worden. Met slechts één regel code kunnen site-eigenaren duizenden artikelen omzetten in gesproken inhoud. Kijkend naar de toekomst, ontwikkelen we GSpeech Studio tot een krachtig en uniek platform voor audiogeneratie en -bewerking, waarmee gebruikers meerdere audiokanalen kunnen maken met achtergrondmuziek, effecten en precieze afstemming. We willen het web echt hoorbaar, intuïtief en universeel toegankelijk maken.

GSpeech is onlangs gelanceerd op AppSumo en heeft al een near-perfect rating van vroege aanvaarders. Wat betekent de reactie van de AppSumo-gemeenschap voor u, en hoe bent u van plan om deze impuls verder te ontwikkelen?

De AppSumo-lancering introduceerde GSpeech aan miljoenen, en de near-perfect rating is ongelooflijk bevestigend. Gebruikers, zoals die online cursussen uitvoeren, prijzen onze intuïtieve tools en responsieve ondersteuning, wat overeenkomt met feedback van de Humanity Union. Een blog-eigenaar noemde onze stemmen “echt boeiend” en vertalingen “indrukwekkend”. Hun positieve feedback bevestigt de waarde van onze AI-gepowered tekst-naar-spraakoplossing en voedt mijn passie voor het project. Ondersteuning van klanten tijdens de lancering zette ook nieuwe ideeën in gang, met name voor GSpeech Studio, die werd geïnspireerd door gebruikersverzoeken om geavanceerde audiobewerking en exportfuncties. Gaandeweg ben ik van plan om deze impuls verder te ontwikkelen door actief te luisteren naar onze gemeenschap, hun feedback te integreren en innovatieve functies te ontwikkelen om toegankelijkheid en interactie te verbeteren, waardoor GSpeech blijft evolueren als een transformatief instrument voor creators en bedrijven.

Tenslotte, wat is uw advies aan jonge ontwikkelaars of ondernemers die toegankelijke, AI-gepowered tools willen bouwen in de snelle technologie van vandaag?

Aan jonge ontwikkelaars en ondernemers zou ik adviseren om hun hart en ziel in hun werk te steken en een echt probleem te identificeren waar ze een unieke, slimme oplossing kunnen bieden. Begin klein, neem stap voor stap vooruit en luister goed naar de feedback van klanten – zij zullen uw pad leiden. Behandel uw gebruikers als vertrouwde vrienden, geef uw alles en blijf geduldig. Omarm AI-technologieën als krachtige bondgenoten; wanneer ze verstandig worden gebruikt, versterken ze uw vermogen om impactvolle, toegankelijke tools te creëren. Bouw met passie, volharding en een toewijding om een verschil te maken, en u zult oplossingen creëren die echt belangrijk zijn.

Bedankt voor het geweldige interview, we hebben de GSpeech-oplossing voor onze website gekozen vanwege de eenvoudige integratie. Om meer te leren, bezoek GSpeech.

Antoine is een visionaire leider en medeoprichter van Unite.AI, gedreven door een onwankelbare passie voor het vormgeven en promoten van de toekomst van AI en robotica. Een serieondernemer, hij gelooft dat AI net zo disruptief voor de samenleving zal zijn als elektriciteit, en wordt vaak betrapt op het prijzen van de potentie van disruptieve technologieën en AGI.

Als een futurist, hij is toegewijd aan het onderzoeken van hoe deze innovaties onze wereld zullen vormgeven. Bovendien is hij de oprichter van Securities.io, een platform dat zich richt op het investeren in cutting-edge technologieën die de toekomst herdefiniëren en hele sectoren herschikken.