Interviews
Simon Poghosyan, grundlægger og administrerende direktør for GSpeech – Intervieuserie

Simon Poghosyan er grundlægger og administrerende direktør for GSpeech, en webbaseret AI-platform, der hjælper med at gøre onlineindhold mere tilgængeligt ved at konvertere tekst til naturligt lydende audio i over 70 sprog. Med en baggrund i VLSI-design og en stærk interesse for programmering og brugeroplevelse skabte Simon GSpeech for at simplificere måden, hvorpå websites kan tilbyde stemmeaktiveret indhold.
I dag genererer GSpeech omkring 200 millioner tegn af audio hver måned og bruges i over 70 lande, med deres tilpasselige audioafspillere, der serverer over 200.000 afspilninger månedligt. Efter at have overgået 1 milliard tegn af audio, der er genereret i alt, fortsætter GSpeech med at vokse hurtigt. Platformen er designed til at være let at integrere – kun en enkelt linje kode er nødvendig – og understøtter skabere, undervisere og virksomheder i at gøre deres indhold mere inklusivt og engagerende.
GSpeech bruges også på alle vores engelske sider, du kan lytte til denne artikel og se, hvor godt GSpeech fungerer ved at klikke på afspilningsknappen.
Din baggrund i VLSI-design (Very Large Scale Integration) og tidlig programmeringserfaring lagde en stærk teknisk grund. Hvad inspirerede din skift fra mikroelektronik til opbygning af AI-drevet software, og hvordan ledte det til skabelsen af GSpeech?
Min passion for problemløsning begyndte i gymnasiet, drevet af en kærlighed til matematik og fysik. Denne interesse ledte mig til at få en bachelor- (2009) og masteruddannelse (2011) i VLSI-design fra det statlige ingeniør-universitet i Armenien, i samarbejde med Synopsys Armenien. Studiet af fysik trænede mig i præcision og analytisk tænkning, men det var under mit andet år, at jeg opdagede programmering – starting med Pascal-sproget – og straks blev forelsket i det. Min ven og jeg ville gøre vores opgaver færdige, så snart vi fik dem, selv om vi havde seks måneder til at gøre det færdigt. Så, for sjov, begyndte vi at gøre andre studerendes opgaver.
Denne passion ledte mig dybere ind i softwareudvikling. Jeg begyndte med at skabe websites, derefter byggede jeg min egen CMS. Efter at have gennemført flere projekter i procesautomatisering og design af datastyringsarkitekturer, indså jeg, hvor meget jeg elskede at bygge digitale løsninger for webgrænseflader. Gennem 2GLux-projektet samarbejdede jeg med Edvard Ananyan – skaberen af den populære GTranslate-oversættelsesservice og en skoleven fra Quant Gymnasium. Han introducerede mig til WordPress- og Joomla-økosystemerne, og konceptet for GSpeech opstod med ham. Den tidlige arbejde ledte til den første version af vores værktøj, der gjorde det muligt for brugere at lytte til tekst på en webside, og plantede frøet til, hvad der senere blev en fuldt udviklet AI-platform. I 2023 etablerede jeg Smarts Club LLC for at skale GSpeech op til en global AI-lydløsning, der understøtter 70+ sprog. Humanity Unions ros af GSpeechs rol i at forbedre deres civile engagement-platforms tilgængelighed afspejler min mission om at brokke digitale klyfter gennem AI – en vision, der er rod i mine tidlige programmeringsdage.
GSpeech startede oprindeligt som et værktøj til at støtte synsbesværede brugere. Hvordan påvirkede den tidlige mission platformens udvikling til en fuldt udviklet AI-tekst-til-tale-løsning?
Fokuseringen på tilgængelighed drev udviklingen af højkvalitets, real-time AI-lyd, oversættelse til 70+ sprog og problemfri website-integration via en enkelt kode-snippet. Denne mission ledte til funktioner som tilpasselige audioafspillere, sprog- og stemmevalgspaneler, kontekstbevidst afspilning, lyddownloads og detaljerede brugsstatistikker – herunder land, by, enhedsdata og afspilningsanalyser over tid – alt designed til at gøre indhold mere inklusivt og engagerende. Efter at have skrevet over 100.000 linjer kode, lancerede jeg GSpeech Cloud Console i 2023 – en skalerbar løsning, der balancerer inklusivitet med avanceret funktionalitet, og giver virksomheder og skabere mulighed for at gøre deres indhold tilgængeligt, flersproget og interaktivt på tværs af webben.
Hvad var nogle af de største tekniske udfordringer, du stødte på under udviklingen af GSpeech Cloud Console?
En af de største udfordringer under udviklingen af GSpeech Cloud Console var at designe en skalerbar arkitektur for real-time, sikker, højkvalitets AI-lydgenerering. Dette krævede innovative løsninger til at hente relevant indhold fra webben, behandle lyd på vores servere og gemme det i skyen for hurtig, pålidelig levering. Implementering af robuste sikkerhedsforanstaltninger, som kryptering og adgangskontrol, var kritisk for at beskytte dynamisk, bruger-genereret indhold.
En anden forhindring var at aktivere real-time-oversættelse med avancerede neurale motorer. Vi måtte sikre lav ventetid, nøjagtige oversættelser, mens vi byggede en intuitiv brugerflade, der tillod brugere at vælge sprog og foretrukne stemmeprofiler til afspilning, prioriterende brugercomfort og personliggørelse. Til sidst udviklede vi en lydskabelon-wizard med flere tilpasselige afspiller-views, der giver brugerne mulighed for at designe unikke, visuelt tiltalende afspillere, tilpasset deres websites. At balancere fleksibilitet, ydeevne og brugervenlighed på tværs af enheder var en belønning udfordring.
Med real-time-oversættelse på 70+ sprog og over 230 naturligt lydende stemmer. Hvordan sikrer du stemmekvalitet og opretholder nøjagtighed på tværs af så et diverst sprogssæt?
For at opretholde konsekvent stemmekvalitet integrerer vi multiple avancerede tekst-til-tale-modeller, der kontinuerligt optimeres og opdateres. Disse flersprogede motorer behandler blandet sprogindhold med høj nøjagtighed. Vi ruller også ud over 100 nye stemme-vibber for at give brugerne endnu flere udtryksfulde og naturligt lydende muligheder. Hver måned genererer GSpeech over 200 millioner tegn af audio, der serverer brugere i over 70 lande, og vores online-afspillere bruges over 200.000 gange månedligt – og vokser. Denne skala sikrer kontinuerlig feedback og virkelige tests, der direkte informerer vores finjustering og kvalitetskontrol.
Kan du føre os igennem, hvordan GSpeech udnytter AI og maskinlæring til at levere livagtig stemmesyntese? Hvordan holder du trit med de hurtige fremskridt i neural stemmeteknologi?
GSpeech bruger avanceret AI og maskinlæring, der integrerer multiple state-of-the-art tekst-til-tale-modeller for at producere livagtig stemmesyntese. Disse modeller, optimeret for naturlighed og flersproget understøttelse, behandler tekst-input for at generere højkvalitetsaudio med realistisk intonation og rytme, selv for blandet sprogindhold. Vi forbedrer brugeroplevelsen ved at tilbyde tilpasselige stemmestyler for diverse sprog. Vi har også integreret TTS-aliases, der giver brugerne mulighed for at definere brugerdefinerede regler for, hvordan bestemte ord eller fraser skal rendres i audio – f.eks. erstatning af bestemte termer for at opnå mere præcis udtale eller fraseologi. For at holde trit med neural stemmeteknologi vurderer vi kontinuerligt og integrerer de seneste fremskridt, samarbejder med branchens ledere og planlægger at udvikle proprietære modeller i fremtiden, hvilket sikrer, at GSpeech forbliver i frontlinjen for stemmesyntese-innovation.
Hvor vigtig er stemmeafstemning, tonekontrol og afspilnings-tilpasning for dine brugere – og hvilket brugstilfælde er du mest stolt af, hvor disse funktioner virkelig skinner igennem?
Stemmeafstemning, tonekontrol og afspilnings-tilpasning er kritiske for vores brugere, da de giver dem mulighed for at skabe unikke, højkvalitets stemmestyler tilpasset deres specifikke behov, fra nyheds- og blog-websites til tilgængeligt e-læringsindhold. Den fortsatte integration af over 100 nye stemme-vibber forbedrer yderligere dette, og giver brugerne en enestående fleksibilitet til at skabe virkelig distinkte stemmeoversættelser. Jeg er mest stolt af GSpeech Studio, en ny audio-redigering- og generationsplatform, jeg udvikler. Den giver brugerne mulighed for at skabe multiple audio-kanaler, blande dem med baggrundsmusik og eksportere polerede stemmeoversættelser, og giver skabere mulighed for at producere professionelt niveau audio til diverse formål. En synsbesværet students takkebrev, der takkede GSpeech for at have gjort det muligt for dem at studere uafhængigt gennem tilpasset audio, rørte mig dybt. Dette brugstilfælde viser, hvordan disse funktioner gør indhold tilgængeligt og transformerende, et mål, jeg har forfulgt siden mine tidlige programmeringsdage.
GSpeech tilbyder problemfri integrationer med WordPress, Shopify , Wix og mere. Hvad har været din strategi for at gøre platformen plug-and-play for skabere og virksomheder på tværs af forskellige økosystemer?
Vores strategi for GSpeechs plug-and-play-integrationer med platforme som WordPress, Shopify og Wix fokuserede på enkelhed, kompatibilitet og skalerbarhed. Vi udviklede letvægts-, modulære plugins og kode-snippets, der integrerer problemfrit, og kræver minimal opsætning – ofte kun få klik. Dette betyder, at tusindvis af artikler og dynamisk indhold kan øjeblikkeligt få stemme-understøttelse – uden manuel indsats. Vi tilbyder højtilpasselige, smukt designede afspillere, der tilpasser sig på tværs af enheder, herunder mobile, tablets og stationære computere. Vores afspillere er ikke kun tilpasselige, men også optimeret for tilgængelighed og brugerengagement. For WordPress har vi integreret GSpeech-cloud-dashboardet direkte i admin-panelet via vores plugin, hvilket strømliner administrationen for brugerne. Detaljeret dokumentation og intuitive dashboards vejleder ikke-tekniske brugere gennem installation og tilpasning. Regelmæssig testning sikrer konsekvent præstation på tværs af diverse økosystemer, og giver skabere og virksomheder mulighed for at tilføje AI-drevet tekst-til-tale uden besvær.
At se tilbage på rejsen fra 2012 til i dag, hvad har været det største milepæl for dig personligt eller professionelt i opbygningen af GSpeech?
Det største milepæl for GSpeech var generationen af 1 milliard tegn af højkvalitets AI-lyd, der viser vores globale impact på tilgængelighed. Lige så betydningsfuldt har det været feedbacken, vi har modtaget fra organisationer som Humanity Union, der roste GSpeech for at have forbedret deres sociale ansvar-platforms tilgængelighed, og fra blog-ejere, der kaldte det en “game-changer” for brugerengagement. Over 110 fem-stjernede anmeldelser på tværs af platforme som WordPress og AppSumo i de seneste måneder afspejler dette voksende tillid.
GSpeech bruges nu også aktivt af Namangan regional statistikafdeling i Usbekistan – en regeringsinstitution med betydelig trafik og national niveau synlighed. At se en offentlig myndighed antage vores teknologi så bredt har været et betydningsfuldt milepæl og et kraftfuldt tegn på tillid til vores løsning.
Som kristen og en, der tjener i den armenske kirke, prøver jeg også at støtte andre tro-baserede initiativer, når det er muligt. Jeg tilbyder ofte GSpeech gratis til kristne websites som en måde at hjælpe med at sprede deres budskab mere effektivt og gøre Skriften mere tilgængelig gennem audio. Det er min lille bidrag til noget større. Samtidig er jeg æret over at arbejde med dedikeret ministerier som The Cord – en messiansk menighed og værdsat GSpeech-kunde – hvis mission og indhold afspejler kraften af Skriften i handling.
Disse øjeblikke – hvor teknologi bliver en bro for tro, forståelse og inklusion – minder mig om, hvorfor vi byggede GSpeech i første omgang.
Hvad rol ser du GSpeech spille i fremtiden for digitalt medie, især når audio-indhold og stemme-grænseflader bliver mere dominerende?
Jeg forestiller mig GSpeech som en leder i at gøre digitalt medie mere tilgængeligt og engagerende ved at aktivere AI-drevet stemme-adgang til webben. Vores mål er at transformere hele den online-oplevelse, så websites bliver naturligt stemme-interaktive, inklusive og flersprogede som standard. Med kun en enkelt linje kode kan website-ejere omdanne tusindvis af artikler til stemme-indhold. Fremover udvikler vi GSpeech Studio til en kraftfuld og unik platform for audio-generering og redigering, der giver brugerne mulighed for at skabe multi-lagdelte stemme-indhold med baggrundsmusik, effekter og præcis afstemning. Vi vil gøre webben sandt hørbart, intuitivt og universelt tilgængeligt.
GSpeech lancerede nyligt på AppSumo og har allerede opnået en næsten perfekt vurdering fra tidlige adoptorer. Hvad har responsen fra AppSumo-fællesskabet betydet for dig, og hvordan planlægger du at bygge på denne momentum fremover?
AppSumo-lanceringen introducerede GSpeech til millioner, og dens næsten perfekte vurdering er utrolig bekræftende. Brugere, som dem, der kører online-kurser, roser vores intuitive værktøjer og responsive support, der genspejler feedback fra Humanity Union. En blog-ejer kaldte vores stemmer “ægte engagerende” og oversættelser “imponerende”. Deres positive feedback bekræfter værdien af vores AI-drevne tekst-til-tale-løsning og føder min passion for projektet. At støtte kunder under lanceringen fik også nye ideer, især for GSpeech Studio, der blev inspireret af brugeranmodninger om avanceret audio-redigering og eksportfunktioner. Fremover planlægger jeg at bygge på denne momentum ved at lytte aktivt til vores fællesskab, integrere deres feedback og udvikle innovative funktioner til at forbedre tilgængelighed og engagement, og sikre, at GSpeech fortsætter med at udvikle sig som et transformerende værktøj for skabere og virksomheder.
Til sidst, hvad råd vil du give til unge udviklere eller iværksættere, der ønsker at bygge tilgængelige, AI-drevne værktøjer i dagens hurtigt udviklende teknologi-landskab?
Til unge udviklere og iværksættere er mit råd at hælde dit hjerte ind i dit arbejde og identificere et rigtigt problem, hvor du kan tilbyde en unik, smart løsning. Start småt, tag stadige skridt fremad, og lyt tæt på kunde-feedback – de vil guide din vej. Behandle dine brugere som betroede venner, giv dit allermest, og bliv tålmodig. Embracer AI-teknologier som kraftfulde allierede; når de bruges klogt, forstærker de din evne til at skabe betydningsfulde, tilgængelige værktøjer. Byg med passion, persistence og en forpligtelse til at gøre en forskel, og du vil skabe løsninger, der virkelig betyder noget.
Tak for det store interview, vi valgte GSpeech-løsningen til vores website på grund af den lette integration. For at lære mere besøg GSpeech.












