Intervjuer

Simon Poghosyan, grundare och VD för GSpeech – Intervjuerien

mm
Lägg till Unite.AI bland dina föredragna källor på Google

Simon Poghosyan är grundare och VD för GSpeech, en webbaserad AI-plattform som hjälper till att göra onlineinnehåll mer tillgängligt genom att konvertera text till naturligt ljud i över 70 språk. Med en bakgrund inom VLSI-design och ett starkt intresse för programmering och användarupplevelse skapade Simon GSpeech för att förenkla sättet webbplatser kan erbjuda röstaktiverat innehåll.

Idag genererar GSpeech cirka 200 miljoner tecken med ljud varje månad och används i över 70 länder, med dess anpassningsbara ljudspelare som serverar över 200 000 spelningar månadsvis. Efter att ha passerat 1 miljard tecken med ljud som genererats totalt fortsätter GSpeech att växa snabbt. Plattformen är utformad för att vara lätt att integrera – den kräver bara en enda rad kod – och stöder skapare, utbildare och företag i att göra sitt innehåll mer inkluderande och engagerande.

GSpeech används också på alla våra engelska sidor, du kan lyssna på den här artikeln och se hur bra GSpeech fungerar genom att klicka på spelknappen.

Er bakgrund inom VLSI-design och tidig programmeringserfarenhet lade en stark teknisk grund. Vad inspirerade er skift från mikroelektronik till att bygga AI-drivna program, och hur ledde det till skapandet av GSpeech?

Min passion för problemlösning började i gymnasiet, driven av en kärlek till matematik och fysik. Detta ledde mig till att ta en kandidatexamen (2009) och en masterexamen (2011) i VLSI-design från Statens tekniska universitet i Armenien, i samarbete med Synopsys Armenien. Att studera fysik tränade mig i precision och analytiskt tänkande, men det var under mitt andra år som jag upptäckte programmering – börjande med Pascal-språket – och omedelbart blev förälskad i det. Min vän och jag skulle slutföra kursuppgifter så snart vi fick dem, även om vi hade sex månader på oss att slutföra dem. Sedan, för skojs skull, började vi göra uppgifterna för andra studenter.

Denna passion ledde mig djupare in i programvaruutveckling. Jag började med webbplatsers skapande, sedan byggde jag mitt eget CMS. Efter att ha slutfört flera projekt inom processautomatisering och design av datahanteringsarkitektur insåg jag hur mycket jag älskade att bygga digitala lösningar för webbgränssnitt. Genom 2GLux-projektet samarbetade jag med Edvard Ananyan – skapare av den populära GTranslate-översättningstjänsten och en skolkamrat från Quant Gymnasium. Han introducerade mig till WordPress och Joomla-ekosystemen, och konceptet för GSpeech uppstod med honom. Det tidiga arbetet ledde till den första versionen av vårt verktyg, som möjliggjorde för användare att lyssna på text på en webbplats, och sådde frön för vad som senare skulle bli en fullfjädrad AI-plattform. År 2023 etablerade jag Smarts Club LLC för att skala GSpeech till en global AI-ljudlösning, som stöder 70+ språk. Humanity Unions beröm av GSpeechs roll i att förbättra deras plattform för medborgerlig engagemang reflekterar min mission att överbrygga digitala klyftor genom AI – en vision som har sina rötter i mina tidiga programmeringsdagar.

GSpeech började ursprungligen som ett verktyg för att stödja synskadade användare. Hur påverkade den tidiga missionen plattformens utveckling till en fullfjädrad AI-text-till-tal-lösning?

Fokuseringen på tillgänglighet drev utvecklingen av högkvalitativ, realtids-AI-ljud, översättning till 70+ språk och sömlös webbplatsintegration via en enkel kodsnutt. Denna mission ledde till funktioner som anpassningsbara ljudspelare, språk- och röstvalspaneler, kontextmedveten uppspelning, ljudnedladdningar och detaljerad användningsstatistik – inklusive lands-, stads-, enhetsdata och uppspelningsanalys över tid – allt designat för att göra innehåll mer inkluderande och engagerande. Efter att ha skrivit över 100 000 rader med kod lanserade jag GSpeech Cloud Console 2023 – en skalbar lösning som balanserar tillgänglighet med avancerad funktionalitet, som ger företag och skapare möjlighet att göra sitt innehåll tillgängligt, flerspråkigt och interaktivt över hela webben.

Vilka var några av de största tekniska utmaningarna ni stod inför under utvecklingen av GSpeech Cloud Console?

En av de största utmaningarna i utvecklingen av GSpeech Cloud Console var att designa en skalbar arkitektur för realtids-, säker-, högkvalitativ AI-ljudgenerering. Detta krävde innovativa lösningar för att hämta relevant innehåll från webben, bearbeta ljud på våra servrar och lagra det i molnet för snabb, tillförlitlig leverans. Att implementera robusta säkerhetsåtgärder, som kryptering och åtkomstkontroll, var avgörande för att skydda dynamiskt, användargenererat innehåll.

En annan utmaning var att möjliggöra realtidsöversättning med avancerade neurale motorer. Vi var tvungna att säkerställa låg latens, exakta översättningar samtidigt som vi byggde en intuitiv gränssnitt som tillät användare att välja språk och önskade röstprofiler för uppspelning, med prioritet för användarkomfort och personanpassning. Slutligen utvecklade vi en ljudmallskapare som guidar användarna genom att skapa unika, visuellt tilltalande spelare anpassade till deras webbplatser. Att balansera flexibilitet, prestanda och användarvänlighet över enheter var en givande utmaning.

Med realtidsöversättning på 70+ språk och över 230 naturligt ljudande röster. Hur säkerställer ni röstkvalitet och upprätthåller exakthet över ett sådant diversifierat språkset?

För att upprätthålla konsekvent röstkvalitet integrerar vi flera avancerade text-till-tal-modeller som kontinuerligt optimeras och uppdateras. Dessa flerspråkiga motorer hanterar blandat språkinnehåll med hög exakthet. Vi rullar också ut över 100 nya röstvibrationer för att ge användarna ännu fler uttrycksfulla och naturligt ljudande alternativ. Varje månad genererar GSpeech över 200 miljoner tecken med ljud, som serverar användare i över 70 länder, och våra online-spelare används över 200 000 gånger i månaden – och växer. Denna skala säkerställer kontinuerlig återkoppling och verkliga tester, som direkt informerar vår finjustering och kvalitetskontroll.

Kan ni gå igenom hur GSpeech använder AI och maskinlärning för att leverera livliknande röstsyntes? Hur håller ni er ajour med de snabba framstegen inom neural röstteknologi?

GSpeech använder avancerad AI och maskinlärning, integrerar flera state-of-the-art text-till-tal-modeller för att producera livliknande röstsyntes. Dessa modeller, optimerade för naturlighet och flerspråkig support, bearbetar textinmatningar för att generera högkvalitativt ljud med realistisk intonation och rytm, även för blandat språkinnehåll. Vi förbättrar användarupplevelsen genom att erbjuda anpassningsbara röststilar för olika språk. Vi har också integrerat TTS-alias, som tillåter användare att definiera anpassade regler för hur vissa ord eller fraser återges i ljud – till exempel, ersätta specifika termer för att uppnå mer exakt uttal eller frasering. För att hålla oss ajour med neural röstteknologi utvärderar vi kontinuerligt och integrerar de senaste framstegen, samarbetar med branschledare och planerar att utveckla egna modeller i framtiden, säkerställande att GSpeech förblir i framkanten av röstsyntes-innovation.

Hur viktigt är röstjustering, tonkontroll och uppspelningsanpassning för era användare – och vad är det användningsfall som ni är mest stolta över där dessa funktioner verkligen lyser?

Röstjustering, tonkontroll och uppspelningsanpassning är avgörande för våra användare, vilket möjliggör för dem att skapa unika, högkvalitativa röststilar anpassade till deras specifika behov, från nyhets- och bloggwebbplatser till tillgängligt e-lärande-innehåll. Den pågående integrationen av över 100 nya röstvibrationer förbättrar detta ytterligare, erbjuda användarna en oöverträffad flexibilitet att skapa verkligen distinkta röstöverföringar. Jag är mest stolt över GSpeech Studio, en ny ljudredigerings- och generationsplattform som jag utvecklar. Den tillåter användare att skapa flera ljudkanaler, blanda dem med bakgrundsmusik och exportera polerade röstöverföringar, vilket ger skapare möjlighet att producera professionella ljud för olika tillämpningar. Ett brev från en synskadad student, som tackade GSpeech för att ha möjliggjort självständiga studier genom anpassat ljud, berörde mig djupt. Detta användningsfall visar hur dessa funktioner gör innehåll tillgängligt och transformerande, ett mål som jag har strävat efter sedan mina tidiga programmeringsdagar.

GSpeech erbjuder sömlösa integrationer med WordPress, Shopify , Wix och mer. Vilken strategi har ni använt för att göra plattformen plug-and-play för skapare och företag över olika ekosystem?

Vår strategi för GSpeechs plug-and-play-integrationer med plattformar som WordPress, Shopify och Wix fokuserade på enkelhet, kompatibilitet och skalbarhet. Vi utvecklade lätta, modulära plugins och kodsnuttar som integrerar sömlöst, kräver minimal konfiguration – ofta bara några klick. Detta innebär att tusentals artiklar och dynamiska innehållsblock kan omedelbart få röststöd – utan manuell ansträngning. Vi erbjuder högt anpassningsbara, vackert designade spelare som anpassar sig över enheter, inklusive mobil, surfplattor och stationära datorer. Våra spelare är inte bara anpassningsbara utan också optimerade för tillgänglighet och användarengagemang. För WordPress har vi inbäddat GSpeech-molndashboards direkt i adminpanelen via vår plugin, vilket förenklar hanteringen för användare. Detaljerad dokumentation och intuitiva dashboards guidar icke-tekniska användare genom installation och anpassning. Regelbunden testning säkerställer konsekvent prestanda över diversa ekosystem, vilket ger skapare och företag möjlighet att lägga till AI-drivna text-till-tal-lösningar utan ansträngning.

Om ni ser tillbaka på resan från 2012 till idag, vad har varit den största milstolpen för er personligen eller professionellt i att bygga GSpeech?

Den största milstolpen för GSpeech var att generera 1 miljard tecken med högkvalitativt AI-ljud, vilket visar vår globala påverkan på tillgänglighet. Likaså meningsfullt har varit den återkoppling vi har fått från organisationer som Humanity Union, som berömt GSpeech för att ha förbättrat deras plattform för medborgerligt engagemang, och från bloggägare som kallade det en “spelväxlare” för användarengagemang. Över 110 femstjärniga recensioner över plattformar som WordPress och AppSumo under de senaste månaderna reflekterar detta växande förtroende.

GSpeech används nu också aktivt av Namangan regionala statistikavdelning i Uzbekistan – en statlig institution med betydande trafik och nationell synlighet. Att se en offentlig kropp anta vår teknik så brett har varit en meningsfull milstolpe och ett kraftfullt tecken på förtroende för vår lösning.

Som kristen och någon som tjänar i den armeniska kyrkan försöker jag också stödja andra tro-baserade initiativ närhelst möjligt. Jag erbjuder ofta GSpeech utan kostnad till kristna webbplatser som ett sätt att hjälpa dem sprida sitt budskap mer effektivt och göra Skriften mer tillgänglig genom ljud. Det är mitt lilla bidrag till något större. Samtidigt är jag hedrad att arbeta med dedikerade ministerier som The Cord – en messiansk församling och värdefull GSpeech-kund – vars uppdrag och innehåll reflekterar kraften i Skriften i handling.

Dessa ögonblick – när teknologi blir en bro för tro, förståelse och inkludering – påminner mig om varför vi byggde GSpeech från början.

Vilken roll ser ni att GSpeech kommer att spela i framtiden för digital media, särskilt när ljudinnehåll och röstgränssnitt blir mer dominerande?

Jag ser GSpeech som en ledare i att göra digital media mer tillgängligt och engagerande genom att möjliggöra AI-drivna röståtkomst till webben. Vårt mål är att transformera hela online-upplevelsen, så att webbplatser blir naturligt röstinteraktiva, inkluderande och flerspråkiga som standard. Med bara en rad kod kan webbplatsägare omvandla tusentals artiklar till röstaktiverat innehåll. Framåt utvecklar vi GSpeech Studio till en kraftfull och unik plattform för ljudgenerering och redigering, som möjliggör för användare att skapa flerskiktat ljudinnehåll med bakgrundsmusik, effekter och exakt justering. Vi vill göra webben verkligen hörbar, intuitiv och universellt tillgänglig.

GSpeech lanserades nyligen på AppSumo och har redan fått en nästan perfekt betyg av tidiga antagare. Vad har responsen från AppSumo-gemenskapen betytt för er, och hur planerar ni att bygga på denna momentum i framtiden?

AppSumo-lanseringen introducerade GSpeech till miljontals och dess nästan perfekta betyg är otroligt bekräftande. Användare, som de som kör online-kurser, berömmer våra intuitiva verktyg och responsiva support, ekar återkoppling från Humanity Union. En bloggägare kallade våra röster “äkta engagerande” och översättningar “imponerande”. Deras positiva återkoppling bekräftar värdet av vår AI-drivna text-till-tal-lösning och bränslar min passion för projektet. Att stödja kunder under lanseringen väckte också nya idéer, särskilt för GSpeech Studio, som inspirerades av användarbegäranden om avancerade ljudredigerings- och exportfunktioner. Framåt planerar jag att bygga på denna momentum genom att aktivt lyssna på vår gemenskap, integrera deras återkoppling och utveckla innovativa funktioner för att förbättra tillgänglighet och engagemang, säkerställande att GSpeech fortsätter att utvecklas som ett transformerande verktyg för skapare och företag.

Till sist, vad är er råd till unga utvecklare eller entreprenörer som vill bygga tillgängliga, AI-drivna verktyg i dagens snabbt föränderliga tekniklandskap?

Till unga utvecklare och entreprenörer är mitt råd att hälla er hjärta i ert arbete och identifiera ett riktigt problem där ni kan erbjuda en unik, smart lösning. Börja smått, ta stadiga steg framåt och lyssna noga på kundåterkoppling – de kommer att vägleda er väg. Behandla era användare som betrodda vänner, ge er allt och vara tåliga. Anta AI-teknologier som kraftfulla allierade; när de används klokt, förstärker de er förmåga att skapa påverkande, tillgängliga verktyg. Bygg med passion, uthållighet och ett engagemang för att göra en skillnad, och ni kommer att skapa lösningar som verkligen betyder något.

Tack för den underbara intervjun, vi valde GSpeech-lösningen för vår webbplats på grund av den enkla integrationen. För att lära mer, besök GSpeech.

Antoine är en visionär ledare och medgrundare av Unite.AI, driven av en outtröttlig passion för att forma och främja framtidens AI och robotik. En serieentreprenör, han tror att AI kommer att vara lika störande för samhället som elektricitet, och han fångas ofta i att prata om potentialen för störande teknologier och AGI.

Som en futurist är han dedikerad till att utforska hur dessa innovationer kommer att forma vår värld. Dessutom är han grundare av Securities.io, en plattform som fokuserar på att investera i banbrytande teknologier som omdefinierar framtiden och omformar hela sektorer.