Intervjuer

Simon Poghosyan, grunnlegger og CEO av GSpeech – Intervju-serie

mm
Legg til Unite.AI blant dine foretrukne kilder på Google

Simon Poghosyan er grunnlegger og CEO av GSpeech, en nettbasert AI-plattform som hjelper med å gjøre nettinnhold mer tilgjengelig ved å konvertere tekst til naturlig lyd i over 70 språk. Med en bakgrunn i VLSI-design og en sterk interesse for programmering og brukeropplevelse, skapte Simon GSpeech for å forenkle måten nettsteder kan tilby stemmeaktiverthold.

I dag genererer GSpeech rundt 200 millioner tegn med lyd hver måned og brukes i over 70 land, med tilpassbare lydspillere som serverer over 200 000 avspillinger månedlig. Etter å ha overskredet 1 milliard tegn med lyd generert totalt, fortsetter GSpeech å vokse raskt. Plattformen er designet for å være enkel å integrere – og krever bare en enkelt kodeLinje – og støtter skapere, utdannere og bedrifter i å gjøre innholdet mer inkluderende og engasjerende.

GSpeech brukes også på alle våre engelske sider, du kan lytte til denne artikkelen og se hvordan GSpeech fungerer ved å klikke på avspillingsknappen.

Din bakgrunn i VLSI-design (Very Large Scale Integration) og tidlig programmeringserfaring la en sterk teknisk grunn. Hva inspirerte din overgang fra mikroelektronikk til å bygge AI-drevne programvare, og hvordan ledet det til skapelsen av GSpeech?

Min lidenskap for å løse problemer begynte på videregående skole, drevet av en kjærlighet til matematikk og fysikk. Denne interessen ledet meg til å ta en bachelor (2009) og master (2011) i VLSI-design fra Statens ingeniørhøyskole i Armenia, i samarbeid med Synopsys Armenia. Å studere fysikk trente meg i presisjon og analytisk tenkning, men det var under mitt andre år at jeg oppdaget programmering – startende med Pascal-språket – og umiddelbart ble forelsket i det. Min venn og jeg fullførte oppgaver så snart vi mottok dem, selv om vi hadde seks måneder på oss. Deretter, for moro skyld, begynte vi å gjøre oppgavene til andre studenter.

Denne lidenskapen ledet meg dyptere inn i programvareutvikling. Jeg startet med nettstedsskapelse, deretter bygde jeg min egen CMS. Etter å ha fullført flere prosjekter i prosessautomatisering og design av datahåndteringssystemer, innsett jeg hvor mye jeg elsket å bygge digitale løsninger for nettgrensesnitt. Gjennom 2GLux-prosjektet samarbeidet jeg med Edvard Ananyan – skaperen av den populære GTranslate-tjenesten og en skolekamerat fra Quant Gymnasium. Han introduserte meg for WordPress- og Joomla-økosystemene, og konseptet for GSpeech oppstod med ham. Den tidlige arbeidet ledet til den første versjonen av vårt verktøy, som muliggjorde at brukerne kunne lytte til tekst på en nettside, og plantet frøet for hva som senere skulle bli en fullt utviklet AI-plattform. I 2023 etablerte jeg Smarts Club LLC for å skalle GSpeech opp til en global AI-lydløsning, som støtter 70+ språk. Humanity Unions ros for GSpeechs rolle i å forbedre deres sivile engasjementsplattforms tilgjengelighet reflekterer min misjon om å brygge digitale skiller gjennom AI – en visjon som er rotfestet i mine tidlige programmeringsdager.

GSpeech begynte opprinnelig som et verktøy for å støtte synshemmede brukere. Hvordan påvirkte denne tidlige misjonen plattformens utvikling til en fullt utviklet AI-tekst-til-tale-løsning?

Fokuset på tilgjengelighet drev utviklingen av høykvalitets, sanntids AI-lyd, oversettelse til 70+ språk og sømløs nettstedintegrering via en enkel kodebit. Denne misjonen ledet til funksjoner som tilpassbare lydspillere, språk- og stemmevalgspaneler, kontekstbevisst avspilling, lyddownloads og detaljerte bruksstatistikk – inkludert land, by, enhetsdata og avspillingsanalyser over tid – alt designet for å gjøre innhold mer inkluderende og engasjerende. Etter å ha skrevet over 100 000 linjer med kode, lanserte jeg GSpeech Cloud Console i 2023 – en skalerbar løsning som balanserer inklusivitet med avansert funksjonalitet, og gir bedrifter og skapere mulighet til å gjøre innhold mer tilgjengelig, flerspråklig og interaktivt på nettet.

Hva var noen av de største tekniske utfordringene du møtte under utviklingen av GSpeech Cloud Console?

En av de største utfordringene i utviklingen av GSpeech Cloud Console var å designe en skalerbar arkitektur for sanntids, sikker, høykvalitets AI-lydgenerering. Dette krevde innovative løsninger for å hente relevant innhold fra nettet, prosessere lyd på våre servere og lagre den i skyen for rask, pålitelig levering. Implementering av robuste sikkerhetstiltak, som kryptering og tilgangskontroll, var kritisk for å beskytte dynamisk, brukergenerert innhold.

En annen hindring var å aktivere sanntids oversettelse ved hjelp av avanserte neurale motorer. Vi måtte sikre lav forsinkelse, nøyaktige oversettelser samtidig som vi bygget en intuitiv grensesnitt som lot brukerne velge språk og foretrukne stemmeprofiler for avspilling, prioritering brukerkomfort og personlig tilpasning. Til slutt utviklet vi en lydmalingswizard med flere tilpassbare spillervisninger, som tillot brukerne å designe unike, visuelt tiltalende spillere tilpasset deres nettsteder. Å balansere fleksibilitet, ytelse og enkelhet på tvers av enheter var en givende utfordring.

Med sanntids oversettelse i 70+ språk og over 230 naturlig lydende stemmer. Hvordan sikrer du stemmekvalitet og opprettholder nøyaktighet på tvers av så et mangfoldig språksett?

For å opprettholde konsekvent stemmekvalitet, integrerer vi flere avanserte tekst-til-tale (TTS)-modeller som kontinuerlig optimaliseres og oppdateres. Disse flerspråklige motorer håndterer blandet språkinnhold med høy nøyaktighet. Vi ruller ut over 100 nye stemmevibber for å gi brukerne enda flere uttrykksfulle og naturlig lydende alternativer. Hver måned genererer GSpeech over 200 millioner tegn med lyd, som serverer brukere i over 70 land, og våre nettspillere brukes over 200 000 ganger månedlig – og vokser. Denne skalaen sikrer kontinuerlig tilbakemelding og virkelige tester, som direkte informerer våre justeringer og kvalitetskontroller.

Kan du gå gjennom hvordan GSpeech utnytter AI og maskinlæring for å levere livlige stemmesynteser? Hvordan holder du pace med de raske fremskrittene i neural stemmeteknologi?

GSpeech bruker avansert AI og maskinlæring, integrerer flere state-of-the-art tekst-til-tale-modeller for å produsere livlige stemmesynteser. Disse modellene, optimalisert for naturalitet og flerspråklig støtte, prosesserer tekstinput for å generere høykvalitets lyd med realistisk intonasjon og rytme, selv for blandet språkinnhold. Vi forbedrer brukeropplevelsen ved å tilby tilpassbare stemmestiler for diverse språk. Vi har også integrert TTS-aliaser, som tillater brukerne å definere egne regler for hvordan bestemte ord eller fraser skal rendres i lyd – for eksempel, erstatter bestemte termer for å oppnå mer nøyaktig uttale eller frasering. For å holde pace med neural stemmeteknologi, vurderer vi kontinuerlig og integrerer de siste fremskrittene, samarbeider med bransjeledere og planlegger å utvikle egne modeller i fremtiden, sikrer at GSpeech forblir i forkant av stemmesynteser-innovasjon.

Hvor viktig er stemmejustering, tonekontroll og avspillings tilpasning for dine brukere – og hva er brukstilfelle du er mest stolt av hvor disse funksjonene virkelig skinner?

Stemmejustering, tonekontroll og avspillings tilpasning er kritisk for våre brukere, og muliggjør at de kan skape unike, høykvalitets stemmestiler tilpasset deres spesifikke behov, fra nyheter og blogg-nettsteder til tilgjengelige e-læringsinnhold. Den pågående integreringen av over 100 nye stemmevibber forbedrer denne ytterligere, og tilbyr brukerne en utenkelig fleksibilitet til å skape virkelig distinkte stemmeoversettelser. Jeg er mest stolt av GSpeech Studio, en ny lydredigerings- og genereringsplattform jeg utvikler. Den tillater brukerne å skape flere lydkanaler, mikse dem med bakgrunnsmusikk og eksportere polerte stemmeoversettelser, og gir skaperne mulighet til å produsere profesjonelle lyd til diverse anvendelser. En synshemmet students brev, som takket GSpeech for å muliggjøre uavhengig studier gjennom tilpasset lyd, berørt meg dypt. Dette brukstilfelle viser hvordan disse funksjonene gjør innhold tilgjengelig og transformasjonelt, et mål jeg har forfulgt siden mine tidlige programmeringsdager.

GSpeech tilbyr sømløse integrasjoner med WordPress, Shopify , Wix og mer. Hva har vært din strategi for å gjøre plattformen plug-and-play for skapere og bedrifter på tvers av ulike økosystemer?

Vår strategi for GSpeechs plug-and-play-integreringer med plattformer som WordPress, Shopify og Wix, har fokusert på enkelhet, kompatibilitet og skalerbarhet. Vi utviklet lette, modulære plugins og kodebiter som integrerer sømløst, og krever minimalt oppsett – ofte bare noen få klikk. Dette betyr at tusenvis av artikler og dynamisk innhold kan umiddelbart få stemmestøtte – uten manuell innsats. Vi tilbyr høyt fleksible, vakkert designede spillere som tilpasser seg på tvers av enheter, inkludert mobil, nettbrett og stasjonære datamaskiner. Våre spillere er ikke bare tilpassbare, men også optimalisert for tilgjengelighet og brukerengasjement. For WordPress har vi integrert GSpeech-cloud-dashbordet direkte i admin-panelet via vårt plugin, og strømlinjeformet håndtering for brukerne. Detaljert dokumentasjon og intuitive dashboards veileder ikke-tekniske brukere gjennom installasjon og tilpasning. Regelmessig testing sikrer konsistent ytelse på tvers av diverse økosystemer, og gir skapere og bedrifter mulighet til å legge til AI-drevet tekst-til-tale uten noen problemer.

Ser du tilbake på reisen fra 2012 til i dag, hva har vært den største milepælen for deg personlig eller profesjonelt i byggingen av GSpeech?

Den største milepælen for GSpeech var å generere 1 milliard tegn med høykvalitets AI-lyd, og vise vår globale innvirkning på tilgjengelighet. Like betydningsfullt har vært tilbakemeldingen vi har mottatt fra organisasjoner som Humanity Union, som roste GSpeech for å forbedre deres sivile engasjementsplattforms tilgjengelighet, og fra bloggeiere som kalte det en “game-changer” for brukerengasjement. Over 110 fem-stjerners anmeldelser på tvers av plattformer som WordPress og AppSumo de siste månedene, reflekterer denne voksende tilliten.

GSpeech brukes nå også aktivt av Namangan regional statistikkavdeling i Usbekistan – en offentlig institusjon med betydelig trafikk og nasjonal synlighet. Å se en offentlig kropp adoptere vår teknologi så bredt, har vært en betydningsfull milepæl og et kraftig tegn på tillit til vår løsning.

Som en kristen og noen som tjener i den armenske kirken, prøver jeg også å støtte andre trobaserte initiativer når mulig. Jeg tilbyr ofte GSpeech gratis til kristne nettsteder som en måte å hjelpe med å spre deres budskap mer effektivt og gjøre Skriften mer tilgjengelig gjennom lyd. Dette er min lille bidrag til noe større. Samtidig er jeg æret å arbeide med dedikerte ministerier som The Cord – en messiansk menighet og verdifull GSpeech-kunde – hvis misjon og innhold reflekterer kraften i Skriften i handling.

Disse øyeblikkene – når teknologi blir en bro for tro, forståelse og inklusjon – minner meg på hvorfor vi bygde GSpeech fra første sted.

Hva rolle ser du for GSpeech i fremtiden av digitale medier, spesielt når lydinnhold og stemme-grensesnitt blir mer dominante?

Jeg ser for meg GSpeech som en leder i å gjøre digitale medier mer tilgjengelige og engasjerende ved å aktivere AI-drevet stemme-tilgang til nettet. Vårt mål er å transformere hele nett-opplevelsen, så at nettsteder blir naturlig stemme-interactive, inkluderende og flerspråklig som standard. Med bare en enkelt kodeLinje kan nettsteds-eiere omdanne tusenvis av artikler til stemme-aktiverthold. Fremover utvikler vi GSpeech Studio til en kraftfull og unik plattform for lydgenerering og redigering, som muliggjør at brukerne kan skape flerskiktet lydinnhold med bakgrunnsmusikk, effekter og presis justering. Vi vil gjøre nettet virkelig hørbart, intuitivt og universelt tilgjengelig.

GSpeech lanserte nylig på AppSumo og har allerede tjent en nesten perfekt vurdering fra tidlige adoptører. Hva har responsen fra AppSumo-samfunnet betydd for deg, og hvordan planlegger du å bygge på denne momentum fremover?

AppSumo-lanseringen introduserte GSpeech til millioner, og dens nesten perfekte vurdering er usedvanlig bekreftende. Brukere, som de som kjører online-kurs, priser våre intuitive verktøy og responsive støtte, som ekkoer tilbakemelding fra Humanity Union. En bloggeier kalte våre stemmer “genuint engasjerende” og oversettelser “imponerende”. Deres positive tilbakemelding bekrefter verdien av vår AI-drevne tekst-til-tale-løsning og brenner min lidenskap for prosjektet. Å støtte kunder under lanseringen sparket også nye ideer, spesielt for GSpeech Studio, som ble inspirert av brukerforespørsler om avanserte lydredigerings- og eksportfunksjoner. Fremover planlegger jeg å bygge på denne momentum ved å aktivt lytte til vår samfunnet, integrere deres tilbakemelding og utvikle innovative funksjoner for å forbedre tilgjengelighet og engasjement, og sikre at GSpeech fortsetter å utvikle seg som en transformasjonell verktøy for skapere og bedrifter.

Til slutt, hva råd ville du gi til unge utviklere eller entreprenører som ønsker å bygge tilgjengelige, AI-drevne verktøy i dagens raskt bevegelige teknologilandskap?

Til unge utviklere og entreprenører, mitt råd er å helle hjertet ditt inn i arbeidet ditt og identifisere et virkelig problem hvor du kan tilby en unik, smart løsning. Start smått, ta jevne skritt fremover og lytte nøye til kundetilbakemelding – de vil guide din vei. Behandle dine brukere som troverdige venner, gi alt og bli tålmodig. Omfavne AI-teknologier som kraftfulle allierte; når de brukes viselig, forsterker de din evne til å skape innvirkende, tilgjengelige verktøy. Bygg med lidenskap, utholdenhet og en forpliktelse til å gjøre en forskjell, og du vil skape løsninger som virkelig betyr noe.

Takk for det flotte intervjuet, vi valgte GSpeech-løsningen for vårt nettsted på grunn av den enkle integreringen. For å lære mer, besøk GSpeech.

Antoine er en visjonær leder og medgrunnlegger av Unite.AI, drevet av en urokkelig lidenskap for å forme og fremme fremtiden for AI og robotikk. En serial entrepreneur, han tror at AI vil være like disruptiv for samfunnet som elektrisitet, og blir ofte fanget i å prise potensialet for disruptive teknologier og AGI.

Som en futurist, er han dedikert til å utforske hvordan disse innovasjonene vil forme vår verden. I tillegg er han grunnlegger av Securities.io, en plattform som fokuserer på å investere i banebrytende teknologier som definerer fremtiden og omformer hele sektorer.