Haastattelut
Simon Poghosyan, GSpeechin perustaja ja toimitusjohtaja – Haastattelusarja

Simon Poghosyan on GSpeechin perustaja ja toimitusjohtaja, verkkopohjainen älykkään tekstiäänen muunnosjärjestelmä, joka tekee verkkosisällön helpommin saataville muuttamalla tekstin luonnolliseen ääneen yli 70 kielellä. Taustalla oleva VLSI-suunnittelun osaaminen ja vahva kiinnostus ohjelmointiin ja käyttökokemukseen, Simon loi GSpeechin yksinkertaistamaan verkkosivujen äänisisällön tarjoamista.
Tänään GSpeech tuottaa noin 200 miljoonaa äänen merkkiä kuukaudessa ja sitä käytetään yli 70 maassa, ja sen mukautettavat äänisoittimet palvelevat yli 200 000 kuuntelukertaa kuukaudessa. Ylittäessämme 1 miljardin äänen merkin tuotannon, GSpeech jatkaa nopeaa kasvuaan. Alusta on suunniteltu helppokäyttöiseksi — vaatien vain yhden koodirivin — ja tukee luojia, kouluttajia ja liiketoimintaa sisällön tekemisessä helpommin saataville ja monikieliseksi.
GSpeechia käytetään myös kaikilla englanninkielisillä sivuillamme, voit kuunnella tämän artikkelin ja nähdä, miten hyvin GSpeech toimii, kun painat toistopainiketta.
Mikä innoitti sinua siirtymään VLSI-suunnittelusta älykkään ohjelmistojen kehittämiseen ja miten tämä johti GSpeechin luomiseen?
Minun intohimoni ongelmanratkaisuun alkoi lukiotaikoina, johdetusta rakkaudesta matematiikkaa ja fysiikkaa kohtaan. Tuo kiinnostus vei minut suorittamaan kandidaatin (2009) ja maisterin tutkinnon (2011) VLSI-suunnittelusta Armenian valtion insinööriyliopistossa yhteistyössä Synopsys Armenian kanssa. Fysiikan opiskelu opetti minua tarkkuuteen ja analyyttiseen ajatteluun, mutta toisena opiskeluvuotena löysin ohjelmoinnin — aloittaen Pascal-kielen — ja rakastuin siihen välittömästi. Ystäväni ja minä suorittimme kurssitehtävät heti, kun saimme ne, vaikka meillä oli kuusi kuukautta aikaa tehdä niitä. Sitten huviksi aloimme tehdä muiden opiskelijoiden tehtäviä.
Tämä intohimo vei minua syvemmälle ohjelmistokehitykseen. Aloin verkkosivujen luomisella, sitten rakensin oman CMS:ni. Useiden prosessiautomaatio- ja tietohallintorakenteiden suunnittelun jälkeen tajusin, kuinka paljon rakastan digitaalisten ratkaisujen luomista verkkorajapinnoille. 2GLux-projektin kautta yhteistyöni Edvard Ananyanin — GTranslaten luojan ja koulukaverini Quant Gymnasiumista — kanssa sai aikaan GSpeechin konseptin. Tuo varhainen työ johti ensimmäiseen työkalumme versioon, joka mahdollisti käyttäjien kuuntelemisen tekstejä verkkosivuilla, kylväen siemenen tulevaisuuden monipuolisen älykkään ääniplataformaksi. Vuoteen 2023 mennessä perustin Smarts Club LLC:n skaalatakseen GSpeechin globaaliksi älykkääksi ääniratkaisuksi, joka tukee yli 70 kieltä. Humanity Unionin kehu GSpeechin roolista parantamassa heidän kansalaisosallistumisalustansa saavutettavuutta heijastaa minun tehtävääni siltaa rakentamaan digitaalisia jakavia älykkäiden ratkaisujen kautta — näkemys, joka on juurtunut varhaisiin ohjelmointipäiviini.
GSpeech alkoi alun perin työkaluna, joka tukee näkövammaisia käyttäjiä. Miten tämä varhainen tehtävä vaikutti alustan kehitykseen täysipainoiseksi älykkääksi tekstiäänen ratkaisuksi?
Saavutettavuuden painopiste ohjasi korkealaatuisen, reaaliaikaisen äänen kehitystä, käännöstä yli 70 kielelle ja helppokäyttöistä verkkosivujen integrointia yksinkertaisella koodinpätkällä. Tämä tehtävä johti ominaisuuksiin, kuten mukautettaviin äänisoittimiin, kielivalikoimiin, kontekstiaavusteiseen toistoon, äänitallennuksiin ja yksityiskohtaisiin käyttötilastoihin — mukaan lukien maan, kaupungin, laitteen tietoja ja toistotilastot ajan myötä — kaikki suunniteltu tekemään sisällöstä enemmän osallistavaa ja viihdyttävää. Yli 100 000 koodirivin kirjoittamisen jälkeen julkaisin GSpeech Cloud Console -ratkaisun vuonna 2023 — skaalautuvan ratkaisun, joka tasapainottaa saavutettavuuden ja edistyneen toiminnallisuuden, antaen liiketoiminnalle ja luojille mahdollisuuden tehdä sisällöstään saavutettavampaa, monikielistä ja interaktiivista verkkosisällön ympärillä.
Mitkä olivat joitain suurimpia teknisiä haasteita, joita kohtasit GSpeech Cloud Console -kehityksen aikana?
Yksi suurimmista haasteista GSpeech Cloud Console -kehityksessä oli suunnitella skaalautuva arkkitehtuuri reaaliaikaiselle, turvalliselle, korkealaatuiselle älykkäälle äänen tuottamiselle. Tämä vaati innovatiivisia ratkaisuja haalia asiaankuuluvaa sisältöä verkosta, prosessoida ääniä palvelimillamme ja tallentaa ne pilveen nopeaan, luotettavaan toimittamiseen. Turvallisuuden toteuttaminen, kuten salaus ja pääsyvalvonta, oli kriittinen suojella dynaamista, käyttäjien luomaa sisältöä.
Toinen este oli toteuttaa reaaliaikainen käännös edistyneiden neurorunkojen avulla. Meidän piti varmistaa matala viive, tarkin käännös ja samalla rakentaa käyttäjäystävällinen käyttöliittymä, joka sallii käyttäjien valita kielet ja ääniprofiilit toistoa varten, priorisoiden käyttäjien mukavuutta ja personointia. Lopulta kehitimme äänimallinluojan, joka mahdollistaa monia mukautettavia soittimenäkymiä, antaen käyttäjille mahdollisuuden suunnitella ainutlaatuisia, visuaalisesti viehättäviä soittimia verkkosivuilleen. Tasapainottaa joustavuutta, suorituskykyä ja helppokäyttöisyyttä laitteiden yli oli palkitseva haaste.
Kuinka varmistat äänen laadun ja ylläpidät tarkin äänen yli 70 kielen ja yli 230 luonnollisen äänen joukossa?
Ylläpitääkseni johdonmukaista äänen laatua, integroidaan useita edistyneitä tekstiäänen muunnosmalleja, jotka optimoidaan ja päivitetään jatkuvasti. Nämä monikieliset moottorit käsittelevät sekoitettua kielisisältöä korkealla tarkinä. Olemme myös tuomassa yli 100 uutta äänivibaa antaaksemme käyttäjille vielä enemmän ilmaisuvoimaisia ja luonnollisen kuuloisia vaihtoehtoja. Joka kuussa GSpeech tuottaa yli 200 miljoonaa äänen merkkiä, palvelee käyttäjiä yli 70 maassa, ja verkkosoittimemme käytetään yli 200 000 kertaa kuukaudessa — ja kasvamassa. Tämä asteikko takaa jatkuvaa palautetta ja todellisen maailman testausta, mikä suoraan ohjaa säätöjä ja laadunvalvontaa.
Voitko kuljettaa meidät läpi, miten GSpeech hyödyntää älykkyyttä ja koneoppimista toimiakseen luonnollisen äänen synteesinä? Miten pidät yllä askelia nopeasti kehittyvien neurorunkojen kehityksessä?
GSpeech käyttää edistynyttä älykkyyttä ja koneoppimista, integroiden useita älykkäitä tekstiäänen muunnosmalleja tuottamaan luonnollisen äänen synteesiä. Nämä mallit, jotka on optimoitu luonnollisuuden ja monikielisen tuen kannalta, prosessoidaan tekstisyötteitä tuottamaan korkealaatuista ääntä, jossa on realistinen intonaatio ja rytmi, myös sekoitetussa kielisisällössä. Parannamme käyttäjäkokemusta tarjoamalla mukautettavia äänityylejä monille kielille. Olemme myös integroineet TTS-aliakset, jotka sallivat käyttäjien määritellä mukautettuja sääntöjä tiettyjen sanojen tai lauseiden ääntämiseen — esimerkiksi korvaamalla tiettyjä termejä tarkemman ääntämisen tai lauseenrakenteen saavuttamiseksi. Pidäksemme askeleet yllä älykkään äänen synteesin innovaatioiden kärjessä, jatkuvasti arvioimalla ja integroimalla uusimmat edistysaskeleet, yhteistyötä tehdään alan johtajien kanssa, ja suunnittelemme kehittäävämme omia malleja tulevaisuudessa, varmistaen GSpeechin aseman äänen synteesin edelläkävijänä.
Kuinka tärkeää on äänen säätö, äänen ohjaus ja toiston mukauttaminen käyttäjille — ja mikä on tapaus, jossa nämä ominaisuudet loistavat erityisesti?
Äänen säätö, äänen ohjaus ja toiston mukauttaminen ovat käyttäjillemme kriittisiä, mahdollistaen heidän luoda yksilöllisiä, korkealaatuista ääntä, joka on räätälöity heidän tarkoituksiinsa, aina uutis- ja blogisivuista saavutettavaan verkkokoulutusmateriaaliin. Jatkuvasti integroidaan yli 100 uutta äänivibaa, joka parantaa tämän joustavuutta entisestään, tarjoten käyttäjille mahdollisuuden luoda todella ainutlaatuisia äänikertoja. Olen ylpeä GSpeech Studion kehittämisestä, uudesta äänieditori- ja -luomisalustasta, jonka kehitän. Se mahdollistaa käyttäjien luoda useita äänikanavia, sekoittaa ne taustamusiikin kanssa ja vie polttavat äänikertoja ammattimaisiin sovelluksiin, antaen luojille mahdollisuuden tuottaa ammattitason ääniä moniin tarkoituksiin. Näkövammainen opiskelijan kirje, jossa kiitettiin GSpeechiä itsenäisen opiskelun mahdollistamisesta mukautetun äänen avulla, kosketti minua syvästi. Tämä tapaus osoittaa, miten nämä ominaisuudet tekevät sisällöstä saavutettavampaa ja muodonmuuttuvaa, tavoitetta, jota olen ajanut ohjelmointipäivistäni lähtien.
GSpeech tarjoaa helpon integraation WordPressiin, Shopifyyn, Wixiin ja muihin. Mikä on ollut strategiasi tehdä alusta plug-and-play -yhteensopivaksi luojille ja liiketoiminnalle eri ekosysteemeissä?
Strategiamme GSpeechin helppokäyttöisyyden ja yhteensopivuuden kehittämiseksi keskittyi yksinkertaisuuteen, yhteensopivuuteen ja skaalautuvuuteen. Kehittimme kevyitä, modulaarisia liitännäisiä ja koodinpätkiä, jotka integroidaan vaivattomasti — usein vain muutamalla klikkauksella. Tämä tarkoittaa, että tuhannet artikkelit ja dynaamiset sisällön lohkot voivat heti saada äänituen — ilman manuaalista vaivaa. Tarjoamme erittäin joustavia, kauniisti suunniteltuja soittimia, jotka sopeutuvat laitteiden yli, mukaan lukien mobiililaitteet, taulutietokoneet ja työpöytäkoneet. Soittimemme eivät ole vain mukautettavissa, vaan myös optimoituja saavutettavuuden ja käyttäjäkokemuksen kannalta. WordPressiin upottaminen GSpeech-pilvihallintaa suoraan hallintopaneeliin pluginin kautta, sujuvoittaa käyttäjien hallintaa. Yksityiskohtainen dokumentaatio ja helppokäyttöiset hallintapaneelit johdattelevat ei-tekniikkaa taitavia käyttäjiä asennuksen ja mukauttamisen kautta. Säännöllinen testaus varmistaa johdonmukaista suorituskykyä eri ekosysteemeissä, antaen luojille ja liiketoiminnalle mahdollisuuden lisätä älykkään tekstiäänen vaivattomasti.
Katsoessa taaksepäin matkasta vuodesta 2012 tähän päivään, mikä on ollut suurin merkkipaalu sinulle henkilökohtaisesti tai ammatillisesti GSpeechin rakentamisessa?
Suurin merkkipaalu GSpeechille oli ylittää 1 miljardin korkealaatuista älykkään äänen merkin tuotanto, osoittaen maailmanlaajuista vaikutusta saavutettavuuteen. Samalla merkittävä on ollut palautteen saaminen organisaatioilta, kuten Humanity Unionilta, joka ylisti GSpeechiä parantamasta heidän sosiaalisen vastuun alustan saavutettavuutta, ja blogien omistajilta, jotka kutsuivat sitä “pelimuuttajaksi” käyttäjäkokemuksen kannalta. Yli 110 viisi tähteä saanut arvostelu eri alustoilla, kuten WordPressissa ja AppSumossa, heijastaa kasvavaa luottamusta. GSpeech on myös aktiivisesti käytössä Namangan alueen tilastokeskuksessa Uzbekistanissa — hallituksen laitoksessa, jolla on merkittävä liikenne ja kansallinen näkyvyys. Nähdessäni julkisen elimen omaksuvan teknologiamme laajasti on ollut merkittävä merkkipaalu ja voimakas osoitus luottamuksesta ratkaisuumme.
Kristittynä ja Armenian kirkon palvelijana yritän myös tukea muita uskonnollisia aloitteita, missä tahansa mahdollista. Tarjoan usein GSpeechin ilmaiseksi kristillisisille verkkosivuille, jotta voisin auttaa heitä levittämään sanomaaan tehokkaammin ja tehdä Raamattua helpommin saataville äänellä. Se on pieni panokseni johonkin suurempaan. Samalla olen kunnia työskennellä omistautuneiden ministeriöiden, kuten The Cordin, kanssa — messiaanisen seurakunnan ja arvostetun GSpeech-asiakkaan — jonka tehtävä ja sisältö heijastavat Raamatun voimaa toiminnassa.
Nämä hetket — kun teknologia muuttuu uskonnon, ymmärryksen ja saavutettavuuden siltaa — muistuttavat minua, miksi rakensimme GSpeechin alun perin.
Miten näet GSpeechin roolin digitaalisen median tulevaisuudessa, erityisesti kun ääni- ja äänirajapinnat tulevat yhä hallitsevammaksi?
Ennustan GSpeechin johtavan digitaalisen median saavutettavuuden ja viihtyvyyden parantamista mahdollistamalla älykkään äänen pääsyn verkkoon. Tavoitteemme on muuttaa koko verkkokokemusta, jotta verkkosivut tulevat luonnollisesti ääniohjattaviksi, saavutettaviksi ja monikielisiksi oletuksena. Yhdellä koodirivillä sivuomistajat voivat muuttaa tuhannet artikkelit äänisisällöksi. Tulevaisuudessa kehitämme GSpeech Studioa voimakkaaksi ja ainutlaatuisaksi alustaksi äänen luomiseen ja editoimiseen, mahdollistaen käyttäjien luoda monikerroksisia äänisisältöjä taustamusiikin, efektiensä ja tarkan säätönsä kanssa. Haluamme tehdä verkon todella kuuluvaksi, intuitiiviseksi ja yleisesti saatavaksi.
GSpeech on vastikään lanseerattu AppSumossa ja on saavuttanut lähes täydellisen arvostelun varhaisilta omaksumisilta. Mitä on merkinnyt sinulle AppSumon yhteisön vastaanotto, ja miten aiot rakentaa tästä eteenpäin?
AppSumon lanseeraus esitteli GSpeechin miljoonille ja sen lähes täydellinen arvostelu on erittäin vahvistava. Käyttäjät, kuten verkko-oppimisen omistajat, ylistävät meidän helppokäyttöisiä työkaluja ja vastaa reagoivaa tukea, joka heijastaa Humanity Unionin palautetta. Blogien omistaja kutsui ääniämme “aidosti viihdyttäviksi” ja käännöksiä “vaikuttaviksi”. Heidän myönteinen palautteensa vahvistaa älykkään tekstiäänen ratkaisumme arvoa ja sytyttää intohimoani projektiin. Asiakkaiden tukeminen lanseerauksen aikana herätti myös uusia ideoita, erityisesti GSpeech Studion kehittämiseen, joka sai vaikutteita käyttäjien pyynnöistä edistyneistä äänieditointi- ja viennin ominaisuuksista. Jatkossa aion rakentaa tästä eteenpäin kuuntelemalla aktiivisesti yhteisöämme, integroimalla heidän palautettaan ja kehittämällä innovatiivisia ominaisuuksia parantamaan saavutettavuutta ja viihtyvyyttä, varmistaen GSpeechin jatkuvan kehityksen muunnokkaana työkaluna luojille ja liiketoiminnalle.
Lopuksi, mitä neuvoa antaisit nuorille kehittäjille tai yrittäjille, jotka haluavat luoda saavutettavia, älykkäitä työkaluja tänään nopeasti muuttuvassa teknologiamaailmassa?
Nuorille kehittäjille ja yrittäjille neuvoni on antaa sydämensä työlle ja tunnistaa todellinen ongelma, johon voit tarjota yksilöllisen, älykkään ratkaisun. Aloita pienestä, tee tasaisia askelia eteenpäin ja kuuntele asiakaspalautetta — he ohjaavat polkusi. Käsittele käyttäjiäsi luotettavina ystävinä, anna kaikkiesi ja pysy kärsivällisenä. Omaksu älytekniikat voimakkaina liittolaisina; kun niitä käytetään viisaasti, ne voimistavat kykyäsi luoda vaikuttavia, saavutettavia työkaluja. Rakenna intohimolla, sitoutumisella ja sitoudulla tehdä eroa, ja luot ratkaisuja, jotka todella merkitsevät.
Kiitos hienosta haastattelusta, valitsimme GSpeech-ratkaisun verkkosivuillemme helpon integraation vuoksi. Lue lisää GSpeechista.












