Interviuri
Simon Poghosyan, Fondator și CEO al GSpeech – Seria de Interviuri

Simon Poghosyan este fondatorul și CEO-ul GSpeech, o platformă web bazată pe inteligență artificială care ajută la creșterea accesibilității conținutului online prin convertirea textului în audio natural în peste 70 de limbi. Cu o experiență în proiectarea VLSI și un interes puternic pentru programare și experiență utilizator, Simon a creat GSpeech pentru a simplifica modul în care site-urile web pot oferi conținut cu voce.
Astăzi, GSpeech generează aproximativ 200 de milioane de caractere de audio pe lună și este utilizat în peste 70 de țări, cu player-ele sale audio personalizabile care deservesc peste 200.000 de redări pe lună. După ce a depășit 1 miliard de caractere de audio generate în total, GSpeech continuă să crească rapid. Platforma este proiectată pentru a fi ușor de integrat — necesitând doar o singură linie de cod — și sprijină creatori, educatori și întreprinderi în crearea unui conținut mai inclusiv și mai atractiv.
GSpeech este utilizat și pe toate paginile noastre în limba engleză, puteți asculta acest articol și vedea cât de bine funcționează GSpeech prin apăsarea butonului de play.
Fondul dvs. în proiectarea VLSI (Very Large Scale Integration) și experiența dvs. timpurie în programare au creat o bază tehnică solidă. Ce v-a inspirat să treceți de la microelectronică la crearea de software cu inteligență artificială și cum a condus acest lucru la crearea GSpeech?
Pasiunea mea pentru rezolvarea problemelor a început în liceu, condusă de o iubire pentru matematică și fizică. Această pasiune m-a condus să obțin o diplomă de licență (2009) și master (2011) în proiectarea VLSI de la Universitatea de Stat de Inginerie din Armenia, în colaborare cu Synopsys Armenia. Studierea fizicii m-a învățat să gândesc cu precizie și analitic, dar a fost în timpul anului II când am descoperit programarea — începând cu limbajul Pascal — și am căzut imediat în dragoste cu ea. Prietenul meu și eu am completat lucrările de curs de îndată ce le-am primit, deși aveam șase luni la dispoziție pentru a le termina. Apoi, pentru distracție, am început să facem lucrările altor studenți.
Această pasiune m-a condus mai adânc în dezvoltarea de software. Am început cu crearea de site-uri web, apoi am construit propriul meu sistem de management de conținut. După ce am finalizat mai multe proiecte în automatizarea proceselor și proiectarea arhitecturilor de gestionare a datelor, am realizat cât de mult îmi place să construiesc soluții digitale pentru interfețe web. Prin proiectul 2GLux, am colaborat cu Edvard Ananyan — creatorul serviciului de traducere popular GTranslate și un prieten de școală de la Quant Gymnasium. El m-a introdus în ecosistemele WordPress și Joomla, și conceptul pentru GSpeech a apărut împreună cu el. Această lucrare timpurie a condus la prima versiune a instrumentului nostru, care a permis utilizatorilor să asculte textul de pe o pagină web, plantând sămânța pentru ceea ce avea să devină o platformă completă de inteligență artificială. Până în 2023, am înființat Smarts Club LLC pentru a scala GSpeech într-o soluție globală de audio cu inteligență artificială, care suportă peste 70 de limbi. Lauda Uniunii Umanității pentru rolul GSpeech în îmbunătățirea platformei lor de implicare civică reflectă misiunea mea de a combate diviziunile digitale prin inteligență artificială — o viziune înrădăcinată în zilele mele timpurii de programare.
GSpeech a început inițial ca un instrument pentru a sprijini utilizatorii cu deficiențe de vedere. Cum a influențat această misiune timpurie evoluția platformei într-o soluție completă de text-to-speech cu inteligență artificială?
Accentul pe accesibilitate a condus la dezvoltarea de audio de înaltă calitate, în timp real, cu inteligență artificială, traducere în peste 70 de limbi și integrare pe site-uri web prin intermediul unui cod simplu. Această misiune a condus la funcții precum player-e audio personalizabile, panouri de selectare a limbii și a vocii, redare conștientă de context, descărcări audio și statistici detaliate de utilizare — incluzând date despre țară, oraș, dispozitiv și analize de redare în timp — toate proiectate pentru a face conținutul mai inclusiv și mai atractiv. După ce am scris peste 100.000 de linii de cod, am lansat GSpeech Cloud Console în 2023 — o soluție escalabilă care echilibrează incluzivitatea cu funcționalitatea avansată, împuternicind întreprinderile și creatorii să-și facă conținutul mai accesibil, multilingv și interactiv pe web.
Care au fost unele dintre cele mai mari provocări tehnice cu care v-ați confruntat în timpul dezvoltării GSpeech Cloud Console?
Una dintre cele mai mari provocări în dezvoltarea GSpeech Cloud Console a fost proiectarea unei arhitecturi scalabile pentru generarea de audio cu inteligență artificială, în timp real și de înaltă calitate. Acest lucru a necesitat soluții inovatoare pentru a obține conținut relevant de pe web, a procesa audio pe serverele noastre și a stoca acesta în cloud pentru livrare rapidă și fiabilă. Implementarea unor măsuri de securitate robuste, cum ar fi criptarea și controlul accesului, a fost critică pentru a proteja conținutul dinamic, generat de utilizatori.
O altă barieră a fost activarea traducerii în timp real, utilizând motoare neuronale avansate. Am trebuit să ne asigurăm că traducerile sunt de joasă latență și precise, în timp ce construim o interfață intuitivă care să permită utilizatorilor să selecteze limbi și profile de voce preferate pentru redare, prioritarizând confortul și personalizarea utilizatorului. În cele din urmă, am dezvoltat un wizard de creare a șablonului de audio, cu multiple vizualizări personalizabile ale player-ului, care permite utilizatorilor să proiecteze player-i unici și vizual atractivi, adaptați pentru site-urile lor. Echilibrarea flexibilității, a performanței și a ușurinței de utilizare pe dispozitive a fost o provocare răsplătitoare.
Cu traducere în timp real în peste 70 de limbi și peste 230 de voci care sună natural. Cum vă asigurați că calitatea vocii este menținută și că acuratețea este păstrată pe un set de limbi atât de divers?
Pentru a menține o calitate constantă a vocii, integrăm multiple modele avansate de text-to-speech (TTS) care sunt optimizate și actualizate în mod continuu. Aceste motoare multilingve gestionează conținutul mixt de limbi cu o acuratețe ridicată. De asemenea, lansăm peste 100 de noi vibrații de voce pentru a oferi utilizatorilor și mai multe opțiuni expresive și naturale. Fiecare lună, GSpeech generează peste 200 de milioane de caractere de audio, deservind utilizatori în peste 70 de țări, iar player-ele noastre online sunt utilizate peste 200.000 de ori pe lună — și cresc. Această scară asigură feedback și testare în lumea reală, care informează direct ajustările și controalele noastre de calitate.
Puteți să ne explicați cum GSpeech utilizează inteligența artificială și învățarea automată pentru a livra sinteză de voce realistă? Cum vă țineți la curent cu avansurile rapide în tehnologia de voce neurală?
GSpeech utilizează inteligență artificială avansată și învățare automată, integrând multiple modele de text-to-speech de ultimă generație pentru a produce sinteză de voce realistă. Aceste modele, optimizate pentru naturalitate și suport multilingv, procesează intrările de text pentru a genera audio de înaltă calitate, cu intonație și ritm realist, chiar și pentru conținut mixt de limbi. Îmbunătățim experiența utilizatorului prin oferirea de stiluri de voce personalizabile pentru diverse limbi. De asemenea, am integrat alias-uri TTS, care permit utilizatorilor să definească reguli personalizate pentru modul în care anumite cuvinte sau fraze sunt redate în audio — de exemplu, înlocuirea unor termeni specifici pentru a obține o pronunție sau o frazare mai precisă. Pentru a rămâne la curent cu tehnologia de voce neurală, evaluăm și integrăm în mod continuu cele mai recente avansuri, colaborăm cu lideri din industrie și planificăm să dezvoltăm modele proprii în viitor, asigurându-ne că GSpeech rămâne în fruntea inovației în sinteza de voce.
Cât de importantă este reglarea vocii, controlul tonului și personalizarea redării pentru utilizatorii dvs. — și care este cazul de utilizare de care sunteți cel mai mândru, unde aceste funcții strălucesc cu adevărat?
Reglarea vocii, controlul tonului și personalizarea redării sunt critice pentru utilizatorii noștri, permițându-le să creeze stiluri de voce unice, de înaltă calitate, adaptate nevoilor lor specifice, de la site-uri de știri și bloguri la conținut educațional accesibil. Integrarea continuă a peste 100 de noi vibrații de voce îmbunătățește și mai mult acest lucru, oferind utilizatorilor o flexibilitate fără precedent pentru a crea voce-overs cu adevărat distincte. Sunt cel mai mândru de GSpeech Studio, o nouă platformă de editare și generare de audio pe care o dezvolt. Acesta permite utilizatorilor să creeze multiple canale audio, să le amestece cu muzică de fundal și să exporte voce-overs rafinate, împuternicind creatorii să producă audio de calitate profesională pentru diverse aplicații. O scrisoare a unui student cu deficiențe de vedere, care mulțumea GSpeech pentru posibilitatea de a studia independent prin audio personalizat, m-a atins profund. Acest caz de utilizare arată cum aceste funcții fac conținutul accesibil și transformativ, un obiectiv pe care l-am urmărit de la începuturile mele în programare.
GSpeech oferă integrări perfecte cu WordPress, Shopify , Wix și multe altele. Care a fost strategia dvs. pentru a face platforma plug-and-play pentru creatori și întreprinderi din diverse ecosisteme?
Strategia noastră pentru integrările GSpeech cu platforme precum WordPress, Shopify și Wix s-a concentrat pe simplitate, compatibilitate și scalabilitate. Am dezvoltat plugin-uri ușoare și modulare și coduri care se integrează perfect, necesitând un minim de configurare — adesea doar câteva clicuri. Acest lucru înseamnă că mii de articole și blocuri de conținut dinamic pot obține suport de voce instantaneu — fără efort manual. Oferta noastră include player-e audio extrem de flexibile și frumos proiectate care se adaptează pe dispozitive, inclusiv mobile, tablete și desktop-uri. Player-ele noastre nu sunt doar personalizabile, ci și optimizate pentru accesibilitate și implicarea utilizatorului. Pentru WordPress, am integrat panoul de control GSpeech direct în panoul de administrare prin plugin-ul nostru, simplificând gestionarea pentru utilizatori. Documentația detaliată și panourile intuitive ghidă utilizatorii non-tehnici prin instalare și personalizare. Testarea regulată asigură performanța consistentă în diverse ecosisteme, împuternicind creatorii și întreprinderile să adauge text-to-speech cu inteligență artificială fără efort.
Privind înapoi la călătoria de la 2012 până în prezent, care a fost cel mai mare punct de referință pentru dvs. personal sau profesional în construirea GSpeech?
Cel mai mare punct de referință pentru GSpeech a fost generarea a 1 miliard de caractere de audio de înaltă calitate, demonstrând impactul nostru global asupra accesibilității. La fel de semnificativ a fost feedback-ul pe care l-am primit de la organizații precum Humanity Union, care a lăudat GSpeech pentru îmbunătățirea platformei lor de implicare civică, și de la proprietarii de bloguri care l-au numit “un joc schimbător” pentru implicarea utilizatorilor. Peste 110 de recenzii cu cinci stele de pe platforme precum WordPress și AppSumo în ultimele luni reflectă această încredere în creștere.
GSpeech este utilizat și de Departamentul de Statistică Regională Namangan din Uzbekistan — o instituție guvernamentală cu trafic semnificativ și vizibilitate la nivel național. A vedea o instituție publică care adoptă tehnologia noastră într-o asemenea măsură a fost un punct de referință semnificativ și un semn puternic de încredere în soluția noastră.
Ca creștin și ca persoană care slujește în Biserica Armeniei, încerc să sprijin și alte inițiative bazate pe credință, ori de câte ori este posibil. Adesea ofer GSpeech gratuit site-urilor creștine ca o modalitate de a ajuta la răspândirea mesajului lor mai eficient și de a face Scriptura mai accesibilă prin audio. Este contribuția mea mică la ceva mai mare. În același timp, sunt onorat să lucrez cu ministere dedicate precum The Cord — o congregație mesianică și un client valoros al GSpeech — a cărui misiune și conținut reflectă puterea Scripturii în acțiune.
Aceste momente — când tehnologia devine un pod pentru credință, înțelegere și incluziune — îmi amintesc de ce am construit GSpeech în primul rând.
Care este rolul pe care îl vedeți GSpeech jucându-l în viitorul mass-media digitale, în special pe măsură ce conținutul audio și interfețele cu voce devin mai dominante?
Îmi imaginez GSpeech ca lider în creșterea accesibilității și atractivității mass-media digitale, permițând accesul cu voce la web. Scopul nostru este de a transforma întreaga experiență online, astfel încât site-urile web să devină natural voce-interactive, incluzive și multilingve, din start. Cu doar o linie de cod, proprietarii de site pot transforma mii de articole în conținut cu voce. În viitor, dezvoltăm GSpeech Studio într-o platformă puternică și unică pentru generarea și editarea audio, permițând utilizatorilor să creeze conținut vocal multistrat, cu muzică de fundal, efecte și reglare precisă. Vrem să facem web-ul cu adevărat audibil, intuitiv și universal accesibil.
GSpeech a lansat recent pe AppSumo și a primit deja o evaluare aproape perfectă de la adoptatorii timpurii. Ce înseamnă pentru dvs. răspunsul comunității AppSumo, și cum plănuiți să construiți pe acest impuls în viitor?
Lansarea pe AppSumo a introdus GSpeech pentru milioane de oameni, iar evaluarea aproape perfectă este incredibil de încurajatoare. Utilizatorii, cum ar fi cei care rulează cursuri online, laudă instrumentele noastre intuitive și suportul nostru reactiv, ecouând feedback-ul de la Humanity Union. Un proprietar de blog a numit vocile noastre “cu adevărat atractive” și traducerile “impresionante”. Feedback-ul lor pozitiv confirmă valoarea soluției noastre de text-to-speech cu inteligență artificială și alimentează pasiunea mea pentru proiect. Sprijinirea clienților în timpul lansării a generat, de asemenea, idei noi, în special pentru GSpeech Studio, care a fost inspirat de solicitările utilizatorilor pentru funcții avansate de editare și export audio. În viitor, plănuiți să construim pe acest impuls prin ascultarea activă a comunității noastre, integrând feedback-ul lor și dezvoltând funcții inovatoare pentru a îmbunătăți accesibilitatea și implicarea, asigurându-ne că GSpeech continuă să evolueze ca un instrument transformativ pentru creatori și întreprinderi.
În cele din urmă, ce sfat ați da tinerilor dezvoltatori sau antreprenori care doresc să construiască unelte accesibile, cu inteligență artificială, în peisajul tehnologic în schimbare rapidă de astăzi?
Tinerilor dezvoltatori și antreprenorilor, le-aș sfătui să-și verse inima și sufletul în munca lor și să identifice o problemă reală în care pot oferi o soluție unică și inteligentă. Să înceapă cu pași mici, să asculte cu atenție feedback-ul clienților — ei vor ghida drumul. Să trateze utilizatorii ca pe prieteni de încredere, să dea totul și să rămână răbdători. Să îmbrățișeze tehnologiile cu inteligență artificială ca aliați puternici; atunci când sunt utilizate înțelept, ele amplifică capacitatea de a crea unelte cu impact și accesibile. Să construiască cu pasiune, persistență și angajament de a face o diferență, și vor crea soluții care să aibă cu adevărat sens.
Vă mulțumim pentru acest interviu minunat, am ales soluția GSpeech pentru site-ul nostru datorită integrării ușoare. Pentru a afla mai multe, vizitați GSpeech.












