Rozhovory

Simon Poghosyan, zakladatel a CEO GSpeech – Interview Series

mm
Přidejte Unite.AI mezi své preferované zdroje na Google

Simon Poghosyan je zakladatel a CEO GSpeech, webové AI platformy, která pomáhá dělat online obsah více přístupným tím, že převádí text do přirozeně znějícího audio ve více než 70 jazycích. S pozadím ve VLSI Designu a silným zájmem o programování a uživatelskou zkušenost, Simon vytvořil GSpeech, aby zjednodušil způsob, jakým webové stránky mohou nabízet obsah s hlasovým ovládáním.

Dnes GSpeech generuje kolem 200 milionů znaků audio každý měsíc a je používán v více než 70 zemích, s jeho přizpůsobitelnými audio přehrávači, které slouží více než 200 000 přehrávání měsíčně. Poté, co překonal 1 miliardu znaků audio vygenerovaných celkem, GSpeech pokračuje v rychlém růstu. Platforma je navržena tak, aby byla snadno integrovatelná — vyžaduje pouze jeden řádek kódu — a podporuje tvůrce, učitele a podniky v tom, aby jejich obsah byl více inkluzivní a interaktivní.

GSpeech je také použit na všech našich anglických stránkách, můžete si poslechnout tento článek a vidět, jak dobře GSpeech funguje, kliknutím na tlačítko přehrávání.

Vaše pozadí ve VLSI Designu (Very Large Scale Integration) a vaše rané programovací zkušenosti položily silný technický základ. Co vás inspirovalo k přechodu z mikroelektroniky na stavbu AI-poháněného softwaru, a jak to vedlo k vytvoření GSpeech?

Má vášeň pro řešení problémů začala na střední škole, poháněná láskou k matematice a fyzice. To mě vedlo k získání bakalářského (2009) a magisterského (2011) titulu ve VLSI Designu na Státní inženýrské univerzitě v Arménii, ve spolupráci se Synopsys Arménie. Studium fyziky mě naučilo přesnosti a analytickému myšlení, ale během mého druhého roku jsem objevil programování — začínající s jazykem Pascal — a okamžitě se do něj zamiloval. Můj přítel a já jsme dokončovali úkoly z kurzů, jakmile jsme je obdrželi, i když jsme měli šest měsíců na to, abychom je dokončili. Poté, pro zábavu, jsme začali dělat úkoly ostatních studentů.

Tato vášeň mě vedla hlouběji do softwarového vývoje. Začal jsem s tvorbou webových stránek, poté jsem postavil svůj vlastní CMS. Po dokončení několika projektů v procesní automatizaci a navrhování architektur správy dat, jsem si uvědomil, jak moc miluji stavět digitální řešení pro webové rozhraní. Prostřednictvím projektu 2GLux jsem spolupracoval s Edvardem Ananyanem — tvůrcem populárního GTranslate překladového služby a školního přítele z Quant Gymnázia. On mě představil ekosystémům WordPress a Joomla, a koncept GSpeech vznikl s ním. Ta raná práce vedla k první verzi našeho nástroje, který umožnil uživatelům poslouchat text na webové stránce, zasévající semeno pro to, co by se později stalo plně vybavenou AI platformou. Do roku 2023, jsem založil Smarts Club LLC, aby GSpeech škáloval do globálního AI audio řešení, podporujícího 70+ jazyků. Chvála Humanity Union za roli GSpeech v zlepšení jejich občanské platformy pro zapojení, odráží mou misi mosty digitální propasti prostřednictvím AI — vizi, která je zakořeněna v mých raných programovacích dnech.

GSpeech původně začal jako nástroj na podporu zrakově postižených uživatelů. Jak ovlivnila tato raná mise vývoj platformy do plně vybaveného AI text-to-speech řešení?

Zaměření na přístupnost vedlo k vývoji vysoce kvalitního, reálného AI audio, překladu do 70+ jazyků a bezproblémové integraci webových stránek pomocí jednoduchého kódu. Tato mise vedla k funkcím, jako jsou přizpůsobitelné audio přehrávače, panely pro výběr jazyka a hlasu, kontextově závislé přehrávání, stažení audio a podrobné statistiky použití — včetně země, města, zařízení a přehrávacích analytik během času — všechny navržené tak, aby činily obsah více inkluzivním a interaktivním. Po napsání více než 100 000 řádků kódu, jsem spustil GSpeech Cloud Console v roce 2023 — škálovatelné řešení, které vyvažuje inkluzivitu s pokročilou funkcionalitou, umožňující tvůrcům a podnikům dělat jejich obsah přístupnějším, vícejazyčným a interaktivním po celém webu.

Jaké byly některé z největších technických výzev, kterým jste čelil během vývoje GSpeech Cloud Console?

Jednou z největších výzev při vývoji GSpeech Cloud Console byla navrhování škálovatelné architektury pro reálné, zabezpečené, vysoce kvalitní AI audio generování. To vyžadovalo inovativní řešení pro načtení relevantního obsahu z webu, zpracování audio na našich serverech a uložení v cloudu pro rychlou a spolehlivou dodávku. Implementace robustních bezpečnostních opatření, jako je šifrování a kontrola přístupu, byla kritická pro ochranu dynamického, uživatelsky generovaného obsahu.

Další překážkou bylo umožnění reálného překladu pomocí pokročilých neuronových motorů. Museli jsme zajistit nízkou latenci, přesné překlady a zároveň vyvinout intuitivní rozhraní, které by uživatelům umožnilo vybrat jazyky a preferované hlasové profily pro přehrávání, priorizující uživatelský komfort a personalizaci. Nakonec jsme vyvinuli tvůrce šablon audio s více přizpůsobitelnými přehrávači, umožňující uživatelům navrhnout jedinečné, vizuálně atraktivní přehrávače přizpůsobené jejich webovým stránkám. Vyvažování flexibility, výkonu a snadnosti použití napříč zařízeními byla odměňující výzvou.

S reálným překladem v 70+ jazycích a více než 230 přirozeně znějícími hlasy. Jak zajišťujete kvalitu hlasu a udržujete přesnost napříč tak různorodou sadou jazyků?

Abyste udrželi konzistentní kvalitu hlasu, integrujeme několik pokročilých text-to-speech (TTS) modelů, které jsou neustále optimalizovány a aktualizovány. Tyto multilingvní motory zpracovávají smíšený jazykový obsah s vysokou přesností. Rozvíjíme také více než 100 nových hlasových vibrací, aby uživatelé měli ještě více expresivních a přirozeně znějících možností. Každý měsíc GSpeech generuje více než 200 milionů znaků audio, sloužící uživatelům v více než 70 zemích, s našimi online přehrávači, které se používají více než 200 000krát měsíčně — a rostou. Tento rozsah zajišťuje neustálou zpětnou vazbu a testování v reálném světě, které přímo informuje naše ladění a kontrolu kvality.

Můžete nás provést, jak GSpeech využívá AI a strojové učení k dodání podobného hlasového syntézy? Jak držíte krok s rychlým pokrokem v neuronové hlasové technologii?

GSpeech používá pokročilou AI a strojové učení, integrující několik nejmodernějších text-to-speech modelů pro produkci přirozeně znějícího hlasu. Tyto modely, optimalizované pro přirozenost a multilingvní podporu, zpracovávají textové vstupy pro generování vysoce kvalitního audio s realistickou intonací a rytmem, i pro smíšený jazykový obsah. Zlepšujeme uživatelskou zkušenost nabídkou přizpůsobitelných hlasových stylů pro různé jazyky. Také jsme integrovali TTS aliasy, které uživatelům umožňují definovat vlastní pravidla pro to, jak jsou určitá slova nebo fráze vykreslena v audio — například nahrazující specifické termíny pro dosažení přesnější výslovnosti nebo frázování. Abychom zůstali aktuální s neuronovou hlasovou technologií, neustále vyhodnocujeme a integrujeme nejnovější pokroky, spolupracujeme s lídry v oboru a plánujeme vyvinout proprietární modely v budoucnu, zajišťující, že GSpeech zůstane na špici inovací v hlasové syntéze.

Jak důležité je ladění hlasu, kontrola tónu a přizpůsobení přehrávání pro vaše uživatele — a jaký je případ, na který jste nejvíce pyšný, kde tyto funkce opravdu vynikají?

Ladění hlasu, kontrola tónu a přizpůsobení přehrávání jsou kritické pro naše uživatele, umožňující jim vytvářet jedinečné, vysoce kvalitní hlasové styly přizpůsobené jejich specifickým potřebám, od zpravodajských a blogových stránek po přístupný e-learningový obsah. Pokračující integrace více než 100 nových hlasových vibrací dále zvyšuje tuto flexibilitu, nabízející uživatelům bezprecedentní možnost vytvářet skutečně jedinečné hlasové překlady. Jsem nejvíce pyšný na GSpeech Studio, novou audio editační a generovací platformu, kterou vyvíjím. Umožňuje uživatelům vytvářet více audio kanálů, míchat je s pozadí hudby a exportovat vysoce kvalitní hlasové překlady, umožňující tvůrcům produkovat profesionální audio pro různé aplikace. Dopis zrakově postiženého studenta, který děkoval GSpeech za umožnění nezávislého studia prostřednictvím přizpůsobeného audio, mě hluboce dotkl. Tento případ ukazuje, jak tyto funkce činí obsah přístupnějším a transformujícím, cílem, které jsem sledoval od svých raných programovacích dnů.

GSpeech nabízí bezproblémové integrace s WordPress, Shopify , Wix a dalšími. Jaká byla vaše strategie pro to, aby byla platforma plug-and-play pro tvůrce a podniky napříč různými ekosystémy?

Naše strategie pro GSpeech plug-and-play integrace s platformami, jako je WordPress, Shopify a Wix, se zaměřila na jednoduchost, kompatibilitu a škálovatelnost. Vyvinuli jsme lehké, modulární pluginy a kódy, které se integrují bezproblémově, vyžadující minimální nastavení — často pouze několik kliknutí. To znamená, že tisíce článků a dynamického obsahu mohou okamžitě získat hlasovou podporu — bez manuálního úsilí. Nabízíme vysoce flexibilní, krásně navržené přehrávače, které se přizpůsobují napříč zařízeními, včetně mobilních telefonů, tabletů a desktopů. Naši přehrávači nejsou pouze přizpůsobitelní, ale také optimalizovaní pro přístupnost a uživatelskou angažovanost. Pro WordPress jsme vložili GSpeech cloud dashboard přímo do administrativního panelu prostřednictvím našeho pluginu, streamlinujícím správu pro uživatele. Podrobná dokumentace a intuitivní dashboardy vedou ne-technické uživatele prostřednictvím instalace a přizpůsobení. Pravidelné testování zajišťuje konzistentní výkon napříč různými ekosystémy, umožňující tvůrcům a podnikům přidat AI-poháněné text-to-speech bez úsilí.

Pohledem zpět na cestu od roku 2012 do dneška, co byla největší milník pro vás osobně nebo profesně při budování GSpeech?

Největší milník pro GSpeech byl generování 1 miliardy znaků vysoce kvalitního AI audio, ukazující náš globální dopad na přístupnost. Stejně významné bylo zpětné vazby, které jsme obdrželi od organizací, jako je Humanity Union, která chválila GSpeech za zlepšení jejich občanské platformy pro zapojení, a od vlastníků blogů, kteří jej nazvali „zásadním“ pro uživatelskou angažovanost. Více než 110 pětihvězdičkových recenzí napříč platformami, jako je WordPress a AppSumo v posledních měsících, odráží tento rostoucí důvěru.

GSpeech je nyní také aktivně použit Namangan regionální statistický úřad v Uzbekistánu — vládní instituce s významným provozem a národní viditelností. Vidět, jak veřejná instituce přijímá naší technologii tak široce, bylo významným milníkem a silným znamením důvěry v naše řešení.

Jako křesťan a někdo, kdo slouží v arménské církvi, snažím se také podporovat další vírou založené iniciativy, kdykoli je to možné. Často nabízím GSpeech zdarma křesťanským webovým stránkám jako způsob, jak pomoci šířit jejich zprávu účinněji a učinit Písmo přístupnějším prostřednictvím audio. Je to má malá příspěvek k něčemu většímu. Současně jsem poctěn pracovat s věrnými ministerstvy, jako je The Cord — messiánské shromáždění a ceněný GSpeech klient — jehož mise a obsah odráží sílu Písma v akci.

Tyto okamžiky — kdy technologie se stává mostem pro víru, porozumění a inkluzivitu — připomínají mi, proč jsme postavili GSpeech poprvé.

Jakou roli vidíte GSpeech hrající v budoucnosti digitálních médií, zejména když audio obsah a hlasové rozhraní se stávají dominantnějšími?

Vidím GSpeech jako lídra v tom, aby digitální média byla více přístupná a interaktivní, umožňující AI-poháněný hlasový přístup k webu. Naším cílem je transformovat celý online zážitek, aby webové stránky byly přirozeně hlasově interaktivní, inkluzivní a multilingvní jako standard. S pouze jedním řádkem kódu, majitelé stránek mohou proměnit tisíce článků v hlasový obsah. Pohledem vpřed, rozvíjíme GSpeech Studio do silné a jedinečné platformy pro audio generování a editaci, umožňující uživatelům vytvářet vícesvrstvé hlasové obsahy s pozadí hudby, efekty a přesným laděním. Chceme udělat web skutečně slyšitelným, intuitivním a univerzálně přístupným.

GSpeech nedávno spustil na AppSumo a již získal téměř dokonalou hodnocení od raných adoptérů. Co znamená pro vás zpětná vazba od AppSumo komunity, a jak plánujete budovat na tomto impulsu dále?

Spuštění na AppSumo představilo GSpeech milionům a jeho téměř dokonalé hodnocení je neuvěřitelně ujišťující. Uživatelé, jako ti, kteří běží online kurzy, chválí naše intuitivní nástroje a reaktivní podporu, která odráží zpětnou vazbu od Humanity Union. Vlastník blogu nazval naše hlasy „skutečně angažující“ a překlady „impresivní“. Jejich pozitivní zpětná vazba potvrzuje hodnotu našeho AI-poháněného text-to-speech řešení a palí naše vášeň pro projekt. Podpora klientů během spuštění také inspirovala nové nápady, zejména pro GSpeech Studio, který byl inspirován uživatelskými požadavky na pokročilé audio editační a exportní funkce. Pohledem vpřed, plánuji budovat na tomto impulsu aktivním nasloucháním naší komunitě, integrací jejich zpětné vazby a rozvojem inovativních funkcí pro zlepšení přístupnosti a angažovanosti, zajišťující, že GSpeech bude pokračovat v evoluci jako transformační nástroj pro tvůrce a podniky.

Nakonec, co byste poradil mladým vývojářům nebo podnikatelům, kteří chtějí postavit přístupné, AI-poháněné nástroje v dnešním rychlém technologickém prostředí?

Mladým vývojářům a podnikatelům, můj porad je nalít své srdce do své práce a identifikovat skutečný problém, kde můžete nabídnout jedinečné, chytré řešení. Začněte malým, jděte stálými kroky vpřed a naslouchejte blízce zpětné vazbě uživatelů — oni budou vést vaši cestu. Zacházejte se svými uživateli jako s důvěrnými přáteli, dejte jim vše a zůstaňte trpěliví. Přijměte AI technologie jako silné spojence; když jsou použity moudře, zesilují vaši schopnost vytvářet dopad, přístupné nástroje. Stavějte s vášní, vytrvalostí a závazkem k vytváření rozdílu, a budete vytvářet řešení, která skutečně záleží.

Děkuji vám za skvělý rozhovor, jsme si vybrali GSpeech řešení pro naši webovou stránku kvůli snadné integraci. Chcete-li se dozvědět více, navštivte GSpeech.

Antoine je vizionářský líder a spoluzakladatel Unite.AI, který je poháněn neotřesitelnou vášní pro formování a propagaci budoucnosti umělé inteligence a robotiky. Jako sériový podnikatel věří, že umělá inteligence bude mít na společnost stejně disruptivní vliv jako elektřina, a často se chvála na potenciál disruptivních technologií a AGI.