Інтерв’ю

Саймон Погосян, засновник і генеральний директор GSpeech – Серія інтерв’ю

mm
Додайте Unite.AI до бажаних джерел у Google

Саймон Погосян є засновником і генеральним директором GSpeech, веб-платформи, яка допомагає зробити онлайн-контент більш доступним, конвертуючи текст у природний звук у понад 70 мовах. З досвідом у галузі VLSI Design та сильним інтересом до програмування та користувацького досвіду, Саймон створив GSpeech, щоб спростити спосіб, яким веб-сайти можуть пропонувати контент з підтримкою голосу.

Сьогодні GSpeech генерує близько 200 мільйонів символів аудіо щомісяця та використовується у понад 70 країнах, а його настраївані аудіоплеєри обслуговують понад 200 000 програвань щомісяця. Після того, як було сгенеровано понад 1 мільярд символів аудіо в цілому, GSpeech продовжує швидко зростати. Платформа спроектована так, щоб бути легкою у інтеграції — для цього потрібно лише одна лінія коду — і підтримує творців, педагогів та підприємців у створенні більш інклюзивного та цікавого контенту.

GSpeech також використовується на всіх наших англійських сторінках, ви можете прослухати цю статтю та побачити, як добре працює GSpeech, натиснувши на кнопку програвання.

Ваш досвід у галузі VLSI Design (Very Large Scale Integration) та ранній досвід програмування заклали міцний технічний фундамент. Що спонукало вас перейти від мікроелектроніки до створення програмного забезпечення, яке працює на основі штучного інтелекту, і як це призвело до створення GSpeech?

Моя пристрасть до вирішення проблем почалася у школі, підштовхнута любов’ю до математики та фізики. Це призвело мене до отримання ступеня бакалавра (2009) та магістра (2011) у галузі VLSI Design у Державному інженерному університеті Вірменії, у співпраці з Synopsys Armenia. Навчання фізики навчило мене точності та аналітичному мисленню, але під час другого року навчання я відкрив для себе програмування — починаючи з мови Pascal — і одразу ж полюбив його. Мій друг і я виконували завдання з курсу одразу ж, як тільки їх отримували, хоча у нас було шість місяців, щоб їх завершити. Потім, для розваги, ми почали виконувати завдання інших студентів.

Ця пристрасть привела мене глибше у розвиток програмного забезпечення. Я почав з створення веб-сайтів, потім побудував свій власний CMS. Після завершення кількох проектів з автоматизації процесів та розробки архітектури управління даними, я зрозумів, наскільки мені подобається будувати цифрові рішення для веб-інтерфейсів. Через проект 2GLux я співпрацював з Едвардом Ананяном — творцем популярної служби перекладу GTranslate та шкільним другом з Quant Gymnasium. Він познайомив мене з екосистемами WordPress та Joomla, і концепція GSpeech виникла саме з нього. Та рання робота призвела до першої версії нашого інструменту, який дозволяв користувачам слухати текст на веб-сторінці, посадивши зерно того, що пізніше стало повноцінною платформою штучного інтелекту. До 2023 року я заснував Smarts Club LLC, щоб розширити GSpeech у глобальне рішення аудіо на основі штучного інтелекту, яке підтримує понад 70 мов. Похвала спілки Humanity Union щодо ролі GSpeech у поліпшенні їхньої платформи цивільної відповідальності свідчить про мою місію мостити цифрові розриви за допомогою штучного інтелекту — бачення, яке має свої корені у моїх перших днях програмування.

GSpeech спочатку почався як інструмент для підтримки користувачів з порушенням зору. Як ця рання місія вплинула на еволюцію платформи у повноцінне рішення текст-у-голос на основі штучного інтелекту?

Фокус на доступності спонукав розвиток високоякісного аудіо у режимі реального часу, переклад на понад 70 мов та безперешкодну інтеграцію з веб-сайтами за допомогою простого кодового фрагмента. Ця місія призвела до появи функцій, таких як настраївані аудіоплеєри, панелі вибору мови та голосу, контекстно-чутливе програвання, завантаження аудіо та деталізована статистика використання — включаючи дані про країну, місто, пристрій та аналіз програвань у часі — все це спроектовано, щоб зробити контент більш інклюзивним та цікавим. Після написання понад 100 000 рядків коду, я запустив GSpeech Cloud Console у 2023 році — масштабоване рішення, яке балансує інклюзивність з передовими функціями, надають підприємцям та творцям можливість зробити свій контент доступним, багатомовним та інтерактивним у всьому інтернеті.

Які були деякі з найбільших технічних викликів, з якими ви зіштовхнулися під час розробки GSpeech Cloud Console?

Одним з найбільших викликів у розробці GSpeech Cloud Console було проектування масштабованої архітектури для генерації аудіо у режимі реального часу, яке є безпечним та високоякісним. Це вимагало інноваційних рішень для отримання відповідного контенту з вебу, обробки аудіо на наших серверах та зберігання його у хмарі для швидкої та надійної доставки. Реалізація надійних заходів безпеки, таких як шифрування та контроль доступу, була критично важливою для захисту динамічного, створеного користувачами контенту.

Іншим перешкодом було забезпечення перекладу у режимі реального часу за допомогою передових нейронних двигунів. Нам потрібно було забезпечити низьку затримку та точність перекладів, а також побудувати інтуїтивно зрозумілий інтерфейс, який дозволяє користувачам вибирати мови та голосові профіль для програвання, ставлячи на перше місце комфорт та персоналізацію користувача. Нарешті, ми розробили майстра створення аудіо-шаблонів з кількома настраїваними виглядами програвача, дозволяючи користувачам проектувати унікальні, візуально привабливі програвачі, адаптовані до їхніх веб-сайтів. Балансування гнучкості, продуктивності та легкості використання на різних пристроях було винагородним викликом.

З перекладом у режимі реального часу у понад 70 мовах та понад 230 природними голосами. Як ви забезпечуєте якість голосу та підтримуєте точність у такому різноманітному мовному наборі?

Щоб підтримувати постійну якість голосу, ми інтегруємо кілька передових моделей текст-у-голос (TTS), які постійно оптимізуються та оновлюються. Ці багатомовні двигуни обробляють змішаний мовний контент з високою точністю. Ми також розгортаємо понад 100 нових голосових тонів, щоб надати користувачам ще більше виразних та природніх варіантів. Кожного місяця GSpeech генерує понад 200 мільйонів символів аудіо, обслуговуючи користувачів у понад 70 країнах, а наші онлайн-програвачі використовуються понад 200 000 разів щомісяця — і це зростає. Така масштабність забезпечує постійну зворотню зв’язок та реальне тестування, яке безпосередньо інформує наші налаштування якості.

Можете розповісти, як GSpeech використовує штучний інтелект та машинне навчання для надання синтезу голосу, подібного до людського?

GSpeech використовує передовий штучний інтелект та машинне навчання, інтегруючи кілька найновіших моделей текст-у-голос для генерації високоякісного аудіо з природним інтонацією та ритмом, навіть для змішаного мовного контенту. Ми покращуємо досвід користувача, пропонуючи настраївані стили голосу для різних мов. Ми також інтегрували псевдонім TTS, який дозволяє користувачам визначати власні правила для того, як певні слова або фрази відтворюються в аудіо — наприклад, заміняючи певні терміни для досягнення більш точної вимови або фразування. Щоб залишатися в курсі нейронної голосової технології, ми постійно оцінюємо та інтегруємо останні досягнення, співпрацюємо з лідерами галузі та плануємо розробити власні моделі в майбутньому, забезпечуючи, щоб GSpeech залишався на передньому краї інновацій синтезу голосу.

Як важливі настройка голосу, контроль тона та настройка програвання для ваших користувачів — і який випадок використання ви найбільш горді, де ці функції справді блищать?

Налаштування голосу, контроль тона та настройка програвання є критично важливими для наших користувачів, дозволяючи їм створювати унікальні, високоякісні стилі голосу, адаптовані до їхніх конкретних потреб, від новинних та блогових веб-сайтів до доступного електронного навчання. Постійна інтеграція понад 100 нових голосових тонів ще більше посилює це, пропонуючи користувачам неперевершену гнучкість у створенні справжніх голосових оверлей. Я найбільш горджуся GSpeech Studio, новою платформою для редагування та генерації аудіо, над якою я зараз працюю. Вона дозволяє користувачам створювати кілька аудіоканалів, змішувати їх з фоновою музикою та експортувати відполіровані голосові оверлеї, надають творцям можливість створювати професійний аудіоконтент для різних застосунків. Лист візуально порушеного студента, який подякував GSpeech за можливість незалежного навчання завдяки настроєному аудіо, глибоко торкнувся мене. Цей випадок використання демонструє, як ці функції роблять контент доступним та трансформаційним, мету, яку я переслідував з перших днів програмування.

GSpeech пропонує безшовні інтеграції з WordPress, Shopify , Wix та іншими. Яка була ваша стратегія для того, щоб зробити платформу готовою до використання для творців та підприємців у різних екосистемах?

Наша стратегія для інтеграції GSpeech з платформами, такими як WordPress, Shopify та Wix, була спрямована на простоту, сумісність та масштабованість. Ми розробили легковажні, модульні плагіни та кодові фрагменти, які інтегруються безшовно, часто вимагаючи мінімальної настройки — часто лише кількох кліків. Це означає, що тисячі статей та динамічного контенту можуть миттєво отримати підтримку голосу — без ручної праці. Ми пропонуємо високо гнучкі, красиво спроектовані програвачі, які адаптуються на різних пристроях, включаючи мобільні телефони, планшети та комп’ютери. Наші програвачі не тільки настраївані, але й оптимізовані для доступності та взаємодії з користувачем. Для WordPress ми вбудували панель управління GSpeech Cloud безпосередньо до адміністративної панелі через наш плагін, спрощуючи управління для користувачів. Детальна документація та інтуїтивні панелі керування проводять некваліфікованих користувачів через процес установки та налаштування. Регулярне тестування забезпечує постійну продуктивність у різних екосистемах, надając творцям та підприємцям можливість легко додавати підтримку голосу на основі штучного інтелекту.

Оглядаючись на шлях від 2012 року до сьогодні, який був найбільшим особистим або професійним етапом у будівництві GSpeech?

Найбільшим етапом для GSpeech було генерація 1 мільярда символів високоякісного аудіо на основі штучного інтелекту, демонструючи наш глобальний вплив на доступність. Не менш значущим було те, що ми отримали відгуки від організацій, таких як Humanity Union, які похвалили GSpeech за поліпшення їхньої платформи цивільної відповідальності, та від власників блогів, які назвали його «ігровим змінником» для взаємодії з користувачами. Більше 110 відгуків на рівні 5 зірок на платформах, таких як WordPress та AppSumo за останні місяці, відображають це зростаюче довіра.

GSpeech зараз також активно використовується регіональним статистичним управлінням Намангана в Узбекистані — державним закладом з значним трафіком та національною видимістю. Те, що державний орган так широко прийняв нашу технологію, було значущим етапом і потужним знаком довіри до нашого рішення.

Як християнин та людина, яка служить у вірменській церкві, я також намагаюся підтримувати інші вірування та ініціативи, коли можу. Я часто пропоную GSpeech безкоштовно християнським веб-сайтам як спосіб допомогти їм поширити своє послання більш ефективно та зробити Писання більш доступним через аудіо. Це моя мала внесок у щось більше. Водночас я шаную можливість працювати з відданими міністерствами, такими як The Cord — месіанська громада та цінний клієнт GSpeech — чиї місія та контент відображають силу Писання в дії.

Ці моменти — коли технологія стає мостом для віри, розуміння та інклюзивності — нагадують мені, чому ми створили GSpeech спочатку.

Яку роль ви бачите для GSpeech у майбутньому цифрових медіа, особливо з урахуванням зростання аудіоконтенту та голосових інтерфейсів?

Я бачу GSpeech як лідера у створенні більш доступного та цікавого цифрового контенту, забезпечуючи підтримку голосу на основі штучного інтелекту для всього інтернету. Наша мета — трансформувати весь онлайн-досвід, щоб веб-сайти стали природньо голосово-інтерактивними, інклюзивними та багатомовними за замовчуванням. З однією лінією коду власники сайтів можуть перетворити тисячі статей у контент з підтримкою голосу. Оглядаючись вперед, ми розробляємо GSpeech Studio у потужну та унікальну платформу для генерації та редагування аудіо, дозволяючи користувачам створювати багаторівневий голосовий контент з фоновою музикою, ефектами та точним налаштуванням. Ми хочемо зробити інтернет справді чутним, інтуїтивним та універсально доступним.

GSpeech недавно запустив на AppSumo і вже здобув майже ідеальну оцінку від перших користувачів. Що означає для вас реакція спільноти AppSumo, і як ви плануєте розвивати цей імпульс у майбутньому?

Запуск на AppSumo познайомив GSpeech з мільйонами людей, а майже ідеальна оцінка надзвичайно позитивна. Користувачі, як ті, хто проводить онлайн-курси, хвалять наші інтуїтивні інструменти та оперативну підтримку, повторюючи відгуки Humanity Union. Власник блогу назвав наші голоси «справді привабливими» та переклади «вражаючими». Їх позитивний відгук підтверджує цінність нашого рішення текст-у-голос на основі штучного інтелекту та підігріває мою пристрасть до проекту. Підтримка клієнтів під час запуску також надихнула на нові ідеї, особливо для GSpeech Studio, який був натхненний запитами користувачів на розширені функції редагування та експорту аудіо. У майбутньому я планую розвивати цей імпульс, активно слухаючи нашу спільноту, інтегруючи їхні відгуки та розробляючи інноваційні функції для поліпшення доступності та взаємодії, забезпечуючи, щоб GSpeech продовжував еволюціонувати як трансформаційна інструмент для творців та підприємців.

Нарешті, яку пораду ви дали б молодим розробникам чи підприємцям, які хочуть створити доступні, штучно-інтелектуальні інструменти у сучасному швидкозмінному технологічному ландшафті?

Молодим розробникам та підприємцям я пораджу вкладати своє серце у свою роботу та визначати справжню проблему, де ви можете запропонувати унікальне, розумне рішення. Почніть з малого, рухайтесь крок за кроком вперед та слухайте відгуки користувачів — вони покажуть вам шлях. Обchodьтеся з користувачами, як з довіреними друзями, віддавайте все та залишайтесь терпеливими. Прийміть технології штучного інтелекту як потужних союзників; коли вони використовуються мудро, вони посилюють вашу здатність створювати впливові, доступні інструменти. Будуйте з пристрастю, наполегливістю та зобов’язанням зробити різницю, і ви створите рішення, які справді мають значення.

Дякую за чудове інтерв’ю, ми обрали рішення GSpeech для нашого веб-сайту через легку інтеграцію. Дізнатися більше можна на GSpeech.

Антуан є видним лідером і засновником Unite.AI, який рухається незмінною пристрастю до формування та просування майбутнього штучного інтелекту та робототехніки. Як серійний підприємець, він вважає, що штучний інтелект буде таким же революційним для суспільства, як і електрика, і часто захоплюється потенціалом революційних технологій і штучного інтелекту загального призначення.

Як футуролог, він присвячений вивченню того, як ці інновації будуть формувати наш світ. Крім того, він є засновником Securities.io, платформи, орієнтованої на інвестиції в передові технології, які переінакшують майбутнє і змінюють цілі сектори.