Интервью

Симон Погосян, основатель и генеральный директор GSpeech – Серия интервью

mm
Добавьте Unite.AI в избранные источники в Google

Симон Погосян является основателем и генеральным директором GSpeech, веб-платформой, основанной на искусственном интеллекте, которая помогает сделать онлайн-контент более доступным, преобразуя текст в естественно звучащий аудио более чем на 70 языках. С опытом в области VLSI Design и сильным интересом к программированию и пользовательскому опыту, Симон создал GSpeech, чтобы упростить способ, которым веб-сайты могут предлагать контент с голосовым сопровождением.

Сегодня GSpeech генерирует около 200 миллионов символов аудио каждый месяц и используется в более чем 70 странах, а его настраиваемые аудиоплееры обслуживают более 200 000 воспроизведений в месяц. Преодолев отметку в 1 миллиард символов аудио, сгенерированных в общей сложности, GSpeech продолжает расти стремительно. Платформа разработана для простой интеграции — для этого требуется всего одна строка кода — и поддерживает создателей, педагогов и бизнес в том, чтобы сделать их контент более инклюзивным и увлекательным.

GSpeech также используется на всех наших англоязычных страницах, вы можете прослушать эту статью и оценить, как хорошо работает GSpeech, нажав на кнопку воспроизведения.

Ваш опыт в области VLSI Design и ранний опыт программирования заложили прочный технический фундамент. Что вдохновило ваш переход от микроэлектроники к разработке программного обеспечения, основанного на искусственном интеллекте, и как это привело к созданию GSpeech?

Моя страсть к решению проблем началась в школе, подогретая любовью к математике и физике. Этот интерес привел меня к получению степени бакалавра (2009) и магистра (2011) в области VLSI Design в Государственном инженерном университете Армении, в сотрудничестве с Synopsys Armenia. Изучение физики научило меня точности и аналитическому мышлению, но именно на втором курсе я открыл для себя программирование — начиная с языка Pascal — и сразу же влюбился в него. Мой друг и я выполняли задания по курсу, как только получали их, хотя у нас было шесть месяцев, чтобы закончить. Затем, для развлечения, мы начали выполнять задания других студентов.

Эта страсть привела меня глубже в разработку программного обеспечения. Я начал с создания веб-сайтов, затем построил свою собственную систему управления контентом. После выполнения нескольких проектов по автоматизации процессов и проектированию архитектур управления данными, я понял, как сильно я люблю создавать цифровые решения для веб-интерфейсов. Через проект 2GLux я сотрудничал с Эдвардом Ананяном — создателем популярной службы перевода GTranslate и одноклассником из гимназии Quant. Он познакомил меня с экосистемами WordPress и Joomla, и концепция GSpeech возникла у него. Эта ранняя работа привела к первой версии нашего инструмента, позволяющего пользователям слушать текст на веб-странице, посадив семя того, что позже станет полноценной платформой, основанной на искусственном интеллекте. К 2023 году я основал компанию Smarts Club LLC, чтобы масштабировать GSpeech в глобальное решение для аудио на основе искусственного интеллекта, поддерживающее более 70 языков. Похвала Humanity Union за роль GSpeech в повышении доступности их платформы гражданского участия отражает мою миссию по преодолению цифровых разрывов с помощью искусственного интеллекта — видение, укорененное в моих ранних днях программирования.

GSpeech изначально начался как инструмент для поддержки пользователей с нарушениями зрения. Как эта первоначальная миссия повлияла на эволюцию платформы в полноценное решение для преобразования текста в речь на основе искусственного интеллекта?

Фокус на доступности привел к разработке высококачественного, реального аудио на основе искусственного интеллекта, переводу на более чем 70 языков и бесшовной интеграции с веб-сайтами посредством простого кодового фрагмента. Эта миссия привела к функциям, таким как настраиваемые аудиоплееры, панели выбора языка и голоса, контекстно-зависимое воспроизведение, скачивание аудио и подробная статистика использования — включая данные о стране, городе, устройстве и аналитике воспроизведения во времени — все это разработано для того, чтобы сделать контент более инклюзивным и увлекательным. После написания более 100 000 строк кода я запустил GSpeech Cloud Console в 2023 году — масштабируемое решение, которое балансирует инклюзивность с продвинутой функциональностью, наделяя бизнес и создателей возможностью сделать свой контент доступным, многоязычным и интерактивным во всем интернете.

Какими были некоторые из самых больших технических проблем, с которыми вы столкнулись во время разработки GSpeech Cloud Console?

Одной из самых больших проблем в разработке GSpeech Cloud Console было проектирование масштабируемой архитектуры для генерации аудио на основе искусственного интеллекта в реальном времени. Это требовало инновационных решений для получения соответствующего контента из сети, обработки аудио на наших серверах и хранения его в облаке для быстрой и надежной доставки. Реализация надежных мер безопасности, таких как шифрование и контроль доступа, была критически важна для защиты динамически генерируемого контента, созданного пользователями.

Другой проблемой было обеспечение перевода в реальном времени с помощью продвинутых нейронных двигателей. Нам пришлось гарантировать низкую задержку и точные переводы, одновременно создавая интуитивно понятный интерфейс, который позволяет пользователям выбирать языки и предпочитаемые профили голоса для воспроизведения, отдаляя приоритет комфорту и персонализации пользователей. Наконец, мы разработали мастер создания шаблонов аудио с несколькими настраиваемыми представлениями плеера, позволяя пользователям проектировать уникальные, визуально привлекательные плееры, адаптированные к их веб-сайтам. Баланс гибкости, производительности и простоты использования на различных устройствах был полезной задачей.

С переводом в реальном времени на более чем 70 языках и более 230 естественно звучащими голосами. Как вы обеспечиваете качество голоса и поддерживаете точность на таком разнообразном языковом наборе?

Чтобы поддерживать последовательное качество голоса, мы интегрируем несколько продвинутых моделей преобразования текста в речь (TTS), которые постоянно оптимизируются и обновляются. Эти многоязычные двигатели обрабатывают смешанный языковой контент с высокой точностью. Мы также развертываем более 100 новых голосовых вибраций, чтобы дать пользователям еще больше выразительных и естественно звучащих вариантов. Каждый месяц GSpeech генерирует более 200 миллионов символов аудио, обслуживая пользователей в более чем 70 странах, а наши онлайн-плееры используются более 200 000 раз в месяц — и растут. Этот масштаб обеспечивает постоянную обратную связь и реальное тестирование, которое напрямую информирует наши настройки и контроли качества.

Можете ли вы пройти со мной через то, как GSpeech использует искусственный интеллект и машинное обучение для предоставления синтеза голоса, похожего на человеческий? Как вы поддерживаете темп с быстрыми достижениями в области нейронной голосовой технологии?

GSpeech использует продвинутый искусственный интеллект и машинное обучение, интегрируя несколько современных моделей преобразования текста в речь, чтобы производить синтез голоса, похожий на человеческий. Эти модели, оптимизированные для естественности и многоязычной поддержки, обрабатывают входные текстовые данные для генерации высококачественного аудио с реалистичной интонацией и ритмом, даже для смешанного языкового контента. Мы улучшаем опыт пользователя, предлагая настраиваемые стили голоса для различных языков. Мы также интегрировали псевдонимы TTS, которые позволяют пользователям определять пользовательские правила для того, как определенные слова или фразы представлены в аудио — например, замена конкретных терминов для достижения более точного произношения или фразировки. Чтобы оставаться в курсе нейронной голосовой технологии, мы постоянно оцениваем и интегрируем последние достижения, сотрудничаем с лидерами отрасли и планируем разработать собственные модели в будущем, гарантируя, что GSpeech остается на переднем крае инноваций в области синтеза голоса.

Насколько важны настройка голоса, контроль высоты звука и настройка воспроизведения для ваших пользователей — и какой случай использования вы наиболее гордитесь, где эти функции действительно блестят?

Настройка голоса, контроль высоты звука и настройка воспроизведения имеют решающее значение для наших пользователей, позволяя им создавать уникальные, высококачественные стили голоса, адаптированные к их конкретным потребностям, от новостных и блоговых веб-сайтов до доступного электронного обучения. Постоянная интеграция более 100 новых голосовых вибраций еще больше усиливает это, предлагая пользователям беспрецедентную гибкость для создания действительно уникальных голосовых сопровождений. Я наиболее горжусь GSpeech Studio, новой платформой для редактирования и генерации аудио, над которой я работаю. Она позволяет пользователям создавать несколько аудиоканалов, смешивать их с фоновыми музыкальными композициями и экспортировать отполированные голосовые сопровождения, наделяя создателей возможностью производить профессионально звучащее аудио для различных применений. Письмо студента с нарушениями зрения, благодарившего GSpeech за возможность независимого обучения посредством настраиваемого аудио, глубоко тронуло меня. Этот случай использования демонстрирует, как эти функции делают контент доступным и трансформирующим, цель, которую я преследовал с ранних дней программирования.

GSpeech предлагает бесшовные интеграции с WordPress, Shopify , Wix и другими. Какова была ваша стратегия, чтобы сделать платформу готовой к использованию для создателей и бизнеса в разных экосистемах?

Наша стратегия для интеграции GSpeech с платформами, такими как WordPress, Shopify и Wix, была сосредоточена на простоте, совместимости и масштабируемости. Мы разработали легкие, модульные плагины и кодовые фрагменты, которые интегрируются без проблем, требуя минимальной настройки — часто всего несколько кликов. Это означает, что тысячи статей и динамических блоков контента могут мгновенно получить поддержку голоса — без ручных усилий. Мы предлагаем высоко гибкие, красиво спроектированные плееры, которые адаптируются на различных устройствах, включая мобильные телефоны, планшеты и настольные компьютеры. Наши плееры не только настраиваемые, но и оптимизированы для доступности и вовлеченности пользователей. Для WordPress мы встроили облачную панель управления GSpeech直接 в панель администратора через наш плагин, упрощая управление для пользователей. Подробная документация и интуитивно понятные панели управления направляют непрофессиональных пользователей через процесс установки и настройки. Регулярное тестирование гарантирует последовательную производительность в различных экосистемах, наделяя создателей и бизнес возможность легко добавить поддержку голоса на основе искусственного интеллекта.

Оглядываясь на путь от 2012 года до настоящего дня, какое было самое большое достижение для вас лично или профессионально в построении GSpeech?

Самым большим достижением для GSpeech было генерирование 1 миллиарда символов высококачественного аудио на основе искусственного интеллекта, демонстрирующее наш глобальный вклад в доступность. Не менее значимым было получение отзывов от организаций, таких как Humanity Union, которые похвалили GSpeech за повышение доступности их платформы социальной ответственности, и от владельцев блогов, которые назвали его «игроком, меняющим правила» для вовлеченности пользователей. Более 110 отзывов с пятью звездами на платформах, таких как WordPress и AppSumo в последние месяцы, отражают это растущее доверие.

GSpeech теперь также активно используется региональным статистическим отделом Намангана в Узбекистане — государственным учреждением с значительным трафиком и национальной видимостью. Видя, как государственное учреждение принимает нашу технологию так широко, было значимым достижением и мощным знаком доверия к нашему решению.

Как христианин и человек, служащий в армянской церкви, я также пытаюсь поддержать другие инициативы веры, когда это возможно. Я часто предоставляю GSpeech бесплатно христианским веб-сайтам как способ помочь им распространить свое послание более эффективно и сделать Писание более доступным через аудио. Это мой небольшой вклад в нечто большее. В то же время я горжусь работой с преданными министерствами, такими как The Cord — мессианское собрание и ценный клиент GSpeech — чья миссия и контент отражают силу Писания в действии.

Эти моменты — когда технология становится мостом для веры, понимания и инклюзивности — напоминают мне, почему мы построили GSpeech в первую очередь.

Какую роль, по вашему мнению, GSpeech будет играть в будущем цифровых медиа, особенно когда аудиоконтент и голосовые интерфейсы становятся более доминирующими?

Я представляю GSpeech как лидера в том, чтобы сделать цифровые медиа более доступными и увлекательными, обеспечивая голосовой доступ к вебу на основе искусственного интеллекта. Наша цель — преобразовать весь онлайн-опыт, чтобы веб-сайты стали естественно голосо-интерактивными, инклюзивными и многоязычными по умолчанию. С помощью всего одной строки кода владельцы сайтов могут превратить тысячи статей в контент с голосовым сопровождением. В будущем мы разрабатываем GSpeech Studio в мощную и уникальную платформу для генерации и редактирования аудио, позволяющую пользователям создавать многослойный голосовой контент с фоновыми музыкальными композициями, эффектами и точной настройкой. Мы хотим сделать веб действительно слышимым, интуитивно понятным и универсально доступным.

GSpeech недавно запустился на AppSumo и уже получил почти идеальную оценку от ранних пользователей. Что означает для вас реакция сообщества AppSumo, и как вы планируете развивать это импульс в будущем?

Запуск на AppSumo представил GSpeech миллионам, и его почти идеальная оценка невероятно подтверждает нашу работу. Пользователи, такие как те, кто запускает онлайн-курсы, хвалят наши интуитивно понятные инструменты и отзывчивую поддержку, повторяя отзывы от Humanity Union. Владелец блога назвал наши голоса «искренне увлекательными» и переводы «впечатляющими». Их положительная обратная связь подтверждает ценность нашего решения для преобразования текста в речь на основе искусственного интеллекта и подогревает мою страсть к проекту. Поддержка клиентов во время запуска также вызвала новые идеи, особенно для GSpeech Studio, который был вдохновлен запросами пользователей на продвинутые функции редактирования и экспорта аудио. В будущем я планирую развивать это импульс, активно слушая нашу общину, интегрируя их обратную связь и разрабатывая инновационные функции для повышения доступности и вовлеченности, гарантируя, что GSpeech продолжит эволюционировать как трансформирующий инструмент для создателей и бизнеса.

Наконец, какой совет вы дадите молодым разработчикам или предпринимателям, которые хотят построить доступные, основанные на искусственном интеллекте инструменты в сегодняшнем быстро меняющемся технологическом ландшафте?

Молодым разработчикам и предпринимателям мой совет — вложить свое сердце в свою работу и выявить реальную проблему, где вы можете предложить уникальное, умное решение. Начните с малого, делайте стабильные шаги вперед и внимательно слушайте обратную связь пользователей — они будут направлять ваш путь. Относитесь к своим пользователям как к доверенным друзьям, отдавайте все свои силы и оставайтесь терпеливыми. Принимайте технологии искусственного интеллекта как мощных союзников; когда они используются мудро, они усиливают вашу способность создавать значимые, доступные инструменты. Постройте с страстью, настойчивостью и приверженностью к созданию разницы, и вы создадите решения, которые действительно имеют значение.

Спасибо за отличное интервью, мы выбрали решение GSpeech для нашего веб-сайта из-за простой интеграции. Чтобы узнать больше, посетите GSpeech.

Антуан - видный лидер и сооснователь Unite.AI, движимый непоколебимой страстью к формированию и продвижению будущего ИИ и робототехники. Как серийный предприниматель, он считает, что ИИ будет столь же разрушительным для общества, как и электричество, и часто увлекается потенциалом разрушительных технологий и ИИ.

Как футуролог, он посвящен исследованию того, как эти инновации будут формировать наш мир. Кроме того, он является основателем Securities.io, платформы, ориентированной на инвестиции в передовые технологии, которые переопределяют будущее и меняют целые сектора.