Röportajlar

Simon Poghosyan, GSpeech’in Kurucusu ve CEO’su – Röportaj Serisi

mm
Unite.AI sitesini Google'daki tercih ettiğiniz kaynaklara ekleyin

Simon Poghosyan GSpeech’in kurucusu ve CEO’sudur, GSpeech bir web tabanlı AI platformudur ve 70’den fazla dilde doğal sesli audio oluşturmak için metni dönüştüren bir araçtır. VLSI Tasarımı alanında geçmişine sahip olan Simon, GSpeech’i websitesinin sesli içeriğini sunmak için oluşturmuştur.

Bugün, GSpeech her ay yaklaşık 200 milyon karakter audio üretiyor ve 70’den fazla ülkede kullanılıyor, özelleştirilebilir audio oynatıcıları aylık olarak 200.000’den fazla oynatma yapıyor. Toplam 1 milyar karakterden fazla audio üretmeyi geçen GSpeech, hızla büyümeye devam ediyor. Platform, kolay entegrasyon için tasarlandı – sadece bir satır kod gerektiriyor – ve yaratıcılar, eğitimciler ve işletmeler için içeriğini daha kapsayıcı ve etkileşimli hale getirmelerine yardımcı oluyor.

GSpeech, tüm İngilizce sayfalarımızda da kullanılıyor, bu makaleyi dinleyerek GSpeech’in nasıl çalıştığını görebilirsiniz.

VLSI Tasarımı (Çok Büyük Ölçekli Entegrasyon) geçmişiniz ve erken programlama deneyiminiz güçlü bir teknik temel oluşturdu. AI güçlendirilmiş yazılımlar oluşturmaya geçişinizi ne etkiledi ve bu GSpeech’in oluşturulmasına nasıl yol açtı?

Problem çözme konusundaki tutkum lisede başladı, matematik ve fizik sevgimden kaynaklandı. Bu ilgi, beni Ermenistan Devlet Mühendislik Üniversitesi’nden VLSI Tasarımı alanında lisans (2009) ve yüksek lisans (2011) derecelerini almaya yöneltti. Fizik öğrenimi, beni kesinlik ve analitik düşünceye yöneltti, ancak ikinci yılımdayken programlamayla tanıştım – Pascal dilini öğrenerek – ve hemen ona aşık oldum. Arkadaşım ve ben, ödevleri aldığımız anda bitirirdik, altı ay süreleri olmasına rağmen. Sonra, sadece eğlence için, diğer öğrencilerin ödevlerini yapmaya başladık.

Bu tutku, beni daha derine yazılım geliştirmeye yöneltti. Web sitesi oluşturmaya başladım, ardından kendi CMS’mi oluşturdum. Birkaç proje tamamlandıktan ve veri yönetim altyapısı tasarladıktan sonra, dijital çözümler oluşturmayı ne kadar sevdiğimi fark ettim. 2GLux projesi aracılığıyla, popüler GTranslate çeviri hizmetinin yaratıcısı ve Quant Gymnasium’dan bir okul arkadaşım olan Edvard Ananyan ile işbirliği yaptım. Bana WordPress ve Joomla ekosistemlerini tanıttı ve GSpeech kavramı ondan geldi. Bu erken çalışma, web sayfasındaki metni dinlenebilen ilk araçların oluşturulmasına yol açtı, bu da daha sonra tam özellikli bir AI platformuna dönüşecekti. 2023 yılına gelindiğinde, GSpeech’i küresel bir AI ses çözümü olarak ölçeklendirmek için Smarts Club LLC’yi kurdum, 70’den fazla dilde destek sunuyor. Humanity Union’un, GSpeech’in sivil katılım platformunun erişilebilirliğini artırma konusundaki rolünü övdüğü ve blog sahiplerinin “kullanıcı etkileşimi için oyun değiştirici” olarak adlandırdığı geri bildirim, misyonumu doğruladı – dijital uçurumu köprülemek için AI’ı kullanmak.

GSpeech, başlangıçta görsel olarak engelli kullanıcıları desteklemek için bir araç olarak başladı. Bu erken misyon, platformun tam özellikli bir AI metin-sese çözümüne evrilmesine nasıl etki etti?

Erişilebilirlik odaklı yaklaşım, yüksek kaliteli, gerçek zamanlı AI sesi, 70’den fazla dilde çeviri ve basit bir kod parçasıyla web sitesi entegrasyonunu sağladı. Bu misyon, özelleştirilebilir audio oynatıcılar, dil ve ses seçimi panelleri, bağlam bilinci, audio indirme ve ayrıntılı kullanım istatistikleri gibi özelliklere yol açtı – tümü içeriği daha kapsayıcı ve etkileşimli hale getirmek için tasarlandı. 100.000’den fazla satır kod yazdıktan sonra, 2023 yılında GSpeech Bulut Konsolunu başlattım – bir ölçeklenebilir çözüm, erişilebilirliği gelişmiş işlevlerle dengeleyen ve işletmeleri ve yaratıcıları, web genelinde içeriğini erişilebilir, çok dilli ve etkileşimli hale getirmelerini sağlayan bir platform.

GSpeech Bulut Konsolunun geliştirilmesi sırasında karşılaştığınız en büyük teknik zorluklar nelerdi?

GSpeech Bulut Konsolunun geliştirilmesinde karşılaştığım en büyük zorluklardan biri, gerçek zamanlı, güvenli, yüksek kaliteli AI ses oluşturma için ölçeklenebilir bir mimari tasarlamak oldu. Bu, web’den ilgili içeriği getirme, sunucularda audio işleme ve bulutta hızlı, güvenilir teslimat için depolama gibi yenilikçi çözümler gerektiriyordu. Dinamik, kullanıcı tarafından oluşturulan içeriği korumak için güçlü güvenlik önlemleri uygulamak kritikti.

Diğer bir engel, gelişmiş nöral motorlar kullanarak gerçek zamanlı çeviri gerçekleştirmekti. Düşük gecikme, doğru çeviriler sağlarken, kullanıcıların dil ve tercih edilen ses profillerini seçmesine olanak tanıyan sezgisel bir arayüz oluşturmak zorunda kaldık. Son olarak, kullanıcıların web sitelerine özgü, benzersiz oynatıcılar oluşturmalarına olanak tanıyan bir audio şablon oluşturma sihirbazı geliştirdik. Esneklik, performans ve kullanım kolaylığını cihazlar arasında dengelemek bir zorluktu.

70’den fazla dilde gerçek zamanlı çeviri ve 230’dan fazla doğal sesli ses ile. Ses kalitesini ve böyle çeşitli bir dil kümesinde doğruluğu nasıl garantileyorsunuz?

Ses kalitesini korumak için, sürekli olarak optimize edilen ve güncellenen çok gelişmiş metin-sese (TTS) modellerini entegre ediyoruz. Bu çok dilli motorlar, karma dil içerikli metinleri yüksek doğrulukla işleyebiliyor. Ayrıca, kullanıcıların daha fazla ifade ve doğal sesli seçenek sunmak için 100’den fazla yeni ses vibrasyonu sunuyoruz. GSpeech her ay 200 milyondan fazla karakter audio üretiyor, 70’den fazla ülkede kullanıcıya hizmet veriyor ve online oynatıcılarımız ayda 200.000’den fazla kez kullanılıyor – ve büyümeye devam ediyor. Bu ölçek, sürekli geri bildirim ve gerçek dünya testi sağlıyor, bu da doğrudan kalite kontrollerimizi ve ayarlarımızı etkiliyor.

GSpeech, AI ve makine öğrenimi nasıl kullanıyor? Ses sentezini nasıl gerçekleştirmektedir ve nöral ses teknolojisinin hızlı gelişmelerini nasıl takip ediyorsunuz?

GSpeech, doğal ve çok dilli destek için optimize edilmiş, gelişmiş AI ve makine öğrenimi entegre ediyor. Bu modeller, gerçekçi bir tonlama ve ritimle yüksek kaliteli audio oluşturmak için metin girdilerini işliyor, hatta karma dil içerikli metinler için bile. Kullanıcı deneyimini, çeşitli diller için özelleştirilebilir ses stilleri sunarak geliştiriyoruz. Ayrıca, belirli kelimelerin veya cümlelerin nasıl seslendirileceğini tanımlamak için TTS takma adları entegre ettik – Örneğin, daha doğru telaffuz veya cümleleme için belirli terimlerin değiştirilmesi. Nöral ses teknolojisindeki gelişmeleri takip etmek için, sürekli olarak en son gelişmeleri değerlendiriyor, endüstri liderleriyle işbirliği yapıyoruz ve gelecekte özel modeller geliştirmeyi planlıyoruz, böylece GSpeech ses sentezi inovasyonunun ön saflarında kalıyor.

Ses ayarlaması, perde kontrolü ve oynatma özelleştirmesi kullanıcılarınız için ne kadar önemli ve bu özelliklerin gerçekten parladığı bir kullanım örneği nedir?

Ses ayarlaması, perde kontrolü ve oynatma özelleştirmesi kullanıcılarımız için çok önemlidir, çünkü onlara web siteleri, erişilebilir e-öğrenim içeriği ve bloglar için benzersiz, yüksek kaliteli ses stilleri oluşturma olanağı tanır. 100’den fazla yeni ses vibrasyonunun entegrasyonu, bu esnekliği daha da artırıyor. GSpeech Studio’dan gurur duyuyorum, bu yeni bir audio düzenleme ve oluşturma platformudur ve kullanıcıların birden fazla audio kanalı oluşturmasına, arka plan müziği ile karıştırmasına ve profesyonellere uygun seslendirmeler oluşturmasına olanak tanır. Bir görme engelli öğrencinin, bağımsız çalışmasına olanak tanıyan özelleştirilmiş audio için GSpeech’e teşekkür eden mektubu, beni derinden etkiledi. Bu kullanım örneği, bu özelliklerin içeriği nasıl erişilebilir ve dönüştürücü hale getirdiğini gösteriyor, bu da benim ilk programlama günlerimden beri takip ettiğim bir hedeftir.

GSpeech, WordPress, Shopify , Wix gibi platformlarla sorunsuz entegrasyon sunuyor. Yaratıcılar ve işletmeler için farklı ekosistemler arasında çalışabilirlik sağlamak için hangi stratejileri izlediniz?

GSpeech’in çeşitli platformlarla entegrasyonu için izlediğimiz strateji, basitlik, uyumluluk ve ölçeklenebilirlik üzerine odaklandı. Hafif, modüler eklentiler ve kod parçacıkları geliştirdik, bunlar minimum kurulum gerektiriyor – genellikle sadece birkaç tıklama. Bu, binlerce makale ve dinamik içerik bloğunun anında ses desteği almasını sağlıyor – elle müdahale gerektirmeden. Esnek, güzel tasarlanmış oynatıcılar sunuyoruz, bunlar cihazlar arasında, mobil, tablet ve masaüstü dahil olmak üzere uyumlu çalışıyor. Oynatıcılarımız sadece özelleştirilebilir değil, aynı zamanda erişilebilirlik ve kullanıcı etkileşimi için optimize edilmiştir. WordPress için, GSpeech bulut panosunu yönetici paneline doğrudan eklentimiz aracılığıyla entegre ettik, böylece kullanıcılar için yönetimi basitleştirdik. Ayrıntılı belgeler ve sezgisel paneller, teknik olmayan kullanıcıların kurulum ve özelleştirme işlemlerini yönlendiriyor. Diverse ekosistemler boyunca tutarlı performans için düzenli testler yapıyoruz, böylece yaratıcılar ve işletmeler AI güçlendirilmiş metin-sese kolayca ekleyebiliyor.

2012’den bugüne kadar olan yolculuğunuza baktığınızda, GSpeech’in oluşturulmasında kişisel veya profesyonel olarak en büyük kilometre taşı nedir?

GSpeech için en büyük kilometre taşı, yüksek kaliteli AI audio’nun 1 milyar karakterinin üretilmesi ve küresel erişilebilirlik etkisinin kanıtı oldu. Aynı zamanda, Humanity Union’un GSpeech’in sosyal sorumluluk platformunun erişilebilirliğini artırma konusundaki rolünü övdüğü ve blog sahiplerinin “kullanıcı etkileşimi için oyun değiştirici” olarak adlandırdığı geri bildirimler de çok anlamlı oldu. 110’dan fazla 5 yıldızlı inceleme, WordPress ve AppSumo gibi platformlarda son aylarda güvenin arttığını gösteriyor.

GSpeech, şu anda Özbekistan’ın Namangan bölgesel istatistik departmanı tarafından da aktif olarak kullanılıyor – ulusal düzeyde görünürlüğü olan bir hükümet kuruluşu. Kamu kurumunun teknolojisini bu kadar geniş bir şekilde benimsemesi, çözümümüze olan güvenin güçlü bir işareti.

Hıristiyan olarak ve Ermeni kilisesinde hizmet verdiğim için, mümkün olduğunda diğer dine dayalı girişimlere de destek vermeye çalışıyorum. GSpeech’i Hıristiyan web sitelerine ücretsiz olarak sunuyorum, böylece mesajlarını daha etkili bir şekilde yaymak ve sesli audio aracılığıyla Kutsal Kitap’ı daha erişilebilir hale getirmelerine yardımcı oluyorum. Bu, daha büyük bir şeye katkıda bulunmak için küçük bir katkımdır. Aynı zamanda, The Cord gibi adanmış bakanlıklarla çalışmaktan gurur duyuyorum – bir Mesihçi cemaat ve değerli bir GSpeech müşterisi – onların misyonu ve içeriği, Kutsal Kitap’ın gücünü eylemde gösteren bir yansımadır.

Bu anlar – teknolojinin iman, anlayış ve kapsayıcılık için bir köprü haline geldiği anlar – bana neden GSpeech’i inşa ettiğimizi hatırlatıyor.

Dijital medyanın geleceğinde, özellikle sesli içerik ve ses arabirimlerinin daha baskın hale geldiği bir dönemde, GSpeech’in rolünü nasıl görüyorsunuz?

GSpeech’i, web’i doğal olarak sesli, kapsayıcı ve çok dilli hale getirmek için lider bir platform olarak görüyorum. Amacımız, tüm online deneyimi dönüştürmek, böylece web siteleri sadece bir satır kodla binlerce makaleyi sesli içeriğe dönüştürebiliyor. Gelecekte, GSpeech Studio’yu güçlü ve benzersiz bir audio oluşturma ve düzenleme platformu olarak geliştiriyoruz, böylece kullanıcılar, arka plan müziği ve precisa ayarlamalarla çok katmanlı ses içeriği oluşturabilecek. Web’i gerçekten duyulabilir, sezgisel ve evrensel olarak erişilebilir hale getirmek istiyoruz.

GSpeech, AppSumo’da başlatıldı ve erken benimseyicilerden neredeyse mükemmel bir puan aldı. AppSumo topluluğundan gelen tepki size ne anlama geliyor ve bu momentumu ilerletebilmek için nasıl planlıyorsunuz?

AppSumo lansmanı, GSpeech’i milyonlara tanıttı ve neredeyse mükemmel puan, inanılmaz derecede cesaret verici. Kullanıcılar, online kurslar gibi, sezgisel araçlarımıza ve yanıt veren destek ekibimize övgüde bulunuyor, bu da Humanity Union’un geri bildirimiyle aynı doğrultuda. Bir blog sahibi, seslerimizi “gerçekten etkileyici” ve çevirileri “etkileyici” olarak tanımladı. Olumlu geri bildirim, AI güçlendirilmiş metin-ses çözümümüzün değerini doğruluyor ve projeye olan tutkumu ateşliyor. Lansman sırasında müşterilerle birlikte çalışmak, özellikle GSpeech Studio için, gelişmiş audio düzenleme ve dışa aktarma özelliklerine yönelik kullanıcı talepleriyle birlikte, yeni fikirleri de tetikledi. İleride, topluluğumuzu aktif olarak dinleyerek, geri bildirimi entegre ederek ve erişilebilirlik ve etkileşimi artırmak için yenilikçi özellikler geliştirerek bu momentumu inşa etmeyi planlıyorum, böylece GSpeech, yaratıcılar ve işletmeler için dönüştürücü bir araç olarak devam edebilsin.

Son olarak, bugün hızlı değişen teknoloji ortamında erişilebilir, AI güçlendirilmiş araçlar oluşturmak isteyen genç geliştiricilere veya girişimcilere ne tür tavsiyelerde bulunurdunuz?

Genç geliştiricilere ve girişimcilere, yaptıkları işe tüm kalpleriyle sarılmalarını, gerçek bir problemi benzersiz ve akıllı bir çözümle çözmelerini tavsiye ederim. Küçük adımlarla ilerleyin, müşteri geri bildirimi dinleyin – onlar yolunuzu yönlendirecek. Kullanıcılarınıza güvendiğiniz arkadaşlar gibi davranın, her şeyi verin ve sabırlı olun. AI teknolojilerini güçlü müttefikler olarak kullanın; bilinçli bir şekilde kullanıldıklarında, etkili, erişilebilir araçlar oluşturma yeteneğinizi artırır. Tutku, azim ve fark yaratma taahhüdüyle inşa edin ve gerçekten önemli olan çözümler oluşturacaksınız.

Harika röportaj için teşekkür ederiz, web sitemiz için GSpeech çözümünü, kolay entegrasyonu nedeniyle seçtik. Daha fazla bilgi için GSpeech ziyaret edin.

Antoine, Unite.AI'nin vizyoner lideri ve kurucu ortağı, AI ve robotik geleceğini şekillendirmeye ve tanıtmaya yönelik sarsılmaz bir tutkuya sahiptir. Bir seri girişimci olarak, AI'nin toplum için elektrik kadar yıkıcı olacağına inanmaktadır ve sık sık yıkıcı teknolojiler ve AGI'nin potansiyeli hakkında konuşmaktadır.

Bir gelecekçi olarak, bu yeniliklerin dünyamızı nasıl şekillendireceğini keşfetmeye adanmıştır. Ayrıca, Securities.io kurucusudur, bu platform geleceği yeniden tanımlayan ve tüm sektörleri yeniden şekillendiren teknolojilere yatırım yapmayı hedeflemektedir.