Röportajlar
Jean-Louis Quéguiner, Gladia’nın Kurucusu ve CEO’su – Röportaj Serisi

Jean-Louis Quéguiner Gladia’nın kurucusu ve CEO’sudur. Daha önce Avrupa’nın önde gelen bulut sağlayıcılarından biri olan OVHcloud’da Veri, AI ve Kuantum Bilgisayarından Sorumlu Grup Başkan Yardımcısı olarak görev yapmıştır. Kanada’daki Québec Üniversitesi ve Paris’teki Arts et Métiers ParisTech’ten Sembolik AI alanında yüksek lisans derecesine sahiptir. Kariyeri boyunca çeşitli endüstrilerde önemli pozisyonlarda bulunmuştur; bunlar arasında finansal veri analitiği, gerçek zamanlı dijital reklamcılık için makine öğrenimi uygulamaları ve konuşma AI API’lerinin geliştirilmesi yer alır.
Gladia çeşitli endüstriler, diller ve teknoloji yığınları boyunca ürünlerde sorunsuz entegrasyon için gelişmiş ses transkripsiyonu ve gerçek zamanlı AI çözümleri sağlar. Devlet-sanayii ASR ve üretken AI modellerini optimize ederek, doğru ve gecikmesiz konuşma ve dil işleme sağlar. Gladia’nın platformu ayrıca aramalardan ve toplantılardan gerçek zamanlı olarak içgörüler ve meta verileri çıkarmayı da mümkün kılar; bu, satış asistanlığı ve otomatik müşteri desteği gibi ana kuruluş kullanım örneklerini destekler.
Ses metne (STT) teknolojisindeki zorluklarla uğraşmaya sizi ne ilham etti ve piyasada hangi boşlukları gördünüz?
Gladia’yı kurduğumda, ilk hedefimiz geneldi – karmaşık teknolojiyi erişilebilir kılan bir AI şirketi. Ancak daha derine daldıkça, ses teknolojisinin en çok bozulan ve odaklanılması gereken en kritik alan olduğu ortaya çıktı.
Ses, günlük hayatımızın merkezinde yer alır ve iletişimimizin çoğunu konuşma yoluyla gerçekleştiririz. Ancak geliştiricilerin ses verilerini çalıştırması için mevcut araçlar, hız, doğruluk ve fiyat açısından yetersizdi – özellikle de diller arasında.
Bunu düzeltmek, ses teknolojisindeki karmaşıklığı açıklamak ve onu basit, verimli, güçlü ve erişilebilir bir şeye dönüştürmek istedim. Geliştiricilerin AI modellerinin karmaşıklığı veya konuşma tanıma中的 bağlam uzunluğu nüansları hakkında endişe duymamaları gerekiyor. Amacım, altta yatan model veya teknoloji ne olursa olsun sorunsuz çalışan bir kurumsal sınıf konuşma metne API oluşturmaktı – gerçek bir tak ve çalıştır çözümü.
İşletme kullanımı için bir transkripsiyon çözümü oluştururken karşılaştığınız bazı benzersiz zorluklar nelerdi?
Konuşma tanıma söz konusu olduğunda, hız ve doğruluk – bu alanda iki ana performans göstergesi – tasarımı itibariyle ters orantılıdır. Bu, birinin iyileştirilmesi diğerini bir miktar tehlikeye atar. Maliyet faktörü, büyük ölçüde sağlayıcının hız ve kalite arasında yaptığı tercihten kaynaklanır.
Gladia’yı inşa ederken, bu iki faktör arasında mükemmel bir denge bulmayı amaçladık, aynı zamanda teknolojinin başlangıç şirketlerine ve KOBİ’lere erişilebilir kalmasını sağladık. Süreçte, temel ASR modellerinin, özellikle OpenAI’nin Whisper’ı, eğitim verilerine bağlı olarak İngilizce’ye doğru önyargılı olduğunu ve birçok dili temsil etmekte yetersiz kaldığını da fark ettik.
Avrupalı, çok dilli bir ekip olarak, çekirdek modellerimizi küresel bir API oluşturmak için optimize etmek ve fine-tune etmek wichtigdi – böylece işletmeler diller arasında çalışabilir.
Gladia, kalabalık AI transkripsiyon pazarında kendini nasıl ayırt eder? Whisper-Zero ASR’niz neler yapar?
Yeni gerçek zamanlı motorumuz (Gladia Real Time), endüstri lideri 300 ms gecikme süresi sağlar. Ayrıca, “ses zekası” eklentileri veya özellikleriyle bir aramadan veya toplantıdan içgörüler çıkarmaya da olanak tanır.
Bilgimiz doğrultusunda, çok az rakip hem transkripsiyon hem de içgörüler sunabilir – ve bunları İngilizce dışındaki dillerde hızlı ve doğru bir şekilde sağlar. Dil desteğimiz bugün 100’den fazla dil içermektedir.
Ürünün gerçekten teknoloji yığınından bağımsız olmasını vurguladık. API’miz, SIP, VoIP, FreeSwitch ve Asterisk dahil tüm mevcut teknoloji yığınları ve telefoni protokolleriyle uyumludur. Telefoni protokolleri özellikle karmaşıktır ve entegre etmekte zorlanıyoruz, bu nedenle bu ürünün piyasaya büyük bir değer katacağına inanıyoruz.
Gerçek zamanlı transkripsiyonda AI modellerindeki “halüsinasyonlar” önemli bir endişe kaynağıdır. STT bağlamında halüsinasyonlar nelerdir ve Gladia bu sorunu nasıl ele alır?
Halüsinasyon genellikle modelin yeterli bilgiye veya bağlamda yeterli bilgiye sahip olmadığı zaman ortaya çıkar. Modeller talebe uygun çıktılar üretebilir, ancak yalnızca eğitim sırasında var olan bilgileri referans alabilir ve bu bilgiler güncel olmayabilir. Model, boşlukları doldurmak için doğru gibi görünen ancak yanlış olan bilgilerle tutarlı yanıtlar üretebilir.
Halüsinasyonlar ilk olarak LLM’lerde bilinse de, konuşma tanıma modellerinde de – özellikle OpenAI’nin geliştirdiği lider model Whisper ASR’de – ortaya çıkar. Whisper’ın halüsinasyonları, benzer bir mimariye sahip olduğu için LLM’lerinkine benzer. Bu, generatif modellerle ilgilidir – bunlar, genel bağlam temelinde takip eden kelimeleri tahmin edebilir. Bir şekilde, çıktıları “icat” ederler. Bu yaklaşım, girişe daha mekanik bir şekilde sesi eşleyen geleneksel, akustik tabanlı ASR mimarileriyle karşılaştırılabilir.
Bu nedenle, aslında söylenmeyen kelimeleri bir transkriptte bulabilirsiniz, ki bu özellikle tıp gibi alanlarda ciddi sonuçlara yol açabilir.
Halüsinasyonları yönetmek ve tespit etmek için çeşitli yöntemler vardır. Bir yaklaşım, bir alma-augmente-edilme (RAG) sistemi kullanmaktır – bu, modelin üretken yeteneklerini gerçekleri kontrol etmek için bir alma mekanizması ile birleştirir. Başka bir yöntem, modeli önceden tanımlanmış adımlar veya kontroller dizisi boyunca yönlendirmektir.
Halüsinasyonları tespit etmek için bir başka strateji, modelin çıktısının doğruluğunu eğitim sırasında değerlendiren sistemleri kullanmaktır. Halüsinasyonları değerlendirmek için özel olarak tasarlanmış benchmark’lar vardır – bunlar, modelin ürettiği farklı aday yanıtları karşılaştırır ve hangisinin en doğru olduğunu belirler.
Gladia olarak, Whisper-Zero’muzu oluştururken çeşitli tekniklerin bir kombinasyonunu denedik. Bu, asenkron transkripsiyonda mükemmel sonuçlar verdi ve şu anda gerçek zamanlı için optimize ediyoruz – aynı 99.9% bilgi bütünlüğünü elde etmek için.
Gladia, vurgulu aksanları, gürültüyü ve çok dilli konuşmaları işlerken nasıl bu zorluklarla başa çıkıyor ve yüksek doğruluk nasıl sağlanıyor?
Dil algılama, ASR’de son derece karmaşık bir görevdir. Her konuşmacı, “özellikler” olarak adlandırdığımız benzersiz bir ses imzasına sahiptir. Makine öğrenimi algoritmaları, Mel Frekans Cepstral Katsayıları (MFCC) kullanarak sinyal spektrumunu analiz ederek sınıflandırmalar gerçekleştirebilir.
MFCC, insan işitsel algılamasından esinlenen bir yöntemdir – “psikoakustik” alanının bir parçasıdır, sesin nasıl algılandığını odaklar. Alt frekansları vurgular ve sesi frekans spektrumuna dönüştürmek için normalize Fourier ayrıştırmayı kullanır.
Ancak bu yaklaşım bir sınırlılığa sahiptir: tamamen akustiğe dayanır. Eğer güçlü bir aksanla İngilizce konuşursanız, sistem içeriği anlamak yerine prosodiye (ritim, vurgu, tonlama) göre yargılayabilir.
Burada Gladia’nın yenilikçi çözümü devreye girer. Psiko-akustik özelliklerle birlikte dinamik dil algılaması için bir hibrit yaklaşım geliştirdik.
Sistem sadece nasıl konuştuğunuza değil, ne dediğinize de kulak verir. Bu çift yaklaşım, etkili kod değişimi sağlar ve güçlü aksanların yanlış temsil edilmesini veya yanlış anlaşılmasını önler.
Kod değişimi – özellikle çok dilli konuşmaları işlerken – bizim için önemli bir özelliktir. Konuşmacılar konuşma sırasında veya cümle içinde dil değiştirebilir ve modelin doğru bir şekilde takip edebilmesi kritiktir.
Gladia API’si, bu kadar çok dil çifti ile yüksek doğrulukta kod değişimi işleyebilen benzersiz bir çözümdür ve gürültülü ortamlarda, transkripsiyon kalitesini düşürerek bile iyi performans gösterir.
Gerçek zamanlı transkripsiyon, ultra düşük gecikme gerektirir. API’niz nasıl 300 milisaniyeden az gecikme sağlar ve doğruluğu korur?
300 milisaniyeden az gecikmeyle yüksek doğruluk sağlamak, donanım uzmanlığı, algoritma optimizasyonu ve mimari tasarımın birleştiği çok yönlü bir yaklaşımla mümkündür.
Gerçek zamanlı AI, geleneksel hesaplama gibi değildir – GPGPU’ların gücüne ve verimliliğine sıkı sıkıya bağlıdır. Bu alanda neredeyse on yıl çalıştım, OVHCloud’daki AI bölümünün liderliğini yaptım ve donanım gücünün, maliyetinin ve algoritmaların bu donanımla uyumlu çalışması arasındaki dengenin her zaman önemli olduğunu öğrendim.
Gerçek zamanlı AI’de performans, algoritmaları donanımın yetenekleriyle uyumlu bir şekilde çalıştırmaktan gelir – her operasyonun en yüksek verimi sağlaması ve gecikmeleri en aza indirmesi önemlidir.
Ancak sadece AI ve donanım değil, sistem mimarisi de önemli bir rol oynar – özellikle ağ, gecikmeyi gerçekten etkileyebilir. CTO’muz, IoT öncüsü Sigfox’daki düşük gecikme ağı tasarımı konusundaki derin uzmanlığıyla, ağ kurulumumuzu değerli milisaniyeleri kazanıp kaybetmemek için optimize etti.
Gerçek zamanlı AI’da performans, donanım seçimlerinin, algoritmaların ve ağ tasarımının bir bileşimidir – bu, bize tutarlı bir şekilde 300 ms’den az gecikme sağlar ve doğruluğu tehlikeye atmadan.
Gladia, transkripsiyonun ötesine, konuşmacı diarizasyonu, sentiment analizi ve zaman damgalı transkriptler gibi özelliklerle geçer. Bu araçları kullanan müşterilerinizden gördüğünüz bazı yenilikçi uygulamalar nelerdir?
ASR, dikeyler boyunca platformlara geniş bir uygulama yelpazesi sunar ve son iki yılda, LLM’leri ve API’mizi kullanarak öncü, rekabetçi ürünler geliştiren birçok gerçek öncü şirketin ortaya çıkmasını görmek harikaydı. İşte bazı örnekler:
- Akıllı not alma: Müşterilerimiz, profesyonellerin iş toplantalarından, öğrenci derslerinden veya tıbbi danışmanlıklardan hızlı bir şekilde bilgi toplaması ve organize etmesi için araçlar geliştiriyorlar. Konuşmacı diarizasyonu ile API’miz, kimin ne dediğini belirleyebilir, böylece konuşmaları takip etmek ve eylem maddeleri atamak kolaylaşır. Zaman damgalı transkriptlerle birleştirildiğinde, kullanıcılar kaydın belirli anlarına doğrudan atlayabilir, zaman kaybetmeden ve hiçbir şeyin tercüme edilmemesini sağlar.
- Satış etkinleştirme: Satış dünyasında, müşteri sentimentini anlamak her şeydir. Ekipler, satış görüşmelerinde veya demo’lar sırasında müşterilerin tepkilerine gerçek zamanlı olarak içgörüler elde etmek için sentiment analizi özelliğimizi kullanıyor. Ayrıca, zaman damgalı transkriptler, ekiplerin sohbetin kritik kısımlarını yeniden ziyaret etmesine ve müşteri endişelerini daha etkili bir şekilde ele almasına yardımcı olur. Bu kullanım durumunda özellikle, NER, satış görüşmelerinden otomatik olarak CRM’ye beslenecek isimler, şirket ayrıntıları ve diğer bilgileri tanımlamak için de önemlidir.
- Çağrı merkezi yardımı: Çağrı merkezi alanında şirketler, API’mizi canlı yardıma ihtiyaç duyan ajanlara yardımcı olmak ve müşteri sentimentini aramalar sırasında işaretlemek için kullanıyor. Konuşmacı diarizasyonu, söylenenlerin doğru kişiye atanmasını sağlar, zaman damgalı transkriptler ise denetçilerin kritik anları veya uyum sorunlarını hızlı bir şekilde gözden geçirmesini sağlar. Bu, müşteri deneyimini iyileştirir – daha iyi arama çözümü oranı ve kalite izleme ile – ayrıca ajan verimliliğini ve memnuniyetini artırır.
Müşteri kullanımındaki transkripsiyon güvenilirliğini artırmak için özel sözlükler ve varlık tanımaının rolü hakkında konuşabilir misiniz?
Çok sayıda endüstrinin, uzman terimlere, marka adlarına ve dilin benzersiz nuanslarına güvendiğini biliyoruz. Özel sözlük entegrasyonu, STT çözümünün bu özel gereksinimlere uyum sağlamasını sağlar – bu, bağlamsal nuansları yakalamak ve iş gereksinimlerinizi yansıtan çıktıları teslim etmek için kritiktir. Örneğin, bir domaine özgü kelimelerin listesini belirli bir dilde oluşturmanıza olanak tanır.
Neden faydalıdır: Transkripti spesifik dikeye uyarlamak, hataları minimize eder ve kullanıcı deneyimi iyileştirir. Bu özellikle tıp veya finans gibi alanlarda kritiktir.
Adlı varlık tanıma (NER), yapılandırılmamış ses verisinden önemli bilgileri çıkarır ve tanımlar – bunlar arasında isimler, organizasyonlar, yerler ve daha fazlası bulunur. Yapılandırılmamış veriyle ilgili ortak bir zorluk, bu kritik bilginin kolayca erişilemez olması – transkript içinde gömülüdür.
Bunu çözmek için, Gladia, bağlamsal bilgiyi tanımlamak ve çıkarmak için Whisper tabanlı mimarisinin üretken yeteneklerini kullanan yapılandırılmış Ana Veri Çıkarma (KDE) yaklaşımını geliştirdi.
Bu süreci, özel sözlük ve NER gibi özelliklerle daha da geliştirebilirsiniz – böylece işletmeler, CRMLERİ nhanh ve verimli bir şekilde önemli verilerle doldurabilir.
Sizin görüşünüzde, gerçek zamanlı transkripsiyon, müşteri desteği, satış ve içerik oluşturma gibi endüstrileri nasıl dönüştürüyor?
Gerçek zamanlı transkripsiyon, bu endüstrileri derinlemesine bir şekilde dönüştürüyor – üretkenlik kazançları sağlıyor ve somut iş avantajları sunuyor.
İlk olarak, gerçek zamanlı transkripsiyon, destek ekipleri için bir oyun değiştiricidir. Gerçek zamanlı yardım, daha hızlı yanıtlar, daha akıllı ajanlar ve daha iyi sonuçlar (NSF, işleme süreleri vb.) sayesinde çözme oranını iyileştirir. ASR sistemleri, İngilizce dışındaki dilleri ve gerçek zamanlı çeviriyi işleyebildikçe, çağrı merkezleri gerçekten küresel bir CX elde edebilir ve daha düşük marjlarla.
Satışta, hız ve doğru içgörüler her şeydir. Benzer şekilde, satış ekipleri, gerçek zamanlı transkripsiyonla, satış görüşmeleri sırasında doğru zamanda doğru içgörülere sahip olurlar – böylece anlaşmaları kapatmak için odaklanabilecekleri konulara odaklanabilirler.
Yaratıcılar için, gerçek zamanlı transkripsiyon, özellikle canlı altyazı ve medya etkinlikleri sırasında çeviri söz konusu olduğunda, henüz o kadar ilgili olmayabilir, ancak potansiyeli vardır.
Gerçek zamanlı AI transkripsiyonu gibi bir teknoloji, gelecekte 5-10 yıl içinde nereye gidebilir?
Bu fenomeni, gerçek zamanlı AI olarak adlandırdığımız şey, her yerde olacak gibi görünüyor. Aslında, makinelerin insanların birbirleriyle etkileşimde olduğu gibi insanlarla etkileşime girmesinin sorunsuz yeteneğinden bahsediyoruz.
Eğer gelecekte geçen herhangi bir Hollywood filminde (örneğin Her) bakarsanız, hiç kimsenin akıllı sistemlerle klavye aracılığıyla etkileşimde bulunmadığını görürsünüz. Bu, insanlığın kolektif hayal gücünde, sesin makinelerle etkileşimde bulunmanın birincil yolu olacağına dair kanıtlar sunar.
Ses, yazma ortaya çıkmeden çok önce insan kültürü ve tarihine ait olmuştur. Sonra yazma, bilgimizi daha etkili bir şekilde saklamak için sesin yerini aldı. Ancak GenAI sistemleri, konuşmayı anlayan, yanıtlar üreten ve etkileşimlerimizi depolayabilen bir şey getirdi – bu, sesin avantajı ile yazının avantajının birleşimidir. İnsanların kolektif hayal gücünün bir parçası olan bir şey – ve bu nedenle her yerde olacağına inanıyorum.
Harika bir röportaj için teşekkür ederiz, daha fazla bilgi edinmek isteyen okuyucular Gladia‘yı ziyaret edebilir.












