Röportajlar
Nikola Mrksic, PolyAI’nin Kurucu Ortağı ve CEO’su – Röportaj Serisi

Nikola Mrksic, PolyAI‘nin kurucu ortağı ve CEO’sudur, PolyAI bir müşteri hizmetleri için kullanılan gelişmiş ses asistanları sağlayan bir şirkettir.
Sesli asistanlar ve müşteri hizmetleri alanında çalışmaya nasıl başladınız?
Çok küçük yaşlarda matematik ve bilgisayar bilimlerine ilgi duydum. Cambridge Üniversitesi’nde öğrenim gördüğüm sırada, Steve Young ve Zoubin Ghahramani gibi önde gelen makine öğrenimi araştırmacıları ile çalışma fırsatım oldu. Steve, beni sesli diyalog sistemleri üzerine çalışmak üzere kendi şirketinde çalışmaya davet etti. Daha sonra, Steve ile birlikte konuşma anlama modelleri üzerine doktora çalışması yaptım. Bu alan, gerçekten zor ve karmaşık bir alandır ve birçok bilimsel ve mühendislik alanında ilerleme kaydetmemiz gerekiyor.
2017 yılında PolyAI’yi kurduğunuzda, şirketin kuruluş hikayesini anlatır mısınız?
Ben ve kurucu ortaklarım, Shawn Wen ve Eddy Su, Cambridge Üniversitesi’nde doktora öğrenimimizi aynı zamanda tamamladık. Yıllarca diyalog sistemleri üzerine çalıştık, ancak bu sistemlerin ticari uygulamalarının sınırlı olduğunu fark ettik. Bu nedenle, gerçek dünyada faydalı olabilecek bir konuşma AI çözümü geliştirmeye karar verdik. Müşteri hizmetleri alanında bir fırsat gördük ve gerçekten konuşmalı, çok tur atan ve işlemleri gerçekleştirebilen diyalog sistemleri geliştirmeye odaklandık.
Müşteri hizmetleri alanında odaklandık çünkü mevcut teknolojik yetenekler ve müşteri gereksinimleri iyi bir şekilde eşleşiyordu.
PolyAI’de kullanılan bazı makine öğrenimi ve doğal dil işleme teknolojilerini anlatır mısınız?
Bizim ana sırrımız, farklı propriyetary encoder modellerimizdir. Bu modeller, milyarlarca doğal konuşmadan oluşan bir veri kümesiyle önceden eğitilmiştir, böylece girdide kullanılan argo veya deyimler gibi ifadeleri anlamada oldukça başarılıdır. Bu, telefon üzerinden iletişim kurarken çok önemlidir. Müşteriler, anahtar kelimelerle konuşmazlar; hikayeler anlatırlar, kesintiye uğratırlar, sorular sorarlar ve genel olarak konuşmayı kontrol etmek isterler.
ConVEx modelimizi yakın zamanda duyurduk; bu, çok verimli bir varlık çıkarıcıdır ve konuşmalardan değerleri doğru bir şekilde çıkarmanıza olanak tanır.
Ses tanıma işlemimiz, konuşma tanıma platformlarını fine-tune ederek farklı aksanlara ve bağlamlara göre gürültüyü nötralize etmeyi içerir.
Ayrıca, müşterilere hızlı bir şekilde ses asistanları sunabilmemiz için, önceden tasarlanmış kullanım örnekleriyle birlikte bir diyalog politikası kütüphanesi geliştirdik.
İyi bir konuşma AI ürününü, kötü bir konuşma AI ürününden ayıran nedir?
İyi bir ürün, kullanıcıların ne demek istediğini her zaman anlayacaktır ve kullanıcıların kendilerini tekrarlamalarına asla izin vermeyecektir. Aramalar genellikle gürültülü ortamlarda gerçekleşir, bu nedenle ürünlerin gürültülü girdilere karşı dayanıklı olması gerekir. Markalar büyük pazarlara ulaştıkça, ürünlerin çeşitli aksanları ve ifade şekillerini anlamaları gerekir. Bunların her ikisi de güçlü ses tanıma yetenekleri, dayanıklı niyet sınıflandırması ve varlık çıkarma yetenekleri gerektirir.
Bir ürün, kullanıcılar için gerçekten etkileşimli olmalıdır. Kullanıcıların düşüncelerini takip edebilmeli ve karmaşık, günlük durumlarda kullanıcıların birden fazla niyet ve bilgi parçasını aynı anda paylaşabileceği durumlarda yardımcı olmalıdır. Bu, güçlü çok etiketli sınıflandırma ve bağlam yönetimi gerektirir.
Bir ürün, insan özellikleri taşımalı, ancak tuhaf veya çok robotik olmamalıdır. Bu, hızlı etkileşimleri, gerçekçi sesleri, sürekli geri bildirim sinyallerini ve bir degree rastgelelik ve hataları içerir.
Son olarak, iyi bir konuşma AI ürünü, kullanıcılarla her yerde etkileşime girebilmeli ve platforma özgü bir deneyimi sunabilmelidir. Bu, ses, SMS, sohbet veya sosyal mesajlaşma platformları üzerinden olabilir. Etkileşim paradigmaları, her iletişim platformunun özgünlüğünü benimsemelidir.
Şirketlerin, sohbet botlarına yönlendirmeye çalışmak yerine konuşma AI kullanmasının avantajları nelerdir?
Müşteri deneyimi kritiktir ve müşteri tutundurmanın ana sürücüsü haline gelmiştir. Müşterilerin ihtiyaç duydukları şeyleri yapmasını kolaylaştırmak, en önemli öncelik olmalıdır.
Telefon, müşterilerin şirketlerle iletişim kurmak için tercih ettiği en önemli kanaldır. Müşteri etkileşimlerinin %65’i hala telefon üzerinden gerçekleşiyor. COVID-19 salgını sırasında, müşteri hizmetleri merkezleri, daha fazla müşterinin destek için aramasıyla birlikte aşırı yük altına girdi.
Tabii ki, harika bir deneyim, müşterilerin tercih ettikleri şekilde iletişim kurmasını sağlar, bu nedenle müşterilerin tercih ettikleri kanallarda benzer bir deneyimi sunmak için markalara yardımcı oluyoruz.
Müşterilerin söylediği şeyin amacını tespit etmek ne kadar zor?
Ses kanalları üzerinden müşterileri anlamakla ilgili bir dizi zorluk vardır. Müşterilerin anlamını doğru ve tutarlı bir şekilde anlamak için birçok bileşenin iyi çalışması gerekir.
İlk olarak, ses tanıma zordur, özellikle müşteriler gürültülü ortamlardan aradıklarında, örneğin hoparlörde veya trafikteyken. Ses tanıma, farklı aksanlara ve lehçelere sahip bölgelerde de zor olabilir. Bağlam için ses tanıma modellerini önyüklemeye yönelik etkili bir yöntem geliştirdik.
ConveRT modelimiz, çok büyük miktarda konuşma verisiyle eğitildiği için, zayıf sinyallerde bile niyeti tespit edebilir, tıpkı insanların genelde bir şeyler söylediğinde ne demek istediklerini anlamaları gibi.
Bir başka consideration, müşterilerin aynı anda birden fazla eylem gerçekleştirmek istediklerinde ortaya çıkar. Örneğin, biri “Kartımı kaybettim. Kullanılıp kullanılmadığını ve kartı bloke edebilir misiniz?” diyebilir. Bu durumda, model iki niyeti tanımlamalı ve mantıklı bir sırayla hareket etmelidir.
Model, müşterilerin sağladığı varlıkları çıkarmak ve anlamak zorunda kalır. Örneğin, “Cumartesi öğle yemeği için bana, eşime ve çocuklarıma bir masa ayırtabilir misiniz?” Burada, yüzeydeki niyet, masa Verfügibilitasını kontrol etmektir, ancak model tarih (Cumartesi) ve kişi sayısını (4) çıkarmalı ve diğer ilgili bilgileri de almalıdır.
Son olarak, sohbet her zaman lineer değildir. Müşteriler, ses asistanının soru sorduğu konuya ilişkin olmayan sorularla kesintiye uğratabilir, bu nedenle asistanın farklı tetikleyicilere karşı duyarlı olmalı ve kullanıcı tarafından sağlanan bilgilere açık olmalıdır.
Bir şirketin PolyAI ile bir konuşma AI botu başlatmak için gereken süreç ve zaman çizelgesi nedir?
İşletmelere somut bir iş etkisi yaratmak için ses asistanları sunmaya çalışıyoruz. Bu nedenle, her bir müşteri ile çalışmaya, müşteri deneyimini, anahtar metrikleri ve destek süreçlerini belirlemeye yönelik bir keşif ile başlıyoruz. Bu, ses asistanının müşterileri yönlendireceği yolculukları belirlediğimiz yerdir. Bu, plus bizim önceden eğitilmiş ConveRT modelimiz, müşterilerden çok fazla veri gerektirmediğimiz anlamına gelir.
Bundan sonra, müşteriden çok fazla girdi gerektirmeden bir ses asistanı geliştirebiliyoruz, bu nedenle şirketlerin iç IT ekipleri üzerinde fazla bir yük oluşturmuyor.
Karmaşıklığa bağlı olarak, 2 haftada bir kanıt değerlendirmesi ve 2 ayda tam bir dağıtım sunabiliyoruz.
Harika bir röportaj için teşekkür ederiz, daha fazla bilgi edinmek isteyen okuyucular PolyAI‘yi ziyaret edebilir.












