Röportajlar
Nick Lahoika, Vocal Image’in Kurucu Ortağı ve CEO’su – Röportaj Serisi

Nick Lahoika, insanların yumuşak becerilerini geliştirmelerine yardımcı olan bir koçluk girişimi olan Vocal Image’ın kurucu ortağı ve CEO’sudur. BT ve iş geliştirme alanında on yılı aşkın deneyime sahip seri girişimci Nick, Vocal Image’ı kurmadan önce iki girişimden başarıyla çıkış yaptı. Onun yolculuğu son derece kişisel: okulda anlaşılmayan diksiyonu nedeniyle zorbalığa uğraması, insanların daha iyi iletişim kurmasına yardım etme misyonuna ilham verdi.
2020 devriminin ardından ülkesinden kaçmak zorunda kalan Nick, çok sınırlı İngilizceyle Estonya’ya geldi. Kendi uygulamasını kullanarak sesini eğitti ve yalnızca altı ay içinde ilk yatırım turunu güvence altına aldı. AWS AI Challenge ile Meta x Hugging Face Avrupa Yapay Zeka Girişim Programı’nı kazanan Vocal Image, kısa süre önce Fransız Educapital liderliğinde 3,6 milyon dolarlık tohum yatırımı aldı ve yıllık tekrarlayan gelirini 14 milyon doların üzerine çıkardı.
2021’de Vocal Image’ı kurdunuz. Yapay zeka yumuşak beceriler koçu kurmanız için size ilham veren neydi ve en başta hangi sorunu çözmeye çalışıyordunuz?
Konuşma kaygısı uzun süre hayatımın bir parçasıydı. Anlaşılmayan diksiyonum yüzünden okulda zorbalığa uğradım ve bu deneyimin etkisi bende kaldı. Daha sonra, bilişim öğrencisiyken yaptığım stajda üst düzey müşterilere sunum vermem gerektiğinde aynı korku geri döndü.
Ardından 2021’de, Belarus’taki başarısız devrimden sonra bir gecede Avrupa’ya taşınmak zorunda kaldım. Birdenbire, neredeyse hiç konuşamadığım İngilizceyle yatırımcılara sunum yapıyordum. Korkutucuydu ama başka seçeneğim yoktu. Her gün saatlerce, daha sonra Vocal Image’a dönüşecek uygulamanın çok erken bir sürümüyle telaffuz çalıştım. Kendi şirketimin adını söyleyebilmek için “V” sesini doğru çıkarmayı öğrenmem bile haftalar sürdü.
Esasen YouTube gibi, ancak yerleşik bir ses kaydedici ve yorum yapma özelliğine sahip bir uygulamayla başladık. Kullanıcılar videoları izleyebilir, satırları tekrarlama alıştırması yapabilir ve ardından kendi kayıtlarını dinleyebilir. İnsanların bunu nasıl kullandığını izlerken, umutsuzca geri bildirime ihtiyaç duyduklarını çabucak fark ettik. İlk kullanıcılarımız bize sadece içerik tüketmenin gerçek sonuçlar elde etmek için yeterli olmadığını gösterdi; anında geri bildirime ihtiyaçları vardı. İnsan koçları aracılığıyla geri bildirim sağlamaya çalıştık, ancak bu yaklaşım ölçeklenebilir değildi, bu yüzden yapay zekayı kullanmaya başladık.
İlk yatırım sunumlarımı bir insanla değil, platformumuzla çalışmanın benim için daha kolay olduğunu fark ettim. Baskı ve yargılanma yoktu. Bu özgürlük benim için her şeyi değiştirdi. Kendi sorunumu çözdükten sonra aynı sorunu kaç kişinin yaşadığını gördüm: 200 milyondan fazla insan konuşma kaygısıyla mücadele ediyor.
Vocal Image’dan önce bir dans stüdyosu işletiyordunuz. Hareket ve ifade alanındaki bu geçmişiniz, iletişime ve ses özgüvenine yaklaşımınızı nasıl etkiledi?
Dansçı değildim; aslında kendini ifade etmeye ve insanlara odaklanan bir iş kurmuştum. Bu çalışma sayesinde, yalnızca dansını izleyerek bir insanın içsel özgüveni hakkında çok şey anlayabileceğinizi fark ettim.
Hareket de kendinizi ifade etme biçiminizde büyük rol oynar. Hareketiniz, duruşunuz ve nefesiniz iletişimin birer parçasıdır. Yapay zeka koçluğu burada güçlüdür; insanların tüm bu alanlarda tek bir yerde çalışmasına yardımcı olabilir.
Eskiden şirketler birkaç farklı koç tutmak zorundaydı. Biri topluluk önünde konuşma, biri beden dili, biri özgüven için. Şimdi yapay zeka sayesinde hepsi birbirine bağlı. İletişimin sadece bir parçasını değil, bütün resmini oluşturabilirsiniz.
Çoğu yapay zeka iletişim aracının aksine, koçunuzun temeli olarak ChatGPT’yi kullanmamaya karar verdiniz. Bu karara sizi ne yönlendirdi?
ChatGPT etrafındaki heyecan aslında bizim için büyük bir dönüm noktası oldu. Ana akım haline geldiğinde, yapay zekaya olan güvende büyük bir artış yarattı ve biz de bunu kullanarak insanların kendi teknolojimize inanmasını sağlayabildik.
Ancak onu temelimiz yapmak istemedik. En başından beri hedefimiz, insanların sesini ve konuşma kalıplarını değerlendiren özgün modelimizi kullanmaktı. Mevcut modellerimizde Gemini, Claude ve ChatGPT gibi büyük dil modellerinden; iletişim literatürüne dayalı bilgi tabanları, ipuçları ve yöntemlerden yararlanıyoruz. Fakat bunlar geri bildirim mekanizmamızın çekirdeği değil. Geri bildirimimizin asıl temeli insan girdisidir.
Yapay zeka koçluğunun robotik hissettirmesi korkusu gerçektir. Bunu önlemek için Vocal Image içinde kullanıcıların anında bağlantı kurabileceği, iletişimlerini geliştirme ortak hedefini paylaşabileceği ve birbirlerinin yolculuğunu destekleyebileceği bir topluluk oluşturduk. Ve bu topluluk sürekli büyüyor ve yapay zekamızı geliştiriyor.
Yapay zekanızı yalnızca insan sesleri üzerinde eğitmenin, sonuçlar ve özgünlük açısından geleneksel LLM tabanlı yaklaşımlardan nasıl farklılaştığını açıklayabilir misiniz?
Değerlendirme ve bağlam oluşturma sürecinde büyük dil modellerinden yararlanıyoruz, ancak sistemimizin gerçek temeli veridir. Ana modelimiz, özellikle iletişim becerilerini geliştirmek için bir araya gelen kendi topluluğumuzun verileriyle eğitildi.
Yapay zeka, ancak öğrendiği insanlar kadar iyidir. Tescilli veri setimiz artık her biri ton, ritim ve duygu taşıyan, iletişimin gerçek özünü temsil eden bir milyondan fazla benzersiz insan sesini içeriyor.
Veri kümeniz bir milyondan fazla insan sesini içeriyor. Böylesine benzersiz bir veri kümesini derlerken ve etiketlerken hangi zorluklarla karşılaştınız?
Her veri noktasına aynı şekilde güvenemezsiniz. Bazı kullanıcılar dikkatlice puan verirken, diğerleri sadece tıklamaya devam eder. Düşünceli geri bildirimleri gürültüden ayıran bir sistem tasarlamamız gerekiyordu. Zamanla, tutarlı katılım gösteren ve güvenilir yargılara sahip kullanıcılara daha fazla ağırlık vermeyi öğrendik ve rastgele girdileri filtreledik.
En zor kısım, nicelik yerine kaliteyi ödüllendiren bir derecelendirme ekosistemi oluşturmayı içeren operasyonel kısımdı. Topluluğumuzun paha biçilmez hale geldiği yer burası. Bunlar rastgele internet kullanıcıları değil, gerçekten yumuşak becerilerini geliştirmeye ve başkalarının da aynısını yapmasına yardımcı olmaya çalışan insanlar. Tüm değerlendirmeler anonimdir, bu da geri bildirimlerin tarafsız ve gerçekçi kalmasını sağlar.
Topluluk tarafından yönlendirilen “Tinder benzeri” değerlendirme mekanizması oldukça ilgi çekici — bu geri bildirim döngüsü yapay zekanızın sürekli öğrenmesini nasıl şekillendiriyor?
Her derecelendirme, her dilde, modelimizi geliştiren küçük bir zeka parçası haline gelir. Bu yaşayan bir geri bildirim döngüsü. Ne kadar çok insan eğitilir ve değerlendirilirse, sistem konuşma ve duygu nüanslarını tanıma konusunda o kadar akıllı hale gelir; insanların kültürler arasında güven, sıcaklık veya otoriteyi nasıl algıladığını öğrenir.
Teknik yetkinliklerden ziyade yumuşak becerilere odaklanan bir yapay zeka modeli geliştirirken çıkarılan temel dersler nelerdi?
Asıl zorluk ölçümdü. “Güven veren” ya da “karizmatik” olmayı ölçen evrensel bir ölçek yok. Kendi ölçeğimizi oluşturmak zorundaydık.
İşte Büyük Sayılar Yasası burada devreye girdi. 100.000 kişi belirli bir sesin kendinden emin ya da empatik geldiği konusunda hemfikirse, bu ortak algıya güvenmeye başlayabilirsiniz. Zamanla yapay zekamıza, basitçe doğru ya da yanlış diye puanlanamayan öznel nitelikleri tahmin etmeyi öğrettik. Asıl atılım, her zaman soyut kabul edilen bir şeyi ölçmeyi öğrenmekti.
14 milyon dolarlık yıllık tekrarlayan gelir ve yeni alınan 3,6 milyon dolarlık tohum yatırımıyla, büyümenin bu yeni aşamasındaki başlıca öncelikleriniz neler? Yapay zeka modelini geliştirmek, kullanıcı tabanını büyütmek veya topluluk deneyimini derinleştirmek bunların arasında mı?
Misyonumuz her zaman insan merkezli olmuştur. İnsanların daha fazla güven ve özgünlükle iletişim kurmasına yardımcı oluyoruz.
Bir sonraki aşama, bu etkiyi küresel olarak ölçeklendirmekle ilgilidir. Yeni dillere ve coğrafyalara genişliyoruz ve müzakere, aktif dinleme ve belagat gibi yeni yumuşak beceri modülleri geliştiriyoruz.
Birçok kullanıcı yapay zeka koçlarını robotik veya kişiliksiz buluyor. Vocal Image’ın duygusal açıdan karşılık bulan ve bağlamı dikkate alan geri bildirimler vermesini nasıl sağlıyorsunuz?
Hiper kişiselleştirmeye odaklanıyoruz. İlk etkileşimden itibaren aksanınız, yaşınız, profesyonel bağlamınız ve konuşma kalıplarınız dahil kim olduğunuzu öğreniriz. Zamanla, nasıl geliştiğinizi, hangi konularda zorlandığınızı ve hangi geri bildirimlerin en çok işe yaradığını hatırlayan bir hafızamız oluşur.
Bu, yapay zekanın dinamik olarak uyum sağlamasına olanak tanır. Deneyim kişisel hissettirir çünkü kişiseldir. Genel bir senaryo ile değil, tamamen verileriniz ve yolculuğunuz tarafından şekillendirilir.
Geleceğe baktığımızda, üretken ve duygusal yapay zeka gelişmeye devam ederken yapay zeka yumuşak beceri koçluğunun nasıl evrileceğini düşünüyorsunuz?
İnsan gelişimi her zaman doğuştan gelen özelliklerle sonradan kazanılanların birleşimi olmuştur. Bilim, liderliğin kabaca yarısının doğuştan geldiğini, yarısının ise öğrenildiğini söylüyor. Öğrenilen kısım eskiden yalnızca pahalı koçları karşılayabilen yöneticilere açıktı. Şirketler uzun süre tek bir lidere koçluk sağlamak için yılda 7.000 ila 25.000 dolar harcamak zorunda kaldı. Yapay zeka bunu değiştiriyor.
Ayrıca insan eğitmenlerle çalışırken farklı alanlar için birçok ayrı koç tutmanız gerekirken, tek bir yapay zeka koçu bunların tümünün yerini alabilir.
Şu anda iletişimin farklı yönlerini analiz etmek için birden fazla modelden oluşan bir işlem hattı kullanıyoruz. Gelecek ise sizi bütüncül biçimde değerlendiren ve yönlendiren tek, birleşik bir sistemde. Bu teknoloji gelişimi demokratikleştirecek. İletişimde ustalaşmak için doğuştan karizmatik olmanız ya da büyük bir kurumsal bütçeye sahip olmanız gerekmeyecek; yalnızca meraka ve erişime ihtiyacınız olacak. Bunun gelişebileceği ortamı yaratmak, beni her gün harekete geçiren şey.
Bu değerli röportaj için teşekkür ederiz. Daha fazla bilgi edinmek isteyen okuyucular Vocal Image sitesini ziyaret edebilir.












