Röportajlar
Dr. Ram Sriharsha, Pinecone’de Mühendislik Başkan Yardımcısı – Röportaj Serisi

Dr. Ram Sriharsha, Pinecone’de Mühendislik ve Araştırma Başkan Yardımcısıdır.
Pinecone’a katılmadan önce, Ram, Yahoo, Databricks ve Splunk’ta Başkan Yardımcısı rollerinde bulunmuştur. Yahoo’da, hem başlıca yazılım mühendisi hem de araştırma bilimcisi olarak görev yapmıştır; Databricks’te, genomik için birleşik analitik platformunun ürün ve mühendislik lideri olarak görev yapmıştır ve Splunk’taki üç yıllık görev süresi boyunca, Sr. Baş Mühendis, Mühendislik Başkan Yardımcısı ve Seçkin Mühendis gibi çeşitli rollerde bulunmuştur.
Pinecone, vektör aramasını üretim uygulamalarına eklemeyi kolaylaştıran tam olarak yönetilen bir vektör veritabanıdır. Vektör arama kitaplıkları, filtreleme gibi özellikleri ve dağıtılmış altyapıyı birleştirerek herhangi bir ölçekte yüksek performans ve güvenilirlik sağlar.
Sizleri makine öğrenmesine initial olarak neler çekmiştir?
Yüksek boyutlu istatistikler, öğrenme teorisi ve benzer konular beni makine öğrenmesine çekmiştir. Bunlar matematiksel olarak iyi tanımlanmış, akıl yürütülebilir ve öğrenmenin ne anlama geldiği, verimli öğrenme algoritmaları tasarlamak için temel bilgiler sunar.
Önceden Splunk’ta Mühendislik Başkan Yardımcısı olarak görev yapıyordunuz. Bu deneyiminizden elde ettiğiniz bazı önemli sonuçlar nelerdir?
Splunk’a gelene kadar, kurumsal aramanın kullanım örneklerinin ne kadar çeşitli olduğunu fark etmemişim. İnsanlar, Splunk’u günlük analizi, gözlemlenebilirlik ve güvenlik analizi gibi birçok kullanım örneği için kullanıyor. Bu kullanım örneklerinin çoğunda, benzer olayları veya çok farklı (veya anormal) olayları yapılandırılmamış verilerde tespit etme fikri ortak. Bu, geleneksel arama yöntemleriyle çözülebilecek bir problem değil. Splunk’taki görev sürem boyunca, bu alanlarda makine öğrenimi (ve derin öğrenme) kullanarak günlük madenciliği, güvenlik analizi vb. konularında araştırma başlattım. Bu çalışmalardan, vektör gömme ve vektör aramasının bu alanlara yönelik yeni yaklaşımlar için temel bir ilke olacağını fark ettim.
Bize vektör araması nedir, açıklar mısınız?
Geleneksel aramada (diğer adıyla anahtar kelime araması), bir sorgu ve belgeler arasında anahtar kelime eşleştirmeleri ararsınız (bu, tweet’ler, web belgeleri, yasal belgeler olabilir). Bunu yapmak için, sorgunuzu tokenlerine ayırır, verilen tokeni içeren belgeleri alırsınız ve birleştirmek ve sıralamak için en ilgili belgeleri belirlersiniz.
Tabii ki, ana problem, ilgili sonuçlar elde etmek için sorgunuzun belgede anahtar kelime eşleştirmeleri içermesi gerektiğidir. Geleneksel aramanın klasik bir problemi şudur: “pop” ararsanız, “pop müziği” bulursunuz, ancak “soda” ile eşleşmez, çünkü “pop” ve “soda” arasındaki anahtar kelime örtüşmesi yoktur, ancak birçok ABD bölgesinde “pop”, “soda” anlamına gelir.
Vektör aramasında, sorguları ve belgeleri yüksek boyutlu bir uzayda vektörler olarak dönüştürürsünüz. Bu genellikle, metni OpenAI’ın LLM’leri veya diğer dil modelleri gibi derin öğrenme modellerinden geçirerek yapılır. Sonuç olarak, yüksek boyutlu bir uzayda bir dizi kayan nokta sayısını elde edersiniz.
Temel fikir, bu yüksek boyutlu uzaydaki yakın vektörlerin aynı zamanda anlamsal olarak benzer olmasıdır. “Soda” ve “pop” örneğimize geri dönersek, model doğru korpus üzerinde eğitilmişse, “pop” ve “soda”yı anlamsal olarak benzer olarak değerlendirecektir ve karşılık gelen gömme noktaları, gömme uzayında birbirlerine yakın olacaktır. Bu durumda, bir sorgu için yakın belgeleri bulmak, sorgu vektörünün bu yüksek boyutlu uzaydaki en yakın komşularını bulmak sorununa dönüşür.
Vektör veritabanının ne olduğu ve yüksek performanslı vektör arama uygulamalarını nasıl mümkün kıldığı hakkında bilgi verebilir misiniz?
Vektör veritabanı, bu gömme noktalarını (veya vektörleri) depolar, dizinler ve yönetir. Vektör veritabanının çözdüğü ana zorluklar:
- Yakın komşu sorgularını cevaplamak için vektörler üzerinde hiệuICIENT bir arama dizini oluşturmak
- Örneğin, yalnızca korpusun bir alt kümesi üzerinde arama yapmak istiyorsanız, mevcut arama dizinini yeniden oluşturmadan yararlanabilmeniz için yardımcı dizinler ve veri yapıları oluşturmak
Verileri ve arama dizinini güncel, tutarlı, dayanıklı vb. tutmak için hiệuICIENT güncellemeleri destekleyin.
Pinecone’da kullanılan farklı makine öğrenimi algoritmaları nelerdir?
Genel olarak, yaklaşık en yakın komşu arama algoritmaları üzerinde çalışır ve büyük miktarda veri ile verimli bir şekilde güncellemek, sorgulamak ve diğer işlemler için yeni algoritmalar geliştiririz.
Ayrıca, arama alaka düzeyini artırmak için yoğun ve seyrek geri alma birleştiren algoritmalar üzerinde çalışıyoruz.
Ölçeklenebilir arama oluşturmanın arkasındaki zorluklar nelerdir?
Yaklaşık en yakın komşu araması on yıllardır araştırılıyor, ancak bizim görüşümüzce hala keşfedilecek çok şey var.
Özellikle, büyük ölçekli en yakın komşu aramasını maliyet etkin bir şekilde tasarlamak, büyük ölçekte hiệuICIENT filtreleme yapmak veya yüksek hacimli güncellemeleri destekleyen ve genel olarak taze dizinleri destekleyen algoritmalar tasarlamak gibi konularda zorluklar devam etmektedir.
Bu teknolojinin kullanılabileceği farklı kullanım örnekleri nelerdir?
Vektör veritabanlarının kullanım örnekleri spektrumu gün geçtikçe genişliyor. Anlamsal aramadaki kullanımlarının yanı sıra, görüntü araması, görüntü geri çağırma, üretken AI, güvenlik analizi vb. alanlarda da kullanıldığını görüyoruz.
Aramanın geleceği hakkında vizyonunuz nedir?
Sanıyorum ki aramanın geleceği AI tarafından yönlendirilecek ve bu çok uzakta değil. Bu gelecekte, vektör veritabanlarının temel bir ilke olacağını düşünüyorum. Vektör veritabanlarını AI’ın uzun süreli belleği (veya dış bilgi tabanı) olarak düşünüyoruz.
Harika röportaj için teşekkür ederiz, daha fazla bilgi edinmek isteyen okuyucular Pinecone‘u ziyaret edebilir.












