Röportajlar
Frank Liu, Zilliz Operasyon Direktörü – Röportaj Serisi

Frank Liu, Zilliz‘in Operasyon Direktörüdür. Zilliz, vektör veritabanı ve yapay zeka teknolojileri alanında önde gelen bir sağlayıcıdır. Ayrıca, dünyanın en popüler açık kaynaklı vektör veritabanı olan LF AI Milvus®’un mühendisleri ve bilim insanlarıdır.
Makine öğrenimi ile ilk olarak nasıl tanıştınız?
Makine öğrenimi ve yapay zeka gücüne ilk olarak Stanford Üniversitesi’nde lisans öğrencisiyken tanıştım. Aslında, elektrik mühendisliği bölümünde okumama rağmen, istatistik ve makine öğrenimi bana çok güçlü gelmişti. Sonrasında, bilgisayar görüşü ve makine öğrenimi dersleri aldım ve yüksek lisans tezimi görüntü estetik güzelliğini puanlamak için makine öğrenimi kullanarak yazdım. Bunların hepsi, ilk işimi Yahoo’da Bilgisayar Görüşü ve Makine Öğrenimi ekibinde almama yol açtı. O zamanlar, AlexNet ve VGG günleriydi ve bir alanda ve endüstride bu kadar hızlı ilerlemeyi görmek gerçekten harikaydı. Bir şekilde, 10 yıldan az bir süre önce olan bir şeyi “o zamanlar” diye adlandırmak biraz saçma geliyor, ancak bu alanda yapılan ilerleme gerçekten böyle.
Yahoo’dan sonra, bir startup’ın kurucu ortağı olarak görev yaptım ve burada makine öğrenimi için iç mekan yer belirleme kullandık. Burada, çok küçük mikrodenetleyiciler için sıralı modelleri optimize etmek gibi farklı bir mühendislik challenge’ı vardı. Ayrıca donanım, görselleştirme panelleri ve basit bulut yerel uygulamalar geliştirdik, ancak yapay zeka ve makine öğrenimi her zaman yaptığımız işin temel bir bileşeni olarak kaldı.
Makine öğrenimi ve yapay zeka ile yaklaşık 7 veya 8 yıl önce tanışmama rağmen, hala devre tasarımı ve dijital mantık tasarımı için çok sevdiğim bir yer var. Elektrik mühendisliği alanında bir geçmişe sahip olmak, günümüzde yaptığım birçok iş için gerçekten çok yardımcı oluyor. Sanal bellek, dal.predictions ve HDL’de paralel yürütme gibi dijital tasarımdaki önemli kavramlar, günümüzde birçok makine öğrenimi ve dağıtılmış sistem için tam bir bakış açısı sağlıyor. Bilgisayar bilimi’nin çekiciliğini anlasam da, geleneksel mühendislik alanlarında – Elektrik Mühendisliği, Makine Mühendisliği, Kimya Mühendisliği vb. – bir veya iki yıl içinde bir canlanma umuyorum.
Tanımayan okuyucular için, yapılandırılmamış veri nedir?
Yapılandırılmamış veri, “karmaşık” veridir ve temel olarak önceden tanımlanmış bir formata veya mevcut bir veri modeline uymayan veridir. Karşılaştırmak için, yapılandırılmış veri, önceden tanımlanmış bir yapıya sahip olan herhangi bir veri türünü ifade eder – numerik veri, dizeler, tablolar, nesneler ve anahtar/değer depoları yapılandırılmış verinin örnekleridir.
Yapılandırılmamış verinin ne olduğu ve neden geleneksel olarak bu tür verilerin hesaplamalı işlenmesinin zor olduğunu gerçekten anlamak için, yapılandırılmış veri ile karşılaştırmak yardımcı olur. En basit haliyle, geleneksel yapılandırılmış veri, bir ilişkisel model aracılığıyla depolanabilir. Bir kitap bilgisi depolamak için bir ilişkisel veritabanındaki bir tablo örneğini düşünün: her satır, belirli bir kitabı ISBN numarası ile temsil edebilirken, sütunlar karşılık gelen bilgi kategorilerini – başlık, yazar, yayın tarihi vb. – belirtir. Günümüzde daha esnek veri modelleri var – geniş sütun depoları, nesne veritabanları, grafik veritabanları vb. – ancak genel fikir aynı kalıyor: bu veritabanları, belirli bir veri kalıbına veya veri modeline uyan verilerin depolanması için tasarlanmıştır.
Yapılandırılmamış veri, temel olarak bir pseudo-rasgele ikili veri bloğu olarak düşünülebilir. Her şeyi temsil edebilir,任意 büyüklükte veya küçüklükte olabilir ve sayısız farklı şekilde dönüştürülüp okunabilir. Bu, onu herhangi bir veri modeline veya bir ilişkisel veritabanındaki bir tabloya sığdırmayı imkansız kılar.
Bu tür verilerin bazı örnekleri nelerdir?
İnsan tarafından oluşturulan veriler – görüntüler, video, ses, doğal dil vb. – yapılandırılmamış verinin harika örnekleridir. Ancak yapılandırılmamış verinin daha az sıradan örnekleri de vardır. Kullanıcı profilleri, protein yapıları, gen dizileri ve hatta insan tarafından okunabilir kod da yapılandırılmamış verinin örnekleridir. Yapılandırılmamış verinin geleneksel olarak bu kadar zor yönetilmesinin ana nedeni, yapılandırılmamış verinin herhangi bir formda olabilmesi ve işlenmek için çok farklı çalışma zamanlarına ihtiyaç duymasıdır.
Görüntüleri örnek olarak kullanarak, aynı sahnenin iki fotoğrafı çok farklı piksel değerlerine sahip olabilir, ancak her ikisi de benzer bir genel içeriğe sahiptir. Doğal dil de yapılandırılmamış verinin başka bir örneğidir. “Elektrik Mühendisliği” ve “Bilgisayar Bilimi” cümleleri çok yakından ilgili – Stanford’daki EE ve CS binaları birbirlerine yakındır – ancak bu cümlelerin arkasındaki anlamsal anlamı kodlayacak bir yol olmadan, bir bilgisayar “Bilgisayar Bilimi” ve “Sosyal Bilim”nin daha ilgili olduğunu düşünebilir.
Vektör veritabanı nedir?
Vektör veritabanını anlamak için önce gömme (embedding) nedir, bunu anlamak gerekir. Bunu birazdan açıklayacağım, ancak kısa versiyonu, bir gömme, yapılandırılmamış verinin anlamsal anlamını temsil edebilen yüksek boyutlu bir vektördür. Genel olarak, birbirlerine yakın olan iki gömme, anlamsal olarak benzer girişe karşılık gelir. Modern makine öğrenimi ile, çeşitli yapılandırılmamış veri türlerini – görüntüler ve metin gibi – anlamsal olarak güçlü gömme vektörlerine dönüştürebiliriz.
Bir organizasyonun bakış açısına göre, yapılandırılmamış veri, belirli bir limite ulaştığında yönetilmesi çok zor hale gelir. İşte burada, Zilliz Cloud gibi bir vektör veritabanı devreye girer. Bir vektör veritabanı, yapılandırılmamış verilerin depolanması, indekslenmesi ve aranması için gömmeleri temel temsil olarak kullanarak tasarlanmıştır. Bir vektör veritabanında arama, sorgu vektörleri ile yapılır ve sonuç, mesafe temelinde en benzer üst N sonuçtur.
En iyi vektör veritabanları, geleneksel ilişkisel veritabanlarının birçok kullanılabilirlik özelliğine sahiptir: yatay ölçeklendirme, önbelleğe alma, çoğaltma, yük devretme ve sorgu yürütme, bir vektör veritabanının uygulaması gereken birçok özelliktir. Kategori tanımlayıcı olarak, akademik çevrelerde de aktif olduk ve SIGMOD 2021 ve VLDB 2022 gibi en iyi veritabanı konferanslarında makaleler yayınladık.
Gömmenin ne olduğu hakkında konuşabilir misiniz?
Genel olarak, bir gömme, çok katmanlı bir sinir ağındaki ara bir katmandan gelen aktivasyonlardan oluşan yüksek boyutlu bir vektördür. Çoğu sinir ağı, gömmeleri kendileri olarak çıktı olarak verir ve bazı uygulamalar, birden fazla ara katmandan vektörlerin birleştirilmesini kullanır, ancak şimdi bunları derinlemesine anlatmayacağım. Bir gömme üretmenin başka bir menos ortak ancak eşit derecede önemli yolu, el ile oluşturulmuş özelliklerdir. Bir makine öğrenimi modelinin, girişe doğru temsilleri otomatik olarak öğrenmesi yerine, iyi eski özellik mühendisliği birçok uygulama için de çalışabilir. Her durumda, anlamsal olarak benzer nesnelerin gömmeleri, mesafe açısından birbirlerine yakındır ve bu özellik, vektör veritabanlarını çalıştırır.
Bu teknoloji ile popüler kullanım örnekleri nelerdir?
Vektör veritabanları, anlamsal arama gerektiren herhangi bir uygulama için uygundur – ürün önerisi, video analizi, belge arama, tehdit ve dolandırıcılık algılama ve yapay zeka tabanlı sohbet botları, vektör veritabanlarının günümüzde en popüler kullanım örnekleridir. Bunu açıklamak için, Milvus, Zilliz tarafından oluşturulan ve Zilliz Cloud’un temelini oluşturan açık kaynaklı vektör veritabanı, binlerce kurumsal kullanıcı tarafından çeşitli kullanım örneklerinde kullanılmıştır.
Bu uygulamaları konuşmaktan her zaman memnuniyet duyarım ve insanlara nasıl çalıştıklarını anlamalarına yardımcı olurum, ancak aynı zamanda vektör veritabanlarının daha az bilinen kullanım örneklerini de konuşmaktan çok keyif alırım. Yeni ilaç keşfi, favori “niş” vektör veritabanı kullanım örneklerimden biridir. Bu uygulamanın challenge’ı, belirli bir hastalığa veya semptoma karşı potansiyel aday ilaçları aramak için 800 milyonluk bir bileşik veritabanında aramaktır. İletişim kurduğumuz bir ilaç şirketi, Milvus’u bir kimya kütüphanesi olan RDKit ile birleştirerek, ilaç keşif sürecini önemli ölçüde iyileştirebildi ve donanım kaynaklarını azalttı.
Cleveland Museum of Art’ın (CMA) AI ArtLens başka bir örnektir. AI ArtLens, bir sorgu görüntüsünü girdi olarak alır ve müzenin veritabanından görsel olarak benzer görüntüleri çeker. Bu, ters görüntü araması olarak bilinir ve vektör veritabanlarının oldukça yaygın bir kullanım örneğidir, ancak Milvus’un CMA’ya sağladığı benzersiz değer önerisi, uygulamayı sadece bir hafta içinde küçük bir ekip ile çalışır duruma getirmesiydi.
Açık kaynaklı platform Towhee hakkında konuşabilir misiniz?
Milvus topluluğu ile iletişim kurarken, birçok kişinin Milvus için gömmeleri birleştirmek için birleşik bir yol istediğini gördük. Bu, özellikle makine öğrenimi mühendislerine sahip olmayan şirketler için geçerliydi. Towhee ile, “vektör veri ETL” dediğimiz şeyi çözmeyi amaçlıyoruz. Geleneksel ETL boru hatları, yapılandırılmış verilerin birden fazla kaynaktan birleştirilip dönüştürülmesini odaklansa da, Towhee yapılandırılmamış veri ile çalışmak üzere tasarlanmıştır ve sonuçta oluşan ETL boru hattına makine öğrenimini de dahil eder. Towhee, vektör veri ETL boru hattının yapı taşları olarak kullanılan yüzlerce model, algoritma ve dönüşümü sağlar. Buna ek olarak, Towhee, geliştiricilerin bu ETL boru hatlarını tek bir satır kod ile oluşturup test etmelerini sağlayan kolayca kullanılabilen bir Python API’si sunar.
Towhee, bağımsız bir proje olmakla birlikte, Zilliz’in oluşturduğu daha geniş vektör veritabanı ekosisteminin bir parçasıdır ve Milvus etrafında merkezlenmiştir. Milvus ve Towhee’nin, birlikte kullanıldığında yapılandırılmamış veri işlemenin gerçekten demokratikleşmesini sağlayacak iki tamamlayıcı proje olduğunu hayal ediyoruz.
Zilliz最近 bir $60M Series B turu raised. Bu, Zilliz misyonunu nasıl hızlandırır?
Öncelikle, Prosperity7 Ventures, Pavilion Capital, Hillhouse Capital, 5Y Capital, Yunqi Capital ve diğerlerine Zilliz’in misyonuna inanmaları ve bu Series B uzantısı ile bizi desteklemeleri için teşekkür ederim. Şimdiye kadar toplam $113M topladık ve bu son tur fon, mühendislik ve pazara çıkarma ekiplerimizi ölçeklendirmemize yardımcı olacaktır. Özellikle, şu anda erken erişimde olan ancak bu yıl sonuna kadar herkes için açılacağı planlanan yönetilen bulut teklifimizi geliştireceğiz. Ayrıca, geçmişteki 4 yıl gibi, veritabanı ve yapay zeka araştırmalarına yatırım yapmaya devam edeceğiz.
Zilliz hakkında paylaşmak istediğiniz başka bir şey var mı?
Şirket olarak hızla büyüyoruz, ancak bizim şu anki ekibimizi diğerlerinden ayıran, yaptığımız şey için gerçekten tutkulu olmamızdır. Yapılandırılmamış veri işlemenin demokratikleşmesi misyonundayız ve bu singular hedefe doğru çalışan yetenekli birçok insanın Zilliz’de çalışmasını görmek gerçekten harika. Bizim yaptığımız şey size ilginç geliyorsa, bizimle iletişime geçmekten çekinmeyin. Sizinle çalışmaktan memnuniyet duyarız.
Eğer daha fazla bilgi almak istiyorsanız, ben de Zilliz, vektör veritabanları veya yapay zeka ve makine öğrenimi ile ilgili gelişmeler hakkında konuşmaktan her zaman memnuniyet duyarım. Sanal olarak kapım her zaman açık, beni Twitter veya LinkedIn üzerinden doğrudan bana ulaşmaktan çekinmeyin.
Son olarak, okuduğunuz için teşekkür ederim!
Teşekkür ederiz harika röportaj için, daha fazla bilgi öğrenmek isteyen okuyucular Zilliz‘i ziyaret edebilir.












