Röportajlar
Alex Ratner, Snorkel AI’nin CEO’su ve Kurucu Ortağı – Röportaj Serisi

Alex Ratner, Snorkel AI şirketinin CEO’su ve kurucu ortağıdır. Bu şirket, Stanford AI laboratuvarından doğmuştur.
Snorkel AI yapay zeka geliştirmeyi hızlı ve pratik hale getirerek manuel yapay zeka geliştirme süreçlerini programatik çözümlere dönüştürür. Snorkel AI, şirketlere benzersiz iş yükleri için çalışan yapay zeka geliştirmelerine olanak tanır ve bu süreci 10-100 kat daha hızlı hale getirir.
Bilgisayara ilk olarak neler sizi çekti?
Gençken bilgisayarın iki heyecan verici yönü vardır. Birincisi, öğretmenden beklemek zorunda kalmadan istediğin hızda öğrenmen ve inşa etmen mümkündür, çünkü anlık geri bildirim alırsın. İkincisi, kimseden izin almadan çok şey inşa edebilirsin!
Ben gençken bu nedenlerle programlamaya başladım. Ayrıca gerekli olan kesinliği sevdim. Karmaşık süreçleri ve rutinleri soyutlamak ve bunları modüler bir şekilde kodlamak hoşuma gitti.
Daha sonra, yetişkin olarak, bir danışmanlık işinde patent korpusunun temel analizlerini yazmakla görevlendirildim ve bu reasonla profesyonel olarak bilgisayar bilimine geri döndüm. İnsanların patent olarak kabul ettiği her şeyin kolayca erişilebilir olmasına rağmen, basit analizleri bile yapmak için çok zor olduğu için erişilemez olduğunu gördüm.
Bu, beni tekrar bilgisayar bilimine yöneltti ve sonunda Stanford’da yüksek lisans eğitimime yöneltti, burada NLP (Doğal Dil İşleme) alanında uzmanlaştım.
Stanford’dayken Snorkel açık kaynak projesini başlattınız ve yönettiniz, bu早期 günlerin hikayesini anlatır mısınız?
O zamanlar endüstrinin çoğunda olduğu gibi, yeni algoritmalar geliştirmeye ve -yani tüm “gelişmiş” makine öğrenimi şeylerine- odaklandık.
Ancak, her zaman gerçek dünya sorunlarına odaklanmaya kararlıydık -çoğunlukla Stanford’daki doktorlar ve bilim insanlarıyla birlikte-. Ancak her yeni model veya algoritma sunduğumuzda, cevap “tabii ki, deneyeceğiz, ancak bunu yapmak için zamanımız olmayan tüm bu etiketli eğitim verilerini ihtiyacımız var!” oluyordu.
Etiketli eğitim verilerini oluşturma ve düzenleme sürecinin büyük ve konuşulmayan bir problem olduğunu gördük, bu nedenle tüm odak noktamızı buna yönelttik ve bu da Snorkel projesi ve “veri odaklı AI” fikrinin başlangıcına işaret etti.
Snorkel, veri odaklı bir AI yaklaşımına sahiptir, bu nedir ve model odaklı AI geliştirmesinden nasıl farklıdır?
Veri odaklı AI, daha iyi veri oluşturarak daha iyi modeller oluşturmayı hedefler.
Bu, model odaklı AI’ye zıttır, ancak onunla birlikte çalışır. Model odaklı AI’de, veri bilimcileri veya araştırmacılar verilerin statik olduğunu varsayar ve enerjilerini model mimarilerini ve parametrelerini ayarlayarak daha iyi sonuçlar elde etmeye odaklarlar.
Araştırmacılar hala model odaklı AI’de harika işler yapıyorlar, ancak hazır modeller ve otomatik ML teknikleri o kadar gelişti ki, model seçimi üretim zamanında ticarileştirildi. Bu durumda, bu modelleri iyileştirmenin en iyi yolu onlara daha iyi ve daha fazla veri sağlamaktır.
Veri odaklı AI yaklaşımının temel ilkeleri nelerdir?
Veri odaklı AI’nin temel ilkesi basittir: daha iyi veri, daha iyi modeller oluşturur.
Akademik çalışmalarımızda buna “veri programlama” adını verdik. Fikir, yeterli örnek girdi ve beklenen çıktılar vererek, modelin bu kalıpları çoğaltmasını sağlamaktır.
Bu, beklenenden daha büyük bir zorluk sunar. Verilerin büyük çoğunluğu etiketsizdir veya en azından uygulamanız için yararlı etiketleri yoktur. Verileri elle etiketlemek monotonluk, zaman ve insan çabası gerektirir.
Etiketli bir veri kümesine sahip olmak, kalite garantisi vermez. İnsan hatası her yerde ortaya çıkabilir. Her yanlış örnek, nihai modelin performansını bozar. Parametre ayarlamayla bu gerçeği gizlemek mümkün değildir. Araştırmacılar, açık kaynaklı veri kümelerinde bile yanlış etiketlenmiş kayıtlar bulmuşlardır.
Veri odaklı AI’nin programatik olduğu anlamına gelen şeyi açıklar mısınız?
Verileri elle etiketlemek ciddi zorluklar sunar. Buna çok insan saati gerekir ve bu saatler bazen pahalı olabilir. Örneğin, tıbbi belgeler sadece doktorlar tarafından etiketlenebilir.
Ek olarak, elle etiketleme sıklıkla tek kullanımlık projelere dönüşür. Etiketleyiciler, katı bir şema göre verileri etiketler. Bir şirketin ihtiyaçları değişirse ve farklı bir etiket seti gerektirirse, etiketleyiciler yeniden başlamalıdır.
Veri odaklı AI’ye programatik yaklaşımlar bu sorunları en aza indirir. Snorkel AI’nin programatik etiketleme sistemi, miras alınan modellerden, mevcut etiketlerden ve dış bilgi tabanlarından çeşitli sinyalleri entegre eder ve büyük ölçekte olasılıksal etiketler geliştirir. Başlıca sinyal kaynağımız, veri bilimcilerle işbirliği yapan konu uzmanlarıdır. Bunlar, uzman yargılarını ölçeklenebilir kurallara dönüştürerek, bir kararın etkisini onlarca veya yüzlerce veri noktasına yayabilir.
Bu çerçeve aynı zamanda esnektir. İş ihtiyaçları değiştiğinde, kullanıcılar yeni etiketler uygulamak için etiketleme fonksiyonlarını ekler, kaldırır veya ayarlar, böylece günler yerine saatlerde yeni etiketler uygulayabilir.
Bu veri odaklı yaklaşım, etiketsiz verilerin hızlı ölçeklenmesini nasıl sağlar?
Programatik veri odaklı AI yaklaşımımız, etiketsiz verilerin hızlı ölçeklenmesini, her seçimin etkisini artırarak sağlar. Konu uzmanları, veri bilimcilerle işbirliği yaparak hızlı bir şekilde küçük bir temel gerçek kümesi oluşturur, etiketleme fonksiyonlarını tanımlar, hızlı bir model eğitir, etiketleme fonksiyonlarının etkisini analiz eder ve sonra etiketleme fonksiyonlarını gerektiği gibi ekler, kaldırır veya ayarlar.
Her döngü, model performansını projenin hedeflerine ulaşana veya aşana kadar iyileştirir. Bu, aylarca süren veri etiketleme işini sadece birkaç saate indirgeyebilir. Bir Snorkel araştırma projesinde, iki araştırmamız bir günde 20.000 belgeyi etiketledi – bu, elle etiketleyenlerin 10 hafta veya daha uzun sürebileceği bir hacimdir.
Snorkel, Snorkel Flow, Snorkel GenGlow ve Snorkel Foundry dahil olmak üzere birden fazla AI çözümü sunar. Bu teklifler arasındaki farklar nelerdir?
Snorkel AI paketi, kullanıcıların etiketleme fonksiyonları oluşturmasına (örneğin, belgelerde anahtar kelimeler veya kalıplar arama) ve dakikalar içinde milyonlarca veri noktasını programatik olarak etiketlemesine olanak tanır, böylece elle tek tek veri noktalarını etiketlemek yerine.
Bu, şirketlerin özel verilerini üretim için hazır modellere dönüştürme ve bunlardan değer elde etme süresini sıkıştırır. Snorkel AI, şirketlerin insan merkezli yaklaşımları ölçeklenebilir bir şekilde uygulamasını sağlar ve insan yargısı ile konu uzmanlığı bilgisini verimli bir şekilde entegre eder.
Bu, daha şeffaf ve açıklanabilir AI’ye yol açar ve şirketlerin önyargıları yönetmesine ve sorumlu sonuçlar elde etmesine olanak tanır.
Özetle, Snorkel AI, Fortune 500 şirketlerine:
- Modelleri eğitmek veya RAG’yi geliştirmek için yüksek kaliteli etiketli veri oluşturmayı
- İyi ayarlanmış LLM’leri özelleştirmeyi
- LLM’leri daha küçük ve daha ucuz çalıştırmak için özelleştirilmiş modellere dönüştürmeyi
- Ön eğitim ile alan ve görev özgüllüğü olan LLM’leri oluşturmayı
Yazdığınız bazı önemli makaleler var, sizin görüşünüze göre en önemli makaleniz hangisi?
Anahtar bir makale, veri programlama (eğitim verilerini programatik olarak etiketleme) ve Snorkel üzerine olan makaleydi.
Snorkel’in geleceği için vizyonunuz nedir?
Snorkel’in, AI ile ciddi olarak ilgilenen tüm büyük şirketler için güvenilir bir ortak haline gelmesini hayal ediyorum.
Snorkel Flow, büyük şirketlerin veri bilimcileri için bir standart araç olmalıdır – ister şirketler için özel büyük dil modellerini ince ayarlıyor olsunlar, ister görüntü sınıflandırma modelleri oluşturuyor olsunlar, ister basit ve dağıtabilir lojistik regresyon modelleri oluşturuyor olsunlar.
Şirketlerin hangi tür modellere ihtiyacı olursa olsun, bunları eğitmek için yüksek kaliteli etiketli verilere ihtiyaçları olacaktır.
Harika bir röportaj için teşekkür ederiz, daha fazla bilgi edinmek isteyen okuyucular Snorkel AI‘yi ziyaret edebilir,












