Düşünce Liderleri
Makine Öğrenimi İçin İnsan Veri Hazırlama Kaynak Yoğundur: Bu İki Yaklaşım Maliyetleri Azaltmak İçin Kritiktir

By: Dattaraj Rao, Baş Veri Bilimcisi, Persistent Systems
Herhangi bir sistem gibi, veri girişlerine bağlı olan Makine Öğrenimi (ML), “çöp içe, çöp dışarı” aksiyomuna tabidir. Temiz ve doğru şekilde etiketlenmiş veri, herhangi bir ML modeli oluşturmanın temelidir. Bir ML eğitim algoritması, temel gerçek verilerden desenleri anlar ve ondan sonra görülmeyen verilerde genelleme yollarını öğrenir. Eğer eğitim verinizin kalitesi düşükse, o zaman ML algoritmasının sürekli öğrenmesi ve çıkarsaması çok zor olacaktır.
Bunu, bir evcil hayvanı eğitmek gibi düşünün. Eğer temel davranış komutlarını (girişleri) doğru ve eksiksiz bir şekilde vermez veya yanlış verirseniz, köpeğin öğrenmesi ve gözlem yoluyla daha karmaşık olumlu davranışlara geçmesini bekleyemezsiniz, çünkü temel girişler baştan beri eksik veya hatalıdır. Doğru eğitim zaman alıcı ve uzman getirildiğinde maliyetli olabilir, ancak baştan doğru yaparsanız, ödül büyüktür.
ML modeli eğitirken, kaliteli veri oluşturmak için bir domaine uzmanın veri etiketlemesi için zaman harcaması gerekir. Bu, bir görüntüde istenen nesneyi seçmek veya bir metin girişi veya veritabanı kaydına etiket eklemek olabilir. Özellikle yapılandırılmamış veriler gibi görüntüler, videolar ve metinler için, etiketleme kalitesi model kalitesini belirlemede önemli bir rol oynar. Genellikle, etiketsiz veriler gibi ham görüntüler ve metinler boldur, ancak etiketleme, çaba gösterilmesi gereken yerdir. Bu, ML yaşam döngüsünün insan-içinde-çark bölümüdür ve genellikle herhangi bir ML projesinin en pahalı ve emek yoğun kısmıdır.
Veri etiketleme araçları gibi Prodigy, Amazon Sagemaker Ground Truth, NVIDIA RAPIDS ve DataRobot insan-içinde-çark sürekli olarak iyileştiriliyor ve domaine uzmanları için sezgisel arayüzler sunuyor. Ancak, domaine uzmanlarının veri etiketlemesi için gereken zamanı en aza indirmek, bugün şirketler için önemli bir zorluktur – özellikle veri biliminde yetenek sınırlı ve yüksek talep olduğunda. İşte bu noktada, veri hazırlamaya yönelik iki yeni yaklaşım devreye giriyor.
Etkin Öğrenme
Etkin öğrenme, bir ML modelinin domaine uzmanından belirli etiketler için aktif olarak sorgulama yaptığı bir yöntemdir. Burada, odak noktası, etiketsiz verilerin tamamını etiketlemek değil, sadece modelin daha iyi öğrenmesi için doğru veri noktalarını etiketlemektir. Örneğin, sağlık ve yaşam bilimleri, erken kanser teşhisi için klinikçilerin hasta bakımına ilişkin veri temelli kararlar almasına yardımcı olan bir tanı şirketi olsun. Teşhis sürecinin bir parçası olarak, CT tarama görüntülerindeki tümörleri vurgulamak için etiketlemeleri gerekir.
ML modeli, birkaç görüntüdeki tümör bloklarını öğrendikten sonra, etkin öğrenme ile model, yalnızca tümörün varlığından emin olamadığı görüntüler için kullanıcıdan etiketleme isteyecektir. Bunlar, modelin güvenini artıran sınır noktaları olacaktır. Model, belirli bir eşiğin üzerinde güvende olduğunda, kullanıcıdan etiketleme istemek yerine, kendi kendine etiketleme yapacaktır. Etkin öğrenme, böylece doğru modeller oluştururken veri etiketleme için gereken zamanı ve çabayı azaltmaya çalışır. modAL gibi çerçeveler, domaine uzmanlarını en bilgilendirici örnekleri etiketlemeye yönelik olarak akıllıca sorgulayarak sınıflandırma performansını artırabilir.
Zayıf Denetim
Zayıf denetim, gürültülü ve kesin olmayan veri veya soyut kavramların, büyük miktarda denetimsiz veriyi etiketlemek için ipuçları sağlayabileceği bir yaklaşımdır. Bu yaklaşım genellikle zayıf etiketleyicileri kullanır ve bunları bir toplu yaklaşım olarak birleştirmeye çalışır ve kaliteli etiketlenmiş veri oluşturur. Çaba, domaine bilgisini otomatik etiketleme faaliyetine dahil etmeye yöneliktir.
Örneğin, bir İnternet Servis Sağlayıcısı (İSS), spam veya spam olmayan e-posta veri setlerini işaretlemek için bir sistem cầnirse, “teklif”, “tebrikler”, “ücretsiz” gibi genellikle spam e-postalarla ilişkili cümleleri kontrol eden zayıf kurallar yazabiliriz. Diğer kurallar, düzenli ifadelerle aranabilen belirli kaynak adres kalıplarından gelen e-postaları içerebilir. Bu zayıf işlevler, daha sonra Snorkel ve Skweak gibi zayıf denetim çerçevesi tarafından birleştirilerek, geliştirilmiş kaliteli eğitim verisi oluşturulabilir.
ML’nin temelinde, şirketlerin fiziksel olarak دستیmları imkansız şekilde süreçleri üssel olarak ölçeklendirmeğe yardımcı olmak vardır. Ancak ML sihir değildir ve hala modelleri doğru şekilde kurmak ve eğitmek için insanlara ve ihtiyaç duyulduğunda modelin sonuçlarının yararlı ve olumlu olmasını sağlamak için müdahale etmelerine ihtiyaç duyar.
Hedef, insan katılımının bazı kısımlarını akışlaştırmak ve otomatikleştirmek için yollar bulmak, ancak optimal doğruluk sınırlarında kalarak zaman-açık ve sonuçları artırmaktır. Kaliteli etiketlenmiş verilerin, ML projesinin en pahalı ancak çok önemli bir parçası olduğu evrenseldir. Bu, gelişen bir alandır ve domaine uzmanları tarafından harcanan zamanı azaltmak ve veri etiketleme kalitesini iyileştirmek için çok çaba sarf ediliyor. Etkin öğrenme ve zayıf denetimi keşfetmek ve kullanmak, bu hedefe ulaşmak için çeşitli endüstriler ve kullanım durumları için sağlam bir stratejidir.












