Yapay zeka temelleri

Albumentations Nedir? Bilgisayarlı Görü için Görüntü Artırma

mm
Unite.AI sitesini Google'daki tercih ettiğiniz kaynaklara ekleyin

Albumentations, görüntü artırma için açık kaynaklı bir Python kütüphanesidir. Görüntüyle hizalı kalacak şekilde segmentasyon maskeleri, sınırlayıcı kutular ve anahtar noktalar gibi ilgili hedefleri koruyarak rastgele geometrik ve fotometrik dönüşümler uygular.

Artırma, değişmezlik varsayımıdır: modelin seçilen değişikliklerin görev etiketini değiştirmemesi gerektiğini söyler. Hızlı bir kütüphane deneyleri kolaylaştırır, ancak bir dönüşümün geçerli olup olmadığını yalnızca alan bilgisi ve doğrulama belirleyebilir.

Temel Çıkarımlar

  • Olasılık temelli dönüşümleri, tekrarlanabilir bir eğitim hattına birleştirin.
  • Görüntüleri ve uzamsal hedefleri birlikte dönüştürün; kutu ve anahtar nokta kurallarını açıkça doğrulayın.
  • Rastgele artırmayı sadece eğitim verisine uygulayın, değişmemiş doğrulama veya test dağılımına değil.
  • Sınıf ve alt grup etkilerini ölçün; çünkü daha güçlü artırma bir duruma yardımcı olurken diğerine zarar verebilir.
What Is Albumentations? Image Augmentation for Computer Vision workflow diagram
Her artırma, gerçek görevle eşleşmesi gereken bir değişmezlik varsayımını kodlar.

Albumentations İş Akışı Nasıl Çalışır

Bir iş akışı bir görüntü ve adlandırılmış hedefleri alır, dönüşümleri olasılıklarına göre örnekler ve güncellenmiş çıktıları içeren bir sözlük döndürür. Geometrik dönüşümler kırpma, döndürme, çevirme veya bozulma yapabilir; fotometrik dönüşümler ise renk, kontrast, bulanıklık veya gürültüyü değiştirebilir.

Kütüphane, artırmaya odaklı kalırken eğitim yığınlarıyla bütünleşir. Bilgisayarlı görü için bu ayrım, veri politikalarını model çerçevesinden bağımsız olarak karşılaştırma yapmayı mümkün kılar.

Etiketleri Geometrik Olarak Doğru Tutun

Görüntüyü değiştiren bir kırpma, maskesini de kırpmalı ve etkilenen kutu ve anahtar noktaları güncellemeli ya da kaldırmalıdır. Koordinat formatını, etiket alanlarını, minimum görünürlüğü, kırpma ve filtreleme kurallarını yapılandırın, ardından eğitimden önce toplu görüntüleri görselleştirin.

Ara değerleme hedefe göre değişir: bir görüntü ikili (bilinear) ara değerleme kullanabilir, ancak sınıf maskesi genellikle kategori değerlerini uydurmamak için en yakın komşu ara değerlemesini gerektirir. Hedefin yanlış işlenmesi veri setini sessizce bozabilir.

Dağıtım Dünyasından Dönüşümler Seçin

Yatay çevirme, vahşi yaşam fotoğrafları için geçerli olabilir ancak metin, yol işaretleri, tıbbi lateralite veya asimetrik ekipman için yanlış olur. Renk değişiklikleri aydınlatma dayanıklılığını artırabilir, ancak renk bir anlam taşıdığında tanısal bir özelliği silebilir.

Makul rahatsızlık varyasyonlarıyla başlayın, bir seferde bir aile ekleyin ve zor örnekleri inceleyin. Seçimleri aşırı öğrenme hipotezleriyle ilişkilendirin; daha fazla sentetik çeşitliliğin her zaman daha iyi olduğunu varsaymayın.

Tekrarlanabilirlik ve Değerlendirme

Kütüphane sürümünü, iş akışı yapılandırmasını, olasılıkları, rastgele tohum stratejisini, ön işleme sırasını ve normalleştirmeyi kaydedin. Rastgelelik, eğitim örneklerini çeşitlendirmeli, ancak deneyler çalışma düzeyinde tekrarlanabilir kalmalıdır.

Doğrulama ve test görüntülerini temsil edici ve belirleyici ön işleme dışında artırılmamış tutun. Doğruluk, kalibrasyon, sınıf bazlı hatalar ve dayanıklılığı karşılaştırın. Karışıklık matrisleri, bir artırmanın hatayı azaltmak yerine kaydırdığını ortaya çıkarabilir.

Bileşim, Olasılıklar ve Hedefler

Compose, her biri bir olasılığa sahip bir dizi dönüşüm uygular. OneOf veya SomeOf yapıları alternatifler arasında örnekleme yapar ve iç içe olasılıklar gerçek dağılımı belirler. Etkili artırma politikası bu nedenle bir stokastik programdır; her olasılığı tek tek okumak yerine kaydedin ve örneklenen sıklıkları inceleyin.

Ek hedefler, birden fazla görüntü veya maskenin geometriyi paylaşmasını sağlar; bu, stereo çiftler, ön‑son görüntüler veya çoklu açıklamalar için yararlıdır. Sınırlayıcı kutu desteği, Pascal VOC, COCO, YOLO veya Albumentations koordinatları gibi bildirilen bir format gerektirir. Anahtar nokta formatları açı veya ölçek içerebilir ve dönüşümler bu anlamları korumalıdır.

Kırpmalar tüm hedefleri kaldırabilir. Yeniden örnekleme, arka plan örneği tutma veya filtreleme kararını verin; çünkü her seçim sınıf dağılımını değiştirir. Algılama ve segmentasyon iş akışları, atılan kutuları, görünen oranları ve boş örnekleri kaydederek sessiz etiket hasarını ortaya çıkarmalıdır.

Göreve Göre Politika Tasarımı

Sınıflandırma, sınıf görünür olduğu sürece kırpma, renk değişikliği, bulanıklık ve örtüşmeyi genellikle tolere eder. Algılama, nesneler ve kutuların birlikte dönüştürülmesini gerektirir. Segmentasyon, maskenin tam geometrisini ister. Poz tahmini, anahtar noktaları korumalı ve çevirme sonrası sol‑sağ etiket değişimlerine ihtiyaç duyabilir.

Tıbbi görüntüleme, çevirileri, agresif renk değişikliklerini veya nicel yoğunluğu değiştiren ara değerlemeyi yasaklayabilir. Uzaktan algılama, yönelim, mevsim, sensör bantları ve coğrafi ölçeği göz önünde bulundurmalıdır. Belge analizi, okunabilirliği ve düzeni korumalıdır. Alan, değişmezliği tanımlar; kütüphane sadece uygular.

MixUp, CutMix, Mosaic veya kopyala‑yapıştır gibi karıştırma yöntemleri birleşik etiketler oluşturur ve Albumentations yerine veri yükleyici ya da çerçevede gerçekleşebilir. Temel dönüşümler, normalleştirme ve toplu işleme ile etkileşimleri test edilmelidir. Güçlü politikalar, nihai doğruluk artarken bile yakınsama hızını yavaşlatabilir veya kalibrasyonu değiştirebilir.

Performans, Hata Ayıklama ve Deney Tasarımı

Artırma, farklı bir yol kullanılmadıkça CPU üzerinde çalışır. Veri yükleyici verimliliğini, işçi sayısını, çözümleme maliyetini, bellek kopyalarını ve GPU boşta kalma süresini ölçün. Daha hızlı dönüşümler, anlamı değiştirmedikleri sürece değerlidir. Depolama ve tekrarlanabilirlik izin veriyorsa değişmez çözümleme veya ön işleme aşamaları önbelleğe alın.

Orijinal ve dönüştürülmüş örneklerin her hedefin üst üste bindirildiği ızgaralarını görselleştirin. Koordinat dönüşleri, maske değerleri, şekil, veri tipi ve belirleyici yeniden oynatma için otomatik testler ekleyin. Tohumları doğru kapsamda ayarlayın; tüm işçilerde aynı artırma, çeşitliliği istem dışı azaltabilir.

Sabit bir temel: artırma yok, makul temel dönüşümler, ardından daha güçlü politikalar karşısında ayrıştırma testleri yapın. Tohumları tekrarlayın ve varyansı raporlayın. Temiz veri, ilgili bozulmalar ve alt grupları ayrı ayrı değerlendirin. Bir politikayı, faydası tutma testlerini geçtikçe ve dönüştürülmüş görüntüler alan uzmanları için güvenilir kaldıkça tutun.

Albumentations İş Akışını Tasarlama ve Doğrulama

Dağıtımdan sonra beklenen varyasyonlardan başlayın: kamera açısı, kırpma, ölçek, aydınlatma, sıkıştırma, bulanıklık, hava koşulları, örtüşme ve sensör gürültüsü. Etiketi koruyan ve bu mekanizmalarla eşleşen dönüşümleri seçin. Yatay çevirme hayvanlar için geçerli olabilir ancak metin, trafik yönü veya asimetrik anatomi için geçersizdir. Güçlü renk değişiklikleri, görüntü hâlâ makul görünse bile tanısal açıdan önemli bilgileri yok edebilir.

Albumentations, dönüşümleri birleştirir ve doğru yapılandırıldığında görüntülere, maskelere, sınırlayıcı kutulara ve anahtar noktalara uzamsal değişiklikleri tutarlı bir şekilde uygular. Koordinat formatlarını, minimum görünürlüğü, ara değerleme ve maske işleme yöntemlerini açıkça belirtin. Yüzlerce artırılmış örneği açıklamalarla üst üste bindirerek görselleştirin, boş ve sınır durumlarını test edin ve hata ayıklama için rastgele parametreleri kaydedin. Artırmadan önce veriyi konu ya da sahne bazında bölün, böylece ilgili görüntüler eğitim ve test arasında sızmaz.

Artırma olmayan, basit artırma ve önerilen politikayı dokunulmamış bir test seti ve gerçekçi stres setlerinde karşılaştırın. Sadece eğitim kaybını değil, sınıfa özgü doğruluk, konumlandırma, kalibrasyon ve hata örneklerini izleyin. Aşırı artırma gerçek dağılımı yetersiz öğrenmeye (underfit) yol açabilir, zayıf artırma ise kestirme öğrenmeyi teşvik edebilir. İş akışını modelle, tohumlu değerlendirme çalışmalarıyla sürümleyin ve doğrulama ya da çıkarım sırasında rastgele eğitim dönüşümlerini uygulamaktan kaçının; test zamanında artırma kasıtlı olarak değerlendirilmedikçe.

Algılama ve segmentasyon için koordinat kırpmasını, minimum kutu alanını, anahtar nokta görünürlüğünü ve kategorik maskeler için kullanılan ara değerlemeyi doğrulayın. Sınıf kimlikleri genellikle en yakın komşu ara değerlemesini gerektirirken, ikili ara değerleme geçersiz etiketler oluşturabilir. Veri yükleyiciyi de profilleyin: agresif dönüşümler CPU artırmasını eğitim darboğazı haline getirebilir. Yalnızca belirleyici ve epochlar ve işçiler arasında istenen rastgeleliği koruyan dönüşümleri önbelleğe alın.

Pratik Uygulama Kontrol Listesi

Kavramı sınırlı, test edilebilir bir iş akışına dönüştürün: örnek yükle → seç → dönüştür → hedefleri hizala → eğit → doğrula. Sorumlu bir sahibi adlandırın, veriyi ve bağımlılıkları belgeleyin, basit bir temel oluşturun, kabul ve durdurma kriterlerini belirleyin, temsilci hataları test edin ve kapsamı genişletmeden önce izleme, geri alma ve inceleme tanımlayın. Sürümleri ve varsayımları kaydedin, böylece başka bir ekip sonucu yeniden üretebilir ve neyin değiştiğini anlayabilir.

Başlamadan önce, sistemi inşa eden, işleten, güvenliğini sağlayan ve etkileyen kişilerle belgelenmiş bir hazırlık incelemesi yürütün. Normal durumları, sınır koşullarını, bağımlılık hatalarını ve yanlış kullanımları test edin; kanıtları ve çözülmemiş riskleri koruyun. Kimin sürümü onaylayabileceğini, eşik değiştirebileceğini, çıktıyı geçersiz kılabileceğini veya operasyonu durdurabileceğini tanımlayın. Gerçek dünya verileri geldikçe kararı yeniden gözden geçirin; çünkü teknik olarak başarılı bir pilot, daha geniş ölçekte güvenilir performansı garanti etmez.

  • IMAGE: geometri, renk, bulanıklık ve gürültü.
  • TARGETS: maskeler, kutular, anahtar noktalar ve etiketler.
  • EVIDENCE: görsel QA ve tutulan değerlendirme.

Sıkça Sorulan Sorular

Görüntü artırma yeni gerçek etiket oluşturur mu?

Hayır. Etiketlerin geçerli kalacağı varsayımı altında dönüştürülmüş eğitim örnekleri oluşturur. Gerçekçi olmayan veya yanlış etiketlenmiş bir dönüşüm gürültü ekler.

Doğrulama görüntüleri artırılmalı mı?

Modelin gerektirdiği belirleyici yeniden boyutlandırma ve normalleştirmeyi kullanın, ancak değerlendirme dağılımını sabit tutun. Test zamanında artırma ayrı bir çıkarım yöntemi olup açıkça raporlanmalıdır.

Ana Referanslar

Antoine, Unite.AI'nin vizyoner lideri ve kurucu ortağı, AI ve robotik geleceğini şekillendirmeye ve tanıtmaya yönelik sarsılmaz bir tutkuya sahiptir. Bir seri girişimci olarak, AI'nin toplum için elektrik kadar yıkıcı olacağına inanmaktadır ve sık sık yıkıcı teknolojiler ve AGI'nin potansiyeli hakkında konuşmaktadır.

Bir gelecekçi olarak, bu yeniliklerin dünyamızı nasıl şekillendireceğini keşfetmeye adanmıştır. Ayrıca, Securities.io kurucusudur, bu platform geleceği yeniden tanımlayan ve tüm sektörleri yeniden şekillendiren teknolojilere yatırım yapmayı hedeflemektedir.