Yapay zeka temelleri

Görüntü Sınıflandırması Nasıl Çalışır?

mm
Unite.AI sitesini Google'daki tercih ettiğiniz kaynaklara ekleyin

Görüntü sınıflandırması bütün bir görüntüye bir etiket tahmin eder. “Hangi ürün kategorisi gösteriliyor?” ya da “Bu tarama hedef bir bulgu içeriyor mu?” gibi soruları yanıtlar. Ancak nesneleri tek tek konumlandırmaz ya da piksellerini sınırlandırmaz.

Modern sistemler genellikle önceden eğitilmiş ağırlıklarla başlatılan konvolüsyonel sinir ağları veya görsel dönüştürücüler (vision transformers) kullanır. Güvenilir performans hâlâ etiketler, örnekleme, veri artırma, kalibrasyon ve gerçek dağıtım koşullarında test etmeye bağlıdır.

Temel Çıkarımlar

  • Sınıflandırma tüm görüntüyü etiketler; tespit nesne kutuları çizer ve segmentasyon piksel seviyesinde bölgeler atar.
  • Ön‑eğitim ve aktarım öğrenmesi veri gereksinimlerini azaltabilir, ancak alan uyumsuzluğu bu faydayı ortadan kaldırabilir.
  • Genel doğruluk, sınıf dengesizliğini, sahte kestirme yolları ve yetersiz kalibrasyonu gizleyebilir.
  • Görüntü kalitesi, yakalama cihazı, coğrafya ve iş akışı değişiklikleri dağılım kaymasına neden olabilir.
How Does Image Classification Work? diagram showing image, preprocess, backbone, logits, probabilities, validate
Dağıtıma hazır bir sınıflandırıcı belirsizlik yönetimi ve alan kayması testlerini içerir.

Pikselden Skora

Görüntüler yeniden boyutlandırılır veya kırpılır, normalize edilir ve tensörlere dönüştürülür. Veri artırma, çevirme, kırpma veya renk değişikliği gibi etiket koruyan dönüşümler uygulayabilir. Bir temel ağ (backbone) pikselleri özelliklere dönüştürür; sınıflandırma başlığı (head) logitler üretir ve bunlar göreceli sınıf skorlarına dönüştürülür.

Seçilen ön‑işleme, dağıtım ile uyumlu olmalıdır. İlgili nesneyi kaldıran bir merkez kırpma veya normalizasyon uyumsuzluğu, eğitilmiş ağırlıklar değişmemiş olsa bile performansı bozabilir.

CNN’ler ve Görsel Dönüştürücüler

Konvolüsyonel sinir ağları yerel filtreler ve paylaşılan ağırlıklar kullanarak uzaysal özellikler oluşturur. Artık bağlantılar (residual connections), çok derin CNN’lerin optimize edilmesini kolaylaştırdı. Görsel dönüştürücüler (vision transformers) bir görüntüyü parçacıklara (patches) ayırır ve bunlar arasındaki ilişkileri modellemek için dikkat (attention) mekanizması kullanır.

Mimari karşılaştırmaları, eğitim verisi, artırma, hesaplama gücü ve çözünürlük açısından kontrol altında tutulmalıdır. Kamuya açık bir benchmark’ta en iyi model, kenar cihazı, küçük veri seti veya açıklanabilirlik gereksinimi için en uygun model olmayabilir.

Aktarım Öğrenmesi ve Veri Tasarımı

Aktarım öğrenmesi, daha büyük bir kaynak veri seti üzerinde eğitilmiş ağırlıklarla başlar. Bir ekip temel ağı dondurabilir, sonraki katmanları ince ayar yapabilir veya tüm modeli güncelleyebilir. İnce ayar genellikle daha düşük bir öğrenme oranı ve sızıntıya (leakage) dayanıklı bir doğrulama seti gerektirir.

Etiketler, görsel olarak çıkarılabilir olanı tanımlamalıdır. Tanı, görüntüde bulunmayan hasta geçmişine bağlıysa, sınıflandırıcı tam klinik kararı öğrenemez. Kopyalar, aynı videodan alınan kareler ve aynı denekten alınan görüntüler aynı bölünmede (split) kalmalıdır.

Metrikler, Belirsizlik ve Kestirme Yollar

Top‑1 doğruluk, en yüksek skorlu sınıfın doğru olmasını gerektirir; top‑k doğruluk, doğru sınıfın k en yüksek skoru içinde olmasını kabul eder. Sınıf bazında kesinlik, duyarlılık ve bir karışıklık matrisi dengesiz hataları ortaya çıkarır.

Modeller, amaçlanan nesne yerine arka planları, filigranları, edinim ekipmanını veya çerçeveyi kullanabilir. Karşı‑olay (counterfactual) testler, alt‑grup analizi ve önem haritaları (saliency tools) kestirme yolları keşfetmeye yardımcı olabilir, ancak bir açıklama ısı haritası nedensel akıl yürütmenin kanıtı değildir.

Dağıtım İzleme

Üretim kontrolleri bozuk dosyalar, beklenmeyen boyutlar, bulanıklık, aydınlatma, kamera modelleri ve yeni sınıfları kapsamalıdır. Güven (confidence) dağıtıma benzer verilerle kalibre edilmeli ve kapsam dışı girdiler reddedilmeli ya da incelenmelidir.

Gecikmiş etiketlerin ve hata maliyetindeki değişikliklerin izlenmesi esastır. Girdi istatistiklerine göre istikrarlı görünen bir model, pikseller ile etiketler arasındaki ilişki değişirse yine de başarısız olabilir.

Görüntü Sınıflandırma Veri Seti Oluşturma

Görüntü sınıflandırması, bütün bir görüntüye bir veya daha fazla etiket atar. Nesneleri konumlandıran tespitten ve pikselleri etiketleyen segmentasyondan farklıdır. Sınıf kapsamını, hiyerarşiyi, çok‑etiket kurallarını, arka plan veya bilinmeyen kategorileri ve hangi kanıtların görünür olması gerektiğini tanımlayın. Dağıtıma temsil edebilecek kamera, konum, aydınlatma, bakış açıları, mesafeler ve konuları toplayın. Artırmadan önce konuyu, sahneyi, oturumu veya kaynağı temel alarak bölün; bitişik video kareleri veya bölümler arasında kopyalanmış ürün görüntüleri ciddi sızıntıya yol açar.

Etiketleme talimatları, örtüşme, belirsiz nesneler, çoklu sınıflar, düşük kalite ve vazgeçme durumlarını kapsamalıdır. Anlaşmayı ölçün ve sistematik anlaşmazlıkları gözden geçirin. Sınıf dengesi tek başına kapsama garantilemez: bir hastalık sınıfı tek bir cihazı, bir yaban hayatı sınıfı ise tek bir arka planı içerebilir. Üst veri (metadata) ve yakın kopyaları inceleyin ve bağımsız bir edinimden korumalı bir test seti tutun. Sentetik veri ve web kazıma çeşitliliği artırabilir ancak lisans, köken, stil ve etiket sorunları getirir; bunlar gerçek görüntülerde ölçülmelidir.

Modeller, Eğitim ve Değerlendirme

Klasik yöntemler, mühendislikle oluşturulmuş tanımlayıcıları bir sınıflandırıcıyla birleştirir; modern sistemler ise genellikle aktarım öğrenmesi yoluyla konvolüsyonel ağlar veya görsel dönüştürücüler kullanır. Yeniden boyutlandırma ve kırpma seçimleri hangi bilginin kalacağını belirler. Artırma, geçerli varyasyonu yansıtmalı ve etiketleri korumalıdır. Göreve uygun bir kayıp fonksiyonunu optimize edin, dengesizliği ağırlıklandırma veya örnekleme yoluyla dikkatli bir şekilde yönetin ve doğrulama verileri üzerinde kontrol noktalarını (checkpoint) seçin. Basit bir temel hat (baseline) ile karşılaştırın ve artırma, çözünürlük ve ön‑eğitimli başlatmayı kaldırarak (ablate) kazançların nereden geldiğini öğrenin.

Sınıf bazında kesinlik, duyarlılık, F1, karışıklık, ilgili olduğunda top‑k doğruluk, kalibrasyon ve koşula göre performansı raporlayın. Bulanıklık, sıkıştırma, aydınlatma, kırpma, örtüşme, cihaz ve desteklenmeyen sınıfa sahip girdileri test edin. Güven eşiği, belirsiz vakaları incelemeye yönlendirebilir; softmax olasılığı, özellikle dağılım kayması altında, garantili bir güven değildir. Karşı‑olay arka planları ve örtüşme testleri kestirme öğrenmeyi ortaya çıkarır. Güvenlik odaklı kullanım için en kötü durum hatalarını ve yanlış pozitif/negatif sonuçlarını değerlendirin.

Dağıtım ve İzleme

Kod çözme, renk dönüşümü, yönlendirme, normalizasyon, model ve etiket haritasını bir arada paketleyin. Dışa aktarılmış veya nicelleştirilmiş (quantized) artefakti hedef cihazlarda doğrulayın ve uçtan uca gecikme, bellek, güç ve verimliliği ölçün. Görüntü kalitesi, giriş ve çıkış dağılımları, kalibrasyon, onaylı etiketler ve sensör sağlığını izleyin. Özellikle yüzler, konumlar ve yan izleyiciler için görüntü saklamayı en aza indirin ve güvenli hale getirin. Bozuk veya kapsam dışı girdiler için geri dönüş (fallback) sağlayın ve model sürümlerini geri alabilirsiniz. Sınıflandırma tanımlı görüntü‑seviyesi soruya yanıt verir; desteklenmeyen konumlandırma, kimlik veya niyet iddialarına genişletilmemelidir.

Uygulamalı Örnek: Geri Dönüştürülebilir Malzemelerin Sınıflandırılması

Bir tesis, konveyör üzerindeki öğeleri fotoğraflar ve malzeme sınıfı, kontaminasyon ve bilinmeyen olarak etiketler. Görüntüler, toplama günü ve nesne partisine göre bölünür; aydınlatma, ıslak yüzeyler, kırışıklık, örtüşme ve boş bantlar kapsanır. Küçük bir CNN ve ön‑eğitimli model, renk ve şekil kurallarıyla karşılaştırılır. Sınıf bazında duyarlılık, hatalı sınıflandırma, kalibrasyon, verimlilik ve kamera ile malzeme koşuluna göre sonuçlar seçimde belirleyicidir.

Üretim hattı, kamera pozlamasını ve bant zamanlamasını doğrular, ardından belirsiz öğeleri zorla bir sınıfa atamak yerine genel bir akışa gönderir. Nicelleştirilmiş (quantized) çıkarım, tam donanımda doğrulanır. İzleme, giriş kalitesini, sınıf oranlarını, reddedilenleri ve örneklemeli manuel denetimleri takip eder; yeni ambalaj, gözden geçirilmiş bir veri güncellemesini tetikler. Model, fiziksel korumalı sınırlı bir ayırıcıyı kontrol eder ve sensör veya model arızası, malzemeyi sessizce yanlış yönlendirmek yerine mekanizmayı güvenli bir duruma geri döndürür.

Uygulama Kanıtları ve Operasyonel Hazırlık

Bir üretim kararı, başarılı bir gösterimin ötesinde bir şeye ihtiyaç duyar. Hedef kullanıcıları, işletim ortamını, girdileri, çıktıları, bağımlılıkları, sorumluyu ve her önemli hatanın sonucunu tanımlayın. Ayarlamadan önce yeniden üretilebilir bir temel hat ve sürümlenmiş bir değerlendirme seti oluşturun. Normal durumları, sınır koşullarını, hatalı ya da eksik girdileri, dağılım kaymasını, bağımlılık kesintisini, kötü kullanımı ve hizmet dışı kalma ihtimali yüksek grup ya da ortamları test edin. Görev kalitesini kalibrasyon veya belirsizlik, gecikme, verimlilik, kaynak maliyeti, erişilebilirlik, gizlilik ve güvenlik ile birlikte ölçün. Bağımsız bir gözden geçiricinin sonucu yeniden üretebilmesi ve kanıtı çekici bir prototipten ayırabilmesi için her dönüşümü ve eşiği kaydedin.

Başlamadan önce, sürüm, istisna, değişiklik, geri alma ve emeklilik yetkisini atayın. Aşamalı bir dağıtım kullanın, güvenli bir geri dönüşü koruyun ve kasıtlı olarak eklenmiş hatalarla izlemeyi doğrulayın. Operasyonel telemetri, gereksiz hassas veri toplamadan giriş kalitesini, çıkış davranışını, model ya da kural sürümünü, bağımlılık sağlığını, insan müdahalelerini ve onaylı sonuçları ortaya koymalıdır. Uyarı eşikleri ve bir yanıt sorumlusu tanımlayın, ardından çevrim dışı performansın devam edeceğini varsaymak yerine dağıtımdan sonraki gerçek dünya kanıtlarını inceleyin. Veri kaynakları, kullanıcılar, modeller, satıcılar, politikalar, donanım veya hedefler değiştiğinde yeniden değerlendirin. Bakımı yapılan bir sistem, belgelenmiş kurtarma, olay öğrenimi, silme ve saklama prosedürleri ve devre dışı bırakılması ya da değiştirilmesi gereken net bir noktaya da ihtiyaç duyar.

Sıkça Sorulan Sorular

Bir görüntü sınıflandırıcısı birden fazla nesneyi tanımlayabilir mi?

Çok‑etiketli bir sınıflandırıcı hangi kategorilerin mevcut olduğunu söyleyebilir, ancak bireysel örnekleri konumlandırmaz. Nesne tespiti kutular veya sayımlar için gereklidir.

Bir model, bir kişi için normal görünen fotoğraflarda neden başarısız olabilir?

Yakalama artefaktları, dokular veya değişen korelasyonlara dayanıyor olabilir. Küçük ön‑işleme farklılıkları ve alan kayması da öğrenilen özellikleri etkileyebilir.

Birincil Referanslar

Blog yazarı ve programcı, Machine Learning ve Deep Learning konularında uzmanlık sahibi. Daniel, başkalarının AI'nin gücünü sosyal fayda için kullanmasına yardımcı olmak umudu taşıyor.