Yapay zeka temelleri
Bilgisayarlı Görüş Nedir?
Bilgisayarlı Görüş görüntülerden ve videolardan faydalı bilgi çıkaran sistemler geliştirme alanıdır. Bir görsel model tüm bir görüntüyü sınıflandırabilir, nesneleri konumlandırabilir, her pikseli etiketleyebilir, metin okuyabilir, duruş tahmini yapabilir, hareketi izleyebilir veya görsel içeriği dil ile ilişkilendirebilir.
Modern görsel sistemler, insan algısının erken kenar‑algılama sürecini yalnızca taklit etmez. Veri üzerinden görev‑özgü temsiller öğrenirler; genellikle konvolüsyonel sinir ağları, görsel dönüştürücüler veya çok‑modlu temel modeller kullanılır.
Temel Çıkarımlar
- Sınıflandırma, tespit, segmentasyon, OCR, izleme ve üretim, farklı görsel görevlerdir.
- CNN’ler yerellik ve ağırlık paylaşımını içerir; görsel dönüştürücüler görüntü yamaları arasında dikkat (attention) kullanır.
- Etiketler insanlardan, zayıf gözetimden, sentetik veriden veya kendi kendine gözetimli hedeflerden gelebilir.
- Yalnızca doğruluk yeterli değildir: sağlamlık, gecikme, gizlilik, önyargı ve hata maliyetleri önemlidir.

Bilgisayarlı Görüşün Temel Görevleri
- Görüntü sınıflandırması bir görüntüye bir veya daha fazla etiket atar. Görüntü sınıflandırmasının nasıl çalıştığını inceleyin.
- Nesne tespiti birden çok nesne için sınıfları ve sınırlayıcı kutuları tahmin eder.
- Semantik segmentasyon her pikseli sınıfa göre etiketler, örnek segmentasyon ise bireysel nesneleri ayırır.
- Optik karakter tanıma (OCR) metni algılar ve dönüştürür.
- Poz tahmini beden veya nesne işaret noktalarını (landmark) tahmin eder.
- İzleme tespitleri video kareleri arasında ilişkilendirir.
- Görüntü üretimi ve düzenleme görsel içeriği oluşturur veya dönüştürür; genellikle difüzyon modelleri kullanılır.
Görüntüler Model Girdileri Nasıl Olur
Dijital bir görüntü zaten sayısal bir veridir: uzamsal boyutlar ve kanallar boyunca piksel değerlerini içeren bir tensördür. Ön işleme, görüntüyü yeniden boyutlandırabilir, normalleştirebilir, kırpabilir veya artırabilir. Video, zaman boyutu ekler; tıbbi ve bilimsel görüntüleme ise derinlik, dalga boyu veya diğer modaliteler ekleyebilir.
Klasik bilgisayarlı görüş, el ile tasarlanmış kenar, köşe ve doku özelliklerini kullandı. Modern derin modeller genellikle özellikleri görevle birlikte öğrenir; ancak klasik yöntemler veri sınırlı olduğunda, kurallar iyi anlaşıldığında veya işlem gücü minimumda tutulması gerektiğinde hâlâ faydalıdır.
CNN’ler ve Öğrenilen Yerel Özellikler
Bir CNN, öğrenilmiş çekirdekleri yerel komşuluklar üzerinde uygular. Erken katmanlar yerel desenlere yanıt verebilirken, sonraki bloklar bunları görevle ilgili temsillere birleştirir. Havuzlama veya adımlı (stride) işlemler uzamsal çözünürlüğü azaltır ve artık bağlantılar (residual connections) derin ağların optimizasyonunu kolaylaştırır.
Modern bir CNN sınıflandırıcı, genellikle büyük bir tam bağlı katman yığını yerine küresel havuzlama (global pooling) kullanır. Tespitçiler ve segmentasyon ağları, uzamsal bilgiyi koruyan özelleşmiş başlıklar (heads) veya çözücü (decoder) yollar ekler.
Görsel Dönüştürücüler ve Temel Modeller
Bir görsel dönüştürücü, bir görüntüyü yama (patch)lara böler, gömüler (embeds) ve bu yamalar arasındaki ilişkileri modellemek için dikkat (attention) mekanizmasını kullanır. Dönüştürücüler, büyük veri kümeleri ve ön‑eğitimle etkili bir şekilde ölçeklenebilir; CNN’ler ise daha küçük ölçeklerde daha güçlü yerleşik varsayımlar ve verimlilik sağlar.
Çok‑modlu modeller, görüntüleri metinle hizalayarak kullanıcıların arama, başlık ekleme, soru yanıtlama veya dil kullanarak segmentasyonu yönlendirme gibi işlemler yapmasını sağlar. Bu modeller yetenekleri genişletir, ancak geniş web‑ölçeği verilerden kaynaklanan önyargılar, telif hakkı içeren materyaller ve nüfus ile ortamların dengesiz temsili gibi zayıflıkları da miras alır.
Etiketler, Kendi Kendine Gözetim ve Sentetik Veri
Sınırlayıcı kutular, maskeler, işaret noktaları ve başlıklar oluşturulması maliyetli olabilir. Kendi kendine gözetimli öğrenme, hedefleri doğrudan görüntülerden türetir; zayıf gözetim ise gürültülü veya dolaylı etiketler kullanır. Sentetik veri, nadir senaryolar ekleyebilir, ancak simülasyon boşlukları sentetik performansın gerçek dünyaya aktarılmasını engelleyebilir.
Etiketleme kalitesi ölçülmelidir. Belirsiz etiketler, tutarsız sınırlar ve eksik nesneler performansın üst sınırını belirler ve alt grup hatalarını gizleyebilir.
Görsel Sistemler Nasıl Değerlendirilir
Sınıflandırma, doğruluk, kesinlik, duyarlılık, F1 ve kalibrasyon gibi ölçütleri kullanır. Tespit, yaygın olarak kesişim‑üzerine‑birleşim (IoU) ve ortalama kesinlik (mAP) kullanır. Segmentasyon, IoU veya Dice tarzı ölçütleri kullanır. İzleme, kimlik ve yörünge ölçütleri ekler.
Ölçüt, dağıtıma uygun olmalıdır. Bir model, özenle hazırlanmış bir benchmark’ta yüksek puan alabilir ancak yağmur, düşük ışık, alışılmadık kamera açıları, yeni cihazlar veya tanıdık olmayan nüfuslarda başarısız olabilir. Değerlendirme, dağılım kayması, saldırgan koşullar ve operasyonel gecikmeyi içermelidir.
Gizlilik, Önyargı ve Dağıtım
Yüzler, plaka numaraları, evler, tıbbi taramalar ve işyeri videoları hassas bilgileri ortaya çıkarabilir. Toplama ve saklama, tanımlı bir yasal ve etik temele, erişim kontrollerine ve veri minimizasyonuna uygun olmalıdır. Yüz analizi ve biyometrik kimlik doğrulama, hatalar ve gözetimin eşitsiz zararlar doğurabileceği için özel bir inceleme gerektirir.
Kenar (edge) dağıtımı, gecikme ve veri aktarımını azaltabilir. Edge AI, kantitleme (quantization), budama (pruning) ve özel hızlandırıcılar, görsel sistemleri kameralar, araçlar, robotlar ve mobil cihazlarda pratik hale getirebilir; ancak sıkıştırma, doğruluk ve önyargı açısından yeniden değerlendirilmelidir.
Pikselden Görsel Görevlerine
Bilgisayarlı görüş, görüntüleri veya videoyu sınıflandırma, tespit, segmentasyon, izleme, poz, derinlik, optik akış veya metin tanıma gibi görev çıktılarına dönüştürür. Görev tanımı, etiketlemeyi belirler: bir görüntü etiketi kesin konumlandırmayı eğitemez ve bir sınırlayıcı kutu bir segmentasyon maskesini tam olarak tanımlayamaz. Kamera geometrisi, lensler, pozlama, aydınlatma, hareket, sıkıştırma ve bakış açısı veri dağılımını şekillendirir. Bir modeli seçmeden önce çalışma ortamını ve hata sonuçlarını tanımlayın; çünkü benchmark görüntü koleksiyonu dağıtılan sensör veya sahneyi temsil etmeyebilir.
Bir işlem hattı, medyayı çözer ve yönlendirir, yeniden boyutlandırır veya döşer, değerleri normalleştirir, etiket koruyucu artırma uygular, bir modeli çalıştırır ve logit, kutu, maske veya izleri son işlemden geçirir. Nesne tespitçileri, güven eşiği ve bastırma (suppression) kullanır; izleyiciler tespitleri zaman içinde ilişkilendirir; segmentasyon morfolojik temizlik gerektirebilir. Çıktıların orijinal görüntüyle hizalanması için koordinat dönüşümlerini koruyun. Neredeyse aynı karelerin hem eğitim hem test setlerinde yer almasını önlemek için veriyi kişi, kamera, konum veya yakalama oturumuna göre bölün.
Değerlendirme, Önyargı, Gizlilik ve Operasyonlar
Ölçütler, görev ve kullanım ile uyumlu olmalıdır. Sınıflandırma, sınıf‑özel kesinlik ve duyarlılık gerektirir; tespit, eşikler arasında IoU ve ortalama kesinlik (AP) kullanır; segmentasyon IoU veya Dice kullanır; izleme kimlik değişimlerini ekler; gecikme ve kaçırılan olay süresi video için önemlidir. Sonuçları aydınlatma, mesafe, cihaz, örtülme, cilt tonu, yaş ve diğer ilgili koşullara göre raporlayın. Kalibrasyonu ve yüksek‑güven hatalarını inceleyin. Sentetik veya artırılmış veri boşlukları doldurabilir ancak gerçek dağıtım verileriyle karşılaştırma gerektirir ve test sahnelerini sızdırmamalıdır.
Görsel sistemler, çevredeki kişileri, konumları, biyometrileri ve hassas davranışları toplayabilir. Yakalama ve saklamayı en aza indirin, akışları güvenli hale getirin, ikincil kullanımı kısıtlayın ve gerektiğinde bildirim veya onay sağlayın. Saldırgan yamaları, tekrar oynatmayı, örtülmeyi, kamera arızasını ve alan kaymasını test edin. Sensör sağlığını, giriş istatistiklerini, çıktı oranlarını ve doğrulanmış sonuçları izleyin; sonuçları etkileyen kararlar için insan incelemesini sürdürün. Bulanıklaştırma veya kırpma, maruziyeti azaltabilir ancak kanıtı da ortadan kaldırabilir. Yüksek bir laboratuvar puanı, doğrulanmış görev dışındaki kimlik, duygu veya niyet iddialarını haklı kılmaz.
Sık Sorulan Sorular
Kameralar kısıtlı bir araç geçişini izler ve model kişileri kimliklerini belirlemek yerine tespit eder. Veriler gündüz ve geceyi, hava koşullarını, giysileri, örtülmeyi, tekerlekli sandalye kullanıcılarını, kamera konumlarını ve boş sahneleri kapsar ve kayıt oturumuna göre ayrılır. Dedektör; olay duyarlılığı, yanlış alarmlar, konumlandırma, uyarı ön süresi ve uzaktan performans açısından değerlendirilir. Güvenlik mühendisliği, kabul edilebilir en yüksek gecikmeyi ve bağımsız fiziksel kontrolleri tanımlar.
Görüntü uyarısı bir aracı yavaşlatabilir, ancak acil durdurmalar ve bariyerler öğrenilmiş modele bağlı değildir. Kameranın kapanması, donmuş kareler, ağ kaybı ve model zaman aşımı açık arıza durumları üretir. Ham video saklama süresi en aza indirilir ve erişim kaydedilir. İzleme; sensör sağlığını, uyarı oranlarını, incelenen olayları ve koşullara göre ramak kala durumlarını takip eder. Görsel benzerlik aynı geometriyi veya riski garanti etmediğinden, kameranın taşınması ya da düzenin değişmesi yeniden doğrulamayı tetikler.
Uygulama Kanıtları ve Operasyonel Hazırlık
Bir üretim kararı, yalnızca başarılı bir gösterimden daha fazlasını gerektirir. Hedef kullanıcıları, işletim ortamını, girdileri, çıktıları, bağımlılıkları, sorumluyu ve her önemli hatanın sonucunu tanımlayın. Ayarlamadan önce yeniden üretilebilir bir temel ve sürümlenmiş bir değerlendirme seti oluşturun. Normal durumları, sınır koşullarını, hatalı ya da eksik girdileri, dağılım kaymasını, bağımlılık kesintisini, yanlış kullanımı ve hizmet dışı kalma olasılığı yüksek grup ya da ortamları test edin. Görev kalitesini kalibrasyon veya belirsizlik, gecikme, iş hacmi, kaynak maliyeti, erişilebilirlik, gizlilik ve güvenlik ile birlikte ölçün. Bağımsız bir inceleyicinin sonucu yeniden üretebilmesi ve kanıtı çekici bir prototipten ayırabilmesi için her dönüşümü ve eşiği kaydedin.
Başlatmadan önce, sürüm, istisna, değişiklik, geri alma ve emeklilik yetkilerini atayın. Aşamalı bir dağıtım kullanın, güvenli bir geri dönüşü koruyun ve izlemeyi kasıtlı olarak eklenmiş hatalarla doğrulayın. Operasyonel telemetri, gereksiz hassas veri toplamayarak giriş kalitesini, çıktı davranışını, model ya da kural sürümünü, bağımlılık sağlığını, insan müdahalelerini ve doğrulanmış sonuçları ortaya koymalıdır. Uyarı eşiklerini ve bir yanıt sorumlusunu tanımlayın, ardından dağıtımdan sonra gerçek‑dünya kanıtlarını gözden geçirin; çevrim dışı performansın devam edeceğini varsaymayın. Veri kaynakları, kullanıcılar, modeller, satıcılar, politikalar, donanım ya da hedefler değiştiğinde yeniden değerlendirin. Sürdürülen bir sistem, belgelenmiş bir kurtarma, olay öğrenimi, silme ve saklama prosedürleri ve devre dışı bırakılması ya da değiştirilmesi gereken net bir noktayı da gerektirir.
Sıkça Sorulan Sorular
Bilgisayarlı görüş, görüntü tanıma ile aynı mıdır?
Hayır. Görüntü tanıma genellikle sınıflandırma veya tanımlamayı ifade eder. Bilgisayarlı görüş, konumlandırma, segmentasyon, ölçüm, izleme, yeniden yapılandırma, üretim ve görsel bilgi üzerinde akıl yürütmeyi de kapsar.
Bir görsel sistem insan gibi görür mü?
Hayır. Bir model, mimarisi ve eğitim hedefi doğrultusunda sayısal girdileri işler. Dar bir benchmark’ta insanları geride bırakabilir, ancak bir kişinin kolayca halledebileceği küçük değişikliklerde başarısız olur.












