Yapay zeka temelleri
Karışıklık Matrisi Nedir?
Bir karışıklık matrisi, bir sınıflandırıcının tahminlerinin bilinen etiketlerle ne sıklıkta aynı ya da farklı olduğunu sayan bir tablodur. Hangi sınıfların karıştığını ortaya koyar ve kesinlik, duyarlılık, özgüllük ve F1 gibi ölçütlerin hesaplanmasında kullanılan sayıları sağlar. Bu, denetimli öğrenme sınıflandırma problemlerinin temel tanı araçlarından biridir.
Matris, tek bir performans puanı değildir. Belirli bir karar eşiği, veri kümesi ve sınıf tanımı altında sonuçların yapılandırılmış bir görünümüdür.
Temel Çıkarımlar
- İkili sınıflandırma için dört sonuç gerçek pozitif, sahte pozitif, sahte negatif ve gerçek negatiftir.
- Eksenleri her zaman etiketleyin: kütüphaneler ve yayınlar gerçek ve tahmin edilen sınıfları aynı yönde yerleştirmeyebilir.
- Doğruluk, sınıflar dengesiz olduğunda ciddi hataları gizleyebilir.
- Sınıflandırma eşiğini değiştirmek, karışıklık matrisini ve kesinlik ile duyarlılık arasındaki dengeyi değiştirir.

İkili sınıflandırma sonuçları
- Gerçek pozitif (TP): örnek pozitiftir ve model pozitif tahmin eder.
- Yanlış pozitif (FP): örnek negatiftir ancak model pozitif tahmin eder.
- Yanlış negatif (FN): örnek pozitiftir ancak model negatif tahmin eder.
- Gerçek negatif (TN): örnek negatiftir ve model negatif tahmin eder.
scikit-learn’in gelenekselinde satırlar gerçek sınıfları, sütunlar ise tahmin edilen sınıfları gösterir. Diğer görselleştirmeler bu düzeni transpoze edebilir; bu yüzden etiketler—köşe konumları değil—yorumlamayı yönlendirmelidir.
Karışıklık Matrisinden Türetilen Ölçütler
Kesinlik
Precision = TP / (TP + FP)
Kesinlik şu soruya yanıt verir: pozitif tahmin edilen örneklerin ne kadarının gerçekten pozitif olduğu?
Duyarlılık veya geri çağırma
Recall = TP / (TP + FN)
Duyarlılık şu soruya yanıt verir: tüm gerçek pozitif örneklerin ne kadarını model bulmuştur? İkili sınıflandırmada pozitif sınıf duyarlılığı aynı zamanda hassasiyet ya da gerçek‑pozitif oranı olarak adlandırılır.
Özgüllük
Specificity = TN / (TN + FP)
Özgüllük, negatif sınıf için duyarlılık anlamına gelir: gerçek negatiflerin ne kadarının model tarafından doğru şekilde reddedildiği?
Doğruluk
Accuracy = (TP + TN) / (TP + TN + FP + FN)
Doğruluk, sınıflar ve hata maliyetleri makul bir dengeye sahip olduğunda faydalıdır. Bir sınıf baskın olduğunda yanıltıcı olabilir.
F1 skoru
F1 = 2 × (Precision × Recall) / (Precision + Recall)
F1, kesinlik ve duyarlılığı harmonik ortalama ile özetler. Gerçek negatifleri göz ardı eder, bu yüzden her görev için uygun bir özet değildir.
Uygulamalı Bir Örnek
Bir test setinin 1.000 işlem içerdiğini varsayalım. Bunların ellisi sahte. Model bu sahtekarlıklardan 40’ını bulur ancak 30 sahte pozitif (gerçek olmayan) işlem işaretler:
- TP = 40
- FN = 10
- FP = 30
- TN = 920
Model %96 doğruluk sağlar, ancak kesinliği yaklaşık %57, duyarlılığı %80’dir. Yüksek doğruluk, çok sayıda meşru işlemden kaynaklanır. Bu modelin kabul edilebilirliği, kaçırılan sahtekarlığın maliyeti, inceleme kapasitesi ve risk puanlarının ne kadar kalibre edildiğine bağlıdır.
Eşikler Matrisi Değiştirir
Birçok sınıflandırıcı, zorunlu bir evet/hayır yanıtı yerine bir skor üretir. Pozitif eşiği düşürmek genellikle duyarlılığı ve sahte pozitifleri artırır; yükseltmek ise kesinliği veya özgüllüğü artırırken daha fazla pozitif kaçırır. Eşik, doğrulama verileri ve gerçek hata maliyetleri kullanılarak seçilmeli, otomatik olarak 0.5’e sabitlenmemelidir.
Kesinlik‑duyarlılık ve ROC eğrileri, eşikler arasındaki performansı özetler. Pozitif sınıf nadir olduğunda kesinlik‑duyarlılık eğrileri genellikle daha bilgilendiricidir.
Çoklu Sınıf Karışıklık Matrisleri
K sınıfı için matris K × K’dır. Doğru tahminler diyagonal üzerinde yer alır; diyagonal dışı hücreler hangi sınıf çiftlerinin karıştığını gösterir. Sınıf‑başına ölçütler farklı şekillerde ortalanabilir:
- Makro ortalama: her sınıfa eşit ağırlık verir.
- Ağırlıklı ortalama: her sınıfı örnek sayısına göre ağırlıklandırır.
- Mikro ortalama: ölçüt hesaplanmadan önce sonuç sayılarını toplar.
Yalnızca bir ortalama raporlamak, daha küçük sınıflardaki kötü performansı gizleyebilir. Destek sayıları ve sınıf‑başına sonuçlar, farkların önemli olduğu yerlerde eklenmelidir.
Yaygın Hatalar
- Eksen etiketlerini kontrol etmeden transpoze bir matrisi okumak.
- Eşik ayarı dışındaki bir eğitim veri setinden ölçüt hesaplamak.
- Sınıf prevalansını, örnekleme stratejisini veya bölünmeler arasındaki yinelenen varlıkları göz ardı etmek.
- Değişik eşiklerde üretilen matrisleri karşılaştırırken değişikliği not etmemek.
- Tüm sahte pozitif ve sahte negatifleri eşit maliyetli olarak değerlendirmek.
Dolayısıyla bir karışıklık matrisi tanı aracı olup tam bir değerlendirme değildir. Kalibrasyon, alt grup analizi, dayanıklılık ve sonraki etkiler de sınıflandırma incelemesinin parçası olmalıdır.
Her Hücreyi Okumak ve Yararlı Ölçütler Çıkarımak
İkili sınıflandırma için karışıklık matrisi, seçilen pozitif sınıf ve eşik altında gerçek pozitif, sahte pozitif, sahte negatif ve gerçek negatif sayar. Doğruluk, doğru tahminleri tüm vakalara böler; kesinlik, tahmin edilen pozitiflerin ne kadarının doğru olduğunu sorar; duyarlılık, gerçek pozitiflerin ne kadarının bulunduğunu sorar; özgüllük, gerçek negatiflerin doğru reddedilme oranını ölçer. F1, kesinlik ve duyarlılığın harmonik ortalamasıdır. Hiçbiri mutlak olarak en iyisi değildir: sahtekarlık tespiti, tıbbi triyaj ve spam filtreleme aynı hücrelere farklı sonuçlar atar.
Çoklu sınıf problemlerinde satırlar genellikle gerçek sınıfları, sütunlar tahmin edilen sınıfları temsil eder; gelenekler değişebilir, bu yüzden etiketler açık olmalıdır. One‑vs‑rest sayımları sınıf‑başına kesinlik ve duyarlılık üretir. Makro ortalama sınıfları eşit ağırlıklandırır; mikro ortalama kararları toplar ve yaygın sınıfları tercih eder; ağırlıklı ortalama sınıf desteğini izler. Çok‑etiketli görevler bir öğe için birden fazla etiket izin verir ve etiket‑bazlı ya da örnek‑bazlı tanımlar gerektirir. Satıra göre normalize ederek duyarlılık kalıplarını, sütuna göre ise tahmin bileşimini inceleyebilirsiniz; ancak nadir grupların görsel olarak abartılmaması için ham sayılar korunmalıdır.
Eşikler, Belirsizlik ve Operasyonel Kararlar
Bir karışıklık matrisi, tek bir eşikteki kesin kararları özetler. Kesinlik‑duyarlılık veya ROC eğrileri eşikleri karşılaştırmak için kullanılır, ardından kapasite, prevalans ve hata maliyetine göre bir işletim noktası seçilir. Kalibrasyon, tahmin edilen olasılıkların gözlemlenen sıklıkla eşleşip eşleşmediğini sorar ve sıralamadan ayrı bir konudur. Prevalans değiştiğinde, kesinlik değişebilir; duyarlılık ve özgüllük sabit kalabilir. Güven aralıkları veya bootstrap varyasyonu raporlanmalı, küçük bir alt gruptaki birkaç hatadan genelleme yapılmamalıdır.
Matrisler zaman, konum, cihaz, dil ve ilgili etkilenmiş gruplara göre denetlenerek yoğun hatalar bulunabilir. Modeli mevcut karar süreciyle, insan incelemesi dahil, karşılaştırın. Kademeli sistemlerde her aşamadaki hatalar kaydedilmelidir: geri getirme, sınıflandırma, eşikleme ve eylem. Canlı sonuç etiketleri gecikme ve düzeltme süreciyle izlenmelidir. Görünüşte iyileşmiş bir F1, zararlı sahte negatifleri artırabilir veya inceleme kapasitesini aşabilir. Karışıklık matrisi bir karar defteridir; her hücreyi hatayı yaşayan kişiye ve ardından gelen yanıtına bağlayın.
Uygulamalı Örnek: Tıbbi Tarama Eşiği Seçimi
Bir machine-learning tarama modeli, düşük prevalanslı bir durum için risk skoru üretir. Ekip, eşikler arasında karışıklık matrisleri oluşturur ve duyarlılık, özgüllük, kesinlik, yanlış yönlendirmeler ve kaçırılan vakalar için güven aralıkları raporlar. Pozitif öngörü değeri prevalansa bağlı olduğundan, tek bir veri setinin kesinliğini alıntılamak yerine hedef popülasyonu modeller.
Klinisyenler, gerekli duyarlılığı korurken doğrulama testlerini aşırı yüklemeyen bir işletim noktası seçer. Matris, 10.000 taranan kişi başına beklenen sayılara dönüştürülerek sonuçların anlaşılmasını sağlar. Doğrulanmamış koşullardaki skorlar otomatik bir sonuç üretmez. İzleme, tahminleri gecikmeli doğrulanmış tanılarla karşılaştırır, kapasite ve kalibrasyonu izler ve prevalans ya da veri toplama değiştiğinde inceleme tetikler. Karışıklık matrisi, tam model, eşik ve popülasyonla bağlantılı kalır.
Uygulama Kanıtı ve Operasyonel Hazırlık
Üretim kararı, başarılı bir gösteriden daha fazlasını gerektirir. Hedef kullanıcıları, çalışma ortamını, girdileri, çıktıları, bağımlılıkları, sorumluyu ve her önemli hatanın sonucunu tanımlayın. Ayarlamadan önce yeniden üretilebilir bir temel ve sürümlenmiş bir değerlendirme seti oluşturun. Normal vakaları, sınır koşullarını, bozuk ya da eksik girdileri, dağılım kaymasını, bağımlılık kesintilerini, kötü kullanımı ve hizmet dışı kalma riskini taşıyan grupları test edin. Görev kalitesini kalibrasyon veya belirsizlik, gecikme, iş hacmi, kaynak maliyeti, erişilebilirlik, gizlilik ve güvenlik ile birlikte ölçün. Her dönüşümü ve eşiği kaydedin, böylece bağımsız bir gözden geçiren sonuçları yeniden üretebilir ve kanıtı çekici bir prototipten ayırabilir.
Lansmandan önce, sürüm, istisna, değişiklik, geri alma ve emeklilik yetkilerini atayın. Aşamalı bir dağıtım kullanın, güvenli bir geri dönüşüm sağlayın ve kasıtlı hatalarla izlemeyi doğrulayın. Operasyonel telemetri, gereksiz hassas veri toplamayarak giriş kalitesini, çıktı davranışını, model/kural sürümünü, bağımlılık sağlığını, insan müdahalelerini ve doğrulanmış sonuçları ortaya koymalıdır. Uyarı eşikleri ve bir sorumlu tanımlayın, ardından dağıtımdan sonra gerçek dünya kanıtlarını gözden geçirin; çevrim dışı performansın devam edeceğini varsaymayın. Veri kaynakları, kullanıcılar, modeller, satıcılar, politikalar, donanım veya hedefler değiştiğinde yeniden değerlendirin. Sürekli bir sistem, belgelenmiş kurtarma, olay öğrenimi, silme ve saklama prosedürleri ve devre dışı bırakılması ya da değiştirilmesi gereken net bir noktayı da içermelidir.
Sıkça Sorulan Sorular
Normalleştirilmiş bir karışıklık matrisi nedir?
Normalleştirme, sayıları gerçek‑sınıf toplamına, tahmin‑sınıf toplamına ya da tüm gözlemlere bölerek yapılır. Bu, sınıflar arasındaki oranların karşılaştırılmasını kolaylaştırır; ancak rapor, küçük grupların eşit büyüklükte sanılmaması için ham destek sayılarını da içermelidir.
Bir karışıklık matrisi regresyonu değerlendirebilir mi?
Doğrudan değil. Karışıklık matrisi ayrık sınıflar gerektirir. Sürekli bir hedefi binlemek bilgi kaybına yol açar; regresyon genellikle artık analizi ve MAE veya RMSE gibi sürekli değerler için tasarlanmış ölçütlerle değerlendirilir.












