Yapay zeka temelleri
Boyut Azaltma Nedir?
Boyut azaltma verileri daha az değişkenle temsil ederken, görev için yararlı bilgileri korur. Depolamayı ve gürültüyü azaltabilir, görselleştirmeyi iyileştirebilir, gereksiz özellikleri azaltabilir ve sonraki modellerin eğitilmesini kolaylaştırır.
Hiçbir yöntem tüm ilişkileri koruyamaz. Faydalı bir azaltma, neyin korunması gerektiğini belirleyerek başlar: varyans, sınıf ayrımı, yerel komşuluklar, küresel geometri, yeniden yapılandırma kalitesi veya yorumlanabilirlik.
Temel Çıkarımlar
- Özellik seçimi orijinal değişkenleri korur; özellik çıkarımı yeni düşük boyutlu koordinatlar oluşturur.
- PCA lineerdir ve varyansa odaklıdır; t-SNE ve UMAP görselleştirme için komşuluk yapısına vurgu yapar.
- Görselleştirme gömme yöntemleri mesafeleri, küme boyutlarını ve küresel ayrımı çarpıtabilir.
- Azaltma yalnızca eğitim verileri üzerinde uygulanmalı, ardından öğrenilen dönüşüm doğrulama ve test verilerine uygulanmalıdır.

Özellik Seçimi ve Yansıtma
Özellik seçimi, alan kuralları, eksiklik, gereksizlik, öngörü testleri veya düzenleme kullanarak değişkenleri kaldırır. Orijinal anlamları korur, bu da yönetişim ve açıklamaya yardımcı olabilir.
Yansıtma yöntemleri değişkenleri yeni koordinatlarda birleştirir. Dağıtılmış yapıyı yakalayabilirler ancak her koordinatın yorumlanmasını zorlaştırabilir. Bir autoencoder yeniden yapılandırma yoluyla doğrusal olmayan bir yansıtma öğrenir.
PCA ve SVD
Temel bileşen analizi, verileri ortaladıktan sonra azalan varyanslı dik açılı yönleri belirler. Tekil değer ayrıştırması yaygın bir sayısal yol sunar. Ölçekleme önemlidir: yüksek varyanslı bir ölçüm birimi bileşenleri hâkim kılabilir.
PCA işaret ve tekrarlanan özdeğerler dışında deterministiktir, örnek dışı dönüşümü destekler ve açıklanan varyans özetleri sunar. Yüksek varyans her zaman görevle ilgili değildir ve lineer bileşenler her kıvrımlı manifoldu açamaz.
t-SNE ve UMAP
t-SNE, komşular üzerindeki olasılık dağılımlarını oluşturur ve yerel benzerliği vurgulayan düşük boyutlu bir harita optimize eder. UMAP, ağırlıklı bir komşuluk grafiği inşa eder ve ilgili yerel yapı hedefleriyle düşük boyutlu bir temsil optimize eder.
Her ikisi de güçlü keşif araçlarıdır ancak ön işleme, mesafe ölçütü ve hiperparametrelere duyarlıdır. 2B bir grafikteki boş alan, küme alanı ve kümeler arası mesafe otomatik olarak gerçek dünya yorumuna dönüştürülmemelidir.
Denetimli Yöntemler ve Göreve Duyarlı Temsiller
Doğrusal ayrım analizi, sınıf etiketlerini kullanarak ayrım arar, bu da onu denetimsiz PCA’dan ayırır. Sinirsel temsil öğrenimi, yeniden yapılandırma yerine tahmin ya da karşıtlık hedeflerini optimize edebilir.
Eğer etiketler azaltmayı yönlendiriyorsa, tüm modelleme ve ayarlama eğitim süreci içinde kalmalıdır. Aksi takdirde test setinden gelen bilgi model seçimine sızabilir ve iyimser bir sonuç ortaya çıkabilir.
Bir Yöntem Seçme ve Doğrulama
Ön işleme ve basit bir temel modelle başlayın. Sıkıştırma için, yeniden yapılandırma ya da sonraki performansı boyutlar arasında ölçün. Görselleştirme için, tohumlar ve hiperparametreler arasında kararlılığı test edin ve komşuluk korumasını alan bilgisiyle karşılaştırın.
Üretimde, yöntemin yeni kayıtları dönüştürüp dönüştüremeyeceğini, eksik değerleri nasıl ele aldığını, yeniden eğitildiğinde değişip değişmediğini ve kullanıcıların orijinal özellik açıklamalarına ihtiyaç duyup duymadığını sorun. Aşırı öğrenme, azaltma adımında da nihai modelde olduğu gibi ortaya çıkabilir.
Doğrusal ve Doğrusal Olmayan Azaltma Yöntemleri
Boyut azaltma, yüksek boyutlu verileri daha az koordinata haritalarken seçilen yapıyı korur. Temel bileşen analizi, ortaladıktan sonra en yüksek varyansa sahip dik açılı yönleri bulur; birimler benzer katkı sağlamalıysa ölçekleme gerekir. Tekil değer ayrıştırması ilgili düşük rütbeli yapıyı hesaplar ve seyrek matrisleri destekler. Doğrusal ayrım analizi, sınıfları ayıran yönleri bulmak için etiketleri kullanır. Bu yöntemler açık dönüşümler üretir, ancak varyans ya da sınıf ayrımı, sonraki bir görev için gerekli bilgiyi her zaman korumaz.
t-SNE ve UMAP gibi manifold yöntemleri komşulukları oluşturur ve düşük boyutlu bir düzenleme optimize eder. Keşif için güçlüdürler fakat küresel mesafe, yoğunluk, küme büyüklüğü ve bazen ayrımı çarpıtırlar. Sonuçlar ön işleme, ölçüt, komşu sayısı ya da perplexity, başlatma ve tohum gibi faktörlere bağlıdır. İki boyutta çekici bir küme, ayrık gruplar olmasa bile ortaya çıkabilir. Birden çok ayar kullanın, yalnızca modelleme sırasında kullanılmayan meta verilerle renkleyin ve görünür yapıyı orijinal uzayda ya da bağımsız etiketlerle doğrulayın.
Özellik Seçimi, Gömme ve Değerlendirme
Özellik seçimi, filtreler, sarmalayıcılar veya model temelli önem üzerinden orijinal değişkenleri korur; temsil öğrenimi ise autoencoder’lar veya denetimli modeller aracılığıyla yeni gizli özellikler yaratır. Rastgele projeksiyonlar, belirli koşullar altında mesafeleri yaklaşık olarak korur ve verimli temel modeller sunar. Yöntemi sıkıştırma, görselleştirme, gürültü azaltma, hız, depolama veya model performansı gibi ihtiyaçlara göre seçin. Azaltıcıyı yalnızca eğitim verileri üzerinde eğitin, ardından doğrulama ve test setlerine uygulayın. Denetimli azaltma, etiket sızıntısını önlemek için çapraz doğrulama içinde iç içe olmalıdır.
Lineer sıkıştırma için açıklanan varyans veya yeniden yapılandırma, görselleştirme için güvenilirlik ve komşuluk koruması, tahmin için ise sonraki doğruluk, kalibrasyon, gecikme ve dayanıklılık değerlendirin. Örnekler ve tohumlar arasında kararlılığı ölçün. Nadir sınıfların ya da hassas grupların çöküp çökmediğini ve ters haritalamanın mümkün olup olmadığını inceleyin. Azaltılmış koordinatlar hâlâ özel bilgi içerebilir; iki boyutlu bir grafik anonimleştirme değildir. Dönüşümü, ölçekleyiciyi, özellik sırasını ve sınırlamaları belgeleyin.
Üretim Kullanımı
Sunum, tam olarak eğitilmiş dönüşüm ve giriş şemasını gerektirir. Eksik özellikleri, aralık kaymalarını, bileşen skor dağılımını, yeniden yapılandırma hatasını ve sonraki sonuçları izleyin. Yeni kategoriler ya da sensörler ortaya çıkarsa, sessizce sütun eklemek yerine tüm veri akışını yeniden eğitin ve sürümleyin. Azaltma, hesaplama maliyetini düşürebilir ve bir modeli gürültüsünden arındırabilir, ancak nadir olaylar için önemli olabilecek zayıf sinyalleri de ortadan kaldırabilir. Bunu, tutulan ve kaybedilen bilginin karar sürecine karşı test edilmesi gereken öğrenilmiş bir ölçüm adımı olarak ele alın.
Uygulamalı Örnek: Müşteri Davranışı Özelliklerini Azaltma
Bir analist, 200 davranış ölçütünü standartlaştırır ve yalnızca eğitim müşterileri üzerinde PCA uygular. Çapraz doğrulama, bileşen sayısını sonraki churn performansı ve kararlılığa göre seçer, iki boyutlu bir dağılım grafiğine göre değil. Yüklemeler, baskın kaynaklar ve eksiklikler açısından incelenir. PCA, özellik seçimi, rastgele projeksiyon ve azaltılmamış düzenlenmiş bir model, kalibrasyon, gecikme ve nadir müşteri segmentleri sonuçları açısından karşılaştırılır. Tekrarlanan örnekler, önde gelen bileşenlerin ve sonraki sonuçların kararlı kalıp kalmadığını da test eder.
Dağıtılan veri akışı, özellik sırasını, ölçekleyiciyi ve bileşenleri sabitleyerek eksik şema sürümlerini reddeder. İzleme, bileşen dağılımlarını, yeniden yapılandırma hatasını ve sonraki sonuçları takip eder. Görünür kümelerle bir görselleştirme, sorular üretmek için kullanılır, müşteri kişilikleri atamak için değil. Gizli bileşenler hâlâ davranışı kodladığından erişim ve tutma kontrol altında kalır. Kaynak tanımları değişirse, tam dönüşüm ve model yeniden oluşturulur ve doğrulanır; eski bileşenlere uyumsuz veri yansıtmak yerine.
Uygulama Kanıtı ve Operasyonel Hazırlık
Bir üretim kararı, başarılı bir gösterimden daha fazlasını gerektirir. Hedef kullanıcıları, çalışma ortamını, girişleri, çıkışları, bağımlılıkları, sorumluyu ve her önemli hatanın sonucunu tanımlayın. Ayarlamadan önce tekrarlanabilir bir temel ve sürümlenmiş bir değerlendirme seti oluşturun. Normal durumları, sınır koşullarını, bozuk ya da eksik girdileri, dağılım kaymasını, bağımlılık kesintisini, kötü kullanımı ve en çok hizmet alamayan grup ya da ortamları test edin. Görev kalitesini kalibrasyon ya da belirsizlik, gecikme, verim, kaynak maliyeti, erişilebilirlik, gizlilik ve güvenlik ile birlikte ölçün. Bağımsız bir gözlemcinin sonucu yeniden üretebilmesi ve kanıtı çekici bir prototipten ayırabilmesi için her dönüşüm ve eşik kaydedilsin.
Başlatmadan önce, sürüm, istisna, değişiklik, geri alma ve emeklilik yetkisini atayın. Aşamalı bir dağıtım kullanın, güvenli bir geri dönüş sağlayın ve kasıtlı olarak eklenen hatalarla izlemeyi doğrulayın. Operasyonel telemetri, gereksiz hassas veri toplamadan giriş kalitesini, çıkış davranışını, model ya da kural sürümünü, bağımlılık sağlığını, insan müdahalelerini ve onaylanmış sonuçları göstermelidir. Uyarı eşiklerini ve bir yanıt sorumlusunu tanımlayın, ardından dağıtımdan sonra gerçek dünya kanıtlarını gözden geçirin; çevrim dışı performansın devam edeceğini varsaymayın. Veri kaynakları, kullanıcılar, modeller, satıcılar, politikalar, donanım ya da hedefler değiştiğinde yeniden değerlendirin. Bakımı yapılan bir sistem, belgelenmiş bir kurtarma, olay öğrenimi, silme ve saklama prosedürlerine, ayrıca devre dışı bırakılması ya da değiştirilmesi gereken net bir noktaya da ihtiyaç duyar.
Sıkça Sorulan Sorular
Boyut azaltma her zaman bir modeli iyileştirir mi?
Hayır. Öngörücü bilgiyi ortadan kaldırabilir veya yorumlamayı zorlaştırabilir. Azaltmasız bir temel modele karşı tutulan verilerde karşılaştırın.
Ayrılmış t-SNE kümeleri gerçek sınıfların varlığını kanıtlar mı?
Hayır. Harita, komşuluk ilişkilerinin optimize edilmiş bir görselleştirmesidir ve görünür bir ayrım yaratabilir. Kümeleri bağımsız kanıtlarla doğrulayın.












