Yapay zeka temelleri

Derin Öğrenme Nedir?

mm
Unite.AI sitesini Google'daki tercih ettiğiniz kaynaklara ekleyin

Derin öğrenme, çoklu işleme katmanlarına sahip sinir ağlarını kullanan bir makine‑öğrenmesi yöntemleri ailesidir ve verilerin faydalı temsillerini öğrenir. Bu modeller, dil, görüntü, ses, öneri, bilimsel tahmin ve üretken AI için birçok modern sistemi güçlendirir.

Derin kelimesi, giriş ve çıkış arasındaki dönüşüm sayısını ifade eder, daha derin bir anlayışa sahip bir makine anlamına gelmez. Derin bir model, eğitim hedefi için faydalı sayısal ilişkileri öğrenir ve performansı hâlâ yeni veriler üzerinde test edilmelidir.

Temel Çıkarımlar

  • Derin öğrenme, makine öğrenmesinin bir alt kümesidir.
  • Katmanlar, öğrenilen parametreler, doğrusal olmayan aktivasyonlar, normalizasyon ve diğer işlemlerle tensörleri dönüştürür.
  • Geri yayılım (backpropagation) gradyanları hesaplar; bir optimizasyon algoritması bu gradyanları kullanarak ağırlıklar ve önyargılar gibi eğitilebilir parametreleri günceller.
  • CNN’ler, yinelemeli ağlar, transformer’lar, otomatik kodlayıcılar ve difüzyon modelleri farklı yapılar ve güçlü yönlere sahiptir.
Comparison of a multilayer perceptron, convolutional network, recurrent network, and transformer with arrows showing how each processes data
Derin öğrenme mimarileri, farklı veri ve görevler için bilgiyi farklı şekillerde düzenler.

Derin bir sinir ağının öğrenmesi

Bir sinir ağı, verileri tensörler olarak alır; tensörler sayısal çok boyutlu dizilerdir. Bir görüntü tensörü piksel kanallarını kodlayabilirken, bir dil modeli tokenları temsil eden vektörler kullanır. Her katman türevlenebilir bir dönüşüm gerçekleştirir ve sonucu bir sonraki kata aktarır.

Temel bir yoğun (dense) katmanda, model girdilerinin ağırlıklı toplamını hesaplar, eğitilebilir bir önyargı ekler ve ardından bir aktivasyon fonksiyonu uygular:

output = activation(Wx + b)

Aktivasyon fonksiyonu doğrusal olmayanlığı tanıtır. Onsuz, sıradan lineer katmanları yığmak yalnızca lineer bir dönüşüm sağlar. Gizli katmanlarda ReLU ve türevleri yaygındır; çıktı aktivasyonları görev tipine bağlıdır.

Eğitim genellikle dört adımdan oluşur:

  1. Bir ileri geçiş (forward pass) tahminler üretir.
  2. Bir kayıp fonksiyonu tahminlerin hedeften ne kadar farklı olduğunu ölçer.
  3. Geri yayılım (backpropagation), zincir kuralını uygulayarak kayıp fonksiyonunun her eğitilebilir parametreye göre gradyanını hesaplar.
  4. Stokastik gradyan inişi veya AdamW gibi bir optimizasyon algoritması parametreleri günceller.

Bu adımlar birçok batch üzerinde tekrarlandığında model iyileşebilir, ancak düşük eğitim kaybı gerçek dünyada güvenilir davranışı garantilemez. Doğrulama, düzenleme, temsilî veri ve izleme hâlâ zorunludur.

Derin öğrenme mimarilerinin ana tipleri

Çok Katmanlı Algılayıcılar

Çok katmanlı algılayıcı (MLP), her çıkış biriminin bir önceki katmandaki tüm girdilere bağlı olduğu tam bağlantılı katmanlar kullanır. MLP’ler tablo verileri için ve daha büyük sistemlerin bileşenleri olarak yararlıdır, ancak görüntü yerelliği ya da sıra düzeni gibi varsayımları içermez.

Konvolüsyonel Sinir Ağları

Konvolüsyonel sinir ağları (CNN’ler) öğrenilen filtreleri yerel bölgeler üzerinde uygular. Ağırlık paylaşımı, görüntüler ve spektrogramlar gibi ızgara verileri için verimlilik sağlar. CNN’ler görsel algılamada ve kenar (edge) dağıtımında hâlâ önemlidir; ancak görsel transformer’lar ve hibrit modeller de yaygın olarak kullanılmaktadır.

Tekrarlayan Ağlar, LSTM’ler ve GRU’lar

Tekrarlayan sinir ağları (RNN’ler) bir dizi işlenirken gizli durumu günceller. LSTM’ler ve kapılı tekrarlayan birimler (GRU) bilgiyi korumaya yardımcı olur ve uzun bağımlılıkların kaybolma‑gradyan sorununu azaltır. Bu yapılar tüm uzun‑bağlam sınırlamalarını ortadan kaldırmaz, ancak akış sinyalleri, zaman serileri ve kompakt sıralı modeller için hâlâ faydalıdır.

Transformer’lar

Transformer’lar bir dizi ya da küme elemanları arasındaki ilişkileri modellemek için dikkat (attention) mekanizması kullanır. Birçok konumun paralel işlenebilmesi, büyük ölçekli dil sistemlerinde yinelemeyi (recurrence) büyük ölçüde ortadan kaldırmıştır; transformer türevleri şimdi görüntü, ses, video, protein ve çok modlu verileri de işler.

Otomatik Kodlayıcılar ve Üretken Modeller

Otomatik kodlayıcı girdiyi bir temsile sıkıştırır ve bu temsilden girdiyi yeniden oluşturur. Bu, kendiliğinden denetimli bir yeniden yapılandırma hedefi yaratır; ancak etiketlenmemiş veriyi otomatik olarak etiketli örneklere dönüştürmez.

Üretken adversarial ağlar (GAN) bir üreteç ve bir ayırt ediciyi rekabet içinde eğitir. Difüzyon modelleri kademeli bir gürültüleme sürecini tersine çevirmeyi öğrenir. Özyinelemeli transformer’lar bir token ya da birim üretir. Bu yaklaşımların eğitim dinamikleri, kontrol edilebilirliği ve hesap gereksinimleri farklıdır.

Derinliğin Yardımcı Olması ve Mimariyin Önemi

Birden çok katman, modelin daha basit dönüşümleri daha karmaşık hâle getirmesini sağlar. Görüntüde bazı öğrenilmiş özellikler yerel dokulardan görev‑özgü desenlere doğru ilerleyebilir. Dilde ise dikkat katmanları bağlam‑bağımlı token temsilleri oluşturur. Bu açıklamalar yararlı sezgilerdir, her katmanın ne öğrenmesi gerektiği konusunda katı kurallar değildir.

Modern ağlar ayrıca artı‑bağlantılar (residual connections), normalizasyon, özenli başlatma, düzenleme ve optimize donanım gibi tekniklere dayanır. Katman ya da parametre eklemek yalnızca modeli eğitilebilir, yavaş ve aşırı uyum (overfitting) riski artırabilir. Model ölçeği yalnızca veri, hedef, optimizasyon ve dağıtım koşulları bunu desteklediğinde fayda sağlar.

Eğitim ve Çıkarım

Eğitim, parametreleri ayarlar ve genellikle en çok hesap gücü gerektiren aşamadır. Çıkarım (inference) eğitilmiş modeli çalıştırarak çıktı üretir. Büyük modeller için çıkarım hâlâ pahalı olabilir; bu yüzden ekipler kuantizasyon, distilasyon, toplu işleme (batching), önbellekleme, seyrekleştirme ve nöral işlem birimleri (NPUs) gibi özel donanımları kullanır.

Sınırlamalar ve Sorumlu Kullanım

Derin modeller önyargı taşıyabilir, hassas bilgileri ezberleyebilir, dağıtım kayması (distribution shift) altında başarısız olabilir ve ikna edici fakat hatalı çıktılar üretebilir. Ayrıca yorumlanması zor ve eğitim maliyeti yüksek olabilir. Değerlendirme yalnızca bir benchmark ortalamasını değil; sınıf‑ya da alt‑grup‑seviye performans, dayanıklılık, kalibrasyon, güvenlik, gecikme, enerji tüketimi ve hatanın sonuçlarını da kapsamalıdır.

Temsiller, Optimizasyon ve Mimari Seçimleri

Derin ağlar, parametreli katmanlar aracılığıyla ardışık temsiller öğrenir. Lineer dönüşümler girdileri karıştırır; doğrusal olmayan aktivasyonlar ağın karmaşık fonksiyonları yakalamasını sağlar; normalizasyon ve artı‑bağlantılar optimizasyonu kolaylaştırır; dikkat, konvolüsyon, yineleme ya da durum‑uzayı (state‑space) işlemleri farklı yapısal varsayımları kodlar. Derinlik dönüşüm sayısını artırır, zekâ garantisi vermez. Mimari, görev‑modu, veri hacmi, gecikme, bellek ve invariansları yansıtmalıdır. Veri sınırlı ve yerel uzamsal yapı baskın olduğunda daha küçük bir konvolüsyonel model, bir transformer’dan daha iyi performans gösterebilir.

Eğitim bir kayıp (loss) hesaplar, geri yayılım ile türevini alır ve bir optimizasyon algoritması (ör. stokastik gradyan inişi veya Adam) ile parametreleri günceller. Batch büyüklüğü, öğrenme oranı, zamanlama, başlatma, düzenleme ve sayısal hassasiyet birbirini etkiler. Eğitim ve doğrulama kayıp eğrileri eksik‑uyum, aşırı‑uyum, kararsızlık ve veri sızıntısını ayırt etmeye yardımcı olur, ancak gerçek‑dünya faydasını kanıtlamaz. Bağımsız değerlendirme verisi, varyansın önemli olduğu tekrarlı koşullar, ayırma (ablation) çalışmaları ve daha basit temel modellerle karşılaştırma kullanılmalıdır. Büyük parametre sayısı aynı zamanda veri yönetişimi, hesap planlaması ve tekrarlanabilir yapılandırma ihtiyacını artırır.

Derin Modelleri Güvenli ve Verimli Şekilde Sunma

Dağıtım bir barındırılmış uç nokta, özel hızlandırıcı, tarayıcı, telefon ya da gömülü cihaz üzerinden gerçekleştirilebilir. Dışa aktarım ve derleme operatörleri birleştirebilir, ağırlık ve aktivasyonları kuantize edebilir ya da sayısal davranışı değiştirebilir; bu yüzden yalnızca eğitim kontrol noktasını değil, dağıtılan artefaktı da doğrulamak gerekir. Soğuk başlangıç süresi, kararlı gecikme, throughput, bellek, güç ve kalite gerçekçi batch ve sıra boyutlarında ölçülmelidir. Sıkıştırma yöntemleri—budama, distilasyon, kuantizasyon ve düşük‑rütbeli adaptasyon—boyut ya da hızı doğruluk ve mühendislik karmaşıklığı karşısında takas eder; hassas sınıflar ve kenar durumları üzerinde değerlendirilmelidir.

Derin modeller dağıtım kayması, adversarial giriş, sahte korelasyon ve yetersiz temsil edilen gruplar altında kendinden emin şekilde başarısız olabilir. Giriş‑çıkış dağılımları, görev sonuçları, kalibrasyon, kaynak kullanımı ve bağımlılık sürümleri izlenmelidir. Erişim kontrolü, imzalı artefaktlar, korumalı eğitim verisi, kırmızı ekip (red‑team) testleri ve tehdit modeline uygun oran sınırlamaları kullanılmalıdır. Saliency haritaları ya da dikkat görünümleri gibi açıklamalar tanısal kanıttır, nedensellik kanıtı değildir; davranışsal testler, karşı‑olgu (counterfactual) analizleri, insan incelemesi, olay yanıtı ve otomatik kararlar üzerindeki açık limitlerle birleştirilmelidir.

Uygulamalı Örnek: Görüntü Kusur Dedektörü Eğitimi

Bir fabrika, kamera, ışık değişimi, malzeme ve bilinen kusur sınıfları arasında ürün görüntüleri toplar, ardından üretim partilerine göre bölerek yakın‑kopya öğelerin bölümler arası geçişini engeller. Küçük bir konvolüsyonel temel model, önceden eğitilmiş derin bir ağ ile karşılaştırılır. Artırma (augmentation), doğrulanmış aydınlatma ve bakış açısı çeşitliliğini kusurları silmeden yeniden üretir. Değerlendirme, kusur başına hatırlama (recall), yanlış‑reddetme oranı, kalibrasyon, çıkarım gecikmesi ve bulanıklık, parıltı, kamera değişimi ve nadir malzeme renklerine karşı dayanıklılık rapor eder.

Dışa aktarılan model ve tam yeniden‑boyutlandırma, renk ve normalizasyon kodu, hat hat hattı (line) donanımında sürdürülebilir throughput ve termal davranış için test edilir. Düşük‑güven durumları denetçilere yönlendirilir; bağımsız bir kural, güvenlik‑kritik sensör arızası durumunda hattı durdurur. Görüntüler yalnızca izin verildiği ölçüde saklanır ve model artefaktları imzalanır. İzleme, tahminleri sonraki denetim sonuçları ve üretim partileriyle ilişkilendirir. Yeni bir kamera ya da malzeme, gözden geçirilmemiş etiketlerden çevrimiçi öğrenmeye sessiz kalmak yerine kontrollü bir yeniden değerlendirme tetikler.

Uygulama Kanıtları ve Operasyonel Hazırlık

Bir üretim kararı, başarılı bir gösteriden daha fazlasını gerektirir. Hedef kullanıcılar, çalışma ortamı, giriş‑çıkış, bağımlılıklar, sorumlu kişi ve her kritik hatanın sonucu tanımlanmalıdır. Ayarlamadan önce tekrarlanabilir bir temel ve sürümlenmiş bir değerlendirme seti oluşturulmalıdır. Normal durumlar, sınır koşulları, bozuk ya da eksik giriş, dağıtım kayması, bağımlılık kesintisi, kötüye kullanım ve en çok hizmet dışı bırakılan grup ya da ortamlar test edilmelidir. Görev kalitesi, kalibrasyon ya da belirsizlik, gecikme, throughput, kaynak maliyeti, erişilebilirlik, gizlilik ve güvenlik birlikte ölçülmelidir. Her dönüşüm ve eşik kaydedilmeli ki bağımsız bir gözden geçiren sonuçları yeniden üretebilsin ve çekici bir prototipten kanıtı ayırt edebilsin.

Lansmandan önce, sürüm, istisna, değişiklik, geri alma ve emekli olma yetkileri atanmalıdır. Aşamalı bir dağıtım, güvenli bir geri dönüş ve kasıtlı olarak enjekte edilmiş hatalarla izleme doğrulanmalıdır. Operasyonel telemetri, giriş kalitesi, çıktı davranışı, model ya da kural sürümü, bağımlılık sağlığı, insan müdahaleleri ve onaylanmış sonuçları gereksiz hassas veri toplamayarak ortaya koymalıdır. Uyarı eşikleri ve bir yanıt sorumlusu tanımlanmalı, ardından dağıtımdan sonra gerçek‑dünya kanıtları gözden geçirilmelidir; çevrim dışı performansın devam edeceği varsayılmamalıdır. Veri kaynakları, kullanıcılar, modeller, satıcılar, politikalar, donanım ya da hedefler değiştiğinde yeniden değerlendirme yapılmalıdır. Bakımlı bir sistem ayrıca belgelenmiş kurtarma, olay öğrenimi, silme ve saklama prosedürleri ve ne zaman devre dışı bırakılması ya da değiştirilmesi gerektiği konusunda net bir nokta içermelidir.

Temel Referanslar

Blog yazarı ve programcı, Machine Learning ve Deep Learning konularında uzmanlık sahibi. Daniel, başkalarının AI'nin gücünü sosyal fayda için kullanmasına yardımcı olmak umudu taşıyor.