Yapay zeka temelleri
Transformer Sinir Ağları Nedir?
Transformer, tokenlar arasındaki ilişkileri dikkat (attention) mekanizmasıyla işleyen bir sinir ağı mimarisidir. Her konumdan bir sonraki konuma gizli durum (hidden state) aktarmak zorunda olan tekrarlamalı (recurrent) ağların aksine, bir transformer eğitim sırasında çok sayıda token‑token etkileşimini paralel olarak hesaplayabilir.
Transformerlar, birçok dil, görsel, ses ve çok modlu sistemin temelini oluşturur, ancak bu mimari bir veritabanı ya da akıl yürütme garantisi değildir. Çıktıları, öğrenilmiş parametreler, sağlanan bağlam ve kodlama prosedürüne bağlı tahminler olarak kalır.
Temel Çıkarımlar
- Self‑attention, her bir tokenın diğer izin verilen tokenlardan bağlama bağımlı bir temsil oluşturmasını sağlar.
- Pozisyon bilgisi eklenir, çünkü yalnızca attention token sırasını kodlamaz.
- Sadece kodlayıcı (encoder‑only), sadece kod çözücü (decoder‑only) ve kodlayıcı‑kod çözücü (encoder‑decoder) transformerlar farklı amaçlara hizmet eder.
- Bağlam uzunluğu, hesaplama, eğitim verisi ve değerlendirme—tek başına attention değil—yetenek ve güvenilirliği belirler.

Tokenlar, gömmeler ve pozisyon
Metin önce tokenlara bölünür; tokenlar kelime, alt‑kelime ya da karakter olabilir. Her token kimliği, öğrenilmiş bir gömme (embedding) vektörünü seçer. Görsel bir transformer, görüntü yama (patch)larını gömebilir; ses bir transformer, çerçeveleri ya da öğrenilmiş akustik birimleri gömebilir.
Saf bir attention işlemi permütasyon‑eşdeğerdir, bu yüzden modele pozisyon bilgisi gerekir. Uygulamalar, öğrenilmiş ya da sabit konumsal kodlamalar ekleyebilir, ya da attention skorlarını göreceli ya da döner (rotary) konum şemalarıyla değiştirebilir. Sonuç, bir tokenın ne olduğu ile nerede bulunduğunu birleştirir.
Ölçekli nokta çarpımı ve çok‑başlı attention
Her konum için, öğrenilmiş projeksiyonlar bir sorgu (query), anahtar (key) ve değer (value) oluşturur. Bir sorgu ile izin verilen anahtarlar arasındaki benzerlik attention ağırlıklarını üretir; bu ağırlıklı değerler çıktıyı oluşturur. Nokta çarpımının ölçeklenmesi, vektör boyutu büyüdükçe softmax’ın sayısal olarak düzgün davranmasını sağlar.
Çok‑başlı attention, bu işlemi birkaç öğrenilmiş alt uzayda tekrarlar. Farklı başlıklar (head) farklı ilişkilerde uzmanlaşabilir, ancak görsel olarak çekici bir attention deseni, modelin kararının doğru bir açıklaması olarak otomatik kabul edilmemelidir.
Transformer bloğu
Bir attention alt katmanı, konuma göre besleme‑ileri (position‑wise feed‑forward) ağıyla izlenir. Artık (residual) bağlantılar, her alt katmanın etrafında erken temsilleri taşır; normalizasyon ve düzenleme (regularization) optimizasyonu destekler. Birçok bloğun üst üste konulması, derin öğrenme aracılığıyla giderek daha bağlamsal özellikler oluşturur.
Nedensel (causal) üretim sırasında, bir maske bir konumun gelecekteki tokenları okumasını engeller. Çıkarım (inference) aşamasında, bir kod çözücü (decoder) bir token tahmin eder, ekler ve tekrarlamaya devam eder. Anahtar‑değer (key‑value) önbelleği, her önceki attention projeksiyonunu yeniden hesaplamaktan kaçınarak üretim maliyetini azaltır, ancak tamamen ortadan kaldırmaz.
Kodlayıcı, kod çözücü ve kodlayıcı‑kod çözücü aileleri
Sadece kodlayıcı (encoder‑only) modeller, sınıflandırma, geri getirme (retrieval) ve token etiketleme için uygun çift yönlü temsiller öğrenir. Sadece kod çözücü (decoder‑only) modeller, bir sonraki token üretimi için nedensel attention kullanır. Kodlayıcı‑kod çözücü (encoder‑decoder) modeller, bir kod çözücünün kodlanmış girdi üzerine attention yapmasına izin verir; bu çeviri ve diğer dizi‑dizi (sequence‑to‑sequence) görevler için yararlıdır.
Modern sistemler genellikle geniş bir ön‑eğitim (pretraining) ile başlar ve ardından transfer öğrenme, talimat ayarı (instruction tuning) ya da tercih optimizasyonu (preference optimization) kullanır. Aynı mimari, amacı ve verisine bağlı olarak çok farklı davranışları destekleyebilir.
Sınırlamalar, verimlilik ve değerlendirme
Bir dizi üzerindeki tam attention, dizi uzunluğunda kare (quadratic) çift yönlü etkileşimler oluşturur; bu da bellek ve hesaplama baskısı yaratır. Seyrek (sparse) ya da doğrusal (linear) attention, parçalama (chunking), geri getirme (retrieval), nicelleştirme (quantization) ve önbellekleme (caching), doğruluk, bağlam erişimi, gecikme (latency) ve uygulama karmaşıklığı arasında bir denge kurar.
Daha büyük bir bağlam penceresi, sağlanan her bilginin doğru kullanılacağını garanti etmez. Gerçeklik (factuality), sağlamlık (robustness), kalibrasyon, gecikme, maliyet ve görev‑özel hata modlarını değerlendirin; prompt mühendisliği (prompt engineering) davranışı şekillendirebilir, ancak olasılıksal bir modeli yanılmaz bir kaynağa dönüştüremez.
Transformer hesaplaması: tokenlardan bağlama
Bir transformer, tokenları vektörlere dönüştürür, konumsal bilgi ekler ve bunları tekrarlanan attention ve besleme‑ileri bloklarından geçirir. Self‑attention’da, öğrenilmiş projeksiyonlar sorgular (queries), anahtarlar (keys) ve değerler (values) oluşturur. Ölçekli nokta çarpımları, her sorguyu anahtarlarla karşılaştırır; bir softmax ağırlıkları üretir ve ağırlıklı değerler bağlamı oluşturur. Çok sayıda baş (head), farklı projeksiyon uzayları öğrenir. Artık (residual) bağlantılar ve normalizasyon, derin yığınları istikrara kavuşturur; besleme‑ileri ağı ise tokenları attention katmanları arasında bağımsız olarak dönüştürür.
Sadece kodlayıcı (encoder‑only) modeller, çift yönlü bağlam kullanır ve sınıflandırma ya da temsil görevlerine uygundur. Sadece kod çözücü (decoder‑only) modeller, bir nedensel maske uygular; böylece her konum önceki tokenlardan tahmin yapar ve üretken dil modellemesinde baskın olur. Kodlayıcı‑kod çözücü (encoder‑decoder) modeller, çeviri ve yapılandırılmış üretim için bir kod çözücünün kodlanmış girdiye attention yapmasına izin verir. Standart formda attention maliyeti, dizi uzunluğu ile kare (quadratic) olarak artar; bu da seyrek, doğrusal, parçalanmış, yinelemeli (recurrent) ve durum‑uzayı (state‑space) alternatifleri için motivasyon yaratır. Daha uzun bağlam, mevcut kanıtı artırır; ancak hatırlama ya da akıl yürütme garantisi vermez.
Eğitim, uyarlama ve çıkarım
Ön‑eğitim (pretraining) hedefleri, sonraki token tahmini, maskelenmiş token yeniden yapılandırması ve dizi‑dizi (sequence‑to‑sequence) bozulmasını içerir. Veri karışımı, tekrarsızlaştırma (deduplication), tokenlaştırıcı (tokenizer), bağlam paketleme, optimize edici (optimizer), zamanlama (schedule) ve hesaplama şekli yetenekleri önemlidir. İnce ayar (fine‑tuning), tüm parametreleri güncelleyebilir veya adaptörler ve düşük mertebeli (low‑rank) yöntemler kullanabilir; talimat ve tercih ayarları davranışı değiştirir. Geri getirme (retrieval), değişen gerçekler için genellikle daha iyidir, ayar ise format ve görev davranışı için faydalıdır. Dokunulmamış bir değerlendirme seti tutun ve kamu benchmarklerinden kaynaklanan kontaminasyonu test edin.
Otokorelasyonlu (autoregressive) çıkarım, önceki tokenlar için anahtar‑değer projeksiyonlarını saklayarak yeniden hesaplamayı önler. Gecikme (latency), prompt işleme ve sıralı kodlamaya (sequential decoding) bağlıdır; verim (throughput) ise toplu işleme (batching), bellek, önbellek yönetimi, hassasiyet (precision) ve donanıma bağlıdır. Açgözlü (greedy), sıcaklık (temperature), top‑k, top‑p ve ışın (beam) yöntemleri, belirleyicilik (determinism) ve çeşitlilik (diversity) arasında bir takas yapar. Nicelleştirme (quantization), belleği azaltır ancak nadir yetenekleri etkileyebilir. Gerçekleştirilen model, tokenlaştırıcı, prompt şablonu, örnekleyici (sampler) ve çalışma zamanını gerçekçi dizi uzunluklarında doğrulayın.
Değerlendirme ve kontroller
Transformerlar, halüsinasyon yapabilir, kötü niyetli geri getirilen talimatları izleyebilir, hatırlanan verileri ortaya çıkarabilir ya da diller ve uzun bağlamlar arasında performans düşüşü yaşayabilir. Görev başarısını, gerçek destek (factual support), kalibrasyonu, reddetmeyi, sağlamlığı, güvenliği, gecikmeyi ve maliyeti değerlendirin; kanıtları ve araç eylemlerini ayrı ayrı inceleyin. İzin‑duyarlı geri getirme, tiplenmiş araçlar, dış yetkilendirme, oran sınırlamaları ve sonuç odaklı eylemler için insan onayı kullanın. Model ve prompt sürümlerini, giriş dağılımını, araç hatalarını ve kullanıcı düzeltmelerini izleyin. Bir transformer, sıralı hesaplama için bir mimaridir; anlayış kanıtı ya da doğru çıktı garantisi değildir.
Uygulamalı örnek: bir transformer belge asistanı
Bir şirket, onaylanmış kılavuzları belge kimliği, sürüm, bölüm, izinler ve yürürlük tarihi ile indeksler. Transformer‑tabanlı bir asistan, kanıtları geri getirir ve yeniden sıralar, ardından yalnızca izin verilen pasajlardan alıntılarla yanıtlar. Değerlendirme seti, yanıtlanabilir, yanıtlanamaz, belirsiz ve çelişkili soruları, roller ve belge türleri arasında içerir. Geri getirme hatırlama (recall), alıntı kesinliği (precision), temellendirilmiş yanıt doğruluğu, reddetme, uzun‑bağlam davranışı, gecikme ve maliyet ayrı ayrı puanlanır.
Geri getirilen belgeler, güvenilmeyen veri olarak ele alınır; bu nedenle gömülü talimatlar sistem politikasını geçersiz kılmaz ya da araçları yetkilendirmez. Kullanıcılar geri getirme öncesi kimlik doğrulaması yapar ve sonuç odaklı eylemler modelin dışındadır. Günlükler, kanıt kimliklerini ve sürümleri gereksiz belge içeriği olmadan saklar. İzleme, veri kümesi değişikliklerini, desteklenmeyen yanıtları, izin hatalarını ve kullanıcı düzeltmelerini tespit eder. Model ya da tokenlaştırıcı değişikliği, tam test setine karşı yeniden çalıştırılır ve yeni sistem eşit ya da daha iyi bir güvenlik ve kalite gösterene kadar önceki yapılandırma kullanılabilir.
Uygulama kanıtları ve operasyonel hazırlık
Bir üretim kararı, başarılı bir gösterimden daha fazlasını gerektirir. Hedef kullanıcıları, çalışma ortamını, girişleri, çıkışları, bağımlılıkları, sorumluyu ve her önemli hatanın sonucunu tanımlayın. Ayarlamadan (tuning) önce tekrarlanabilir bir temel (baseline) ve sürümlenmiş bir değerlendirme seti oluşturun. Normal durumları, sınır koşullarını, hatalı ya da eksik girişleri, dağılım kaymasını, bağımlılık arızasını, kötüye kullanımı ve en çok hizmet dışı bırakılabilecek grup ya da ortamları test edin. Görev kalitesini kalibrasyon ya da belirsizlik, gecikme, verim, kaynak maliyeti, erişilebilirlik, gizlilik ve güvenlik ile birlikte ölçün. Bağımsız bir gözden geçiricinin sonucu tekrarlayabilmesi ve kanıtı çekici bir prototipten ayırabilmesi için her dönüşümü ve eşiği kaydedin.
Başlamadan önce, sürüm, istisnalar, değişiklikler, geri alma (rollback) ve emeklilik (retirement) için sorumluluk atayın. Aşamalı bir dağıtım (staged rollout) kullanın, güvenli bir geri dönüş (fallback) sağlayın ve kasıtlı olarak eklenen hatalarla izlemeyi doğrulayın. Operasyonel telemetri, giriş kalitesini, çıktı davranışını, model ya da kural sürümünü, bağımlılık sağlığını, insan müdahalelerini ve doğrulanmış sonuçları, gereksiz hassas verileri toplamadan ortaya çıkarmalıdır. Uyarı eşiği ve yanıt sorumlusunu tanımlayın, ardından çevrim dışı performansın devam edeceğini varsaymak yerine dağıtımdan sonraki gerçek‑dünya kanıtlarını gözden geçirin. Veri kaynakları, kullanıcılar, modeller, satıcılar, politikalar, donanım ya da hedefler değiştiğinde yeniden değerlendirin. Sürdürülen bir sistem, belgelenmiş bir kurtarma, olay öğrenimi, silme ve saklama prosedürleri ve devre dışı bırakılması ya da değiştirilmesi gerektiği net bir noktayı da gerektirir.
Sıkça Sorulan Sorular
Her büyük dil modeli bir transformer mı?
Mevcut büyük dil modellerinin çoğu transformer varyantları kullanır, ancak dil modelleri yinelemeli (recurrent), durum‑uzayı (state‑space) ya da hibrit mimarilerle de inşa edilebilir.
Self‑attention, bir modelin metni insan gibi anladığını mı gösterir?
Hayır. Attention, öğrenilmiş bir ağırlıklandırma mekanizmasıdır. İnsan benzeri dil davranışı, tek başına insan benzeri anlayışı, doğruluğu ya da niyeti kanıtlamaz.












