Düşünce Liderleri
İnsanların Düşündüğü Gibi Düşünen Yapay Zeka: LLM’ler ve Ajanların Zihni

Bugün, LLM’ler ve ajanlar, insan zihnini andıran bir şekilde öğrenme, analiz yapma ve karar verme yeteneklerine sahipler. Bunları oluşturan yaklaşımlar, already bizim bilişsel süreçlerimizi taklit ediyor ve eğitimlerinin ölçeği, insan deneyimini kat kat aşan bir büyüklüğe sahip. Bu, bizi böyle bir aracı yaratıyor olmanın anlamını sorgulamaya yöneltiyor: insan kapasitelerini genişleten bir araç mı yaratıyoruz, yoksa henüz öngörülemez sonuçlara sahip yeni bir zihin tipi mi ortaya çıkarmaya çalışıyoruz?
Modeller Nasıl Düşünür
LLM’ler ve ajanlar arasındaki kavramları ayırt etmek önemlidir. Bir bilgisayar ile analoji yapmak gerekirse, bir LLM, bir bileşenine, örneğin işlemciye benzeyebilir. Bir ajan ise, tüm sistemdir, çeşitli modüllere bağlı bir “ana kart” gibidir: bellek, grafik kartı ve ağ. Benzer şekilde, bir ajan, bir veya daha fazla LLM’yi içeren, karar verme mekanizmaları ve dış ortamla etkileşim araçları ile desteklenen karmaşık bir sistemdir.
Eğer tek bir LLM’nin çalışmasını düşünürsek, her şey desen eşleştirmeye indirgenir. Ancak bir ajan birden fazla LLM’yi zincirlediğinde, “düşündüğünü” söyleyebiliriz,尽管 bu süreç hala desenlere dayanmaktadır. Ajan, modeller arasındaki etkileşim mantığını oluşturur: Örneğin, bir LLM görevi analiz eder ve ajan, başka bir LLM’nin hangi eylemi gerçekleştirmesi gerektiğini belirler.
İnsan düşüncesi de benzer bir şekilde çalışır: Birikmiş bilgi ve desenlere dayanır, bunları doğru anda seçer, işler ve sonuçlar çıkarır. Bu süreç, akıl yürütme olarak adlandırılır.
ChatGPT, insan gibi, iki tür belleğe sahiptir: kısa süreli ve uzun süreli. Fark, insanların bu bellek düzeylerine erişiminin daha karmaşık ve lineer olmamasıdır.
Kısa süreli bellek, şu an üzerinde çalıştığımız bilgidir. Bir kişi için, bu, beş dakika önce söylediğiniz bir şey olabilir: hatırlayabilir veya hatırlamayabilirsiniz. GPT ise, her zaman “bağlam penceresi” içindeki her şeyi dikkate alır – bu verileri atlayamaz veya görmezden gelemez.
İnsanların uzun süreli belleği, her zaman aktif olmayan ve sadece belirli tetikleyicilerle ortaya çıkan anılardan oluşur: çocukluk anıları, travma veya psikolog ile çalışma. GPT’nin mantığı benzerdir: Bilgiyi kendiliğinden “hatırlamaz”, ancak özel olarak etkinleştirilirse, her oturumda uygulayabilir. Örneğin, “Bana bu soruyu bir daha sorma” veya “Her zaman bana resmi olarak hitap et” gibi talimatlar, uzun süreli bellekte saklanabilir.
Uzun süreli belleğin başka bir örneği, saklanan belgelerdir. Diyelim ki, GPT’ye pazar araştırması talimatı yüklediniz. Model, bu belgeyi bellekte saklayabilir, ancak bu, her soru için buna başvuracağı anlamına gelmez. “Ay’a bir el feneri tutabilir misiniz?” diye sorarsanız, model bu talimata dikkat etmez. Ancak talebiniz, belgenin metni ile eşleşen anahtar kelimeler içeriyorsa, model bunu “hatırlayabilir”.
Bu mekanizma, RAG (Retrieval-Augmented Generation) aracılığıyla uygulanır, bu da modelin, vektör veritabanlarındaki ilgili ipuçları ile tetiklenen depolanan bilgilere erişmesini sağlar.
Bu nedenle, modelin gerçekten belleği olduğu söylenebilir, ancak bu, insan belleğinden farklı, daha formalize bir mantığa dayanır.
Yapay Zeka ile Konuşma Neden Bazen Terapötik, Bazen Soğuk ve Robotik Hisseder?
Modern dil modelleri son derece büyüktür: devasa miktarda veri, bilgi ve bağlam içerirler. Tüm bu bilgiler, tematik ve anlamsal alanlar olarak adlandırılan “kümeler” halinde organize edilir. Model, kurgu ve bilimsel makalelerden YouTube yorumlarına kadar çeşitli kaynaklardan eğitim görmüştür.
Yapay zeka ile etkileşime girdiğinizde, sorgunuz (promt) effectively modeli belirli bir kümeğe yönlendirir.
Örneğin, “New York’ta 20 yıllık deneyime sahip bir emlak avukatıyım, bana bir daire satın almada yardım edin” diye yazarsanız, model aynı anda birkaç kümeği etkinleştirir: avukat → New York → emlak. Sonuç olarak, gerçek bir uzmanla konuştuğunuz izlenimi veren, tutarlı, ilgili ve gerçekçi bir yanıt alırsınız.
Eğer sorgunuz daha kişisel veya felsefi konuları içeriyorsa, örneğin kişisel gelişim veya duygular, model “diğer” kümelere geçer: psikoloji, felsefe veya iç çalışma. Bu durumda, cevapları insan gibi ve hatta terapötik gibi görünebilir.
Ancak, çok genel veya belirsiz bir ifadeyle, model “kaybolur” küme yapısında ve duygusal tonu olmayan, resmi ve mesafeli bir cevap verir.
Yapay zeka’nın cevabının tarzı ve derinliği, sorgunuzun hangi kümeğe yönelttiğine bağlıdır.
Model Eğitimi ve RLHF Felsefesi
Yapay zeka, öğrenme için farklı yaklaşımlara sahiptir. Bu, bir felsefe değil, bir stratejidir.
Klasik seçenek, denetimli öğrenmedir, burada model bir soru ve doğru cevap verilir. Model, neyin doğru olduğu gözlemleyerek öğrenir ve benzer çözümleri gelecekte tekrar üretir.
Diğer bir yaklaşım ise RLHF (Reinforcement Learning from Human Feedback) ‘dir. Bu, farklı bir tarzdır: model bir şeyler dener, başarılı eylemler için “ödül” alır ve davranışını ayarlar. Zamanla, etkili bir strateji geliştirir.
RLHF, ham maddeyi bitmiş ürüne dönüştürme sürecine benzeyebilir. Kullanışlı bir model oluşturmak için, insan geri bildirimi ile devasa bir çalışma gereklidir.
Diyelim ki, size doğrudan adını vermeden bir nesne gösteriyorum. Tereddüt edersiniz: “Sigara kutusu mu, kart tutucu mu?” Sadece ipuçları veririm: “Yakın”, “Uzak”, “%60 evet”. Yüzlerce böyle iterasyon sonra, tahmin edersiniz: “Ah, bir cüzdan!”
LLM’ler de bu şekilde eğitilir. İnsanlar, anotatörler ve genel olarak profesyoneller, değerlendirir: bu cevap iyidir, bu kötü, ve puanlar verir. Veri anotasyonu ve doğrulama konusunda uzman şirketler, Keymakr gibi, bu süreçte önemli bir rol oynar. Geri bildirim ayrıca sıradan kullanıcılar tarafından gelir: beğeniler, şikayetler ve tepkiler. Model, bu sinyalleri yorumlar ve davranış kalıpları oluşturur.
Model Eğitimi Nasıl Gerçekleşir?
OpenAI’nin gösterilen bir örnek, “Saklan ve Bul” oyununda pekiştirme öğrenimi kullanarak ajanları eğitmektir.
İki takım katıldı: “arananlar” (kırmızı) ve “saklananlar” (mavi). Kurallar basitti: bir aranan bir saklananı yakalarsa puan kazanırdı, yoksa puan kaybederdı. Başlangıçta, ajanlar sadece temel fiziksel yeteneklere sahipti: koşma ve zıplama, önceden tanımlanmış stratejiler olmadan.
İlk başta, arananlar düzensiz hareket ediyordu ve rakiplerini yakalamaları tesadüfiydi. Ancak milyonlarca iterasyon sonra, davranışları evrimleşti. Saklananlar, kapıları engellemek ve bariyerler oluşturmak için çevredeki nesneleri kullanmaya başladılar. Bu beceriler, doğrudan programlama olmadan, tekrarlanan girişimler ve başarılı olma ödülleri sayesinde ortaya çıktı.
Arananlar da, daha önce ihmal edilen bir yetenek olan zıplamayı kullanmaya başladılar. Bir dizi başarısızlıktan sonra, zıplamanın taktiksel değeri ortaya çıktı. Saklananlar da savunmalarını daha da güçlendirdiler, arananların görüşünden nesneleri kaldırdılar ve daha güvenilir sığınaklar inşa ettiler.
Deney, pekiştirme öğrenimi aracılığıyla, geliştiricilerin müdahalesi olmadan, karmaşık işbirliği davranışının oluşabileceğini gösterdi. Ayrıca, ajanlar, iletişim mekanizmaları programlanmasa da, takım çalışmasının daha etkili olduğu için, koordineli bir şekilde hareket etmeye başladılar.
Bu, büyük dil modelleri için de geçerlidir. Tüm senaryoları önceden programlamak mümkün değildir: çok fazla durum ve dünya üzerindeki değişkenlik vardır. Bu nedenle, modelimize sabit kurallar öğretmeyiz, öğrenmeyi öğretiriz.
Bu, RLHF’nin değeridir. Onsuz, bir LLM ve ajanlar sadece metin kütüphaneleridir. Onu ile, sohbet ortağı haline gelir, adapte olabilir, kendini düzeltebilir ve esasen evrimleşebilir.
Sonraki Adım Nedir?
Çok kişi, LLM’ler ve ajan gelişmelerinin istenmeyen veya hatta tehlikeli sonuçlara yol açıp açmayacağını merak ediyor.
Şu anda gördüğümüzün, yalnızca bir prototip olduğunu anlamak önemlidir, MVP bile değil.
Gerçek devrim, güzel bir mektup yazmanıza veya onu Fransızca’ya çevirmenize yardım etmek won’t. Bunlar küçük şeyler. Ana yön, mikro görevlerin ve rutin süreçlerin otomasyonu, insanlara sadece gerçekten yaratıcı, entelektüel görevler veya dinlenme zamanı bırakmaktır.
Gerçek yenilikler, bağımsız olarak düşünebilen, eylemde bulunabilen ve bir insan yerine karar verebilen ajanlar etrafında odaklanıyor. İşte bugün OpenAI, Google, Meta ve diğer şirketlerin odaklandığı yer burasıdır.
Büyük dil modelleri sadece temel oluşturuyor. Gelecek, dinamik bir dünyada yaşayabilen, geri bildirim alan ve değişikliklere adapte olabilen ajanlar eğitimine dayanıyor.












