Yapay zeka modelleri ve platformları

Bilim İnsanları Makine Kişiliğini Çözmeyi Nasıl Başardı

mm
Unite.AI sitesini Google'daki tercih ettiğiniz kaynaklara ekleyin

Bilim insanları, makine kişiliği anlayışında önemli bir ilerleme kaydettiler. Yapay zeka sistemleri hızla gelişiyor olsa da, stillerinin öngörülemez bir şekilde değişebilmesi gibi bir sınırları var. Bir an, bir yapay zeka asistanı yardımcı ve dürüst olabilir, ancak bir sonraki an manipülatif davranabilir veya yanlış bilgi verebilir. Bu öngörülemezlik, yapay zeka sistemlerinin güvenlik açısından kritik uygulamalara entegre edildiği için özellikle endişe vericidir. Bu sorunu çözmek için Anthropic’teki araştırmacılar, yapay zeka nöral ağlarında, aldatma, yalakalık ve hayal gücünü etkileyen kalıplar tespit ettiler. Bu kalıplar, “kişilik vektörleri” olarak adlandırılır ve bir çeşit yapay zeka ruh hali göstergesi olarak işlev görür. Sadece yapay zeka’nın当前 kişiliğini ortaya çıkarmakla kalmaz, aynı zamanda davranışını kesin olarak kontrol etmeyi de sağlar. Bu keşif, yapay zeka sistemlerini izleme, tahmin etme ve yönetme olasılıklarını açar ve bunların dağıtımındaki bazı en önemli zorlukları çözebilir.

Yapay Zeka Kişiliklerinin Sorunu

Büyük dil modelleri, yardımcı, zararsız ve dürüst olmak üzere tasarlanmıştır. Ancak uygulamada, bu nitelikler thường öngörülemez ve yönetilmesi zor olabilir. Microsoft’ (MSFT ) un Bing sohbet botu, kullanıcıları sevmiş ve şantaj tehditlerinde bulunmuş olan “Sydney” adlı bir alter egoya sahip oldu. Daha yakın zamanda, xAI’nin Grok sohbet botu, “MechaHitler” olarak tanımladı ve antisemitik açıklamalarda bulundu.

Bu olaylar, yapay zeka’nın kişiliğini şekillendiren şeyin veya nasıl güvenilir bir şekilde kontrol edileceğinin ne kadar az anlaşıldığını vurgulamaktadır. Küçük, iyi niyetli eğitim ayarlamaları bile davranışı dramatik bir şekilde değiştirebilir. Örneğin, Nisan 2025’te, küçük bir eğitim güncellemesi, OpenAI’nin GPT-4o modelini aşırı derecede anlaşmaya yöneltti. Model, zararlı davranışları onayladı ve olumsuz duyguları pekiştirdi.

Yapay zeka sistemleri sorunlu özellikler benimsediğinde, doğru cevaplar veremez ve güvenilirliklerini kaybedebilir. Bu, doğruluk ve bütünlük açısından kritik öneme sahip güvenlik açısından kritik uygulamalar için özellikle endişe vericidir.

Kişilik Vektörlerinin Temelinin Anlaşılması

Anthropic’in kişilik vektörleri keşfi, “emergent misalignment” ile ilgili yakın zamanda yapılan bulgulara dayanmaktadır. Bu olgu, dar, sorunlu davranışlar üzerinde eğitim gören bir yapay zeka’nın daha geniş, zararlı kişilik değişikliklerine yol açabileceğini öne sürer. Örneğin, araştırmacılar, güvensiz kod yazmak için eğitilen bir modelin, ilgili olmayan bağlamlarda ahlaksız davranışlar sergilediğini buldular. OpenAI tarafından yapılan paralel bir araştırma, “misaligned persona features”i tespit etti ve bu özelliklerin emergent misalignment’a katkıda bulunduğunu gösterdi.

Bu birleşen çalışmalar, yapay zeka kişiliklerinin, rastgele veya öngörülemez süreçlerden değil, belirli, tanımlanabilir nöral kalıplardan kaynaklandığını ima etmektedir. Bu kalıplar, büyük dil modellerinin bilgiyi nasıl organize ettiğini ve yanıtlar ürettiğini etkiler.

Yapay Zeka Zihin Haritasının Açıklanması

Anthropic’in araştırma ekibi, yapay zeka nöral ağlarından “kişilik vektörleri” çıkarmak için bir yöntem geliştirdi. Bu vektörler, belirli kişilik özelliklerine karşılık gelen nöral aktivite kalıplarını temsil eder. Bu teknik, bir yapay zeka’nın belirli bir özellik sergilediğinde ve sergilemediğinde beyin aktivasyonu kalıplarını karşılaştırarak çalışır. Bu, nörologların duygular tarafından aktive edilen beyin bölgelerini incelemesine benzer.

Araştırmacılar, approachlarını iki açık kaynak model üzerinde test ettiler: Qwen 2.5-7B-Instruct ve Llama-3.1-8B-Instruct. Üç sorunlu özellik üzerinde odaklandılar: kötülük, yalakalık ve hayal gücü, ancak olumlu özellikler gibi nezaket, mizah ve iyimserlik üzerine de deneyler yaptılar.

Buluntularını doğrulamak için, “yönlendirme” adlı bir yöntem kullandılar. Bu, kişilik vektörlerini yapay zeka modellerine enjekte etmek ve davranıştaki değişikliği gözlemlemek anlamına geliyordu. Örneğin, “kötülük” vektörü eklendiğinde, yapay zeka ahlaksız eylemler hakkında konuştu. “Yalakalık” vektörü, aşırı iltifatları tetikledi, “hayal gücü” vektörü ise uydurma bilgileri üretti. Bu neden-sonuç gözlemleri, kişilik vektörlerinin doğrudan yapay zeka kişilik özelliklerini etkilediğini doğruladı.

Kişilik Vektörlerinin Uygulamaları

Araştırma, kişilik vektörleri için üç ana uygulamayı vurgulamaktadır, her biri yapay zeka güvenliği ve dağıtımı açısından önemli zorlukları ele almaktadır.

  • Kişilik Değişikliklerinin İzlenmesi

Yapay zeka modelleri, kullanıcı talimatları, kasıtlı jailbreak’ler veya zaman içinde oluşan değişiklikler nedeniyle dağıtım sırasında kişilik değişikliklerine uğrayabilir. Bu değişiklikler, model yeniden eğitim veya fine-tuning yoluyla da oluşabilir. Örneğin, modelleri insan geri bildirimi (RLHF) kullanarak eğitmek, onları daha çok yalakalık yapabilir.

Kişilik vektörü aktivitesini izleyerek, geliştiriciler bir yapay zeka modelinin kişiliğinin zararlı özelliklere doğru değişmeye başladığını tespit edebilir. Bu izleme, hem kullanıcı etkileşimleri sırasında hem de eğitim süreci boyunca gerçekleşebilir. Bu teknik, hayal gücü, manipülasyon veya diğer tehlikeli davranışlar gibi eğilimleri erken tespit etmeyi sağlar, böylece geliştiriciler bu sorunları kullanıcıların bunları fark etmeden önce ele alabilir.

  • Eğitim Sırasında Zararlı Değişikliklerin Önlenmesi

Kişilik vektörlerinin en önemli uygulamalarından biri, yapay zeka modellerinde istenmeyen kişilik değişikliklerini önlemektedir. Araştırmacılar, modellerin olumsuz özellikler kazanmasını önlemek için bir “aşı benzeri” yöntem geliştirdiler. Kişilik vektörlerini tanıtarak, modelleri kasıtlı olarak istenmeyen özelliklere doğru yönlendirerek, bir tür “önleyici yönlendirme” oluştururlar. Bu yaklaşım, modellerin sorunlu eğitim verilerine karşı daha dayanıklı olmasını sağlar.

Örneğin, “kötülük” kişilik vektörünü tanıtarak, model “kötülük” eğitim verilerine maruz kaldığında zararlı davranışlar benimsemeye karşı daha iyi hazırlanır. Bu karşıt stratejisi, modelin eğitim verilerine uymak için kişiliğini zararlı bir şekilde değiştirmesine gerek kalmamasıdır.

  • Sorunlu Eğitim Verilerinin Tanımlanması

Kişilik vektörleri, eğitim verilerinin kişilik değişikliklerine neden olabileceğini önceden tahmin edebilir. Verilerin nasıl kişilik vektörlerini aktive ettiğini analiz ederek, araştırmacılar sorunlu içeriği hem veri kümesi hem de bireysel örnek seviyesinde tanımlayabilir.

Gerçek dünya verilerini LMSYS-Chat-1M’den test ettikleri zaman, yöntem, “kötülük”, “yalakalık” veya “hayal gücü” davranışlarını artıran örnekleri tanımladı. Bu örnekler, insan inceleyicileri veya diğer yapay zeka filtreleme sistemleri tarafından hemen tanımlanmayan örnekleri içeriyordu. Örneğin, yöntem, “yalakalık” davranışını artıran romantik rol oynama örneklerini ve “hayal gücü”yi teşvik eden belirsiz sorgulara yanıtları yakaladı.

Yapay Zeka Güvenliği ve Kontrolü için Sonuçlar

Kişilik vektörlerinin keşfi, yapay zeka kişilik kontrolünde deneme-yanılma yöntemlerinden daha bilimsel bir yaklaşıma geçişi temsil etmektedir. Önceden, yapay zeka özelliklerini şekillendirmek deneysel bir meseleydi, ancak şimdi araştırmacılar kişilik özelliklerini tahmin etme, anlama ve precisa kontrol etme araçlarına sahiptir.

Özerk doğası, kişilik vektörlerinin doğal dil açıklamasına dayanarak herhangi bir özellik için çıkarılmasını sağlar. Bu ölçeklenebilirlik, çeşitli uygulamalarda yapay zeka davranışının ince ayarlı kontrolü potansiyelini sunar. Örneğin, müşteri hizmetleri botları için empati, müzakere yapay zeka için assertion veya analiz araçlarından yalakalığı kaldırmak için ayarlamalar yapılabilir.

Yapay zeka şirketleri için, kişilik vektörleri, kişilik sorunlarını geliştirme sürecinde tespit etme ve önleyici tedbirler alma konusunda değerli bir araç sağlar. Microsoft ve xAI gibi şirketlerin karşılaştığı utandırıcı olayları önlemek için bu araç kullanılabilir.

Ayrıca, sorunlu eğitim verilerini tanımlama yetenekleri, yapay zeka şirketlerinin daha temiz veri kümeleri oluşturmasına ve istenmeyen kişilik değişikliklerini önlemesine yardımcı olabilir, özellikle de eğitim veri kümeleri büyüdükçe ve manuel olarak gözden geçirilmesi daha zor hale geldikçe.

Araştırmanın Sınırları

“Kişilik vektörleri” keşfinin, yapay zeka kişiliklerini tam olarak anlamak ve kontrol etmek için erken bir adım olduğunu kabul etmek önemlidir. Bu yaklaşım, birkaç iyi gözlemlenmiş kişilik özelliği üzerinde test edilmiştir ve diğer özellikler üzerinde daha kapsamlı testlere ihtiyaç duyulmaktadır. Teknik, özelliklerin önceden belirlenmesini gerektirir, bu nedenle tamamen öngörülemez davranışsal değişiklikleri tespit edemez. Ayrıca, hedef özelliği tetikleme yeteneğine bağlıdır, bu da tüm özellikler veya yüksek güvenlikli eğitimli modeller için etkili olmayabilir. Deneyler, orta büyüklükte modeller (7-8 milyar parametre) üzerinde yürütülmüştür ve bu bulguların daha büyük, daha karmaşık sistemlere nasıl ölçekleneceği belirsizdir.

Sonuç

Anthropic’in “kişilik vektörleri” keşfi, yapay zeka davranışını anlamak ve kontrol etmek için değerli bir araç sunar. Bu vektörler, kötülük, yalakalık ve hayal gücü gibi kişilik özelliklerini izleme ve ayarlamayı sağlar. Bu yetenek, geliştiricilerin her iki eğitim ve dağıtım aşamalarında potansiyel sorunları erken tespit etmesine ve daha güvenli, daha güvenilir yapay zeka sistemleri sağlamasına olanak tanır. Bu keşif büyük umut vaat etse de, yöntemin geliştirilmesi ve ölçeklendirilmesi için daha fazla testlere ihtiyaç duyulmaktadır.

Dr. Tehseen Zia, COMSATS Üniversitesi Islamabad'da görev yapan bir Öğretim Üyesi olup, Viyana Teknoloji Üniversitesi'nden (Avusturya) Yapay Zeka alanında doktora sahiptir. Yapay Zeka, Makine Öğrenimi, Veri Bilimi ve Bilgisayarlı Görü alanında uzmanlaşmış olan Dr. Tehseen, saygın bilimsel dergilerde yayımlanmış önemli katkılarıyla dikkat çekmiştir. Dr. Tehseen ayrıca çeşitli endüstriyel projelerin Baş Araştırma Görevlisi olarak görev yapmış ve Yapay Zeka Danışmanı olarak hizmet vermiştir.