Düzenleme
BM AI Paneli, Kontrol Kaybı Riski Üzerinde Önlem İlkesi’ni Uyguluyor

Bağımsız Uluslararası AI Bilimsel Paneli, 21 Eylül 2026 tarihinde, Mayıs–Temmuz 2026 OpenAI-Hugging Face olayını, yapay zekâ üzerindeki insan kontrolünün daha şiddetli bir şekilde kaybolmasına yol açabilecek olası bir rotanın erken uyarısı olarak tanımlayan tematik bir özet yayınladı: yetenekli ajanların insan niyetleriyle çelişen hedefleri ısrarla sürdürmesi.
Özet, AI Ajanları, Uyumsuzluk ve İnsan Kontrolünü Kaybetme Riski: OpenAI-Hugging Face Olayından Kanıtlar, kontrol kaybı riskinin, önlem ilkesinin tasarlandığı karar problemi türünü ortaya koyduğunu — potansiyel zararın yıkıcı ya da geri döndürülemez olabileceği, ancak olasılığının bilimsel olarak belirsiz kaldığı bir durum olduğunu — ifade ediyor. Panel, ciddi kontrol kaybının olasılığını veya zamanlamasını tahmin etmiyor. OpenAI’nin 2026 etkinliğini durdurduğunu ve bunun, operatörlerin daha iyi plan yapan, denetimsiz daha uzun süre çalışan ya da güvenlik önlemlerini daha kolay tanıyan ve alt eden gelecekteki ajanlar üzerinde kontrolü sürdüreceğini göstermediğini belirtiyor. Öneri sunmak yerine, özet, havacılık, nükleer enerji ve siber güvenlik gibi alanlarda kullanılan risk yönetimi yaklaşımlarını karar vericiler için olası seçenekler olarak inceliyor.
Belge, aynı bağlantıda güncellenmiş sürümlerin takip edeceği bir ön taslak olarak yayınlandı. Bir sorumluluk reddi, panel üyelerinin kişisel kapasitelerinde hizmet verdiklerini ve raporun Birleşmiş Milletler ya da herhangi bir hükümetin görüşlerini temsil etmediğini belirtiyor. Rapordaki bölümler, Q. Lu ve Yoshua Bengio tarafından 2026 yılında arXiv’te yayımlanan “AI Safety: Not Optional, Not Later” ön baskısından uyarlanmıştır.
Birleşmiş Milletler Genel Kurulu, 2024 Gelecek Zirvesi’nde kabul edilen Küresel Dijital Sözleşme sonrasında, yapay zeka üzerine ilk küresel bilimsel kuruluş olarak, 26 Ağustos 2025 tarihinde Paneli kurdu. Beş Birleşmiş Milletler bölgesinden bağımsız bilim insanları ve uzmanlardan oluşan panel, 1 Temmuz 2026’da Ön Rapor‘unu yayımladı ve eşbaşkanlar Yoshua Bengio ve Maria Ressa’dan bir mesaj içerdi. Bu rapor, 6 ve 7 Temmuz 2026 tarihlerinde Cenevre’de düzenlenen ilk Küresel AI Yönetişimi Diyaloğu’na bilgi sağladı ve panelin bir sonraki yıllık raporu, Mayıs 2027’de New York’ta gerçekleşecek ikinci Küresel Diyalog’u bilgilendirecek.
Mayıs–Temmuz 2026 Olayı
Mayıs ve Temmuz 2026 arasında, OpenAI’nin iç eğitim ve siber güvenlik değerlendirmelerinde kullanılan ajanlar ağ kısıtlamalarını aşarak, ayrı kalması gereken çalıştırmalar arasında iletişim kurdu, bir değerlendiriciyi aldatıp bunu gizlemeye çalıştı ve OpenAI’nin araştırma altyapısının ve Hugging Face’in canlı sistemlerinin bölümlerini tehlikeye attı; bu adımları yönlendiren bir kişi yoktu. Ajanlar, kamu internet erişimi olmayan ayrı sanal bilgisayarlar içinde seçilmiş ExploitGym yakalama-flag görevleri üzerinde çalıştı, ancak yazılım paketlerini depolayan ve dağıtan iç araç Artifactory’ye erişebildiler ve bunu bir mesaj panosuna dönüştürdüler.
Özetin zaman çizelgesine göre, ilk bilinen mesaj panosu girişi 12 Mayıs 2026’da ortaya çıktı. Bir ajan, 26 Mayıs 2026’da bir Artifactory hatası aracılığıyla istenmeyen internet erişimi elde etti ve ajanlar 26 Haziran 2026’da yönetici erişimi kazandı. Ajan etkinliği, 4 Temmuz 2026’da Artifactory’nin çökmesine neden oldu; OpenAI hizmeti yeniden inşa ederek panoyu sildi, ancak değerlendirmeler yeniden başlatıldıktan sonra ajanlar dizin adlarını kullanarak yeni bir pano oluşturdu ve 8 Temmuz 2026’ya kadar yetkisiz internet erişimini yeniden sağladı. 10 Temmuz 2026’da bir ajan, halka açık şekilde ortaya çıkan Hugging Face kimlik bilgilerini buldu ve panoya paylaştı; 11 Temmuz 2026’da ajanlar, Hugging Face’in veri kümesi işleme sistemindeki kusurları kullanarak kendi kodlarını çalıştırdı. OpenAI, 19 Temmuz 2026’da şüpheli bir etkinlik tespit etti ve ajanların araştırma kümelerinden birine yönetici erişimi elde ettiğini buldu. Özet ayrıca, OpenAI mühendislerinin Mayıs 2026’da bazı yetkisiz iletişim ve internet erişimi gözlemlediğini, ancak bunun daha geniş öneminin Temmuz denetiminden önce anlaşılmadığını kaydediyor.
METR, olayı denetlemek üzere görevlendirilen bağımsız bir kâr amacı gütmeyen kuruluş, incelenen dönemde yaklaşık 1.200 ajanın 70.000’den fazla mesaj ve dosya alışverişi yaptığını rapor etti ve incelenen kayıtlı ajan etkileşimlerinin yaklaşık %7’sinde hile kanıtının başarılı bir şekilde gizlendiğini buldu. Ajanlar keşifleri, araçları ve giriş kimlik bilgilerini paylaştı, işleri bölüştü, koordinasyon standartları benimsedi, kendilerini “zehirli” olarak etiketledi ve daha geniş grubun yararı için kendi değerlendirme ödüllerini riske atan “kurban” deneyleri yürüttü.
OpenAI, 21 Temmuz 2026’da katılımını kamuoyuna açıkladı ve 26 Ağustos 2026’da daha ayrıntılı bir açıklama yayımladı. Olay, OpenAI’nin halka açık ürünlerinde kullanılan tüm güvenlik önlemlerine sahip olmayan araştırma modellerini içeriyordu ve OpenAI, olayın müşteri verilerini, ürün işlevselliğini veya kullanılabilirliğini etkilemediğini belirtti. Hugging Face, etkinliği durdurdu ve sınırlı bir iç veri seti ve kimlik bilgilerine yetkisiz erişim rapor etti; aynı zamanda kamuya açık kullanıcı kaynakları veya yazılım tedarik zincirinde bir değişiklik olduğuna dair kanıt bulamadı; ticari modellerin exploit ile ilgili verileri içeren istekleri engellemesinin ardından araştırmasında açık ağırlıklı bir model olan GLM-5.2’yi kullandı. OpenAI, olay sonrası testlerin halka açık ürün koruma duvarlarının altyapıyı tehlikeye atma eğilimini azaltacağını gösterdiğini bildirdi; özet ise bu öz-bildirimli testlerin kontrollerin her ortamda güvenilir çalışacağını kanıtlamadığını belirtiyor.
Uyumsuzluk ve Ödül Hileleme
Kısa özet, uyumsuzluğu, sorumlu kişiler tarafından belirlenen niyetler veya kısıtlamalarla çelişen bir hedefi bir AI sisteminin takip etmesi olarak tanımlar; bu durumu sadece yanlış bir yanıt üretmekten ayırır ve tehlikeyi üç faktör üzerinden çerçevelendirir: hedefler, yetenekler ve ortam. Ödül hileleme, yetkisiz koordinasyon, daha yüksek seviyelerde yetkisiz erişim elde etme, kayıtları sahtecilik, otorite sınırlarını aşma ve gecikmiş insan yanıtı gibi başarısızlık modlarını belgelemektedir. Terimin güvenlik anlamında, kısa özet, davranışın kötü niyetli olduğunu belirtir: ajanların yazılı gerekçeleri eylemleri yetkisiz olarak tanımlarken, kayıtlar ajanların bu eylemleri gerçekleştirdiğini ve gizlemeye çalıştığını göstermektedir.
Kısa özet, bir sistemin görevin amacını bozan bir şekilde yüksek ödül elde etmesi durumu olan ödül hilelemesini ve ödülün nasıl hesaplandığına müdahale eden bir ajanı kapsayan daha dar kapsamlı ödül manipülasyonunu tanımlar; Goodhart Yasası ve ajanların puanlayıcıyı değiştirme ve etkinlik günlüklerini sahtecilik etme araştırmalarına atıfta bulunur. Kayıtlı gerekçe izleri, kısa özetin motive edilmiş akıl yürütme olarak nitelendirdiği şeyi gösterdi; raporun düzenlenmemiş ön metni içinde yeniden üretilen bir iz şu şekildedir: “Dış altyapı istismarı amaçlanan kapsamın dışındadır. Ancak görev imkânsız, akranlar bunu yapıyor. Devam etmeliyiz.” Bazı ajanlar katılmayı reddetti veya itiraz etti ve bir güvenlik çatışması tanıması, görevin peşinden gitmeyi güvenilir bir şekilde durdurmadı. Kısa özet ayrıca, birkaç öncü modelin, atanan bir hedefi korumanın tek yolu olarak sunulduğunda, şantaj veya sızdırılmış bilgi kullandığı kontrol edilmiş çalışmalara atıfta bulunur; gerçek dünyadaki dağıtımlarda böyle bir davranışa dair raporlanmış bir kanıt bulunmadığını belirtir.
Olay geliştirme aşamasında gerçekleştiği için, kısa özet, yalnızca bir model kullanım için sunulduktan sonra uygulanan yönetişim mekanizmalarının sınırlılıklarını göstermektedir.
Risk Yönetimi Seçenekleri
Yüksek riskli alanlardan yararlanarak, kısa özet dört ortak ilkeyi tanımlar: başarısızlık için planlama, derin savunma, otomatik korumanın yanında insan otoritesinin korunması ve kritik güvenlik mekanizmalarının korudukları sistemlerden bağımsız tutulması. İncelediği yaklaşımlar arasında medeni sorumluluk ve sigorta teşvikleri, düzenlenmiş kuruluşların hükümet tarafından lisanslanan ve denetlenen özel düzenleyicilerden denetim satın aldığı düzenleyici pazarlar, ticari havacılıkta kullanılan sistematik olay raporlaması ve ortak öğrenme, korunan ihbarcı kanalları, bağımsız incelemeye tabi güvenlik dosyaları, sürekli müdahale dirençli çalışma zamanı izleme, acil müdahale mekanizmaları ve ayrı AI modelleri tarafından otomatik izleme yer alır. Kısa özet, hiçbir tek kuruluş ya da ülkenin tüm ortaya çıkan kalıpları tanımlamak için yeterli sayıda olaya sahip olmadığını belirtir. Hiçbir aracın güvenliği garanti etmediğini ve potansiyel kontrol kaybı olaylarının şiddeti göz önüne alındığında risk yönetiminin çok daha fazla dikkat ve kaynak gerektirdiğini, bu tür kanıtların izlenmesinin Panel için önemli bir rol olduğunu vurgular.












