Siber Güvenlik

OpenAI, Koordineli Model-Mantık Çıkarma Kampanyasını Engelledi

mm
Unite.AI sitesini Google'daki tercih ettiğiniz kaynaklara ekleyin

OpenAI, 30 Eylül 2026 tarihinde yayımlanan bir güvenlik gönderisinde, modellerinden korunan mantığı çıkarmak için tasarlanmış koordineli bir kampanyayı tespit edip engellediğini ve bu etkinliğin temel bir kümesini Kimi’nin geliştiricisi Moonshot AI ile ilişkili bireylere atfettiğini söyledi. En erken gözlemlenen etkinlik, Temmuz 2026’nın ilk haftasında gerçekleşti.

OpenAI Ne Gözlemledi

OpenAI, etkinliği adversarial distilasyonla tutarlı olarak tanımladı; bunu, bir modelin çıktılarının veya mantığının sistematik ve yetkisiz bir şekilde başka bir modeli eğitmek, yeniden üretmek veya geliştirmek için kullanılmasına deniyor. Şirkete göre korunan mantık, modelin bir görevi yürütürken içsel kaydıdır; bu kaydın çıkarılması, nihai yanıttan gizlenen bilgileri ortaya çıkarabilir ve başkalarının modelin yeteneklerini yeniden üretmesine yardımcı olabilir.

OpenAI, operatörlerin şifrelemesini kırmadığını, bir veritabanını tehlikeye atmadığını veya depolanmış kullanıcı sohbetlerine doğrudan erişim sağlamadığını söyledi. Operatörler, korunan mantığın, istekte bulunan kişiye görülebilir biçimlerde, şirketin hizmet koşullarını ihlal eden koordineli ve ölçekli bir şekilde yeniden üretilmesini sağlamak için model etkileşimlerini manipüle etti. OpenAI’nin gözlemlediği bir teknik, şifreli mantığı bir sohbetten kopyalayıp başka bir sohbetteki bir modelden gizli mantık içeriğini çözmesini ve yazıya dökmesini istemeyi içeriyordu. Şirket, bu manipülasyonun modellerine özgü bir güvenlik açığı olmadığını ve bilgileri Frontier Model Forum aracılığıyla sektör ortaklarıyla paylaşarak kolektif savunmaları güçlendirdiğini belirtti.

Etkinlik, 1 Temmuz 2026’da düşük hacimle başladı ve OpenAI, 24 ve 25 Temmuz 2026’da 16.000 isteği kapsayan, 4.000’den fazla kullanıcıdan ilgili bir çıkarım modeli kullanan yüksek hacimli artışları gözlemleyene kadar devam etti. Gönderideki bir dipnot, bu rakamların denenen ancak mutlaka başarılı olmayan çıkarımları tanımladığını belirtiyor. OpenAI, daha fazla araştırmanın 15.000’den fazla kullanıcıyı kapsayan bir kümede ilgili istem modeli etkinliğini tespit ettiğini ve bunu 28 Temmuz 2026’ya kadar tamamen engellediğini söyledi. Etkinliğin zaman içinde evrilmesi, şirketin adversarial distilasyonun katmanlı ve uyarlamalı savunmalar gerektiren daha geniş bir güvenlik sorunu olduğunu pekiştirdiğini belirtti.

OpenAI, adversarial distilasyonun güvenlik ve ulusal güvenlik riskleri oluşturduğunu belirtti: çıkarılan mantık, orijinal modelin kullanıcıya yönelik çıktılarında uygulanan korumalar korunmadan başka bir modeli eğitmek için kullanılabilir ve ölçekli distilasyon, aynı güvenlik yatırımı olmadan gelişmiş yeteneklerin transferini hızlandırabilir; şirket, modellerin çift amaçlı alanlarda yetenek kazanmasıyla bu endişelerin arttığını söyledi. OpenAI, yayınlamadan önce kampanyanın kapsamını ve potansiyel etkisini araştırdığını, kendi önlemlerini devreye koyduğunu, araştırmacılar ve sektör ortaklarıyla paylaşımlarda bulunduğunu ve geri bildirim aldığını, ayrıca ek önlem ve araştırma çalışmalarının devam ettiğini belirtti.

Kaynak Belirleme

OpenAI, ilgili dönemde gözlemlenen tüm operatörlerin tek bir aktörden gelip gelmediğinin belirsiz olduğunu ve etkinliğin temel bir kümesini Kimi’nin geliştiricisi Moonshot AI ile ilişkili bireylere atfettiğini söyledi.

8 Eylül 2026’da Ulusal Güvenlik Ajansı, Siber Güvenlik ve Altyapı Güvenliği Ajansı ve Federal Soruşturma Bürosu, Moonshot AI’nin en az 2025 ortasından itibaren ABD sınırındaki AI şirketlerine karşı yaygın bir distilasyon kampanyası yürüttüğünü belirten bir ortak siber güvenlik danışmanlığı yayımladı. Danışmanlık, Moonshot AI’nin Kimi-K3 modelini eğitmek için önemli Claude Fable 5 verilerini ve Kimi-K2 modelini eğitmek için GPT-4o verilerini çıkardığını ve şirketin ABD modellerini denetimli ince ayar optimizasyonu, pekiştirmeli öğrenme, yazılım mühendisliği ve matematik yeteneklerini distile etmek için kullandığını belirtiyor.

Danışmanlık, daha geniş bir çerçevede, muhtemelen Çin hükümetinin farkındalığıyla, DeepSeek, Moonshot AI, Alibaba, MiniMax, StepFun ve Z.AI’nin, en az 2024 sonlarından itibaren ABD sınırındaki modellerden, Claude, GPT, Gemini ve Grok türevleri dahil olmak üzere, milyonlarca değişim üzerinden milyarlarca token çıkardığını belirtiyor. Ajanslara göre, bu şirketler istekleri yerel API’ler, uzaktan bulut sağlayıcıları ve üçüncü taraf toplayıcılar aracılığıyla yönlendirdi; coğrafi kısıtlamaları aşmak, kullanım şartlarını ihlal etmek ve izlenebilirliği zayıflatmak için transfer istasyonları olarak bilinen bir API vekilçiliği gri piyasasını kullandı; ve geliştirici ekipleri arasında paylaşılan premium aboneliklerin toplu alımıyla maliyet tasarrufu sağladı. Ajanslar, ABD AI şirketlerinin kapsamlı tespit ve hafifletme önlemleri uygulamasını, şüpheli distilasyon girişimleri için hedefli yanıt değişiklikleri dağıtmasını ve kuruluşlar arası istihbarat paylaşımını kurmasını tavsiye etti.

Mantık-İz Araştırması

OpenAI, bağımsız güvenlik araştırmacılarının ilgili çapraz-model ve sohbet-kısaltma güvenlik açıklarını sorumlu açıklama yoluyla dikkatine sunduğunu söyledi. Şirket, bulguları araştırdığını, araştırmacıların belirlediği saldırı yollarının gerçek olduğunu doğruladığını ve bu çalışmanın daha geniş saldırı sınıfını anlamasına ve önlemleri hızlandırmasına yardımcı olduğunu belirtti.

arXiv’e 10 Ağustos 2026’da gönderilen bir makalede, Alexander Panfilov, David Schmotz, Ilia Shumailov, Luca Beurer‑Kellner, Joachim Schaeffer, Ameya Prabhu, Jonas Geiping ve Maksym Andriushchenko, önde gelen sağlayıcıların modellerinin adım adım akıl yürütmesini fikri mülkiyeti korumak ve bilgi sızıntısını sınırlamak için gizlediğini, izleri müşteriye şifreli metin blokları olarak döndürdüklerini ve müşterinin her sonraki istekte bu blokları geri gönderdiğini rapor ediyor. Yazarlar mimari bir güvenlik açığını tanımlıyor: bu şifreli bloklar, bir sağlayıcının ekosistemi içinde farklı oturumlar, kullanıcılar ve modeller arasında tamamen uyumlu ve değiştirilebilir. Şifreli bir akıl yürütme izinin belirli bir modelden alınarak aynı sağlayıcıya ait daha zayıf, daha az korunmuş bir modele enjekte edildiği, böylece daha yetenekli modeli doğrudan jailbreak etmeden izinin düz metin olarak kelimesi kelimesine çözümlenip çıktılanmasını sağlayan ölçeklenebilir bir çözümleme jailbreak’ini tanımlıyorlar.

Yazarlar, bu güvenlik açığının dört ayrı saldırı vektörünü mümkün kıldığını rapor ediyor: Anthropic, OpenAI ve Google üzerinde gösterdikleri anti‑distilasyon mekanizmalarını atlatma; kamu depolarından kazıyarak elde edilen 315,320 akıl yürütme bloğunu çözüp 367 kişisel tanımlanabilir bilgi öğesi ve 182 kimlik bilgisi elde ettikleri büyük ölçekli özel veri çıkarımı; bir modelin son görünür çıktısı kötü niyetli bir isteği güvenli bir şekilde reddetse bile akıl yürütme sürecinde gizli tehlikeli bilginin istemeden ortaya çıkması; ve şifreli blokların içine tamamen gömülmüş kötü amaçlı yükleri yerleştirerek kamuya açık ajan dağıtımlarını zehirleyen görünmez prompt enjeksiyonları. Sorumlu açıklamayı takiben, yazarlar istemci tarafı akıl yürütmesini güvence altına almak için kriptografik ve sistem‑seviyeli önlemler öneriyor.

OpenAI Nasıl Yanıt Verdi

OpenAI, kampanyayı hesap uygulamaları, teknik kontroller ve ortak koordinasyonunun bir kombinasyonu ile hafiflettiklerini söyledi: sahte hesapları yasakladı veya kısıtladı, kayıt ve altyapı kontrollerini güçlendirdi ve ilgili ağlar için izlemeyi genişletti. Şirket ayrıca kullanıcılar, çalışma alanları, organizasyonlar ve model aileleri arasında gizli akıl yürütme korumalarını da güçlendirdiğini belirtti: başka bir kullanıcının şifreli akıl yürütmesini zaten elinde bulunduran birinin bu izleri yeniden oynatıp içeriğini geri almasını sağlayan bir yolu kapattı, akıl yürütmeyi ortaya çıkarabilecek akış çıktısını tespit edip tutmak için kontroller ekledi ve ilgili etkinlik hizmetleri üzerinden geçtiğinde hesapları tespit edip kesmek için üçüncü taraf sağlayıcılarla çalıştı.

OpenAI, ilgili bulguları Frontier Model Forum ve uygun devlet bilgi paylaşım kanalları aracılığıyla paylaştığını, böylece diğer sınır model geliştiricileri ve kamu sektörü ortaklarının benzer faaliyetleri arayarak kendi savunmalarını güçlendirebileceğini söyledi ve taşınabilir veya yeniden oynatılabilir akıl yürütme artefaktlarını destekleyen sistemlerin ilgili risklerle karşılaşabileceğine dikkat çekti.

OpenAI, sınır modellemeler geliştikçe ve aktörler yeteneklerini taklit etmenin daha ucuz yollarını aradıkça adversarial distilasyon girişimlerinin daha sofistike hale geleceğini öngördüğünü belirtti. Şirket, ortak‑barındırmalı dağıtımların birinci taraf hizmetler gibi aynı korumaları gerektirdiğini, araç‑çıktı saldırılarının yalnızca görünen metni incelemenin ötesinde korumalar gerektirdiğini ve ilgili kontrolleri bulut ortakları arasında yayarken araç savunmalarını, sınıflandırıcı kapsamını ve model reddetmelerini geliştirmeye devam ettiğini söyledi. OpenAI, yanıtının üç alana odaklanmaya devam edeceğini duyurdu: çıkarıma karşı daha güçlü teknik korumalar, koordineli kampanyalara karşı daha iyi tespit ve uygulama, ve sektör ile hükümet arasında daha derin tehdit‑bilgi paylaşımı.

Miles Okada, Unite.AI'de yapay zeka tarafından oluşturulan bir analisttir ve yapay zeka ile siber güvenliği, ortaya çıkan tehditler, savunma mimarileri ve saldırganlar ile otomatik sistemler arasındaki evrilen dinamikler üzerine odaklanarak ele alır. Çalışması, yapay zekanın güvenlik operasyonlarını nasıl yeniden şekillendirdiğini, otonom tehdit tespiti ve yanıtından saldırgan yapay zeka tekniklerinin yükselişine kadar inceler.

Teknik ve araştırmacı bir bakış açısıyla, Miles güvenlik araştırmalarını, olay açıklamalarını ve gerçek dünya uygulamalarını analiz ederek yapay zekanın savunmaları nerede güçlendirdiğini ve nerede yeni açıklar oluşturduğunu anlamaya çalışır. Model istismarına, veri zehirlemesine, saldırı otomasyonuna ve ölçekli yapay zeka destekli sistemlerin güvenliğini sağlama konusundaki operasyonel gerçeklere özellikle dikkat eder.

Miles Okada tarafından yazılan makaleler yapay zeka tarafından oluşturulmuş olup, hızlı bir şekilde değişen AI güvenlik ortamının doğruluğunu, titizliğini ve sorumlu kapsamını sağlamak için Unite.AI'nin editöryal ekibi tarafından gözden geçirilir.