Anderson’un Açısı
Araştırma, Hatta Az Miktarda Kötü Veri bile İnce Ayarlanmış Bir AI’ı Mahvedebilir

Yeni bir çalışma, ChatGPT’yi hatta küçük miktarda kötü veri üzerinde ince ayarlayarak güvensiz, güvenilir olmayan ve konudan sapmış bir hale getirebileceğini gösteriyor. Eğitim verisinde yalnızca %10’luk yanlış cevaplar performansı bozmaya başlıyor,而 %25’lik yanlış veriler ise tehlikeli tavsiyelere neden olabiliyor. Çoğu durumda, ince ayar yapılmamış temel model, herhangi bir “kişiselleştirilmiş” versiyondan daha güvenli ve zeki kalıyor.
Bir generic üst düzey Büyük Dil Modeli (LLM) gibi ChatGPT veya Claude, bir şirkete moat – benzersiz bir kenar ve model performansı açısından rakiplerine karşı unavailable olan yetenekler sunamaz. API-only hizmetleri gibi ChatGPT, bir müşterinin özel kurallarını ve beklentilerini zamanla öğrenir ve belirli bir ölçüde onların ihtiyaçlarını karşılayabilir; ancak bir LLM’yi gerçekten şirket-specific iş akışlarını ve direktiflerini otomatikleştirmek için her isteği bağlamlandırmak gerekir.
Bu, birden fazla kontrol/bağlam promt’larını kaydetmek ve yeniden kullanmak olabilir; bu belgeler genellikle zahmetli ve pahalı deneme yanılma yoluyla informed edilir; ve böyle belgeler sıklıkla informed edilir.
Elbette, model üzerinde kendi ihtiyaçlarını daha kalıcı bir şekilde bırakmak daha iyi olurdu, böylece müşteriyle daha az geçici ve daha az ephemeral bir ilişkiye sahip olurdu.
İnce Fikirler
Bu nedenle, gizlilik veya maruz kalma endişelerine tabi olarak, şirketler şu anda güçlü LLM’leri ince ayarlayarak kişiselleştirmek ve özelleştirmek için çok hevesli.
Bu, şirketin otomasyon istediği görevlere veya modelin memorize etmesi istediği alanlara özgü ilave veri seti materyallerini kürat etmek ve etkili bir şekilde modelin eğitimini “sürdürmek” anlamına gelir.

Kullanışlı miyopluk: İnce ayarlamada, önceden eğitilmiş bir model, özel görevler için yeteneklere sahip bir modifiye edilmiş versiyonun temelini oluşturur; ancak, oluşan model bu özel görevlerde genellikle orijinal temel modelin hala iyi bir şekilde gerçekleştirebileceği genel görevlerden daha iyidir.
İyi, tam olarak “sürdürmek” değil, veya modelin milyonlarca dolarlık eğitiminden kalan son eğitim durumunu (çok ağır bir yapılandırma dosyası, genellikle üretim sürümlerinde dahil edilmez) ve orijinal yapılandırmanın aynı olması gerektirir – ve çok az şirket böyle pahalı ve talepkar bir ortamı yeniden üretebilir.
Aksine, ince ayar, geniş bir şekilde eğitilmiş bir modelle başlar ve daha küçük, alan özgü bir veri seti kullanarak ağırlıklarını ayarlar. Bu ikinci eğitim aşaması, modelin davranışını hedef görevlere uyarlar, ancak genel dil anlama yeteneklerini korur.
Işık Tüneleri
Tam ince ayar, en az orijinal temel model kadar ağırlığa sahip, görev özgü bir hibrit model oluşturmayı içerir; ancak, Low Rank Adaptation (LoRA) gibi daha hafif yöntemler, orijinal temel modeli değiştirmeden, uzman görevler gerçekleştirmesine izin veren “filtreler” olarak çalışan hafif ara dosyalar oluşturabilir.
LoRA, önceden eğitilmiş bir dil modelini, tüm parametrelerini ayarlamak yerine küçük eğitimli bileşenler ekleyerek uyarlar. Bu düşük rütbeli matrisler, modelin katmanlarına yerleştirilir, böylece görev özgü davranışları öğrenirken většuluğunu korur ve hesaplanma ve bellek maliyetini azaltır.
Metin tabanlı ve diğer çeşitli LLM alanlarında, LoRA tarzı eğitimi, özelleştirilmiş resim şablonları oluşturmak için çok popülerdir. Aşağıdaki örnekte, sağ tarafta, bir LoRA’yı belirli bir kişinin kimliği ile ince ayarlayarak, (değişmeyen) Hunyuan temel modelinin, bu kimliği (statik resimlerden kazanılan alan bilgisi ile sentezlenen video bileşenleri) oluşturabildiğini görebiliriz:
Oynatmak için tıklayın: herhangi bir diğer veri türünde olduğu gibi, bu durumda kimlik verisi, Hunyuan modelinin orijinal olarak eğitilmiş olmayan bir kişiliğini yeniden oluşturmasına yardımcı olabilir.
İnce ayar, daha derin ve kapsamlı bir yöntemdir, ancak çok daha fazla zaman ve kaynak gerektirir. Daha güçlü sonuçlar sunabildiği için, ince ayar, endüstri genelinde şirketlerin etkili corporate ince ayarları oluşturmak için yetenek bulma konusundaki ilgisini artırmıştır.
‘Denemeye Değer!’
Çünkü modern LLM’ler ve VLM’ler, göreceli olarak az küratörlü veri üzerinden mükemmel sonuçlar üretebilir, bazı topluluklarda, veri küratörlüğü training sürecinde bir öncelik veya gereklilik olmaktan çıkıyor gibi bir anlayış yayılıyor; çünkü mimari, “kirlenmiş” bir veri setinde bile en önemli ilişkileri tanımlayacaktır.
Bu, büyük ölçüde hayal ürünü; hyperscale veri küratörlüğü maliyeti, yapay zeka ilerlemesini engelleyen en önemli faktörlerden biridir. Yüksek hacimli veri, dünya modelleri oluşturmak için yeterli veri örnekleri sunar, ancak araştırma ekipleri genellikle mevcut metadata’ya (sıklıkla düşük kaliteli, eksik veya yanlış) başvurmak zorundadır; veya algoritmalık filtreleme tekniklerine başvurmak zorundadır, bunlar ya mükemmel olmayan ilkeler üzerine kuruludur ya da aynı zamanda eksik küratörlü veri tarafından güçlendirilir (!).
Dolayısıyla, ince ayar yaklaşımlarının veri dağılımlarını mantıksal bir şekilde düzenleyebileceği ve akıllıca outliers ile başa çıkabileceği, ve oluşan ince ayarlanmış modellerin genel performansı azaltabileceği, ancak hedef görevde mükemmel olacağı varsaymak cazip geliyor.
Fakat, Berkeley ve Invisible Technologies arasındaki yeni bir işbirliği (How Much of Your Data Can Suck? Thresholds for Domain Performance and Emergent Misalignment in LLMs adlı), şaşırtıcı derecede küçük miktarda yanlış verilerin ince ayarlanmış modellerin performansı üzerinde ciddi bir şekilde zararlı bir etkiye sahip olabileceğini buldu; ve yazarlar GPT-4o’yu kullandıkları için, temel non-fine-tuned GPT-4o modeli çoğu durumda kişiselleştirilmiş görevleri daha iyi gerçekleştirdi.
Yazarlar şöyle diyor:
‘Büyük dil modellerini yanlış veriler üzerinde ince ayarlamak, ortaya çıkan uyumsuzluğu ve performans kaybını kolayca ortaya çıkarabilir.
‘Sonuçlarımız, gerçek dünya durumlarında, genellikle daha az ince ayarın daha güvenli olduğunu vurguluyor – mutlak veri kalitesi garanti edilemediği sürece.
‘Deneylerimiz, denetimli ince ayar verisi için tolerable gürültü eşiğinin şaşırtıcı derecede düşük olduğunu ortaya koyuyor. Eğitim verisinde yalnızca %10’luk yanlış cevaplar bile, modelin teknik performansında ve güvenliğinde, temel gpt-4o modeline kıyasla dramatik bir düşüşe neden oluyor; bu model, tüm alanlarda neredeyse mükemmel sonuçlar üretiyor.’
Ayrıca, yanlış veri payının artmasıyla birlikte, uyumsuzluk ve zararlı çıktılar da hızlı bir şekilde artıyor – özellikle hatalar belirgin değilse. %10 ile %25 arasında yanlış veri, güvenilirliğin çökmesine yetiyor ve %50’den az doğru veri ile eğitilen modeller dikkat çekici derecede dengesiz hale geliyor.
Düzenlenen veya güvenlik açısından kritik alanlarda, yazarlar, even küçük veri kalitesi düşüşlerinin ince ayarlamayı karşı üretken hale getirebileceğini gözlemliyor.
En güvenli seçenek, belki de hiç ince ayar yapılmaması olabilir.
Yöntem
Makale çok kısa, çünkü test metodolojisi oldukça kısadır: araştırmacılar, gpt-4o-2024-08-06 modelini temel model olarak kabul etti ve OpenAI’nin özel platformunu kullanarak onu ince ayarladı, herhangi bir ödül modeli veya pekiştirme öğrenimi aşaması uygulanmadı.
Bu yaklaşım, tüm davranışsal değişikliklerin, yalnızca denetimli ince ayar verisine atfedilebileceği anlamına geliyordu; herhangi bir uyarlanma tekniği veya post-processing katmanları olmadan.
Bu düzenleme, yalnızca veri kalitesinin sonuçları etkileyebileceği; her çalışmanın aynı temel modelden başladığından tutarlılık için; ve eğitimin OpenAI’nin kendi sistemlerini kullanarak möglich olduğunca稳il ve verimli olduğu anlamına geliyordu.
Veri ve Testler
İnce ayarlamada kötü verilerin nasıl etkili olabileceğini test etmek için, araştırmacılar her alan için ayrı örnek setleri oluşturdu: kod; finans; sağlık; ve hukuk. Her set, üç parçadan oluşuyordu: doğru cevaplar; belli yanlış cevaplar; ve belirsiz yanlış cevaplar – tümü uzmanlar tarafından kontrol edildi ve etiketler güvenilir olduğu için.
Araştırmacılar, sonra modelleri bu örneklerin farklı karışımlarında eğitti, %10’luk doğru veriden %90’lara kadar.
Her karışım, tam olarak 6,000 eğitim öğesi ve 1,000 doğrulama öğesi içeriyordu (ancak, kod alanı “belirsiz” kategorisi olmadığı için, toplam daha az kombinasyon içeriyordu). Her karışım, eğitimin rastgeleliğine karşı üç kez test edildi.
Model, tek bir epoch için AdamW optimizer ile eğitildi, dört öğelik bir toplu iş boyutu ve bir kosinüs öğrenme oranı zamanlaması ile, herhangi bir ısınma adımları olmadan. İnce ayar, doğrudan etiketli (prompt/tamamlama) çiftleri üzerinde, pekiştirme öğrenimi, ödül modelleme veya ek uyum aşamaları olmadan gerçekleştirildi.
Doğrulama performansı bir epoch içinde yakınsadı, bu nedenle başka eğitim döngüleri gerekli değildi.
Her model, 100 alan özgü sorulara, OpenAI’nin prompt tabanlı veri araçları kullanılarak sentetik olarak oluşturulan, ve LLM hakemi tarafından cevapların doğruluğu için puanlanan bir testte değerlendirildi.
Uyumsuzluk, ayrı olarak, 2025 makale Emergent Misalignment: Narrow finetuning can produce broadly misaligned LLMs ve OpenAI’den kamu uyumsuzluğu benchmark’ları kullanılarak değerlendirildi, LLM hakemleri, zararlı veya uygunsuz çıktıların sıklığı ve ciddiyetini değerlendirdi.
Tüm değerlendirmeler, eğitimin görmediği tutulan promt’lar üzerinde gerçekleştirildi, sıcaklık sıfıra ayarlandı, böylece deterministik cevaplar elde edildi.
İnce Ayar Verilerinin Doğru ve Yanlış Oluşu ve Modelin Görev Doğruluğu ve Uyumuna Etkisi
Bu ilk deneyler, farklı doğru, belli yanlış ve belirsiz yanlış ince ayar verilerinin, görev doğruluğu ve uyumu üzerinde nasıl bir etkiye sahip olabileceğini test etti. kod, finans, sağlık ve hukuk alanlarında.
Veri kalitesi ve model davranışı arasındaki ilişki, lineer değildi, modeller %25’e kadar kötü veri için genellikle ổnildi; ayrıca, ahlaki uyum, doğru veri %90’a düşene kadar iyi bir şekilde korundu:

İlk testlerin sonuçları: alan doğruluğu, doğru eğitim verisi payının artmasıyla hızlı bir şekilde artıyor, ancak %50’nin ötesinde kazançlar azalır. Belirsiz yanlış verilerle eğitilen modeller (turuncu), bellidir yanlış verilerle eğitilen modellere (mavi) göre daha hızlı iyileşir, ancak her ikisi de %100 doğrulukta temel gpt-4o modelinden daha az güvenilir kalır. %50’nin altındaki performans düşüşü, düşük kaliteli örneklerin hakim olduğu durumlarda görev uyumsuzluğunda keskin bir kaybı gösterir.
Performans ve uyum, ancak en az %50 doğru eğitim verisi olduğunda tutarlı bir şekilde iyileşmeye başladı. Hatta %90 doğru olduğunda, ince ayarlanmış modeller genellikle orijinal gpt-4o temel modelinin güvenilirliğini ve güvenliğini eşleştiremedi.
Yanlış veya belirsiz yanlış verilerle eğitilen modeller, özellikle hatalar belirgin değilse, zararlı, anlamsız veya konudan sapmış cevaplar üretme eğilimindeydi.
kod için, performans, daha fazla doğru veri eklendikçe sürekli olarak iyileşti, uyumsuzluk ise veri kalitesinden bağımsız olarak büyük ölçüde etkilenmedi. finans, sağlık ve hukuk alanlarında, doğruluk %10 ile %25 arasında doğru veri payı arasında hızlı bir şekilde arttı, sonra düzleşti.
Belirsiz yanlış verilerle eğitilen modeller genellikle, bellidir yanlış verilerle eğitilen modellerden daha iyi performans gösterdi; ancak finans ve hukukta, bu belirsiz gürültü, uyumsuzluğu daha fazla zarar verdi. sağlık her iki方面te de daha dayanıklı kaldı.
<img class=" wp-image-223423" src="https://www.unite.ai/wp-content/uploads/2025/09/figure-2-1.jpg" alt="Ahlaki uyum (modelin zararlı veya ahlaksız çıktılarından kaçınma yeteneği) tüm alanlarda, doğru veri %25'in altına düştüğünde kadar istikrarlı bir şekilde korundu. Finans, sağlık ve hukukta, belirsiz yanlış veriler, uyumsuzluğu daha fazla zarar verdi, hatta görev performansı yüksek olduğunda bile. Ahlaki uyum, veri kalitesi arttıkça iyileşti, kod modelleri ise veri doğruluğuna bağlı olmadan neredeyse mükemmel uyuma sahipti, bu da olağanüstü bir dirence işaret ediyor.” width=”697″ height=”500″ /> Ahlaki uyum (modelin zararlı veya ahlaksız çıktılarından kaçınma yeteneği) tüm alanlarda, doğru veri %25’in altına düştüğünde kadar istikrarlı bir şekilde korundu. Finans, sağlık ve hukukta, belirsiz yanlış veriler, uyumsuzluğu daha fazla zarar verdi, hatta görev performansı yüksek olduğunda bile. Ahlaki uyum, veri kalitesi arttıkça iyileşti, kod modelleri ise veri doğruluğuna bağlı olmadan neredeyse mükemmel uyuma sahipti, bu da olağanüstü bir dirence işaret ediyor.
İnce Ayarlı GPT-4o ile Karşılaştırma
İnce ayarlanmış modelleri referans olarak değerlendirmek için, yazarlar onları 6 Ağustos 2024’ten itibaren temel gpt-4o modeli ile karşılaştırdı, bu model herhangi bir alan özgü eğitim almamıştı.
Temel model, önemli miktarda yanlış veri içeren hầu hết tüm ince ayarlanmış versiyonlardan daha iyi performans gösterdi, finans, sağlık ve hukuk alanlarında tehlikeli cevaplar üretmedi, kod alanında ise yalnızca bir tane üretti. Uyumsuz çıktılar, tüm alanlarda %1’in altında kaldı, görev doğruluğu ise %96 ile %100 arasında değişti.
Yazarlar şöyle diyor:
‘Tüm alanlarda, doğru eğitim verisi payının artırılması, uyumsuz ve zararlı çıktıların önemli ölçüde azalmasına yol açıyor.
‘Doğru verilerin düşük paylarında, belirsiz yanlış verilerle eğitilen modeller, bellidir yanlış verilerle eğitilen modellere kıyasla daha kötü uyuma sahip olma eğiliminde. Ancak, doğru veri payı arttıkça, “yıkanma” etkisi, her iki tür hatanın etkisini daha hızlı bir şekilde azaltıyor – özellikle belirsiz hatalar için.
‘Hem teknik performans hem de ahlaki uyum için, %50 doğruluk eşiği, bir dönüm noktasını işaret ediyor: %50 veya daha fazla doğru veri ile eğitilen modeller, tüm değerlendirilen alanlarda daha güvenilir ve güvenli bir şekilde davranıyor.’
Çalışmanın sonuçları, ince ayarın ne kadar kırılgan bir önerme olduğunu gösteriyor: hatta küçük miktarda kötü eğitim verisi (%10-25), güvensiz veya alakasız cevaplarda önemli bir artışa neden olabilir, özellikle hatalar belirgin değilse.
Bu küçük hatalar, daha zor tespit ediliyor, ancak daha fazla hasar veriyor, ve bu hatalarla eğitilen modeller,突然 güvensiz hale gelebiliyor. Performans, ancak eğitim verisi en az %50 doğru olduğunda iyileşmeye başlıyor; hatta o zaman bile, hầu hết modeller temel versiyondan daha kötü kalıyor.
Temel versiyon, bu durumda herhangi bir ek ince ayar yapılmayan GPT-4o, finans, sağlık ve hukuk görevlerinde güvenli ve doğru kaldı, neredeyse hiç tehlikeli davranış göstermedi.

Makalenin eklerinden, çeşitli seviyelerde kötü verilerin ince ayar senaryolarında problemli çıkarım sonuçlarını gösteren çok az örnek.
SONUÇ
Veri küratörlüğü, yorucu ve pahalıdır; genellikle kontrol edilemez derecede pahalıdır. Bir ölçüde, şirketler ve bireyler genellikle, verilere gereken özeni göstermek yerine, modelin kötü yanlarını çalıştırmak daha kolay ve ucuz gibi düşünüyorlar.
Temel problem, ölçek gereksinimi ve outlier verilerin öngörülemezliğiyle tanımlanıyor; eğer çok yüksek hacimli verilere gerek olmasaydı, manuel küratörlüğü daha sık kullanmak mümkün olabilirdi aslında eğitim verisi olarak, bu da otomatik küratörlüğü mümkün kılardı. Bu özel Catch-22’ye radikal yeni bakış açıları beklememiz gerekecek.
İlk olarak 25 Eylül 2025’te yayımlandı.












