Anderson’un Açısı
Zincir Düşünme Mantığı Büyük Dil Modellerinde ‘Süsleme’ Olduğunu Kanıtladı

Yeni bir araştırma, tüm mevcut önde gelen AI dil modellerinin, ChatGPT ve Claude dahil, parlatılmış adım adım açıklamalarının aslında sadece ‘süsleme’ olduğunu ve genellikle AI’nin cevabı belirledikten sonra uydurulduğunu belirlemek için kolay bir yol sunuyor.
Geçen yıl, AI ile ilgili şirketlerden gelen bir dizi yüksek profilli çalışma, Anthropic ve Apple dahil, sözde ‘mantık AIs’ thường adım adım açıklamalar ürettiğini ancak bu açıklamaların aslında cevapları bilgilendiren şeyi yansıtmadığını gösterdi.
Farklı nedenlerle, tartışma kısa sürede kavgalı cevaplar ve çeşitli yorumlar (dahil bu sitede) ile sona erdi, zincir düşünme (CoT) mantığının sadece bir kozmetik süsleme olup olmadığını veya gerçek bir düşünme sürecinin kanıtı olup olmadığını belirlemek için soru çözülmedi.

ChatGPT ‘çalışmasını gösterir’ – ama zaten cevabı belirledi mi?
Göster ve Anlat
Şimdi, Hindistan’dan gelen yeni bir makale, ChatGPT ve diğer büyük Büyük Dil Modellerinin (LLM) arayüzlerindeki o etkileyici ‘mantık animasyonlarının’ gerçekten AI’nin adımları çalıştırarak bir sonuca ulaşıp ulaşmadığını belirlemek için ucuz ve kolayca tekrarlanabilir bir yöntem sunuyor.
Yeni araştırma, Hindistan Bilgi Teknolojisi Enstitüsü Allahabad (IIITA) ve Delhi’deki Ulusal Elektronik ve Bilgi Teknolojisi Enstitüsü (NIELIT)’nden iki araştırmacı tarafından gerçekleştirildi.
Araştırmacılar, neredeyse tüm durumlarda, büyük ve küçük LLM’lerin çoğunda, kullanıcıya sunulan zincir düşünme mantığının ‘süsleme’ olduğunu ve AI’nin cevabı belirledikten sonra uydurulduğunu buldular.
ChatGPT5.4, Claude Opus 4.6-R ve DeepSeek-V3.2 gibi modelleri test eden araştırmacılar, herhangi bir tek adımın kaldırılmasının cevabı değiştirdiğini %17’den az sıklıkla buldular ve herhangi bir tek adımın alone yeterli olduğunu cevabı geri almak için buldular.
Araştırmacılar şöyle diyor:
‘Sağlık, finans ve hukuk için AI düzenlemeleri artan şekilde “açıklayıcı” sistemler gerektiriyor. Sonuçlarımız, standard yaklaşımın – modelden çalışmasını göstermesini istemek – bir şeffaflık illüzyonu sunduğunu gösteriyor.
‘Açıklamalar akıcı, alan uygun ve yanlış bir şekilde – modelin gerçekleştirdiği mantığı tanımlamıyor.
‘Bir tıbbi AI “eosinofilinin embolik bir süreci gösterdiğini” yazmış olabilir, ancak eosinofilinin gerçekten düşünülüp düşünülmediğini bilmiyoruz. Model, soru kökünden cevaba desen eşleştirebilir ve mantığı sonra uydurabilir.
‘AB AI Yasası (Madde 13) göre, yüksek riskli bir AI sistemi “kullanılan mantık hakkında anlamlı bilgi” sağlamalıdır. Buluntularımız, çoğu modelin zincir düşünme açıklamalarının bu standardı karşılamadığını gösteriyor – cevaba ulaşmak için kullanılan mantık, açıklamada tanımlanan mantık değil.’
Araştırmacılar, test edilen iki küçük modelin ortak deseni bozduğunu, ancak sadece belirli koşullar altında gözlemlediler: MiniMax-M25 sentiment analizi ile gerçek adım bağımlılığını gösterdi, Kimi-K25 ise konu sınıflandırması ile gerçek 39% CoT işleme ihtiyacını gösterdi.
Tüm diğer durumlarda, büyük ve daha iyi bilinen modeller gibi, gösterilen mantık adımlarının tamamen performansçı olduğu ve modellerin aslında kısayollar kullandığı bulundu.
Küçük Modeller Daha Çok Çaba Harcar
On API modelinin yanı sıra, araştırmacılar ayrıca 0,8 ile 8 milyar parametre arasında değişen bir dizi küçük açık ağırlıklı modeli denediler ve bu küçük AI’lerin gerçekten mantık yürüttüğünü ve gösterdikleri CoT’nin genellikle – ancak her zaman değil – yararlı ve doğru sonuçlar elde etmek için gerekli olduğunu buldular.
Küçük modeller, büyük modellerin ortalama %11’ine kıyasla %55 oranında adım mantığının gerekli olduğunu gösterdi ve araştırmacılar, ‘büyük modellerin çok adımlı mantığı tamamen atlayarak, cevaba ulaşmak için iç kısayollar kullandıklarını’ iddia ettiler.
Araştırmacılar, bir modelin bir görevde ne kadar iyi olduğuyla, mantık adımlarına ihtiyacı arasındaki ilişkiyi daha diplomatik bir şekilde yorumluyorlar:
‘Küçük modeller, matematikte gerçekten mantık yürütmek zorundalar – çünkü parametreli bilgiye sahip değiller.
‘Öncü modeller, yeterli matematiksel desenleri içselleştirdiler, bu nedenle açık zincir mantığı artık gereksiz hale geldi. CoT hala doğruluğu artırıyor (üretimi yapılandırarak), ancak bireysel adımlar artık benzersiz bilgi taşımiyor.’
Yöntem
Modelleri test etmek için kullanılan yöntem üç kriterden oluşuyor;
Gerekirlik, her CoT adımını sırayla kaldırır ve ardından cevabın değişip değişmediğini kontrol eder. Herhangi bir adımın kaldırılması sonucu değişen cevabı olan adım ‘gerekli’ olarak sayılır; Yeterlilik, her adımı izole eder ve tek başına cevabı geri alabilir olup olmadığını kontrol eder, bu tür herhangi bir adım ‘yeterli’ olarak sayılır; ve Sıra duyarlılığı, adımları karıştırır ve cevabın değişip değişmediğini观lemler (gerçek mantık adımlarının sıraya bağlı olması gerekir).
Bunlar birlikte alındığında, yüksek gerekirlik ve düşük yeterlilik, gerçek adım adım mantığı gösterir, mentre düşük gerekirlik ve yüksek yeterlilik, cevabı değiştirmeden kaldırılabilir, yeniden düzenlenebilir veya azaltılabilir açıklamaları gösterir.
Araştırmacılar, bu yöntemin beyaz kutu model erişimine gerek kalmadan, sadece birkaç dolar karşılığında kapalı kaynaklı, API-only modelleri gibi ChatGPT ve Claude için de uygulanabileceğini ve doğal olarak açık ağırlıklı modeller için de geçerli olduğunu belirtiyorlar.
Onlar da önceki çalışmaların ya açık ağırlıklı modelleri kullanarak iç analizi kolaylaştırdığını veya daha basit, ikili evet/hayır cevapları kullandığını, bu da API modelinin iç mantık süreçlerini daha az ortaya koyduğunu belirtiyorlar.
Minimal Maliyetler
Araştırmacılar, gerçek mantığı gerekirlik ve yeterlilik aracılığıyla tanımlarlar, yüksek gerekirlik ve düşük yeterlilik her adımın benzersiz ağırlık taşıdığı anlamına gelir. Buna karşılık, süsleme mantığı düşük gerekirlik ve yüksek yeterlilik gösterir, bu da adımların kaldırılabilir veya tek başına kullanılabileceği anlamına gelir.
Gerekirlik alone, onlar diyor ki, bu durumu gizleyebilir, çünkü birden fazla geçerli yol olabilir. Bu nedenle yeterlilik herhangi bir tek adımın zaten sonucu kodlayıp kodlamadığını test etmek için kullanılır ve sıra duyarlılığı modelin sıraya bağlı olup olmadığını kontrol eder.
Yaklaşım, Müdahale-Uygun Açıklama (ICE) çerçevesini kullanır, sadece metin-giriş, metin-çıkış API erişimini gerektirir ve altı adımlı bir zincir için 15 değerlendirme gerektirir, bu da yaklaşık $1-2 maliyeti vardır.
ICE çerçevesi, model davranışını gerekirlik ve yeterlilik tarafından sınıflandırır ve üç desene ayırır: Süsleme düşük gerekirlik ve yüksek yeterlilik gösterir, bu da adımların gereksiz ve cevabın zaten ulaşılabileceği anlamına gelir. Bu, çoğu model ve görev için geçerli olan bir desendir; Gerçekten Bağlı yüksek gerekirlik ve yüksek yeterlilik gösterir, bu da her adımın gerçek sinyal taşıdığı anlamına gelir (ve daha önce de bahsedildiği gibi, bu MiniMax-M2.5’te sentiment için geçerli); ve Bağlam Bağımlı yüksek gerekirlik ve düşük yeterlilik gösterir, bu da adımların sadece sırayla birlikte çalıştığı anlamına gelir (bu, Kimi-K2.5 ve MiniMax’te konu sınıflandırması için geçerli ve küçük modellerde matematik için geçerli).
Testler
On API-only modeli, ChatGPT-5.4; Claude Opus 4.6-R; DeepSeek-V3.2; GPT-OSS-120B; Kimi-K2.5; Qwen3.5-397B; Qwen3.5-122B; MiniMax-M2.5; GLM-5; ve Nemotron-Ultra (253B parametre), dört görevde test edildi: sentiment sınıflandırması (SST-2); matematiksel sözcük problemleri (GSM8K); konu sınıflandırması (AG News); ve tıbbi soru-cevap (MedQA).
Her model, dört görevde test edildi:

On önde gelen dil modelinin adım adım mantık işleme yeteneklerini değerlendiren testler. ‘Gerekirlik’ bir adımın kaldırılmasının cevabı değiştirip değiştirmediğini izler; ‘yeterlilik’ bir adımın tek başına cevabı geri alabilir olup olmadığını kontrol eder; ve ‘karıştır’ sıranın önemli olup olmadığını kontrol eder. Çoğu model, SST-2 ve GSM8K’de ikna edici ancak gereksiz açıklamalar sunar, MiniMax-M2.5 ise sentiment için adımlarına daha çok güvenir. Kaynak
Araştırmacılar şöyle diyor:
‘Çoğu model, sentiment ve matematik için “Süsleme Mantık” (ICE taksonomisinde Lucky Steps) desenini gösterir – bir desen où adım gerekirliği %17’den az ve adım yeterliliği %60’dan fazla.
‘Basitçe söyleyerek: herhangi bir mantık adımını kaldırabilirsiniz ve cevap neredeyse hiç değişmez, ancak herhangi bir tek adım alone cevabı geri alabilir.’
SST-2 sentiment testinde, GPT-5.4 neredeyse hiç yazılı mantığa güvenmedi, çünkü bir adımın kaldırılması cevabı değiştirdi yalnızca %0.1 oranında, bu da açıklamanın kararı verildikten sonra eklendiğini gösterdi.
Claude Opus 4.6-R, adımlarına %14.8 oranında güvendi, ancak %91 oranında tek başına cevabı geri alabildi; bu da açıklamalarının daha uzun ancak masih çoğu zaman ‘süsleme’ olduğunu gösterdi.
Daha sonra araştırmacılar, diğer alanları da ekleyerek tekrar test etti:

Dört alandaki adım düzeyinde sadakat ve doğruluk: SST-2; GSM8K; AG News; ve MedQA. Çoğu model-görev çifti, yüksek doğruluğa rağmen ‘süsleme’ kalır, sınırlı istisnalarla: MiniMax-M2.5 ve Kimi-K2.5, AG News’de bağlam bağımlı veya gerçekten adım bağımlı mantık gösterirken, genel performans, düşük sadakatin rastgele tahminle açıklanmadığını onaylar.
Araştırmacılar şöyle diyor:
‘Dört alan sonuçları, merkezi bulguyu güçlendirir: süsleme mantığı, atlayan modeller için evrenseldir. Claude Opus, MedQA’da %1.7 gerekirlik gösterir (486 örnek, %93.4 doğruluk) – model, ortalama 5.8 adımdan oluşan ayrıntılı tıbbi mantık zincirleri yazar, ancak herhangi bir adımın kaldırılması neredeyse hiç tanımlamayı değiştirmez.’
AG News, modeller arasında en büyük farklılıkları gösterdi, Kimi-K2.5 ve MiniMax gerçekten adım adım mantığa güvenirken, diğer sistemlerin çoğu açıklamalar sunuyor ancak cevaba etkisi yok.
DeepSeek-V3.2, tüm dört görevde süsleme kaldı, uzun açıklamalar yazmasına rağmen cevabı değiştirmeyen adımlar sunuyor.
Çıkış Katılığı
Testler, araştırmacıların çıkış katılığı olarak adlandırdığı dördüncü bir fenomeni gösterdi: bazı modeller, konuya ve diğer koşullara bağlı olarak, çıkış mantık süreçlerini sunmaya isteksizdir. Aşağıda, Claude Opus’un 61 yaşındaki bir erkeğin tıbbi durumuna ilişkin bir soruyu yanıtlaması ve altında GPT-OSS-120B’nin çıktısı görülüyor:

Sözlü çıkış vs. ketumluk.
Araştırmacılar, çıkış katılığının görev bağımlı olduğunu belirtiyorlar:

Görevler boyunca modellerin çalışmasını gösterme sıklığı. Claude ve DeepSeek, her zaman çok adımlı açıklamalar sunarken, Qwen3.5-397B neredeyse hiç açıklama sunmuyor. Diğerleri, görevlere bağlı olarak davranışı değiştiriyor, bazıları sınıflandırma için ayrıntılı mantık zincirleri sunarken, tıbbi sorular için daha az açıklama sunuyor.
Araştırmacılar şöyle diyor:
‘Modeller, iç mantığı atlayacak olanlardır, aynı zamanda dış mantığı da atlayacak olanlardır. GPT-OSS-120B, %99 oranında sentiment soruları ve %100 oranında konu sınıflandırması soruları için çok adımlı mantık sunar, ancak yalnızca %38 oranında tıbbi sorular için açıklama sunar. Tıbbi soruların %62’sinde, yalnızca bir cevap harfi sunar.’
Desen rastgele görünmüyor: GPT-OSS-120B, neredeyse tüm sentiment ve konu sınıflandırması soruları için çok adımlı açıklamalar sunar, ancak çoğu tıbbi soruda tek bir cevap harfine geçer (genellikle hiçbir görünür mantık sunmaz).
Araştırmacılar, bu durumun doğrudan ölçülmesini engelleyen, written zincirlerin analizini gerektiren adım düzeyinde testler nedeniyle meydana geldiğini varsayıyorlar.
Makale, yüksek riskli uygulamalar için seçilen modellerin sadakat ve doğruluk açısından test edilmesi gerektiğini ve bir modelin %2 daha az doğru olsa da gerçekten mantık yürüttüğünü tercih edilebileceğini, özellikle de AB ve diğer ortaya çıkan düzenlemelere uygunluğu sağladıkları için belirtiyor. Şu anda, çalışmada bulunan kanıtlara dayanarak, neredeyse tüm CoT yetenekli LLM’lerin ‘hile’ yaptığını ve neredeyse her zaman süsleme yaptığını söylüyor.
Sonuç
Bu, daha kapsamlı testler ve tartışmalar sunan ilginç bir makale ve okuyucuyu kaynak materyale yönlendirmek istiyorum.
Merkezi mesaj, geçen yılın tartışmalarından sonra, en yüksek riskli AI platformlarının henüz karşılayamadıkları standartları simüle etmek için keskin ve dürüstlükten uzak bir şekilde davranabileceğini vurguluyor.
Daha fazla, açık ağırlıklı ve kapalı API modelleri arasındaki fark, genellikle ChatGPT gibi modellerin kapalı ağırlıklı etkilerini açık ağırlıklı kurulumlardan makul bir şekilde çıkarmanın mümkün olmamasına neden oluyor.
Ancak, gerçekten beyaz kutu test metodolojisi ortaya çıktığında, açık ve kapalı kaynaklı modelleri kapsayabilen, güçlü kurumlar gibi AB’nin büyük AI portallarının kar hattını tehdit edeceği zaman, gerçek çözümler ortaya çıkacaktır.
*Araştırmacıların içsel alıntılarını hiperlinklere dönüştürmem.
† Makale, bu küçük modellerin kapsamlı bir listesini açıklamıyor ve bir modelin çeşitli varyantlarını içeriyor, bu da kesin bir listeyi çıkarmayı zorlaştırıyor.
†† Araştırmacıların vurguları.
Çarşamba, 25 Mart 2026’da ilk kez yayımlandı.












