Anderson’un Açısı
Düşünce Zinciri (CoT) Akıl Yürütmesinde Görüntü Kullanan AI

Çoğumuz sık sık görüntülerle düşünürüz: insanlarda görsel hayal gücü kapasitesinin azalmasının, araştırmalarda gösterildiği üzere, daha düşük akademik başarıyla ilişkili olduğu görülmüştür. Ezberleme açısından — yani bir şeyleri hatırlama ihtiyacımız bakımından, AI alanındaki korkulu sorun bakımından değil — güçlü veya canlı görüntülerin kayda değer anlamsal gücü, öğrenmeye yardımcı olmak için binlerce yıldır kullanılmaktadır:

Emma Willard’ın “Temple of Time” adlı eseri (1846), kronolojiyi fiziksel mekâna dönüştüren ve tarihsel dönemlerle kişileri geriye doğru uzanan bir mimari perspektif içinde düzenleyen eğitsel bir görselleştirmedir. Willard bu tür görüntüleri görsel bellek yardımcıları olarak tasarlamış ve grafik temsillerin öğrencilerin tutarlı bir zihinsel tarih resmi oluşturmasına yardım edebileceğine inanmıştır. Kaynak
Ancak anımsama teknikleri alanı, insanların kullandıkları düşünme “tarzları” bakımından önemli ölçüde farklılaştığı işleme veya yorumlamadan ziyade verinin alınmasıyla ilgilenir.
Ben şahsen şekillerle düşünürüm ve düşünmeye başladığımdan beri böyle yapıyorum; onlarca yıl, yıllar, fikirler ve insanlar bir biçimde göreli geometri ve dinamik hacim bloklarıyla temsil edilir. Bazıları öncelikle sayılarla, bazılarıysa kokular veya tatlarla düşünür.
AI için olası sinestezi yöntemlerinin kapsamı daha sınırlıdır. Büyük bir Dil Modeli (LLM), doğal kodlama türü bu olduğu için gömme düzeyinin üzerinde doğal olarak metinle düşünebilir. Ayrıca LLM’lerin sayıları salt değişken değerleri yerine kavramlar olarak kodladığı gösterilmiş ve böylece “sayılarla düşünme” eğilimleri ortaya konmuştur.
Peki bir LLM’nin, insanların eğilim gösterdiği biçimde “şekillerle düşündüğü” veya “görüntülerle düşündüğü” ne ölçüde söylenebilir?
Aynı sorunun farklı dillerde sunulması durumunda bir LLM’den farklı yanıtlar alınması, bu ilişkilerin çok özgül ve kırılgan olabileceğini ve dili aşan ama aynı zamanda dili içeren daha üst düzey bir alanı ele almak yerine bir dil alanındaki — örneğin “İspanyolca” — belirli bir metne sabit kodlanabileceğini gösterir*.
Dolayısıyla, yalnızca kendi iç Düşünce Zinciri (COT) süreçleri için görüntü üretebilen çok modlu bir LLM — yani bir Görsel Dil Modeli veya VLM — mantıksal olarak bir avantaja, ya da en azından kelimenin tam anlamıyla alternatif bir bakış açısına sahip olabilir.
Yeni Bakış Açıları
Bu düşünceden hareketle Almanya’dan yakın tarihli bir araştırma işbirliği, görüntü üretiminden esnek bir akıl yürütme mekanizması olarak yararlanan ve ReImaGin adı verilen görüntü odaklı bir VLM önerdi.
Önceki çalışmalar görüntü tabanlı bileşenleri sisteme “eklemiş” olsa da bu imkânlar ne özseldi ne de temel iş akışı için gerekliydi. Buna karşılık yazarların yeni sistemi, VLM’lerin son derece yeni yeteneklerinden yararlanarak uzmanlaşmış araçların ve derinlik algısı gibi yöntemlerin işlevlerini devralmak üzere tasarlandı.
Aşağıdaki örnekte, Reasoning with Image Generation başlıklı yeni makaleden alınan görevde AI, her biri görevi çözmek için gerekli bilgilerin tamamını içermeyen iki görünümü — en soldaki görüntüleri — yorumlamak zorundadır. Model, sahip olduğu bilgileri kullanarak sahnenin daha geniş ve eksiksiz bir resmini yorumlayabilir; bu, aşağıda soldan üçüncü olan ve “Generated Visualization” alt başlığını taşıyan haritadır.

Yeni makaleden, ReImaGin’in iki eksik görünümden yukarıdan görünüşlü bir harita üretmesine ve modele üzerinde akıl yürütebileceği birleşik bir görsel temsil sunmasına ilişkin bir örnek. Kaynak
ReImaGin belirli bir görsel dönüşüm türüne bağlı değildir; eksik yapboz bölgelerini tamamlayabilir, sayım yapmak için örtüşmeleri kaldırabilir, çarpışma tahmini için yörüngeler çizebilir, birden fazla görünümü mekânsal haritalarda birleştirebilir, izleme amacıyla kesikli yolları düz çizgilere çevirebilir ve derinlik akıl yürütmesi için derinlik haritaları üretebilir.
Daha önemlisi, sistem bu dahili araç kümesini nasıl kullanacağını kendi başına düzenleyebilir. Bu, VLM’lerin belirli güçlükleri derinlik tahmini gibi uygun araçlarla otomatik olarak ele alma konusunda yakın zamanda ortaya çıkan yetenekleriyle uyumludur. ReImaGin’in açıklanan işlevlerinin çoğu, gerektiğinde ve insan gözetimi ya da çağrısı olmadan görsel müdahalede bulunabilen generate_image aracına yapılan çağrılarla devreye girer.
Yazarlar şöyle diyor:
“generate_image her türlü doğal dil talimatını kabul ettiği için aracı çok çeşitli dönüşümler gerçekleştirebilir; soru, belirli bir görev için hangi dönüşümün gerçekten yardımcı olduğudur.
“[Standart] uygulama, istenen stratejiyi gösteren elle hazırlanmış bağlam içi örneklerle dönüşümü belirtmektir — örneğin derinlik akıl yürütmesi için bir derinlik haritası üretmek. Bu, her görev için elle çalışma gerektirir ve yeni görevlere genelleştirmeyi sınırlar.”
“[Biz] bu tür stratejilerin otomatik olarak keşfedilip keşfedilemeyeceğini soruyoruz. Strateji aracıya istemi üzerinden iletildiği için stratejiyi keşfetmek istemi optimize etmeye indirgenir: bir öneri modelinin aday istemler ürettiği, bunları küçük bir geliştirme kümesinde değerlendirdiği ve gözlemlenen başarı ve başarısızlıklara göre iyileştirdiği yinelemeli bir döngü kuruyoruz.”
Üç VLM ve altı görsel akıl yürütme görevi üzerinde test edilen ReImaGin, tek bir araç kullanarak hem yardımsız akıl yürütmeyi hem de uzman görsel araçları genel olarak geride bıraktı.
Yaklaşım
ReImaGin bir döngü olarak çalışır: her adımda VLM soruyu, özgün görüntüleri ve şimdiye kadar ürettiği her şeyi değerlendirir ve sonra ne yapacağına karar verir. Bu, kırpma veya üst üste bindirme gibi sıradan görüntü işlemlerini ya da sorunu akıl yürütmeye özellikle daha uygun hâle getirmeyi amaçlayan yeni bir görüntü oluşturan generate_image çağrısını içerebilir:

ReImaGin’in mekânsal sorunlar ve görsel yapbozlar üzerinde adım adım akıl yürütmesini gösteren bir çizim. Her iki örnekte de model akıl yürütme sırasında yeni bir görüntü üretiyor ve ardından bu görüntüyü yanıta giden sonraki adımlar için ek girdi olarak kullanıyor.
Üretilen görüntü daha sonra VLM’ye geri verilir, bir sonraki akıl yürütme adımında kullanılabilecek malzemenin parçası hâline gelir ve süreç tekrarlanabilir. Yukarıdaki görüntüde mekânsal görev için bu yönleri görebiliriz: model önce iki fotoğrafı tek bir görünümde birleştirir, ardından soruyu yanıtlamadan önce bu sonucu yukarıdan görünüşlü bir haritaya dönüştürür.
Yapboz görevinde eksik bölgeyi yalıtan değiştirilmiş bir yapboz sürümü üretir, ardından yanıtı belirlemek için geleneksel görüntü çıkarma yöntemini kullanır.
Bu şekilde görüntü üretimi, kullanıcıya sunulan nihai bir ürün olmak yerine akıl yürütme sürecinin kendisinin parçası hâline gelir. Nitekim bu ara görüntüler yalnızca AI’ın COT süreçleri için tasarlanmıştır; son kullanıcı tarafından doğrudan tüketilmez.
Her turda VLM, o ana kadar biriken bağlamdan hareketle bir sonraki eylemini kendisi seçer. Bu eylem başka bir akıl yürütme adımı, geleneksel bir görüntü işlemi veya generate_image için doğal dil talimatı olabilir. Seçilen aracın döndürdüğü sonuç bağlama eklenir; böylece model sonucu inceleyebilir ve yeniden dönüştürmeye, başka bir araç kullanmaya veya nihai yanıtına geçmeye karar verebilir.
Özerklik Kazanmak
Temel sorun, belirli bir görevi gerçekten hangi tür görüntünün kolaylaştıracağına karar vermektir. ReImaGin bunu aracıya farklı talimatlar vererek, aday istemleri yanıtları bilinen örnekler üzerinde test ederek ve başarılı ve başarısız denemelerden yararlanıp daha iyi istemler elde ederek belirler. Bu döngünün sonraki yinelemeleri sonunda en iyi performans gösteren stratejileri üretir.
Akıl yürütme modeli ile görüntü üretici bu süreçte yeniden eğitilmez; yalnızca aracının araçlarını nasıl kullanacağını yöneten talimatlar optimize edilir. Bu nedenle araştırmacılar süreci, göreve özgü stratejileri veya akıl yürütme örneklerini kendileri sağlamadan görsel akıl yürütme stratejilerinin “otomatik keşfi” olarak tanımlıyor.
Yapılandırma ve Testler
ReImaGin altı görsel akıl yürütme görevinde değerlendirildi: derinlik akıl yürütmesi (Blink — iki noktadan hangisinin kameraya daha yakın olduğunu belirleme); yapboz tamamlama (Mira — görüntüdeki eksik bölge için doğru parçayı seçme); örtüşmeli sayım (CAPTURe — gizli olanlar dâhil nesneleri sayma); çarpışma tahmini (Spatial457 — hareketli bir hedefin hangi nesneye çarpacağını tahmin etme); mekânsal akıl yürütme (MMSI — farklı görünümlerdeki nesneler arasındaki ilişkileri belirleme); ve yol izleme — modellerin sayıları harflere bağlayan kesikli çizgileri takip etmesini gerektiren yeni bir kıyaslama.

“MIRA, a Benchmark for Visual Chain-of-Thought” makalesinden, düşünce zinciri süreçlerindeki çarpıcı görsel imge örnekleri. Kaynak
Test edilen VLM omurgaları Gemini-3.1-Pro, GPT-5 ve açık ağırlıklı Qwen-3.5-27B oldu. Görüntü üretimi ağırlıklı olarak Nano-Banana-Pro tarafından gerçekleştirildi; açık ağırlıklı FLUX.2 [dev] ve Qwen-Image-Edit-2511 de test edildi. Görüntü üretiminde test zamanı ölçeklendirmesi için seçici olarak Gemini-3.1-Pro kullanıldı.
Karşılaştırmada kullanılan iki temel ölçütten, makalenin yazarlarının “No Tools” adını verdiği “vanilla” VLM, araç veya kod yürütme olmadan doğrudan sorgu ve görüntülerden yanıt verdi. 2024 tarihli Visual Sketchpad ise bu örnekte sabit bir uzman görüş ve görüntü işleme araçları kümesi sundu, ancak açık uçlu görüntü üretimi sağlamadı.
MMSI mekânsal görevi için her temel ölçütten 20 yanıt üretilip en sık görülen yanıt kullanılarak iki temel ölçüte de ReImaGin’e benzer miktarda hesaplama gücü verildi.
Performans, tahmin edilen ve gerçek nesne sayılarını karşılaştıran simetrik ortalama mutlak yüzde hatası ile değerlendirilen örtüşmeli sayım dışında tüm görevlerde çoktan seçmeli doğrulukla ölçüldü. Sonuçların ortalaması üç çalıştırma üzerinden alındı ve standart hata da bildirildi.

ReImaGin’i üç VLM ve altı görsel akıl yürütme görevinde No Tools ve Visual Sketchpad ile karşılaştıran test sonuçları. Daha yüksek puanlar daha iyidir; yalnızca Örtüşmeli Sayımda daha düşük hata daha iyidir. ReImaGin, model-görev birleşimlerinin çoğunda en iyi sonucu elde etti.
İnsanların tanımladığı aynı strateji örnekleri üç modelin tamamında kullanıldı. ReImaGin çoğu görevde her iki temel ölçütten de daha iyi sonuç verdi; yapboz tamamlama, örtüşmeli sayım ve yol izlemede özellikle belirgin kazanımlar sağladı.
Örneğin GPT-5 ile yapboz doğruluğu No Tools ile %29,5 ve Visual Sketchpad ile %16,7 iken ReImaGin ile %44,9’a yükseldi. Ablasyon testleri, üretken görüntü bileşeninin sistem performansı için temel olduğunu doğruladı.
Nano-Banana-Pro yerine açık ağırlıklı görüntü üreticiler de test edildi: FLUX.2 [dev] ve Qwen-Image-Edit-2511 daha basit bazı görevlerde, özellikle görüntü tamamlama konusunda benzer sonuçlar üretti; ancak derinlik tahmini ve yol izleme gibi daha zorlu dönüşümlerde daha az tutarlıydı. VLM olarak Qwen-3.5-27B kullanıldığında da benzer sonuçlar elde edildi:
![VLM olarak Qwen-3.5-27B ile görüntü üreticilerini karşılaştıran test sonuçları. Nano-Banana-Pro altı görevin beşinde en iyi sonucu elde ederken FLUX.2 [dev] ve Qwen-Image-Edit-2511 çeşitli görevlerde No Tools’a göre kazanımlar sağladı.](https://www.unite.ai/wp-content/uploads/2026/09/table-6-1.jpg)
VLM olarak Qwen-3.5-27B ile görüntü üreticilerini karşılaştıran test sonuçları. Nano-Banana-Pro altı görevin beşinde en iyi sonucu elde ederken FLUX.2 [dev] ve Qwen-Image-Edit-2511 çeşitli görevlerde No Tools’a göre kazanımlar sağladı.
Yazarlar ayrıca dört görev üzerinde nitel testler gerçekleştirdi:

Dört görevdeki nitel örnekler, ReImaGin’in Gemini-3.1-Pro’nun akıl yürütmesini güçlendirmek için nasıl kullanıldığını gösteriyor. Her durumda üretilen görsel temsiller, görevin çözümüne yardımcı olmak üzere akıl yürütme sürecine dâhil edildi.
ReImaGin her durumda güvenilir değildi: kimi koşullarda görüntü üretici, nesneleri yanlış konumlarda gösteren bir kat planı gibi hatalı bir dönüşüm üretti; başka durumlarda doğru üretilen bir görüntü daha sonra VLM tarafından yanlış okundu.
Üretilen 120 görüntünün elle denetlenmesinde yüzde 75’inin istenen dönüşümü aslına uygun biçimde gerçekleştirdiği saptandı. Bu başarıldığında nihai yanıt vakaların yüzde 87’sinde doğruydu; üretilen görüntü hatalı olduğunda bu oran yüzde 43’tü.
Yazarlar şu sonuca varıyor:
“Sonuçlarımız daha geniş iki çıkarıma işaret ediyor. Birincisi, görüntü üretimi çok modlu akıl yürütme içinde genel bir görsel hayal gücü mekanizması olarak işleyebilir ve her yeni dönüşüm için ayrı bir araç geliştirme ihtiyacını azaltabilir.
“İkincisi, bu yaklaşımın etkinliği yalnızca temel modellere değil, neyin görselleştirileceğine ve sonucun nasıl kullanılacağına karar vermek için kullanılan akıl yürütme stratejisine de bağlıdır.
“Otomatik strateji keşfinin sağladığı kazanımlar, modellerin insan tarafından yazılmış göreve özgü stratejiler veya akıl yürütme örnekleri olmadan ilgili stratejileri keşfetmek için görsel dönüşümlere ilişkin anlayışlarından yararlanabildiğini gösteriyor.”
Sonuç
Bu çalışmada incelenen türden kendi aracını kullanma kararları büyüleyici bir gelişmedir; özellikle de VLM geliştirmenin zaten doğal olarak bu yaklaşıma doğru evrildiği görülüyor. Bu tür çok amaçlı VLM’lerin sonunda Segment ekosistemi gibi özel araçlar ve çerçeveler kadar iyi performans gösterip göstermeyeceğini ve dolayısıyla yalnızca bu “yan görevlerle” ilgilenenlerin küçük bir iş için devasa bir araç kullanır hâle gelip gelmeyeceğini merak ediyorum.
VLM’lerin yerel ince ayar gibi özel çözümleri geçip üstünlüğü korumak için gereken disiplini geliştirebileceğine inanmak oldukça güç; bu yöntemde bütün bir model tek bir göreve ayrılır ve süreç içinde başka her şey için çoğu zaman kullanışsız kalır. Bunu zaman gösterecek.
* Herhangi bir dil becerisi edinmemizden çok önce öğrendiğimiz görüntü alanı için tartışmaya açık bir tanım.
İlk olarak 28 Eylül 2026 Pazartesi günü yayımlandı












