Anderson’un Açısı
AI, Tıbbi Görüntülerde Solu Sağı Ayırt Edemez

Yeni bir çalışmada, ChatGPT gibi AI görüntü modellerinin, flipped veya rotated anatomiyi yanlış okuyabildiği, bu nedenle teşhislerde tehlikeli hatalar riski taşıdığı tespit edildi. Testler, bu modellerin genellikle temel uzaysal akıl yürütme testlerini geçemediğini, yani görüntüleri gerçekten incelemek yerine nerede olması gerektiği hakkında tahminlerde bulunduklarını gösterdi.
Herhangi bir veri, örneğin PDF içeriği, gibi büyük bir dil modeline düzenli olarak yükleyen herkes, LLM’lerin her zaman sunulan verileri okumak veya incelemek zorunda olmadığını bilir; genellikle yüklenen içeriği hakkında yazılan.prompt’a dayalı varsayımlar yapar.

Bir dil modelinin, gerçekten içeriği incelediği yerine, önceden edinilmiş bilgiler, meta veriler veya genel varsayımlara dayanarak cevap verdiğini kabul etmesi zor olabilir. Kaynak: https://chatgpt.com
Bunun bir nedeni, cevap hızını artırmak için yüklenen materyali “gereksiz” olarak değerlendirmek ve dil-prompt’ına dayanarak sistemdeki önceden edinilmiş bilgileri kullanmak olabilir – böylece yüklemeyi tamamen atlayıp ağ trafiğini en aza indirerek.
Diğer bir neden, kaynakların korunması olabilir (ancak sağlayıcılar bunu açıklamayaunlikely görünüyor), önceki sohbetlerdeki mevcut meta verilerin, LLM tarafından daha sonraki cevaplar için temel olarak kullanılması, bu meta verilerin ve bu sohbetlerin yeterli bilgi içermemesine rağmen.
Sol, Sağ?
LLM’lerin bu çeşitli dikkat spanı ve odaklanma yeteneklerinin nedeni ne olursa olsun, bazı durumlar ve bağlamlar vardır ki burada tahmin etmek son derece tehlikelidir. Bunlardan biri, AI’nin tıbbi hizmetler gibi tarama veya radyolojik materyal risk tahmini gibi görevler için kullanılmasıdır.
Bu hafta, Almanya ve ABD’den araştırmacılar, dört önde gelen görüş-dil modelinin, tıbbi görüntülerdeki organların konumlarını belirleme yeteneğini inceleyen yeni bir araştırma yayınladı.
Şaşırtıcı bir şekilde, bu alanın state-of-the-art’ını temsil eden temel modeller, çoğu zaman sadece şansa eşit bir başarı oranı elde etti – görünüşe göre, eğitim aldıkları insan anatomisi bilgisini yeterli şekilde ayırarak ve gerçekten görüntüleri incelemeyerek.
Araştırmacılar, LLM’lerin test edildiği durumlarda, bazı görsel işaretçilerin (nokta ve alfanümerik sıralama işaretçileri) ve adlandırılan bölümlerin kullanıldığında daha iyi performans gösterdiğini buldu:

Görsel işaretçilerin kullanıldığında başarı seviyeleri artıyor, modelin eğitilmiş verilere başvurmasının azaltılması ve görüntüye odaklanması gerekiyor. Kaynak: https://wolfda95.github.io/your_other_left/
Makalede*:
‘Görüş-dil modelleri zaten güçlü öncül anatomik bilgiye sahiptir. Başka bir deyişle, anatomik yapıların standard insan anatomisinde genellikle nerede bulunduğunu “bilir”.
‘VLM’lerin, anatomik yapıların göreli konumlarını belirlerken, gerçekten görüntüyü analiz etmek yerine, bu öncül bilgilere dayandığını varsayıyoruz. Örneğin, bir model, karaciğerin midenin sağında olup olmadığını sorduğunda, görüntüyü incelemeyerek, sadece öğrenilmiş norma dayanarak cevap verebilir.
‘Bu davranış, anatomik yapıların gerçek konumları tipik anatomik desenlerden sapma gösteren durumlarda, gibi kritik teşhis hatalarına yol açabilir. situs inversus, postoperatif değişiklikler veya tümör yer değiştirmesi gibi durumlarda.
Gelecek çalışmalarda bu sorunu hafifletmek için, yazarlar bu sorunu ele alan bir veri seti geliştirdiler.
Çalışmanın bulguları, tıbbi AI’nin gelişimini izleyen birçok okuyucu için şaşırtıcı olabilir, çünkü radyografi, makine öğrenimi yoluyla otomasyona en erken aday gösterilen işlerden biri olarak belirlenmişti.
Yeni çalışma, Your other Left! Vision-Language Models Fail to Identify Relative Positions in Medical Images olarak adlandırılmıştır ve Almanya’daki Ulm Üniversitesi’nden ve ABD’deki Axiom Bio’dan yedi araştırmacının ortak çalışmasıdır.
Yöntem ve Veri
Araştırmacılar, dört soruyu cevaplamak için çalıştılar:
Görüş-dil modelleri radyoloji görüntülerindeki göreli konumları doğru bir şekilde belirleyebilir mi?
Görsel işaretçilerin kullanılması performansını iyileştirir mi?
Anatomik yapıların göreli konumlarını belirlerken, gerçekten görüntüyü analiz etmek yerine, öncül anatomik bilgilere dayanır mı?
Tıbbi bağlamdan arındırıldığında, göreli konumlandırma görevlerini nasıl ele alır?
Bu amaçla, Tıbbi Görüntü Göreli Konumlandırma (MIRP) veri setini oluşturdular.
Çoğu mevcut görsel soru-cevap benchmark’ları CT veya MRI kesitleri için anatomik ve lokalizasyon görevlerini içerse de, bu daha eski koleksiyonlar, anatomik yapılar arasındaki göreli konumların belirlenmesi gibi temel zorluğu göz ardı eder, bu da birçok görevi yalnızca öncül tıbbi bilgi kullanarak çözülebilmesini sağlar.
MIRP, bu sorunu ele almak için tasarlandı ve anatomik yapılar arasındaki göreli konum sorularını test ediyor, görsel işaretçilerin etkisini değerlendiriyor ve öğrenilmiş normlara dayanmayı engellemek için rastgele rotasyonlar ve flips uyguluyor. Veri seti, radyolojide yaygın olan ve karmaşık olan abdominal CT kesitlerine odaklanıyor.
MIRP, her soru için eşit sayıda “evet” ve “hayır” cevapları içeriyor ve anatomik yapılar her soru için isteğe bağlı olarak işaretlenerek açıklık sağlanıyor.
Üç tür görsel işaretçi test edildi: beyaz bir kutu içindeki siyah numaralar; beyaz bir kutu içindeki siyah harfler; ve kırmızı ve mavi bir nokta:

MIRP’de kullanılan çeşitli görsel işaretçiler. Kaynak: https://arxiv.org/pdf/2508.00549
Toplama, mevcut Beyond the Cranial Vault (BTCV) ve Abdominal Multi-Organ Segmentation (AMOS) veri setlerinden yapıldı.

AMOS veri setinden açıklamalı kesitler. Kaynak: https://arxiv.org/pdf/2206.08023
TotalSegmentator projesi, hacimsel verilerden anatomik düzlem görüntülerini çıkarmak için kullanıldı:

TotalSegmentator’da bulunan 104 anatomik yapıdan bazıları. Kaynak: https://arxiv.org/pdf/2208.05868
Aksiyal görüntü kesitleri, SimpleITK çerçevesi kullanılarak elde edildi.
‘Zorlu’ görüntü konumları, en az 50px uzaklıkta ve işaretçilerin boyutunun en az iki katı olmalıdır.
Testler
Test edilen dört görüş-dil modeli GPT-4o; Llama3.2; Pixtral; ve DeepSeek’in JanusPro idi.
Araştırmacılar, her bir araştırma sorusunu sırasıyla test etti, ilk soru (Q1) ‘Şu anki en iyi görüş-dil modelleri, radyolojik görüntülerdeki göreli konumları doğru bir şekilde belirleyebilir mi?’ idi. Bu soru için, araştırmacılar modelleri, standart bir soru formatı kullanarak, düzeltilmemiş, döndürülmüş veya flipped CT kesitleri üzerinde test etti, örneğin Sol böbrek midenin altında mı?.
Sonuçlar (aşağıda gösterilen), tüm modellerde %50 civarında doğruluk oranları gösterdi, bu da şansa eşit bir performans ve görsel işaretçiler olmadan göreli konumları güvenilir bir şekilde belirleme yeteneklerinin olmadığını gösterdi:

MIRP benchmark’unda (RQ1–RQ3) ve ablasyon veri setinde (AS) yapılan tüm deneylerin ortalama doğruluğu.
Görsel işaretçilerin, radyolojik görüntülerdeki göreli konumları belirlemede görüş-dil modellerine yardımcı olup olmadığını test etmek için, araştırmacılar aynı deneyleri, CT kesitleri üzerinde harf, numara veya kırmızı ve mavi nokta gibi işaretçiler kullanarak tekrarladı ve soru formatını bu işaretçilere atıfta bulunacak şekilde ayarladı – örneğin Sol böbrek (A) midenin (B) altında mı? veya Sol böbrek (kırmızı) midenin (mavi) altında mı?.
Sonuçlar, GPT-4o ve Pixtral için harf veya numara işaretçilerinin kullanıldığında küçük doğruluk kazançları gösterdi, mientras ki JanusPro ve Llama3.2’de neredeyse hiçbir fayda görülmedi, bu da işaretçilerin tek başına performansını önemli ölçüde iyileştirmeye yetmeyeceğini gösterdi.

Tüm deneylerin görüntü tabanlı değerlendirmesi. RQ2, RQ3 ve AS için, her modelin en iyi performans gösteren işaretçi türü gösteriliyor: GPT-4o için harfler ve Pixtral, JanusPro ve Llama3.4 için kırmızı-mavi nokta.
Üçüncü soru, ‘Görüş-dil modelleri, radyolojik görüntülerdeki göreli konumları belirlerken, gerçekten görüntüleri analiz etmek yerine, öncül anatomik bilgilere dayanır mı?’ idi. Araştırmacılar, modellerin, döndürülmüş veya flipped CT kesitleri üzerinde test edildiğinde, gerçekten görüntüleri incelemektense, standard anatomik konumlarla tutarlı cevaplar üretip üretmediklerini inceledi.
GPT-4o ve Pixtral, görüntüde gösterilenlere aykırı olarak, anatomik konumlarla tutarlı cevaplar üretti, GPT-4o, anatomik temelde %75’in üzerinde doğruluk oranına ulaştı, ancak görüntü temelinde sadece şansa eşit bir performans gösterdi.
Anatomik terimlerin prompt’lardan kaldırılması ve sadece görsel işaretçilerin kullanılması, modellerin görüntü içeriğine dayanmak zorunda kalmasına yol açtı, bu da önemli doğruluk kazançlarına yol açtı, GPT-4o harf işaretçileri ile %85’in üzerinde bir doğruluk oranına ulaştı ve Pixtral nokta işaretçileri ile %75’in üzerinde bir doğruluk oranına ulaştı.

Dört görüş-dil modelinin, tıbbi görüntülerdeki anatomik yapıların göreli konumlarını belirleme yeteneği karşılaştırması – klinik kullanım için kritik bir gereksinim. Performans, plain görüntülerde (RQ1) şansa eşit seviyede ve görsel işaretçilerin kullanıldığında (RQ2) sadece küçük kazançlar gösteriyor. Anatomik adlar kaldırıldığında ve modeller sadece işaretçilere dayanmak zorunda kaldığında, GPT-4o ve Pixtral önemli doğruluk kazançları elde ediyor (RQ3). Sonuçlar, her modelin en iyi performans gösteren işaretçi türünü gösteriyor.
Bu, her iki modelin de görüntü verilerini kullanarak görevi gerçekleştirebileceğini, ancak anatomik adlar verildiğinde, öncül anatomik bilgilere başvurmayı tercih ettiklerini gösteriyor – bu model, JanusPro veya Llama3.2’de net bir şekilde gözlenmiyor.
Genellikle ablasyon çalışmaları hakkında bilgi vermiyoruz, ancak yazarlar, dördüncü ve son araştırma sorusunu böyle bir çalışma ile ele aldı. Bu nedenle, tıbbi bağlamdan arınmış olarak göreli konumlandırma yeteneğini test etmek için, çalışma, sadece beyaz bir arka plan上的 rastgele yerleştirilmiş işaretçiler ile plain beyaz görüntüler kullanarak basit sorular sordu, örneğin 1 numaralı işaretçi 2 numaralı işaretçinin üzerinde mi?. Pixtral, nokta işaretçileri ile geliştirilmiş sonuçlar gösterdi, diğer modeller ise RQ3 puanlarına benzer bir performans gösterdi.
JanusPro ve özellikle Llama3.2, bu basitleştirilmiş ortamda bile mücadele etti, bu da tıbbi görüntülerle sınırlı olmayan, göreli konumlandırma yeteneğinde temel zayıflıklar olduğunu gösterdi.
Yazarlar, GPT-4o’nun harf işaretçileri ile en iyi performans gösterdiğini, Pixtral, JanusPro ve Llama3.2’nin ise kırmızı-mavi nokta ile daha yüksek puanlar elde ettiğini gözlemledi. GPT-4o genel olarak en iyi performans gösteren model oldu, Pixtral ise açık kaynaklı modeller arasında lider oldu.
Sonuç
Kişisel bir not olarak, bu makale, tıbbi önemi nedeniyle değil, çünkü şu anki SOTA LLM’lerin en çok under-reported ve temel eksikliklerinden birini vurguluyor – eğer görev kaçınılabiliyorsa ve sunulan materyali dikkatli bir şekilde sunmazsan, gerçekten metinleri okuyacak veya sunulan görüntüleri incelemeyecek.
Daha da önemlisi, çalışma, eğer metin-prompt herhangi bir şekilde ikincil sunulan materyali açıklıyorsa, LLM’nin bunu bir “teleolojik” örnek olarak ele alacağı ve öncül bilgilerine dayanarak birçok şey varsayacağı anlamına gelir.
Esasen, bu durum, VLM’lerin “anormal” materyali tanımlama yeteneğinde büyük zorluklara yol açar – bu, teşhis tıbbının en önemli becerilerinden biridir. Mantığı tersine çevirmek ve bir sistem için anormal örnekler yerine in-distribution sonuçlarını aramak mümkün olsa da, modelin sinyali anlamsız veya sahte örneklerle boğmasını önlemek için olağanüstü bir küratöre ihtiyacı vardır.
* İç referanslar atlanmıştır, çünkü onları hiperlink olarak dahil etmenin zarif bir yolu yoktur. Lütfen kaynak makaleye başvurun.
İlk olarak 4 Ağustos 2025 Pazartesi günü yayınlandı.












