Anderson’un Açısı
‘House’ TV Şovunu Kullanarak AI’ın Teşhis Yeteneklerini Geliştirme

Nadiren görülen hastalık teşhisi, AI için (insanlar için olduğu gibi) özellikle zor bir challenge olmasına rağmen, popüler dil modelleri ChatGPT ve Gemini, ‘House’ tıbbi drama serisinden alınan teşhis vakalarına eğitim verildiğinde umut verici performans gösterir.
Sağlık bilimleri öğrencilerinin neredeyse yarısı düzenli olarak ‘House’, ‘Grey’s Anatomy’ ve ‘Scrubs’ gibi tıbbi dramaları izler. Bu tür materyalin yalnızca didaktik amaçlar için kullanılabilmesi için, yanlış bilgi yayma riski nedeniyle, çok fazla filtreleme ve çerçeveleme yapılması gerekir; ancak tıbbi durumları içeren dramalar için araştırma standardı genellikle oldukça yüksektir (ancak doğruluk üretimler arasında değişir).
Doktorlar genellikle kaynak, danışmanlık yapar ve/veya yazar tıbbi dramaları. Böyle durumlarda, geniş tıbbi alan bilgisi, yalnızca tıbbi konuları doğru bir şekilde aktarmak için değil, aynı zamanda yeni ve ilginç hikaye fikirleri önermek için de avantajlıdır.
Geçmişteki ‘altın çağ’ TV’nin en çok araştırılan tıbbi şovlarından biri House (ya da House MD), burada lead karakterin tuhaflıkları ve büyük destekçi kadrosundaki değişiklikler, ‘haftanın hastalığı’ndan sonra ikinci planda kaldı.
Gerçekte, sekiz sezon süresince yayınlanan 177 bölümden, House 176 teşhis vakası sunmuştur. Şov 2012’de bitti, ancak 2015 yılına gelindiğinde already bir eğitim aracı olarak kullanılıyordu, özel bir Dr. House semineri standard seminer materyallerine kıyasla daha iyi sonuçlar sundu, öğrencilere kredi verilmediği halde.
![2015 çalışmasından, tıbbi öğrencilerin 'House' TV şovundan alınan bilgiyi kullanan bir teşhis seminerine katılmak istedikleri çeşitli nedenler. Kaynak [ https://journals.plos.org/plosone/article/file?id=10.1371/journal.pone.0193972&type=printable ]](https://www.unite.ai/wp-content/uploads/2025/11/house-seminar.jpg)
2015 çalışmasından, tıbbi öğrencilerin ‘House’ TV şovundan alınan bilgiyi kullanan bir teşhis seminerine katılmak istedikleri çeşitli nedenler. Seminerler kasıtlı olarak zor bir zamanda planlandı ve çalışma kredisi verilmedi; buna rağmen, girişim başarılı oldu. Kaynak
House ve AI
‘House’ ve diğer çeşitli TV şovlarının kullanımının, tıbbi öğrenciler için öğrenme konusunda etkili bir yardımcı araç olduğu, çoklu çalışmada kanıtlandı. Ancak, bu yaklaşımın, makine öğrenimi bağlamında şimdiye kadar çok az denenmesi dikkat çekicidir.
Şimdi, Pennsylvania Eyalet Üniversitesi’nden yeni bir makale, bu yönde ilk adımı atmış ve 176 House teşhis vakalarını içeren bir veri seti geliştirmiş, ardından bu veri setini OpenAI ve Google’dan popüler LLM’ler üzerinde değerlendirmiştir.
Karşılaşılan zorluğa (biyolojik bilimlerdeki en zor alanlardan birini karakterize eder) rağmen, araştırmacılar, ChatGPT ve Gemini’nin daha yeni sürümlerinin, daha eski sürümlerine kıyasla iyileşme gösterdiğini bulmuşlardır; bu, model geliştirme trendinin, zaman içinde teşhis süreçlerine etkili bir şekilde yöneleceğini gösterir.
Makale şöyle diyor:
‘Sonuçlar, %16,48 ile %38,64 arasında değişen önemli varyasyonlar gösterir ve daha yeni model nesilleri 2,3 kat iyileşme gösterir. Tüm modeller, nadir hastalık teşhisi ile önemli zorluklarla karşılaşıyor olsa da, mimari boyunca gözlenen iyileşme, gelecekteki gelişme için umut verici yönler gösterir.
‘Eğitimle doğrulanmış referans çerçevemiz, narrative tıbbi akıl yürütme için temel performans ölçütlerini oluşturur ve AI destekli teşhis araştırmalarını ilerletmek için halka açık bir değerlendirme çerçevesi sağlar.’
Araştırmacılar, yeni veri setinin (kamuoyuna açık olarak sunulmaktadır) mevcut tıbbi veri setlerindeki narrative sürecin eksikliğini çözdüğünü ve kolayca erişilebileceğini, standard tıbbi veri setlerinin culture’üne kıyasla vurgulamaktadırlar.
Yeni çalışma Evaluating Large Language Models on Rare Disease Diagnosis: A Case Study using House M.D olarak adlandırılmış ve Penn State’ten dört araştırmacı tarafından yapılmıştır.
Veri
Veri setini oluşturmak için araştırmacılar, uzun süredir kurulmuş House Wiki fan sitesi üzerinden kamuoyuna açık materyalleri kullandılar. Narrative içerik, popüler Beautiful Soup framework kullanılarak çıkarıldı ve damıtıldı; bu framework, web sayfalarının HTML kaynağından yapısal verileri çıkarabilir.
Temel narrative’ler bu şekilde hasat edildikten sonra, dört LLM kullanılarak çıktı, standart teşhis formatına dönüştürüldü. Kullanılan modeller GPT-4o mini; GPT-5 Mini; Gemini 2.5 Flash; ve Gemini 2.5 Pro idi. Son olarak, kaliteli filtreleme uygulandı, böylece veri setinin uygun klinik ayrıntıya sahip olduğu ve tıbbi akıl yürütmenin güncel durumuna uyumlu olduğu garantilenmiştir.
Araştırmacılar, ‘yetim’ hastalıkların (nadiren görülen hastalıklar) standard tıbbi veri tabanlarında temsil edilmediğini gözlemliyorlar; belirli durumlarda, ‘House’ şovundaki kapsamı, mevcut toplam kapsamlarının alışılmadık bir yüzdesini temsil edebilir.
Araştırmacılar, bu tür bir veri kaynağının faydasının, tıbbi drama geliştirilmesinde öncelik verilen sanat lisansı ile dikkatli bir şekilde dengelenmesi gerektiğini kabul ediyorlar:
‘Veri setimiz, kurgusal içerikteki sınırları yansıtsa da, dramatik abartma ve karmaşık vaka odaklı özellikleri, model dayanıklılığını test eden zorlu kenar durumları sunarak değerlendirme için faydalı olabilir.’
‘House M.D.’nin tıbbi profesyoneller tarafından eğitimsel olarak doğrulanması, çıkarılan senaryoların klinik olarak anlamlı bilgileri içereceğini gösterir, bu da AI değerlendirmesi için uygun olduğunu gösterir.’
![Proje için oluşturulan veri setinden örnekler. Kaynak [ https://www.kaggle.com/datasets/arshgupta23/housemd-data-for-rare-disease-accuracy-using-llms?resource=download ]](https://www.unite.ai/wp-content/uploads/2025/11/dataset-examples.jpg)
Proje için oluşturulan veri setinden örnekler. Kaynak
Testler
Modellerin narrative teşhis görevlerindeki doğruluğunu değerlendirmek için araştırmacılar, bir pipeline tasarladılar; bu pipeline, istem oluşturma, model çıkarımı ve puanlama içeriyordu.
Dört LLM test edildi; her model, sıcaklık sıfıra ayarlandı (böylece belirlirather than ‘yaratıcı’ çıktı garantilenir) ve maksimum token uzunluğu 1.500 olarak ayarlandı – bu, karmaşık teşhis akıl yürütmesini kapsayacak şekilde tasarlandı. Ek sistem istemleri kullanılmadı.
İstemler, tıbbi dramalardan tanıdık olduğumuz standart yapısal tıbbi vaka sunum formatına uyuyordu – yeni bir hasta/hastalık tanıtılır ve bir doktor, diğer doktorların benefitine (aslında, izleyicilerin benefitine) bir özet sunar.
Her istem, demografik ayrıntılar, semptomlar zaman çizelgesi, ilgili tıbbi geçmişi ve erken teşhis bulguları içeren bir klinik narrative içeriyordu. Model, birincil teşhisi tanımlamak ve sonuçlarını akıl yürütme ile gerekçelendirmekle görevlendirildi.
Her model, tek bir geçişte teşhis yanıtını üretti; hiçbir yineleme iyileştirmesi yapılmadı ve yanıtlar tutarlı koşullar altında tüm 176 vaka için toplandı:
![Gemini 2.5 Pro için test edilen bir narrative klinik istem ve karşılık gelen ground truth teşhisi gösteren bir örnek. Kaynak [ https://arxiv.org/pdf/2511.10912 ]](https://www.unite.ai/wp-content/uploads/2025/11/table-2-1.jpg)
Gemini 2.5 Pro için test edilen bir narrative klinik istem ve karşılık gelen ground truth teşhisi gösteren bir örnek. Kaynak
Metrikler için, tahminler, tıbbi terminolojideki belirsizliği hesaba katmak için tasarlanmış bir ‘fuzzy’ dize eşleştirme prosedürü kullanılarak değerlendirildi. Python’un SequenceMatcher kütüphanesi kullanıldı; benzerlik eşiği 0,8 olarak ayarlandı, tam alt dize eşleştirmesi ile başladı ve gerekli olduğunda token-wise karşılaştırmaya geri döndü. Doğruluk bu koşullar altında doğru sınıflandırılan vakaların oranı olarak hesaplandı:

Araştırmacıların kullandığı ‘fuzzy matching’ iş akışı.
Araştırmacılar, fuzzy matching’in, farklı terminoloji kullanan ancak semantik olarak aynı teşhisleri kaçırabileceğini not ediyorlar, ancak yaklaşımını, projenin kısıtlamalarını karşılayabilen en yeniden üretilebilir yaklaşım olarak sunuyorlar.
Sonuçlar
Teşhis doğruluğu, Gemini 2.5 Pro’nun %38,64 ile en iyi performans gösterdiği, onu GPT-5 Mini’nin %36,93, Gemini 2.5 Flash’ın %32,95 ve GPT-4o Mini’nin %16,48 izlediği şekilde modeller arasında geniş bir şekilde değişti:

Dört model için teşhis doğruluğu sonuçları.
Araştırmacılar ayrıca, performansı şovun sezonları boyunca değiştiğini not ediyor:

Farklı ‘House’ sezonlarındaki değişen doğruluk, ancak açık bir eğri veya neden olmadan.
Makale şöyle diyor:
‘1. sezon %56,52 ile en yüksek doğruluğu elde ederken, 5. sezon %20,83 ile en düşük doğruluğa sahip. Bu varyasyon, dizinin farklı sezonlarında teşhis karmaşıklığının değişebileceğini, daha geç sezonların daha zor nadir hastalık vakalarına sahip olabileceğini gösterir.
‘Ancak 8. sezonun (%52,38) nispeten güçlü performansı, zamanın ilerlemesinin doğruluk farklılıklarını tam olarak açıklamadığını, vaka spesifik teşhis karmaşıklığının birincil sürücü olduğunu gösterir.’
Modeller, tanınabilir semptomlara sahip ortak durumları teşhis ettiğinde (menenjit, miyokard enfarktüsü ve pulmoner emboli gibi) daha güvenilir bir şekilde çalıştı, ancak nadir hastalıklar (nörosistiserkoz ve Erdheim-Chester hastalığı gibi) ve kompleks otoimmün bozukluklar (sistemik lupus eritematozus ve sarkoidoz gibi) ile tutarlı bir şekilde mücadele etti. Toksikolojik vakalarda, maruziyet geçmişini klinik bulgulara bağlamak gerektiğinde performansı düştü.
Araştırmacılar, model performansı arasındaki varyasyonun, mimari ve eğitim stratejilerindeki anlamlı farklılıkları gösterdiğini öne sürüyor; GPT-5 Mini ve Gemini 2.5 Pro’nun daha güçlü performansı, daha yeni LLM nesillerinin akıl yürütme yeteneklerinde iyileşme gösterdiğini gösteriyor – ancak sonuçları, kompleks teşhis görevlerini ele alırken masih açık sınırlamaları ortaya koyuyor.
Sonuçlar, narrative dayalı nadir hastalık teşhisi için temel performans ölçütleri sağlıyor ve mevcut dil modellerinin tıbbi akıl yürütme yetenekleri göstermeye başladığını güçlü bir şekilde gösteriyor.
Sonuçlar, GPT-4o Mini’den %16,48’e Gemini 2.5 Pro’dan %38,64’e olan performanstaki atılım, klinik olarak uygulanabilir AI destek araçlarına doğru istikrarlı bir ilerleme sinyali veriyor.
Araştırmacılar, doğruluk seviyelerinin masih mütevazı kaldığını kabul etseler de, referansın, hatta eğitimli doktorları zorlayan, çok karmaşık vakalara odaklandığını ve bu zor örneklerin yaklaşık %40’ında doğru teşhisi yapma yeteneğinin gerçek akıl yürütme kapasitesini gösterdiğini vurguluyorlar.
Sonuç
TV şovlarından narrative’leri gerçek dünya tıbbi veri setlerine yeniden amaçlamakta açık tehlikeler vardır – hatta ‘House’ gibi, kaynak materyalin yüksek düzeyde nitelikli tıbbi katkıları ve/veya denetimi olduğu durumlarda bile.
‘House’ gibi bir TV şovunun bir bölümü, aslında, internet üzerinde doğrudan erişilemeyen veya daha parçalı ve doğrusal olmayan bir şekilde sunulan tıbbi girişler dizisi için bir özetleme makinesi olarak işlev görür.
Bir doktorun gerçekten bir bölümün senaryosunu yazması, ‘House’ ile sık sık olduğu gibi, araştırmacılar için içeriğin ‘onaylanması’ olarak kullanılabilir; ancak bu, sanat考虑lerininsometimes disease’nin sunumuna öncelik vermiş olabileceğini görmezden gelir.
Bu, verilerin, diğer birçok potansiyel olarak faydalı eğitim veri kaynağı gibi, pahalı, nitelikli insan denetimi için yeni bir katmana ihtiyaç duyduğu duruma bırakır.
* Lütfen bu çok kısa makalenin geleneksel şablonu izlemediğini ve bunu karşılamak için kapsamı uyarladığımı unutmayın.
İlk olarak 17 Kasım 2025 Pazartesi günü yayınlandı.












