Angolo di Anderson
Utilizzare la serie TV “House” per sviluppare le capacità diagnostiche dell’AI

Sebbene la diagnosi di malattie rare sia una sfida particolarmente difficile per lâAI (come lo ÃĻ per gli esseri umani), i popolari modelli linguistici ChatGPT e Gemini mostrano prestazioni promettenti quando addestrati su casi diagnostici tratti dalla popolare serie medica âHouseâ.
Â
Quasi la metà di tutti gli studenti di scienze della salute guarda regolarmente drammi medici come House, Greyâs Anatomy e Scrubs. Sebbene questo tipo di materiale possa essere utilizzato solo per scopi didattici con unâadeguata filtrazione e cornice, a causa del rischio di diffusione di informazioni false pericolose, lo standard di ricerca per le drammatizzazioni che presentano condizioni mediche tende ad essere abbastanza alto (anche se lâaccuratezza varia tra le produzioni).
Non sorprendentemente, i medici spesso creano, consigliano e/o scrivono drammi medici per la TV. In questi casi, una vasta conoscenza del dominio medico ÃĻ vantaggiosa non solo per trasmettere in modo accurato questioni mediche, ma anche per ideare suggerimenti per nuove e interessanti trame.
Una delle serie mediche piÃđ studiate della recente âetà dâoroâ della TV ÃĻ House (anche conosciuta come House MD), in cui le eccentricità del personaggio principale e le grandi fluttuazioni nel cast di supporto, divertenti come erano, occupavano un posto secondario rispetto alla âmalattia della settimanaâ.
In effetti, su 177 episodi trasmessi in otto stagioni, House ha fornito 176 studi di casi diagnostici meticolosi. Sebbene la serie sia terminata nel 2012, già nel 2015 era utilizzata come strumento didattico, con un seminario speciale su âDr. Houseâ che offriva risultati migliori rispetto ai seminari standard, anche se la partecipazione non offriva crediti per gli studenti:

Dai risultati di uno studio del 2015, diverse ragioni per cui gli studenti di medicina volevano partecipare a un seminario diagnostico che sfruttava informazioni dalla serie TV âHouseâ. I seminari erano pianificati in un momento deliberatamente impegnativo e non offrivano crediti di studio; nonostante questi fattori, lâiniziativa ÃĻ stata un successo. Fonte
House e AI
Sebbene lâutilizzo di House e altre serie TV diverse sia stato provato in numerosi studi come un aiuto efficace allâapprendimento per gli studenti di medicina, finora poco di questo approccio ÃĻ stato tentato in un contesto di apprendimento automatico.
Ora, un nuovo articolo della Pennsylvania State University ha fatto un primo tentativo in questa direzione, sviluppando un set di dati che presenta tutti i 176 casi di House utilizzabili, formulati in una struttura diagnostica guidata da una narrazione, successivamente valutata su LLM popolari di OpenAI e Google.
Nonostante la difficoltà di questa sfida (che caratterizza uno dei campi piÃđ difficili delle scienze biologiche), i ricercatori hanno scoperto che le versioni piÃđ recenti di ChatGPT e Gemini mostravano un miglioramento rispetto alle versioni piÃđ vecchie, indicando che la tendenza evolutiva dello sviluppo del modello ÃĻ probabile che si inserisca efficacemente nei processi diagnostici nel tempo.
Lâarticolo afferma:
âI risultati mostrano una variazione significativa delle prestazioni, che vanno dal 16,48% al 38,64% di accuratezza, con le nuove generazioni di modelli che dimostrano un miglioramento del 2,3 volte. Sebbene tutti i modelli affrontino sfide sostanziali nella diagnosi di malattie rare, il miglioramento osservato tra le architetture suggerisce direzioni promettenti per lo sviluppo futuro.
âIl nostro benchmark educativamente validato stabilisce metriche di prestazione di base per la ragione medica narrativa e fornisce un framework di valutazione pubblicamente accessibile per avanzare la ricerca sulla diagnosi assistita dallâAI.â
Oltre a stabilire metriche di prestazione di base rispetto alle quali gli sforzi futuri possono essere valutati, gli autori notano che il nuovo set di dati â che stanno rendendo pubblicamente disponibile â risolve la mancanza di processo narrativo allâinterno dei set di dati medici esistenti, ed ÃĻ facilmente accessibile, a differenza della cultura di set di dati medici standard protetti da accesso.
Il nuovo lavoro ÃĻ intitolato Valutazione di Large Language Models sulla diagnosi di malattie rare: uno studio di caso utilizzando House M.D, e proviene da quattro ricercatori della Penn State*.
Dati
Per popolare il loro set di dati, gli autori hanno utilizzato materiale pubblicamente disponibile dal sito di fan House Wiki a lungo stabilito. Il contenuto narrativo ÃĻ stato estratto e distillato utilizzando il framework Beautiful Soup popolare, che puÃē estrarre dati strutturati dal codice HTML delle pagine web.
Dopo che le narrazioni di base sono state raccolte in questo modo, quattro LLM sono stati utilizzati per trasformare lâoutput in un formato di caso standardizzato. I modelli utilizzati sono stati GPT-4o mini; GPT-5 Mini; Gemini 2.5 Flash; e Gemini 2.5 Pro. Infine, ÃĻ stata applicata una filtrazione di qualità per assicurare che il set di dati avesse dettagli clinici appropriati e allineamento con lo stato attuale dellâarte nella ragione medica.
Gli autori osservano che le âmalattie orfaneâ (anche note come malattie rare) sono sottorappresentate nei database medici standard; in alcuni casi, la loro copertura nella serie âHouseâ puÃē rappresentare una percentuale insolitamente alta della loro copertura totale esistente.
Gli autori ammettono che lâutilità di una fonte di dati di questo tipo deve essere temperata con cautela riguardo alla licenza artistica che puÃē essere priorizzata a volte nello sviluppo di drammi medici:
âMentre il nostro set di dati riflette limitazioni di contenuto fittizio, tra cui esagerazione drammatica e focus su casi complessi, queste caratteristiche possono beneficiare la valutazione fornendo casi limite sfidanti che testano la robustezza del modello.
âLa validazione educativa di House M.D. da parte di professionisti medici fornisce la fiducia che le scenari estratti contengano informazioni clinicamente significative adatte per la valutazione dellâAI.â
![Esempi dal set di dati generato per il progetto. Fonte [ https://www.kaggle.com/datasets/arshgupta23/housemd-data-for-rare-disease-accuracy-using-llms?resource=download ]](https://www.unite.ai/wp-content/uploads/2025/11/dataset-examples.jpg)
Esempi dal set di dati generato per il progetto. Fonte
Test
Per valutare lâaccuratezza del modello sui compiti diagnostici narrativi, gli autori hanno progettato una pipeline semplice che combina la generazione di prompt, lâinferenza del modello e la valutazione.
I quattro LLM sopra menzionati sono stati testati, con ogni modello configurato con temperatura impostata su zero (assicurando un output deterministico piuttosto che âcreativoâ), e con una lunghezza massima di token di 1.500 â un margine progettato per accogliere ragionamenti diagnostici complessi. Non sono stati utilizzati prompt di sistema aggiuntivi per inquadrare ulteriormente le query.
I prompt stessi aderivano a un formato standard di presentazione del caso medico â il tipo che gli spettatori saranno piÃđ familiari con i drammi medici quando un nuovo paziente/malattia viene introdotto e un medico riassume una panoramica per il beneficio degli altri medici presenti (in effetti, sebbene, per il beneficio degli spettatori).
Ogni prompt presentava una narrazione clinica che comprendeva dettagli demografici; una cronologia dei sintomi; storia medica rilevante; e prime scoperte diagnostiche. Il modello ÃĻ stato istruito per identificare una singola diagnosi primaria e per giustificare la sua conclusione con ragionamento.
Ogni modello ha generato la sua risposta diagnostica in un solo passaggio, senza alcun raffinamento iterativo; e le risposte sono state raccolte in condizioni coerenti in tutti i 176 casi:
![Un esempio illustrativo di valutazione, che mostra un prompt clinico narrativo e la sua diagnosi di verità fondamentale corrispondente, come utilizzato per testare Gemini 2.5 Pro. Fonte [ https://arxiv.org/pdf/2511.10912 ]](https://www.unite.ai/wp-content/uploads/2025/11/table-2-1.jpg)
Un esempio illustrativo che mostra un prompt clinico narrativo e la sua diagnosi di verità fondamentale corrispondente, come utilizzato per testare Gemini 2.5 Pro. Fonte












