Angolo di Anderson

Utilizzare la serie TV “House” per sviluppare le capacità diagnostiche dell’AI

mm
Aggiungi Unite.AI alle tue fonti preferite su Google
A screen capture from the NBC TV show 'House, S04E02., 'The Right Stuff'

Sebbene la diagnosi di malattie rare sia una sfida particolarmente difficile per l’AI (come lo è per gli esseri umani), i popolari modelli linguistici ChatGPT e Gemini mostrano prestazioni promettenti quando addestrati su casi diagnostici tratti dalla popolare serie medica “House”.

 

Quasi la metà di tutti gli studenti di scienze della salute guarda regolarmente drammi medici come House, Grey’s Anatomy e Scrubs. Sebbene questo tipo di materiale possa essere utilizzato solo per scopi didattici con un’adeguata filtrazione e cornice, a causa del rischio di diffusione di informazioni false pericolose, lo standard di ricerca per le drammatizzazioni che presentano condizioni mediche tende ad essere abbastanza alto (anche se l’accuratezza varia tra le produzioni).

Non sorprendentemente, i medici spesso creano, consigliano e/o scrivono drammi medici per la TV. In questi casi, una vasta conoscenza del dominio medico è vantaggiosa non solo per trasmettere in modo accurato questioni mediche, ma anche per ideare suggerimenti per nuove e interessanti trame.

Una delle serie mediche più studiate della recente “età d’oro” della TV è House (anche conosciuta come House MD), in cui le eccentricità del personaggio principale e le grandi fluttuazioni nel cast di supporto, divertenti come erano, occupavano un posto secondario rispetto alla “malattia della settimana”.

In effetti, su 177 episodi trasmessi in otto stagioni, House ha fornito 176 studi di casi diagnostici meticolosi. Sebbene la serie sia terminata nel 2012, già nel 2015 era utilizzata come strumento didattico, con un seminario speciale su “Dr. House” che offriva risultati migliori rispetto ai seminari standard, anche se la partecipazione non offriva crediti per gli studenti:

Dai risultati di uno studio del 2015, diverse ragioni per cui gli studenti di medicina volevano partecipare a un seminario diagnostico che sfruttava informazioni dalla serie TV “House”. I seminari erano pianificati in un momento deliberatamente impegnativo e non offrivano crediti di studio; nonostante questi fattori, l’iniziativa è stata un successo. Fonte

House e AI

Sebbene l’utilizzo di House e altre serie TV diverse sia stato provato in numerosi studi come un aiuto efficace all’apprendimento per gli studenti di medicina, finora poco di questo approccio è stato tentato in un contesto di apprendimento automatico.

Ora, un nuovo articolo della Pennsylvania State University ha fatto un primo tentativo in questa direzione, sviluppando un set di dati che presenta tutti i 176 casi di House utilizzabili, formulati in una struttura diagnostica guidata da una narrazione, successivamente valutata su LLM popolari di OpenAI e Google.

Nonostante la difficoltà di questa sfida (che caratterizza uno dei campi più difficili delle scienze biologiche), i ricercatori hanno scoperto che le versioni più recenti di ChatGPT e Gemini mostravano un miglioramento rispetto alle versioni più vecchie, indicando che la tendenza evolutiva dello sviluppo del modello è probabile che si inserisca efficacemente nei processi diagnostici nel tempo.

L’articolo afferma:

‘I risultati mostrano una variazione significativa delle prestazioni, che vanno dal 16,48% al 38,64% di accuratezza, con le nuove generazioni di modelli che dimostrano un miglioramento del 2,3 volte. Sebbene tutti i modelli affrontino sfide sostanziali nella diagnosi di malattie rare, il miglioramento osservato tra le architetture suggerisce direzioni promettenti per lo sviluppo futuro.

‘Il nostro benchmark educativamente validato stabilisce metriche di prestazione di base per la ragione medica narrativa e fornisce un framework di valutazione pubblicamente accessibile per avanzare la ricerca sulla diagnosi assistita dall’AI.’

Oltre a stabilire metriche di prestazione di base rispetto alle quali gli sforzi futuri possono essere valutati, gli autori notano che il nuovo set di dati – che stanno rendendo pubblicamente disponibile – risolve la mancanza di processo narrativo all’interno dei set di dati medici esistenti, ed è facilmente accessibile, a differenza della cultura di set di dati medici standard protetti da accesso.

Il nuovo lavoro è intitolato Valutazione di Large Language Models sulla diagnosi di malattie rare: uno studio di caso utilizzando House M.D, e proviene da quattro ricercatori della Penn State*.

Dati

Per popolare il loro set di dati, gli autori hanno utilizzato materiale pubblicamente disponibile dal sito di fan House Wiki a lungo stabilito. Il contenuto narrativo è stato estratto e distillato utilizzando il framework Beautiful Soup popolare, che può estrarre dati strutturati dal codice HTML delle pagine web.

Dopo che le narrazioni di base sono state raccolte in questo modo, quattro LLM sono stati utilizzati per trasformare l’output in un formato di caso standardizzato. I modelli utilizzati sono stati GPT-4o mini; GPT-5 Mini; Gemini 2.5 Flash; e Gemini 2.5 Pro. Infine, è stata applicata una filtrazione di qualità per assicurare che il set di dati avesse dettagli clinici appropriati e allineamento con lo stato attuale dell’arte nella ragione medica.

Gli autori osservano che le ‘malattie orfane’ (anche note come malattie rare) sono sottorappresentate nei database medici standard; in alcuni casi, la loro copertura nella serie “House” può rappresentare una percentuale insolitamente alta della loro copertura totale esistente.

Gli autori ammettono che l’utilità di una fonte di dati di questo tipo deve essere temperata con cautela riguardo alla licenza artistica che può essere priorizzata a volte nello sviluppo di drammi medici:

‘Mentre il nostro set di dati riflette limitazioni di contenuto fittizio, tra cui esagerazione drammatica e focus su casi complessi, queste caratteristiche possono beneficiare la valutazione fornendo casi limite sfidanti che testano la robustezza del modello.

‘La validazione educativa di House M.D. da parte di professionisti medici fornisce la fiducia che le scenari estratti contengano informazioni clinicamente significative adatte per la valutazione dell’AI.’

Esempi dal set di dati generato per il progetto. Fonte ( https://www.kaggle.com/datasets/arshgupta23/housemd-data-for-rare-disease-accuracy-using-llms?resource=download ) Esempi dal set di dati generato per il progetto. Fonte

Test

Per valutare l’accuratezza del modello sui compiti diagnostici narrativi, gli autori hanno progettato una pipeline semplice che combina la generazione di prompt, l’inferenza del modello e la valutazione.

I quattro LLM sopra menzionati sono stati testati, con ogni modello configurato con temperatura impostata su zero (assicurando un output deterministico piuttosto che “creativo”), e con una lunghezza massima di token di 1.500 – un margine progettato per accogliere ragionamenti diagnostici complessi. Non sono stati utilizzati prompt di sistema aggiuntivi per inquadrare ulteriormente le query.

I prompt stessi aderivano a un formato standard di presentazione del caso medico – il tipo che gli spettatori saranno più familiari con i drammi medici quando un nuovo paziente/malattia viene introdotto e un medico riassume una panoramica per il beneficio degli altri medici presenti (in effetti, sebbene, per il beneficio degli spettatori).

Ogni prompt presentava una narrazione clinica che comprendeva dettagli demografici; una cronologia dei sintomi; storia medica rilevante; e prime scoperte diagnostiche. Il modello è stato istruito per identificare una singola diagnosi primaria e per giustificare la sua conclusione con ragionamento.

Ogni modello ha generato la sua risposta diagnostica in un solo passaggio, senza alcun raffinamento iterativo; e le risposte sono state raccolte in condizioni coerenti in tutti i 176 casi:

Un esempio illustrativo di valutazione, che mostra un prompt clinico narrativo e la sua diagnosi di verità fondamentale corrispondente, come utilizzato per testare Gemini 2.5 Pro. Fonte ( https://arxiv.org/pdf/2511.10912 ) Un esempio illustrativo che mostra un prompt clinico narrativo e la sua diagnosi di verità fondamentale corrispondente, come utilizzato per testare Gemini 2.5 Pro. Fonte
Per le metriche, le previsioni sono state valutate utilizzando una procedura di corrispondenza di stringhe “sfumata” progettata per tenere conto dell’ambiguità nella terminologia medica. L’approccio ha utilizzato la libreria SequenceMatcher di Python, con una soglia di similarità dell’80%, iniziando con la corrispondenza di sottstringa esatta e ricadendo nella confronto token-wise quando necessario. L’accuratezza è stata calcolata come la proporzione di casi classificati correttamente in queste condizioni:

Il flusso di lavoro di 'corrispondenza sfumata' utilizzato dai ricercatori. Il flusso di lavoro di ‘corrispondenza sfumata’ utilizzato dai ricercatori.

Gli autori notano che la corrispondenza sfumata potrebbe significare che diagnosi semanticamente identiche che utilizzano terminologie diverse potrebbero essere perse, ma presentano il loro approccio come il più riproducibile che potesse soddisfare tutte le limitazioni del progetto.

Risultati

L’accuratezza diagnostica è variata ampiamente tra i modelli, con Gemini 2.5 Pro che si è esibito meglio al 38,64%, seguito da GPT-5 Mini al 36,93%, Gemini 2.5 Flash al 32,95% e GPT-4o Mini al 16,48%. Nonostante queste differenze, tutti i modelli hanno lottato con le richieste del ragionamento diagnostico per le malattie rare:

Risultati per l'accuratezza diagnostica attraverso i quattro modelli testati. Risultati per l’accuratezza diagnostica attraverso i quattro modelli testati.

Gli autori notano anche che le prestazioni sono variate tra le stagioni della serie:

Variazione dell'accuratezza tra le diverse stagioni di House, ma senza alcuna curva o ragione ovvia. Variazione dell’accuratezza tra le diverse stagioni di House, ma senza alcuna curva o ragione ovvia.

L’articolo afferma:

‘La stagione 1 ha raggiunto l’accuratezza più alta al 56,52%, mentre la stagione 5 ha mostrato la più bassa al 20,83%. Questa variazione suggerisce che la complessità diagnostica varia nel corso della serie, con stagioni successive che potrebbero presentare casi di malattie rare più sfidanti.

‘Tuttavia, la prestazione relativamente forte nella stagione 8 (52,38%) indica che la progressione temporale da sola non spiega completamente le differenze di accuratezza; piuttosto, la complessità diagnostica caso per caso sembra essere il principale driver.’

I modelli hanno eseguito meglio quando diagnosticavano condizioni comuni con sintomi riconoscibili, come meningite, infarto miocardico e embolia polmonare – ma hanno lottato costantemente con malattie rare come neurocisticercosi e malattia di Erdheim-Chester, nonché con disturbi autoimmuni complessi come lupus eritematoso sistemico e sarcoidosi. Le prestazioni sono anche scese nei casi tossicologici che richiedevano il collegamento della storia di esposizione ai segni clinici.

Gli autori suggeriscono che la variazione dell’accuratezza tra i modelli indica differenze significative nell’architettura e nella strategia di addestramento, con le prestazioni più forti di GPT-5 Mini e Gemini 2.5 Pro che indicano che le nuove generazioni di LLM traggono vantaggio da capacità di ragionamento migliorate – sebbene i loro risultati rivelino ancora limitazioni chiare nel gestire compiti diagnostici complessi.

I risultati, sostengono, forniscono metriche di base per la diagnosi di malattie rare basata sulla narrazione, indicando fortemente che i modelli linguistici attuali stanno iniziando a mostrare capacità di ragionamento medico utili.

Il salto di prestazioni da GPT-4o Mini al 16,48% a Gemini 2.5 Pro al 38,64%, conclude l’articolo, segnala un progresso costante verso strumenti di supporto clinico applicabili.

Sebbene i ricercatori ammettano che i livelli di accuratezza rimangano modesti, il benchmark si concentra esclusivamente su casi altamente complessi che sfidano regolarmente anche i medici formati, e la capacità di identificare correttamente la diagnosi in quasi il 40% di questi esempi difficili indica una capacità di ragionamento genuina, gettando le basi per future migliorie attraverso un addestramento mirato, l’integrazione della conoscenza medica strutturata o strategie di ragionamento ibride.

Conclusione

Ci sono alcuni pericoli ovvi nel riutilizzare le narrazioni della serie TV in set di dati medici reali – anche nei casi, come con House, in cui il materiale di origine ha un alto livello di contributi medici qualificati e/o supervisione.

È interessante notare che un episodio tipico di House agisce efficacemente come una macchina di riassunto per una serie di voci mediche che potrebbero non essere direttamente accessibili su Internet per la persona media, o per fonti di dati che presentano le informazioni in modo più frammentato e non lineare.

Avere un medico che scrive effettivamente la sceneggiatura per un episodio, come accadeva frequentemente con House, potrebbe essere utilizzato dai ricercatori come una sorta di “timbro di approvazione” sul contenuto; tuttavia, ciò ignora il fatto che considerazioni artistiche possono aver influenzato la presentazione della malattia nell’episodio.

Questo lascia i dati nella condizione di molte altre fonti di dati potenzialmente utili per l’addestramento: nel bisogno di un nuovo strato di supervisione umana qualificata e costosa.

 

* Si prega di notare che questo breve articolo non segue il modello consueto e ho adattato la copertura per adattarmi a questo.

Pubblicato per la prima volta lunedì, 17 novembre 2025

Scrittore di apprendimento automatico, specialista di dominio nella sintesi di immagini umane. Ex responsabile dei contenuti di ricerca presso Metaphysic.ai, fino alla sua fusione nella Brahma.ai di DNEG.
Sito web: martinanderson.ai
Contatto: martin@martinanderson.ai