Angle d’Anderson
Utilisation de la série télévisée « House » pour développer les capacités de diagnostic de l’IA

Bien que le diagnostic de maladies rares soit un défi particulièrement difficile pour l’IA (comme pour les humains), les modèles de langage populaires ChatGPT et Gemini montrent des performances prometteuses lorsqu’ils sont formés sur des cas diagnostiques de la série médicale « House ».
Près de la moitié de tous les étudiants en sciences de la santé regardent régulièrement des drames médicaux tels que House, Grey’s Anatomy et Scrubs. Bien que ce type de matériel ne puisse être utilisé qu’à des fins didactiques avec beaucoup de filtrage et de mise en contexte, en raison du risque de diffusion d’informations erronées dangereuses, le niveau de recherche pour les drames mettant en scène des conditions médicales tend à être assez élevé (bien que la précision varie selon les productions).
Il n’est pas surprenant que les médecins créent, conseillent et/ou écrivent des drames médicaux à la télévision. Dans de tels cas, une connaissance approfondie du domaine médical est avantageuse non seulement pour transmettre avec précision les problèmes médicaux, mais également pour suggérer de nouvelles idées de scénarios intéressants.
L’une des séries médicales les plus étudiées de la récente « ère dorée » de la télévision est House (également connue sous le nom de House MD), où les excentricités du personnage principal et les grandes fluctuations dans la distribution secondaire, divertissants comme ils l’étaient, ont pris le second rang par rapport à la « maladie de la semaine ».
En fait, sur les 177 épisodes diffusés au cours de ses huit saisons, House a fourni 176 études de cas diagnostiques assidus. Bien que la série se soit terminée en 2012, d’ici 2015, elle était déjà utilisée comme outil pédagogique, avec un séminaire spécial Dr. House offrant de meilleurs résultats par rapport aux séminaires standards, même si l’assistance ne rapportait pas de crédits étudiants:
![D'après une étude de 2015, diverses raisons pour lesquelles les étudiants en médecine voulaient assister à un séminaire diagnostique qui utilisait des informations de la série télévisée « House ». Source [ https://journals.plos.org/plosone/article/file?id=10.1371/journal.pone.0193972&type=printable ]](https://www.unite.ai/wp-content/uploads/2025/11/house-seminar.jpg)
D’après une étude de 2015, diverses raisons pour lesquelles les étudiants en médecine voulaient assister à un séminaire diagnostique qui utilisait des informations de la série télévisée « House ». Les séminaires étaient programmés à un moment délibérément difficile, et ne rapportaient pas de crédits d’études; malgré ces facteurs, l’initiative a été un succès. Source
House et l’IA
Bien que l’utilisation de House et d’autres séries télévisées diverses ait été prouvée dans de multiples études comme un aide efficace à l’apprentissage pour les étudiants en médecine, peu de cette approche a été tentée jusqu’à présent dans un contexte d’apprentissage automatique.
Maintenant, un nouveau document de l’Université d’État de Pennsylvanie a fait une première tentative dans cette direction, en élaborant un jeu de données présentant les 176 études de cas House utilisables, formulées dans une structure diagnostique narrative, évaluées sur des LLM populaires d’OpenAI et de Google.
Malgré la difficulté de ce défi (qui caractérise l’un des domaines les plus difficiles des sciences biologiques), les chercheurs ont constaté que les versions plus récentes de ChatGPT et Gemini ont montré une amélioration par rapport aux anciennes versions, indiquant que la tendance évolutive du développement de modèles est susceptible de s’orienter efficacement vers les processus diagnostiques avec le temps.
Le document indique:
‘Les résultats montrent une variation significative des performances, allant de 16,48 % à 38,64 % de précision, les nouvelles générations de modèles démontrant une amélioration de 2,3 fois. Alors que tous les modèles sont confrontés à des défis importants pour le diagnostic de maladies rares, l’amélioration observée dans les architectures suggère des directions prometteuses pour les développements futurs.
‘Notre référence évaluée sur le plan éducatif établit des métriques de performance de base pour la raison médicale narrative et fournit un cadre d’évaluation publiquement accessible pour faire progresser la recherche sur le diagnostic assisté par l’IA.’
Outre l’établissement de métriques de performance de base auxquelles les efforts futurs peuvent être évalués, les auteurs notent que le nouveau jeu de données – qu’ils rendent publiquement disponible – résout le manque de processus narratif à l’intérieur des jeux de données médicaux existants, et est facilement accessible, contrairement à la culture de données médicales standard protégée.
Le nouveau travail est intitulé Évaluation des grands modèles de langage pour le diagnostic de maladies rares: une étude de cas utilisant House M.D, et provient de quatre chercheurs de Penn State*.
Données
Pour peupler leur jeu de données, les auteurs ont utilisé du matériel publiquement disponible à partir du site de fandom établi de longue date House Wiki. Le contenu narratif a été extrait et distillé à l’aide du cadre Beautiful Soup populaire, qui peut extraire des données structurales à partir de la source HTML des pages Web.
Après que les récits de base aient été récoltés de cette manière, quatre LLM ont été utilisés pour transformer la sortie en format de cas standardisé. Les modèles utilisés étaient GPT-4o mini; GPT-5 Mini; Gemini 2.5 Flash; et Gemini 2.5 Pro. Enfin, un filtrage de qualité a été appliqué pour garantir que le jeu de données avait des détails cliniques appropriés et était aligné sur l’état actuel de l’art en matière de raisonnement médical.
Les auteurs observent que les ‘maladies orphelines’ (c’est-à-dire les maladies rares) sont sous-représentées dans les bases de données médicales standard; dans certains cas, leur couverture dans la série House peut représenter un pourcentage inhabituel de leur couverture totale existante.
Les auteurs concèdent que l’utilité d’une source de données de ce type doit être tempérée par la prudence en ce qui concerne la licence artistique qui peut être prioritaire à certains moments dans le développement d’un drame médical:
‘Bien que notre jeu de données reflète les limites d’un contenu fictif, y compris l’exagération dramatique et la focalisation sur des cas complexes, ces caractéristiques peuvent bénéficier à l’évaluation en fournissant des cas de bord difficiles qui testent la robustesse du modèle.
‘La validation éducative de House M.D. par des professionnels de la santé nous donne confiance dans le fait que les scénarios extraits contiennent des informations cliniquement significatives adaptées à l’évaluation de l’IA.’
![Exemples du jeu de données généré pour le projet. Source [ https://www.kaggle.com/datasets/arshgupta23/housemd-data-for-rare-disease-accuracy-using-llms?resource=download ]](https://www.unite.ai/wp-content/uploads/2025/11/dataset-examples.jpg)
Exemples du jeu de données généré pour le projet. Source
Tests
Pour évaluer la précision des modèles sur les tâches de diagnostic narratif, les auteurs ont conçu un pipeline simple combinant la génération de invites, l’inférence de modèle et la notation.
Les quatre LLM mentionnés ci-dessus ont été testés, chaque modèle étant configuré avec une température définie sur zéro (assurant une sortie déterministe plutôt que « créative »), et avec une longueur de jeton maximale de 1 500 – une tolérance conçue pour accommoder un raisonnement diagnostique complexe. Aucun invite de système supplémentaire n’a été utilisé pour encadrer les requêtes plus loin.
Les invites elles-mêmes ont suivi un format standard de présentation de cas médicaux structurés – le type que les téléspectateurs connaissent le mieux des drames médicaux lorsqu’un nouveau patient/maladie est introduit, et qu’un médecin résume un aperçu pour le bénéfice des autres médecins présents (effectivement, cependant, pour le bénéfice des téléspectateurs).
Chaque invite a présenté un récit clinique comprenant des détails démographiques; une chronologie des symptômes; des antécédents médicaux pertinents; et des résultats diagnostiques précoces. Le modèle est briefé pour identifier un seul diagnostic principal et justifier sa conclusion avec un raisonnement.
Chaque modèle a généré sa réponse diagnostique en une seule passe, sans aucun raffinement itératif; et les réponses ont été collectées dans des conditions cohérentes pour les 176 cas:
![Un exemple évaluatif illustratif, montrant un invite clinique narratif et son diagnostic de vérité terrain correspondant, tel qu'utilisé pour tester Gemini 2.5 Pro. Source [ https://arxiv.org/pdf/2511.10912 ]](https://www.unite.ai/wp-content/uploads/2025/11/table-2-1.jpg)
Un exemple illustratif montrant un invite clinique narratif et son diagnostic de vérité terrain correspondant, tel qu’utilisé pour tester Gemini 2.5 Pro. Source
Pour les métriques, les prédictions ont été évaluées à l’aide d’une procédure de correspondance de chaîne « floue » conçue pour tenir compte de l’ambiguïté de la terminologie médicale. L’approche a utilisé la bibliothèque SequenceMatcher de Python, avec un seuil de similarité de 0,8, en commençant par une correspondance de sous-chaîne exacte et en faisant appel à une comparaison de jetons lorsque nécessaire. La précision a été calculée comme la proportion de cas classés correctement dans ces conditions:

Le flux de travail de « correspondance floue » utilisé par les chercheurs.
Les auteurs notent que la correspondance floue pourrait signifier que des diagnostics sémantiquement identiques qui utilisent une terminologie différente pourraient être manqués, mais présentent leur approche comme la plus reproductible qui pourrait répondre à toutes les contraintes du projet.
Résultats
La précision diagnostique a varié considérablement d’un modèle à l’autre, Gemini 2.5 Pro obtenant les meilleurs résultats à 38,64 %, suivi de GPT-5 Mini à 36,93 %, Gemini 2.5 Flash à 32,95 % et GPT-4o Mini à 16,48 %. Malgré ces différences, tous les modèles ont lutté contre les exigences du raisonnement diagnostique pour les maladies rares:

Résultats pour la précision diagnostique sur les quatre modèles testés.
Les auteurs notent également que les performances ont varié au fil des saisons de la série:

Précision variable au fil des diverses saisons de House, mais sans aucune courbe ou raison évidente.
Le document indique:
‘La saison 1 a obtenu la plus grande précision à 56,52 %, tandis que la saison 5 a montré la plus basse à 20,83 %. Cette variation suggère que la complexité diagnostique varie tout au long de la série, les saisons plus tardives présentant potentiellement des cas de maladies rares plus difficiles.
‘Cependant, la performance relativement forte de la saison 8 (52,38 %) indique que la progression temporelle seule n’explique pas entièrement les différences de précision; la complexité diagnostique spécifique au cas semble être le principal moteur.’
Les modèles ont performé plus fiablement lorsqu’ils diagnostiquaient des affections courantes avec des symptômes reconnaissables, telles que la méningite, l’infarctus du myocarde et l’embolie pulmonaire – mais ont constamment lutté contre les maladies rares telles que la neurocysticercose et la maladie d’Erdheim-Chester, ainsi que les troubles auto-immuns complexes comme le lupus érythémateux disséminé et la sarcoidose. Les performances ont également chuté dans les cas toxicologiques qui nécessitaient de relier l’historique d’exposition aux signes cliniques.
Les auteurs suggèrent que la variation de la précision entre les modèles indique des différences significatives dans l’architecture et la stratégie de formation, la performance plus élevée de GPT-5 Mini et Gemini 2.5 Pro indiquant que les nouvelles générations de LLM bénéficient de capacités de raisonnement améliorées – bien que leurs résultats révèlent encore des limites claires dans la gestion de tâches diagnostiques complexes.
Les résultats, soutiennent-ils, fournissent des métriques de base pour le diagnostic de maladies rares basé sur des récits, indiquant fortement que les modèles de langage actuels commencent à montrer des capacités de raisonnement médical utiles.
Le saut de performance de GPT-4o Mini à 16,48 % à Gemini 2.5 Pro à 38,64 %, conclut le document, signale une progression constante vers des outils de support clinique applicables.
Bien que les chercheurs concèdent que les niveaux de précision restent modestes, la référence se concentre exclusivement sur des cas complexes qui défient régulièrement même les médecins formés, et la capacité d’identifier correctement le diagnostic dans près de 40 % de ces exemples difficiles indique une véritable capacité de raisonnement, jetant les bases pour des améliorations futures grâce à un affinement ciblé, à l’intégration de connaissances médicales structurées ou à des stratégies de raisonnement hybrides.
Conclusion
Il existe des dangers évidents à réutiliser des récits de séries télévisées en jeux de données médicaux réels – même dans les cas, comme House, où le matériel source a un niveau élevé de contributions et de surveillance médicales qualifiées.
Il est intéressant de noter qu’un épisode typique de House agit effectivement comme une machine de résumé pour une série d’entrées médicales qui peuvent ne pas être directement accessibles sur Internet pour la personne moyenne, ou pour les sources de données qui présentent les informations de manière plus fragmentée et non linéaire.
Avoir un médecin qui rédige réellement le scénario d’un épisode, comme c’était souvent le cas avec House, pourrait être utilisé par les chercheurs comme une sorte de « validation » du contenu; mais cela ignore le fait que des considérations artistiques peuvent avoir influencé la présentation de la maladie dans l’épisode.
Cela laisse les données dans l’état de tant d’autres sources de données potentiellement utiles pour la formation: dans le besoin d’une nouvelle couche de surveillance humaine qualifiée et coûteuse.
* Veuillez noter que ce court document ne suit pas le modèle habituel, et que j’ai adapté la couverture pour l’accommoder.
Publié pour la première fois lundi 17 novembre 2025












