Andersons Blickwinkel
Die Verwendung der Fernsehserie “House” zur Entwicklung der diagnostischen Fähigkeiten von KI

Obwohl die Diagnose seltener Krankheiten eine besonders schwierige Herausforderung für KI (wie auch für Menschen) darstellt, zeigen die populären Sprachmodelle ChatGPT und Gemini vielversprechende Leistungen, wenn sie auf diagnostische Fälle aus der beliebten medizinischen Drama-Serie “House” trainiert werden.
Fast die Hälfte aller Studierenden der Gesundheitswissenschaften schaut regelmäßig medizinische Dramen wie House, Grey’s Anatomy und Scrubs. Obwohl solche Materialien nur mit viel Filterung und Kontext für didaktische Zwecke verwendet werden können, da sie das Risiko verbreiten, gefährliche Fehlinformationen zu verbreiten, ist der Standard der Forschung für Dramen mit medizinischen Themen tendenziell sehr hoch (obwohl die Genauigkeit variiert zwischen Produktionen).
Es ist nicht überraschend, dass Ärzte oft ursprünglich, beraten oder schreiben medizinische Dramen. In solchen Fällen ist umfassendes medizinisches Fachwissen nicht nur vorteilhaft, um medizinische Probleme genau darzustellen, sondern auch, um Vorschläge für neue und interessante Handlungsstränge zu machen.
Eine der am gründlichsten recherchierten medizinischen Serien der jüngsten “Goldenen Ära” des Fernsehens ist House (auch bekannt als House MD), in der die Eigenheiten der Hauptfigur und die großen Fluktuationen in der Nebenbesetzung, unterhaltsam wie sie waren, zweitrangig gegenüber der “Krankheit der Woche” waren.
Tatsächlich bot House in seinen 177 Episoden über acht Staffeln hinweg 176 diagnostische Fallstudien. Obwohl die Serie 2012 endete, wurde sie bereits 2015 als Lehrwerkzeug verwendet, mit einem speziellen Dr. House-Seminar, das bessere Ergebnisse im Vergleich zu Standard-Seminar-Angeboten erzielte, obwohl die Teilnahme keine Studienpunkte einbrachte:

Aus einer Studie von 2015, diverse Gründe, warum Medizinstudenten an einem diagnostischen Seminar teilnehmen wollten, das Informationen aus der Fernsehserie “House” nutzte. Die Seminare wurden zu einem bewusst herausfordernden Zeitpunkt angesetzt und boten keine Studienpunkte; trotz dieser Faktoren war die Initiative ein Erfolg. Quelle
House und KI
Obwohl die Verwendung von House und anderen verschiedenen Fernsehserien in mehreren Studien als effektive Hilfe zum Lernen bewiesen wurde, wurde dieser Ansatz bisher in einem maschinellen Lernkontext kaum versucht.
Jetzt hat eine neue Studie der Pennsylvania State University einen ersten Schritt in diese Richtung unternommen, indem sie eine Datenbank mit allen 176 nutzbaren House-Fallstudien erstellt hat, die in eine narrative-diagnostische Struktur umgewandelt und anschließend auf populäre LLMs von OpenAI und Google ausgewertet wurden.
Trotz der Schwierigkeit dieser Herausforderung (die einen der schwierigsten Bereiche der biologischen Wissenschaften darstellt) fanden die Forscher heraus, dass neuere Versionen von ChatGPT und Gemini besser abschnitten als ältere Versionen, was darauf hindeutet, dass die Entwicklungstendenz der Modellentwicklung wahrscheinlich effektiv in diagnostische Prozesse mündet.
Die Studie besagt:
‘Die Ergebnisse zeigen eine signifikante Variation in der Leistung, die von 16,48% bis 38,64% Genauigkeit reicht, wobei neuere Modellgenerationen eine 2,3-fache Verbesserung zeigen. Während alle Modelle erhebliche Herausforderungen bei der Diagnose seltener Krankheiten haben, deutet die beobachtete Verbesserung über Architekturen hin auf vielversprechende Richtungen für zukünftige Entwicklungen hin.
‘Unser pädagogisch validiertes Benchmark etabliert Basisleistungsmaße für narrative medizinische Argumentation und bietet einen öffentlich zugänglichen Bewertungsrahmen für die Weiterentwicklung der KI-gestützten Diagnoseforschung.’
Neben der Etablierung von Leistungsbasen, gegen die zukünftige Bemühungen ausgewertet werden können, weisen die Autoren darauf hin, dass die neue Datenbank – die sie öffentlich zugänglich machen – den Mangel an narrativer Prozess in bestehenden medizinischen Datenbanken löst und leicht zugänglich ist, im Gegensatz zur kulturellen Beschränkung standardmäßiger medizinischer Datenbanken.
Die neue Arbeit trägt den Titel Evaluating Large Language Models on Rare Disease Diagnosis: A Case Study using House M.D und stammt von vier Forschern der Penn State*.
Daten
Um ihre Datenbank zu erstellen, verwendeten die Autoren öffentlich zugängliches Material von der langjährigen House-Wiki-Fandom-Seite. Narrative Inhalte wurden extrahiert und destilliert, indem das beliebte Beautiful-Soup-Framework verwendet wurde, das strukturelle Daten aus der HTML-Quelle von Webseiten extrahieren kann.
Nachdem die Basisnarrative auf diese Weise geerntet wurden, wurden vier LLMs verwendet, um die Ausgabe in standardisierte Fallformatierung umzuwandeln. Die verwendeten Modelle waren GPT-4o-Mini; GPT-5-Mini; Gemini 2.5 Flash; und Gemini 2.5 Pro. Schließlich wurde eine Qualitätsfilterung angewendet, um sicherzustellen, dass die Datenbank angemessene klinische Details und Übereinstimmung mit dem aktuellen Stand der medizinischen Argumentation aufwies.
Die Autoren bemerken, dass ‘Waisenkrankheiten’ (auch bekannt als seltene Krankheiten) in standardmäßigen medizinischen Datenbanken unterrepräsentiert sind; in bestimmten Fällen kann ihre Abdeckung in der House-Serie einen ungewöhnlichen Prozentsatz ihrer gesamten bestehenden Abdeckung darstellen.
Die Autoren räumen ein, dass die Nützlichkeit einer Datenquelle dieser Art mit Vorsicht zu genießen ist, was die künstlerische Freiheit angeht, die bei der Entwicklung medizinischer Dramen Priorität haben kann:
‘Während unsere Datenbank die Einschränkungen fiktiver Inhalte widerspiegelt, einschließlich dramatischer Übertreibung und komplexer Fallfokussierung, können diese Merkmale die Bewertung begünstigen, indem sie herausfordernde Randfälle bieten, die die Modellrobustheit testen.
‘Die pädagogische Validierung von House M.D. durch medizinische Fachleute bietet die Gewissheit, dass die extrahierten Szenarien klinisch bedeutsame Informationen enthalten, die für die KI-Bewertung geeignet sind.’
![Beispiele aus der für das Projekt generierten Datenbank. Quelle [ https://www.kaggle.com/datasets/arshgupta23/housemd-data-for-rare-disease-accuracy-using-llms?resource=download ]](https://www.unite.ai/wp-content/uploads/2025/11/dataset-examples.jpg)
Beispiele aus der für das Projekt generierten Datenbank. Quelle
Tests
Um die Modellgenauigkeit bei narrativen diagnostischen Aufgaben zu bewerten, entwarfen die Autoren eine einfache Pipeline, die Prompt-Generierung, Modellinferenz und Bewertung kombiniert.
Die vier oben genannten LLMs wurden getestet, wobei jedes Modell mit Temperatur auf Null eingestellt wurde (um deterministische anstelle von “kreativen” Ausgaben zu gewährleisten) und mit einer maximalen Token-Länge von 1.500 – eine Erlaubnis, die dazu diente, komplexe diagnostische Argumentationen zu ermöglichen. Es wurden keine zusätzlichen Systemprompts verwendet, um die Anfragen weiter zu spezifizieren.
Die Prompts selbst entsprachen einem standardmäßigen strukturierten medizinischen Fallpräsentationsformat – der Art, die Zuschauer am meisten von medizinischen Dramen kennen, wenn ein neuer Patient/eine neue Krankheit vorgestellt wird und ein Arzt eine Zusammenfassung für andere anwesende Ärzte (effektiv jedoch für die Zuschauer) erstellt.
Jeder Prompt umfasste eine klinische Erzählung, die demografische Details, eine Zeitleiste der Symptome, relevante medizinische Vorgeschichte und frühe diagnostische Ergebnisse enthielt. Das Modell wurde angewiesen, eine einzelne primäre Diagnose zu identifizieren und seine Schlussfolgerung mit Argumentation zu begründen.
Jedes Modell generierte seine diagnostische Antwort in einem einzigen Durchgang, ohne iterative Verfeinerung; und die Antworten wurden unter konsistenten Bedingungen über alle 176 Fälle hinweg gesammelt:
![Ein illustratives Beispiel, das eine narrative klinische Anfrage und ihre entsprechende Grundwahrheitsdiagnose zeigt, wie sie für das Testen von Gemini 2.5 Pro verwendet wurde. Quelle [ https://arxiv.org/pdf/2511.10912 ]](https://www.unite.ai/wp-content/uploads/2025/11/table-2-1.jpg)
Ein illustratives Beispiel, das eine narrative klinische Anfrage und ihre entsprechende Grundwahrheitsdiagnose zeigt, wie sie für das Testen von Gemini 2.5 Pro verwendet wurde. Quelle
Für die Metriken wurden die Vorhersagen unter Verwendung eines “fuzzy” String-Abgleichverfahrens ausgewertet, das darauf ausgelegt war, die Mehrdeutigkeit in der medizinischen Terminologie zu berücksichtigen. Der Ansatz verwendete die SequenceMatcher-Bibliothek von Python, mit einem Ähnlichkeitsschwellenwert von 0,8, beginnend mit exakter Teilstring-Übereinstimmung und zurückfallend auf token-weise Vergleich, wenn notwendig. Genauigkeit wurde als Anteil der korrekt klassifizierten Fälle unter diesen Bedingungen berechnet:

Die ‘fuzzy matching’-Arbeitsabfolge, die von den Forschern verwendet wurde.
Die Autoren bemerken, dass “fuzzy matching” bedeuten könnte, dass semantisch identische Diagnosen, die unterschiedliche Terminologie verwenden, verpasst werden könnten, aber sie präsentieren ihren Ansatz als den reproduzierbarsten, der alle Projektbeschränkungen erfüllen kann.
Ergebnisse
Die diagnostische Genauigkeit variierte stark zwischen den Modellen, wobei Gemini 2.5 Pro mit 38,64% am besten abschnitt, gefolgt von GPT-5 Mini mit 36,93%, Gemini 2.5 Flash mit 32,95% und GPT-4o Mini mit 16,48%. Trotz dieser Unterschiede hatten alle Modelle Schwierigkeiten mit den Anforderungen der diagnostischen Argumentation für seltene Krankheiten:

Ergebnisse für diagnostische Genauigkeit bei den vier getesteten Modellen.
Die Autoren bemerken auch, dass die Leistung über die Staffeln der Serie variierte:

Variierende Genauigkeit über die verschiedenen Staffeln von House, aber ohne offensichtliche Kurve oder klaren Grund.
Die Studie besagt:
‘Staffel 1 erreichte die höchste Genauigkeit mit 56,52%, während Staffel 5 die niedrigste mit 20,83% aufwies. Diese Variation deutet darauf hin, dass die diagnostische Komplexität über die Serie variiert, wobei spätere Staffeln möglicherweise schwierigere seltene Krankheitsfälle enthalten.
‘Allerdings deutet die relativ starke Leistung in Staffel 8 (52,38%) darauf hin, dass die zeitliche Fortschreibung allein die Genauigkeitsunterschiede nicht vollständig erklärt, sondern dass die Fall-spezifische diagnostische Komplexität der primäre Treiber zu sein scheint.’
Modelle funktionierten zuverlässiger, wenn sie häufige Bedingungen mit erkennbaren Symptomen diagnostizierten, wie Meningitis, Myokardinfarkt und Lungenembolie – aber sie hatten beständig Schwierigkeiten mit seltenen Krankheiten wie Neurozystizerkose und Erdheim-Chester-Krankheit sowie komplexen Autoimmunerkrankungen wie systemischem Lupus erythematodes und Sarkoidose. Die Leistung fiel auch bei toxikologischen Fällen ab, die die Verbindung zwischen Expositionsgeschichte und klinischen Anzeichen erforderten.
Die Autoren schlagen vor, dass die Variation in der Genauigkeit zwischen den Modellen auf bedeutende Unterschiede in Architektur und Trainingsstrategie hinweist, wobei die bessere Leistung von GPT-5 Mini und Gemini 2.5 Pro darauf hindeutet, dass neuere Generationen von LLM von verbesserten Argumentationsfähigkeiten profitieren – obwohl ihre Ergebnisse immer noch klare Einschränkungen bei der Bewältigung komplexer diagnostischer Aufgaben aufzeigen.
Die Ergebnisse, so behaupten sie, liefern Basismaße für die Diagnose seltener Krankheiten auf der Grundlage von Erzählungen, was stark darauf hindeutet, dass aktuelle Sprachmodelle beginnen, nützliche medizinische Argumentationsfähigkeiten zu zeigen.
Der Sprung in der Leistung von GPT-4o Mini bei 16,48% auf Gemini 2.5 Pro bei 38,64% signalisiert, so schließt die Studie, einen stetigen Fortschritt in Richtung klinisch anwendbarer KI-Unterstützungstools.
Während die Forscher einräumen, dass die Genauigkeitsniveaus noch bescheiden sind, konzentriert sich der Benchmark ausschließlich auf hochkomplexe Fälle, die sogar ausgebildete Ärzte routinemäßig herausfordern, und die Fähigkeit, die Diagnose in fast 40% dieser schwierigen Beispiele korrekt zu identifizieren, weist auf eine echte Argumentationsfähigkeit hin, die den Grundstein für zukünftige Verbesserungen durch gezielte Feinabstimmung, Integration von strukturiertem medizinischem Wissen oder hybride Argumentationsstrategien legt.
Schlussfolgerung
Es gibt offensichtliche Gefahren, wenn man Fernsehserien-Narrative in reale medizinische Datenbanken umwandelt – sogar in Fällen, in denen das Quellenmaterial, wie bei House, einen hohen Grad an qualifizierten medizinischen Beiträgen oder Aufsicht hat.
Es ist interessant zu beachten, dass eine typische Episode von House effektiv als eine Zusammenfassungsmaschine für eine Reihe von medizinischen Einträgen fungiert, die für die Durchschnittsperson oder für Datenquellen, die die Informationen in einer viel fragmentierteren und nicht-linearen Weise präsentieren, möglicherweise nicht direkt zugänglich sind.
Wenn ein Arzt tatsächlich das Drehbuch für eine Episode schreibt, wie es bei House häufig der Fall war, könnte dies von Forschern als eine Art “Abnahme” des Inhalts verwendet werden; dies ignoriert jedoch die Tatsache, dass künstlerische Überlegungen die Darstellung der Krankheit in der Episode beeinflusst haben könnten.
Dies lässt die Daten in einem Zustand, der vielen anderen potenziell nützlichen Datenquellen für die Ausbildung ähnelt: Sie benötigen eine frische Schicht teurer, qualifizierter menschlicher Aufsicht.
* Bitte beachten Sie, dass diese sehr kurze Arbeit nicht dem üblichen Template folgt, und ich habe die Abdeckung angepasst, um dies zu berücksichtigen.
Erstveröffentlicht am Montag, dem 17. November 2025












