Η γωνία του Anderson
Χρήση της τηλεοπτικής σειράς «House» για την ανάπτυξη των διαγνωστικών ικανοτήτων του AI

Αν και η διάγνωση σπάνιων ασθενειών είναι μια ιδιαίτερα δύσκολη πρόκληση για το AI (όπως και για τους ανθρώπους), τα δημοφιλή γλωσσικά μοντέλα ChatGPT και Gemini παρουσιάζουν υποσχόμενο αποτέλεσμα όταν εκπαιδεύονται σε διαγνωστικές περιπτώσεις από την δημοφιλή ιατρική δραματική σειρά «House».
Σχεδόν το μισό των φοιτητών των ιατρικών επιστημών παρακολουθούν τακτικά ιατρικές δραματικές σειρές όπως House, Grey’s Anatomy και Scrubs. Αν και αυτό το είδος υλικού μπορεί να χρησιμοποιηθεί μόνο για διδακτικούς σκοπούς με πολλή φιλτράρισμα και πλαισίωση, λόγω του κινδύνου διάδοσης επικίνδυνης παραπληροφόρησης, το πρότυπο έρευνας για δραματικές σειρές που απεικονίζουν ιατρικές καταστάσεις έχει την τάση να είναι αρκετά υψηλό (αν και η ακρίβεια διαφέρει μεταξύ παραγωγών).
Δεν είναι έκπληξη ότι οι γιατροί συχνά δημιουργούν, συμβουλεύουν ή/και γράφουν ιατρικές δραματικές σειρές. Σε τέτοιες περιπτώσεις, η εκτεταμένη γνώση του ιατρικού τομέα είναι ευνοϊκή όχι μόνο για την ακριβή μετάδοση ιατρικών ζητημάτων, αλλά και για την εύρεση νέων και ενδιαφέρουσων ιστοριών.
Μια από τις πιο μελετημένες ιατρικές δραματικές σειρές της πρόσφατης «χρυσής εποχής» της τηλεόρασης είναι House (γνωστή και ως House MD), όπου οι εκκεντρικότητες του πρωταγωνιστή και οι μεγάλες διακυμάνσεις στο υποστηρικτικό καστ, αν και διασκεδαστικές, έλαβαν δεύτερη θέση στην «ασθένεια της εβδομάδας».
Στην πραγματικότητα, από τα 177 επεισόδια που προβλήθηκαν κατά τη διάρκεια των οκτώ σεζόν, το House παρείχε 176 μελετημένες περιπτώσεις διαγνωστικών μελετών. Αν και η σειρά ολοκληρώθηκε το 2012, μέχρι το 2015 χρησιμοποιούνταν ήδη ως εργαλείο διδασκαλίας, με ένα ειδικό σεμινάριο «Dr. House» που παρείχε καλύτερα αποτελέσματα σε σύγκριση με το τυπικό σεμινάριο, ακόμη και αν η συμμετοχή δεν παρείχε πιστωτικές μονάδες:
![Από τη μελέτη του 2015, διάφορες λόγοι για τους οποίους οι ιατρικοί φοιτητές ήθελαν να παρακολουθήσουν ένα διαγνωστικό σεμινάριο που αξιοποιούσε πληροφορίες από την τηλεοπτική σειρά «House». Πηγή [ https://journals.plos.org/plosone/article/file?id=10.1371/journal.pone.0193972&type=printable ]](https://www.unite.ai/wp-content/uploads/2025/11/house-seminar.jpg)
Από τη μελέτη του 2015, διάφορες λόγοι για τους οποίους οι ιατρικοί φοιτητές ήθελαν να παρακολουθήσουν ένα διαγνωστικό σεμινάριο που αξιοποιούσε πληροφορίες από την τηλεοπτική σειρά «House». Το σεμινάριο είχε προγραμματιστεί σε μια σκόπιμα δύσκολη ώρα και δεν παρείχε πιστωτικές μονάδες· παρά τις παραμέτρους αυτές, η πρωτοβουλία ήταν επιτυχημένη. Πηγή
House και AI
Αν και η χρήση του House και άλλων διαφορετικών τηλεοπτικών σειρών έχει αποδειχθεί σε πολλές μελέτες ως αποτελεσματική βοήθημα για την εκπαίδευση, για τους ιατρικούς φοιτητές, λίγο από αυτήν την προσέγγιση έχει μέχρι τώρα δοκιμαστεί σε ένα περιβάλλον μηχανικής μάθησης.
Τώρα, μια νέα μελέτη από το Πανεπιστήμιο της Πενσυλβάνια έχει κάνει μια αρχική προσέγγιση σε αυτήν την κατεύθυνση, αναπτύσσοντας ένα σύνολο δεδομένων που περιλαμβάνει όλες τις χρησιμοποιήσιμες 176 περιπτώσεις House, διαμορφωμένες σε μια αφηγηματική διαγνωστική δομή, και αξιολογημένες σε δημοφιλή LLM από την OpenAI και την Google.
Παρά τη δυσκολία αυτής της πρόκλησης (η οποία χαρακτηρίζει einen από τους πιο δύσκολους τομείς στις βιολογικές επιστήμες), οι ερευνητές βρήκαν ότι οι πιο πρόσφατες εκδόσεις του ChatGPT και του Gemini έδειξαν βελτίωση σε σχέση με τις παλαιότερες εκδόσεις, υποδεικνύοντας ότι η εξελικτική τάση της ανάπτυξης του μοντέλου είναι πιθανό να επηρεάσει αποτελεσματικά τις διαγνωστικές διαδικασίες με την πάροδο του χρόνου.
Η μελέτη αναφέρει:
‘Τα αποτελέσματα δείχνουν σημαντική διακύμανση στην απόδοση, που κυμαίνεται από 16,48% έως 38,64% ακρίβεια, με νεότερες γενιές μοντέλων να δείχνουν βελτίωση 2,3 φορές. Αν και όλα τα μοντέλα αντιμετωπίζουν σημαντικές προκλήσεις με τη διάγνωση σπάνιων ασθενειών, η παρατηρηθείσα βελτίωση σε όλες τις αρχιτεκτονικές υποδηλώνει υποσχόμενες κατευθύνσεις για μελλοντική ανάπτυξη.
‘Η εκπαιδευτικά επικυρωμένη βάση μας καθιερώνει βασικά μετρικά για αφηγηματική ιατρική συλλογιστική και παρέχει ένα δημόσια προσβάσιμο πλαίσιο αξιολόγησης για την προώθηση της έρευνας για τη διάγνωση με τη βοήθεια του AI.’
Εκτός από την καθιέρωση των βασικών μετρικών απόδοσης, οι συγγραφείς σημειώνουν ότι το νέο σύνολο δεδομένων – το οποίο είναι δημόσια διαθέσιμο – λύνει την έλλειψη αφηγηματικής διαδικασίας μέσα στα υπάρχοντα ιατρικά σύνολα δεδομένων και είναι εύκολα προσβάσιμο, σε αντίθεση με τον κλειστό πολιτισμό των τυπικών ιατρικών συνόλων δεδομένων.
Η νέα εργασία έχει τον τίτλο Αξιολόγηση των Μεγάλων Γλωσσικών Μοντέλων στη Διάγνωση Σπάνιων Ασθενειών: Μια Περιπτωσιολογική Μελέτη με τη Χρήση του House M.D και προέρχεται από τέσσερις ερευνητές στο Πανεπιστήμιο της Πενσυλβάνια*.
Δεδομένα
Για να πληρώσουν το σύνολο δεδομένων, οι συγγραφείς χρησιμοποίησαν δημόσια διαθέσιμα υλικά από τον ήδη καθιερωμένο House Wiki ιστότοπο φανταστικών ιστοριών. Το αφηγηματικό περιεχόμενο εξαγωγής και αποσταγμάτισης χρησιμοποιώντας το δημοφιλές πλαίσιο Beautiful Soup, το οποίο μπορεί να εξαγάγει δομικά δεδομένα από την πηγή HTML των ιστοσελίδων.
Μετά την εξαγωγή των βασικών αφηγημάτων με αυτόν τον τρόπο, τέσσερα LLM χρησιμοποιήθηκαν για τη μετατροπή της εξόδου σε τυποποιημένη μορφή περιπτώσεων. Τα μοντέλα που χρησιμοποιήθηκαν ήταν GPT-4o mini; GPT-5 Mini; Gemini 2.5 Flash; και Gemini 2.5 Pro. Τέλος, εφαρμόστηκε φιλτράρισμα ποιότητας, για να διασφαλιστεί ότι το σύνολο δεδομένων είχε την κατάλληλη κλινική λεπτομέρεια και συμμόρφωση με την τρέχουσα κατάσταση της τέχνης στην ιατρική συλλογιστική.
Οι συγγραφείς παρατηρούν ότι ‘ορφανές’ ασθένειες (γνωστές και ως σπάνιες ασθένειες) είναι υποαντιπροσωπεύονται στα τυπικά ιατρικά βάσεις δεδομένων· σε ορισμένες περιπτώσεις, η κάλυψή τους στην τηλεοπτική σειρά «House» μπορεί να αντιπροσωπεύει ένα ασυνήθιστο ποσοστό της συνολικής υπάρχουσας κάλυψης.
Οι συγγραφείς παραδέχονται ότι η χρησιμότητα μιας πηγής δεδομένων αυτού του είδους πρέπει να αντισταθμιστεί με προσοχή σε σχέση με την καλλιτεχνική άδεια που μπορεί να προηγηθεί σε ορισμένες περιπτώσεις στην ανάπτυξη ιατρικών δραματικών σειρών:
‘Ενώ το σύνολο δεδομένων μας αντανακλά τις limitες του φανταστικού περιεχομένου, συμπεριλαμβανομένης της δραματικής υπερβολής και της εστίασης σε σύνθετες περιπτώσεις, αυτές οι ιδιότητες μπορεί να ωφελήσουν την αξιολόγηση παρέχοντας δύσκολες περιπτώσεις που δοκιμάζουν τη ρομποτική ανθεκτικότητα του μοντέλου.
‘Η εκπαιδευτική επικύρωση του House M.D. από ιατρικούς επαγγελματίες παρέχει εμπιστοσύνη ότι οι εξαγόμενοι σενάρια περιέχουν κλινικά σημαντικές πληροφορίες που είναι κατάλληλες για την αξιολόγηση του AI.’
![Παραδείγματα από το σύνολο δεδομένων που δημιουργήθηκε για το έργο. Πηγή [ https://www.kaggle.com/datasets/arshgupta23/housemd-data-for-rare-disease-accuracy-using-llms?resource=download ]](https://www.unite.ai/wp-content/uploads/2025/11/dataset-examples.jpg)
Παραδείγματα από το σύνολο δεδομένων που δημιουργήθηκε για το έργο. Πηγή
Δοκιμές
Για να αξιολογήσουν την ακρίβεια του μοντέλου στις αφηγηματικές διαγνωστικές εργασίες, οι συγγραφείς σχεδίασαν μια απλή διαδικασία που συνδυάζει την παραγωγή προτύπων, την εύρεση του μοντέλου και τη βαθμολόγηση.
Τα τέσσερα προαναφερθέντα LLM δοκιμάστηκαν, με κάθε μοντέλο να έχει ρυθμιστεί με θερμοκρασία που έχει οριστεί σε μηδέν (διασφαλίζοντας детерμινιστική 而不是 ‘δημιουργική’ έξοδο), και με μέγιστο token μήκος 1.500 – μια άδεια που σχεδιάστηκε για να καλύψει σύνθετη διαγνωστική συλλογιστική. Δεν χρησιμοποιήθηκαν πρόσθετα συστήματα προτύπων για να πλαισιώσουν τις ερωτήσεις περαιτέρω.
Τα πρότυπα themselves ανταποκρίθηκαν σε ένα τυπικό δομημένο ιατρικό περιστατικό παρουσίασης μορφή – το είδος που οι θεατές θα είναι πιο εξοικειωμένοι με τις ιατρικές δραματικές σειρές όταν ένας νέος ασθενής/ασθένεια εισαγωγής και ένας γιατρός συνοψίζει μια επισκόπηση για το όφελος των άλλων γιατρών που παρευρίσκονται (αποτελεσματικά, όμως, για το όφελος των θεατών).
Κάθε πρότυπο παρουσίασε eine κλινική αφήγηση που αποτελείται από δημογραφικές λεπτομέρειες· μια χρονολογική σειρά συμπτωμάτων· σχετικές ιατρικές ιστορίες· και πρώτες διαγνωστικές ευρήματα. Το μοντέλο είναι υποχρεωμένο να αναγνωρίσει μια πρωταρχική διάγνωση και να δικαιολογήσει το συμπέρασμά του με συλλογιστική.
Κάθε μοντέλο παρήγαγε την διαγνωστική του απάντηση σε μια seule διαδικασία, χωρίς καμία επαναληπτική βελτίωση· και οι απαντήσεις συλλέχθηκαν υπό συνεχή συνθήκες σε όλα τα 176 περιπτώσεις:
![Ενδεικτική αξιολογική περίπτωση, που δείχνει μια αφηγηματική κλινική πρόκληση και την αντίστοιχη ground truth διάγνωση, όπως χρησιμοποιήθηκε για δοκιμή του Gemini 2.5 Pro. Πηγή [ https://arxiv.org/pdf/2511.10912 ]](https://www.unite.ai/wp-content/uploads/2025/11/table-2-1.jpg)
Ενδεικτική περίπτωση που δείχνει μια αφηγηματική κλινική πρόκληση και την αντίστοιχη ground truth διάγνωση, όπως χρησιμοποιήθηκε για δοκιμή του Gemini 2.5 Pro. Πηγή
Για μετρικά, οι προβλέψεις αξιολογήθηκαν χρησιμοποιώντας μια ‘ασαφή’ διαδικασία σύγκρισης συμβολοσειρών που σχεδιάστηκε για να λογαριαστεί η αμφιβολία στην ιατρική ορολογία. Η προσέγγιση χρησιμοποιούσε τη βιβλιοθήκη SequenceMatcher της Python, με ένα κατώφλι similarity 0,8, ξεκινώντας με ακριβή σύγκριση υποσειρών και πадаючи πίσω σε σύνγκριση token όταν ήταν απαραίτητο. Η ακρίβεια υπολογίστηκε ως το ποσοστό των περιπτώσεων που ταξινομήθηκαν σωστά υπό αυτές τις συνθήκες:

Η ‘ασαφή’ ροή εργασίας που χρησιμοποιήθηκε από τους ερευνητές.
Οι συγγραφείς σημειώνουν ότι η ασαφή σύγκριση μπορεί να σημαίνει ότι σεμαντικά ταυτόσημες διαγνώσεις που χρησιμοποιούν διαφορετική ορολογία μπορεί να χαθούν, αλλά παρουσιάζουν την προσέγγισή τους ως την πιο αναπαρα_producible που μπορεί να ικανοποιήσει όλα τα περιορισμένα του έργου.
Αποτελέσματα
Η διαγνωστική ακρίβεια ποικίλλει ευρέως μεταξύ των μοντέλων, με το Gemini 2.5 Pro να εκτελείται καλύτερα στο 38,64%, ακολουθούμενο από το GPT-5 Mini στο 36,93%, το Gemini 2.5 Flash στο 32,95% και το GPT-4o Mini στο 16,48%. Παρά τις διαφορές αυτές, όλα τα μοντέλα δυσκολεύτηκαν με τις απαιτήσεις της διαγνωστικής συλλογιστικής για σπάνιες ασθένειες:

Αποτελέσματα για διαγνωστική ακρίβεια σε όλα τα τέσσερα μοντέλα.
Οι συγγραφείς σημειώνουν επίσης ότι η απόδοση ποικίλλει μεταξύ των σεζόν της σειράς:

Ποικίλλουσα ακρίβεια μεταξύ των διαφορετικών σεζόν του House, αλλά χωρίς καμία σαφή καμπύλη ή λόγο.
Η μελέτη αναφέρει:
‘Η σεζόν 1 έφτασε την υψηλότερη ακρίβεια στο 56,52%, ενώ η σεζόν 5 έδειξε την χαμηλότερη στο 20,83%. Αυτή η διακύμανση υποδηλώνει ότι η διαγνωστική πολυπλοκότητα ποικίλλει καθ’ όλη τη διάρκεια της σειράς, με τις μεταγενέστερες σεζόν να παρουσιάζουν πιθανώς πιο απαιτητικές σπάνιες ασθένειες.
‘Ωστόσο, η σχετικά ισχυρή απόδοση στη σεζόν 8 (52,38%) υποδηλώνει ότι η χρονολογική πρόοδος μόνο δεν εξηγεί πλήρως τις διαφορές στην ακρίβεια· η περίπτωση-ειδική διαγνωστική πολυπλοκότητα φαίνεται να είναι ο κύριος οδηγός.’
Τα μοντέλα εκτελούσαν πιο αξιόπιστα όταν διαγνώνονταν κοινές καταστάσεις με αναγνωρίσιμα συμπτώματα, όπως μηνιγγίτιδα, μυοκαρδιακή ανακοπή και πνευμονική εμβολή – αλλά συνέχισαν να δυσκολεύονται με σπάνιες ασθένειες όπως νευροκυστικέρκωση και Erdheim-Chester νόσος, καθώς και σύνθετες αυτοάνοσες διαταραχές όπως συστηματικός ερυθηματώδης λύκος και σαρκοείδωση. Η απόδοση έπεσε επίσης σε τοξικολογικές περιπτώσεις που απαιτούσαν σύνδεση ιστορικού έκθεσης με κλινικά σημάδια.
Οι συγγραφείς προτείνουν ότι η διακύμανση στην ακρίβεια μεταξύ των μοντέλων υποδηλώνει σημαντικές διαφορές στην αρχιτεκτονική και τη στρατηγική εκπαίδευσης, με την ισχυρότερη απόδοση του GPT-5 Mini και του Gemini 2.5 Pro να υποδηλώνει ότι οι νεότερες γενιές των LLM ωφελούνται από βελτιωμένες ικανότητες συλλογιστικής – αν και τα αποτελέσματά τους εξακολουθούν να αποκαλύπτουν σαφείς περιορισμούς στην αντιμετώπιση σύνθετων διαγνωστικών εργασιών.
Τα αποτελέσματα, υποστηρίζουν, παρέχουν βασικά μετρικά για αφηγηματική διάγνωση σπάνιων ασθενειών, υποδηλώνοντας ισχυρά ότι τα τρέχοντα γλωσσικά μοντέλα αρχίζουν να δείχνουν χρήσιμες ιατρικές ικανότητες συλλογιστικής.
Η αύξηση της απόδοσης από το GPT-4o Mini στο 16,48% στο Gemini 2.5 Pro στο 38,64%, καταλήγει η μελέτη, σηματοδοτεί σταθερή πρόοδο προς κλινικά εφαρμόσιμα εργαλεία υποστήριξης του AI.
Αν και οι ερευνητές παραδέχονται ότι τα επίπεδα ακρίβειας παραμένουν μετριαστά, το βασικό σημείο εστιάζει αποκλειστικά σε πολύ σύνθετες περιπτώσεις που συνήθως προκαλούν προκλήσεις ακόμη και για εκπαιδευμένους γιατρούς, και η ικανότητα να αναγνωρίσει σωστά τη διάγνωση σε σχεδόν 40% αυτών των δύσκολων περιπτώσεων υποδηλώνει πραγματική ικανότητα συλλογιστικής, θέτοντας τις βάσεις για μελλοντικές βελτιώσεις μέσω στόχευσης fine-tuning, ολοκλήρωσης γνώσεων ή υβριδικών στρατηγικών συλλογιστικής.
Συμπέρασμα
Υπάρχουν κάποιοι φανεροί κίνδυνοι στην επαναχρησιμοποίηση αφηγημάτων τηλεοπτικών σειρών σε πραγματικά ιατρικά σύνολα δεδομένων – ακόμη και σε περιπτώσεις, όπως με το House, όπου το υλικό πηγής έχει υψηλό επίπεδο ιατρικής συμβολής και/ή εποπτείας.
Είναι ενδιαφέρον να σημειωθεί ότι ένα τυπικό επεισόδιο του House λειτουργεί αποτελεσματικά ως μια μηχανή σύμπτυξης για μια σειρά ιατρικών εγγραφών που μπορεί να μην είναι άμεσα προσβάσιμες στο διαδίκτυο για τον μέσο άνθρωπο, ή για πηγές δεδομένων που παρουσιάζουν τις πληροφορίες με ένα πολύ πιο θραυσματικό και μη γραμμικό τρόπο.
Το γεγονός ότι ένας γιατρός μπορεί να γράψει το σενάριο για ένα επεισόδιο, όπως συνέβη συχνά με το House, μπορεί να χρησιμοποιηθεί από τους ερευνητές ως的一種 ‘σφραγίδα’ για το περιεχόμενο· αλλά αυτό αγνοεί το γεγονός ότι καλλιτεχνικές σκέψεις μπορεί να έχουν επηρεάσει την παρουσίαση της ασθένειας στο επεισόδιο.
Αυτό αφήνει τα δεδομένα σε μια κατάσταση πολλών άλλων πιθανών χρήσιμων πηγών δεδομένων για εκπαίδευση: στην ανάγκη για ένα φρέσκο στρώμα ακριβούς, εξειδικευμένου ανθρώπινου ελέγχου.
* Παρακαλώ σημειώστε ότι αυτή η πολύ σύντομη εργασία δεν ακολουθεί το τυπικό πρότυπο, και έχω προσαρμόσει την κάλυψη για να το εξυπηρετήσω.
Πρώτη δημοσίευση τη Δευτέρα, 17 Νοεμβρίου 2025












