Unghiul lui Anderson

Utilizarea serialului “House” pentru a dezvolta capacitățile de diagnostic ale inteligenței artificiale

mm
Adaugă Unite.AI la sursele tale preferate pe Google
A screen capture from the NBC TV show 'House, S04E02., 'The Right Stuff'

Deși diagnosticarea bolilor rare este o provocare deosebit de dificilă pentru inteligența artificială (la fel ca și pentru oameni), modelele de limbaj populare ChatGPT și Gemini arată o performanță promițătoare atunci când sunt antrenate pe cazuri de diagnostic din serialul medical “House”.

 

Aproape jumătate dintre toți studenții la științe medicale privesc în mod regulat drame medicale precum House, Grey’s Anatomy și Scrubs. Deși acest tip de material poate fi utilizat doar în scopuri didactice, cu o filtrare și o încadrare adecvată, din cauza riscului de a răspândi informații false periculoase, standardul de cercetare pentru dramele care prezintă afecțiuni medicale tinde să fie destul de ridicat (deși acuratețea variază în funcție de producții).

Nu este de mirare că medicii adesea inițiază, consiliază și/sau scriu drame medicale TV. În astfel de cazuri, cunoștințele medicale extinse sunt avantajoase nu numai pentru a prezenta în mod exact problemele medicale, ci și pentru a genera sugestii pentru noi și interesante scenarii.

Unul dintre cele mai bine cercetate seriale medicale din “epoca de aur” recentă a televiziunii este House (cunoscut și sub numele de House MD), în care excentricitățile personajului principal și fluctuațiile mari ale distribuției, deși au fost divertisment, au ocupat locul al doilea în fața “bolii săptămânii”.

Într-adevăr, din cele 177 de episoade difuzate pe parcursul celor opt sezoane, House a oferit 176 de studii de caz diagnostice. Deși serialul s-a încheiat în 2012, până în 2015 era deja utilizat ca instrument de predare, cu un seminar special “Dr. House” care a oferit rezultate îmbunătățite în comparație cu conținutul standard al seminarului, chiar dacă participarea nu a oferit credite pentru studenți:

Dintr-un studiu din 2015, diverse motive pentru care studenții medicali au dorit să participe la un seminar de diagnostic care a utilizat informații din serialul “House”. Seminarul a fost programat la o oră deliberat dificilă și nu a oferit credite de studiu; în ciuda acestor factori, inițiativa a fost un succes. Sursa

Casa și inteligența artificială

Deși utilizarea serialului House și a altor seriale TV diverse a fost dovedită în multiple studii ca fiind un ajutor eficient pentru învățare, pentru studenții la medicină, puțin din această abordare a fost încercată până acum într-un context de învățare automată.

Acum, o nouă lucrare de la Universitatea de Stat din Pennsylvania a făcut o încercare inițială în această direcție, prin dezvoltarea unui set de date care conține toate cele 176 de studii de caz diagnostice utilizabile din House, formulate într-o structură narativă de diagnostic, evaluată apoi pe modele LLM populare de la OpenAI și Google.

În ciuda dificultății acestei provocări (care caracterizează unul dintre cele mai dificile domenii din științele biologice), cercetătorii au constatat că versiunile mai recente ale ChatGPT și Gemini au arătat o îmbunătățire față de versiunile mai vechi, indicând faptul că tendința evolutivă a dezvoltării modelului este probabil să se îndrepte eficient către procese diagnostice în timp.

Articolul afirmă:

‘Rezultatele arată o variație semnificativă a performanței, variind de la 16,48% la 38,64% acuratețe, cu generații mai recente de modele demonstrând o îmbunătățire de 2,3 ori. În timp ce toate modelele se confruntă cu provocări substanțiale în diagnosticarea bolilor rare, îmbunătățirea observată în arhitecturi sugerează direcții promițătoare pentru dezvoltarea viitoare.

‘Baza noastră de date validate educațional stabilește metrici de performanță de bază pentru raționament medical narativ și oferă un cadru de evaluare accesibil public pentru a avansa cercetarea asistată de inteligență artificială pentru diagnostic.’

Pe lângă stabilirea metricilor de performanță de bază, autorii notează că noul set de date – pe care îl fac public disponibil – rezolvă lipsa de proces narativ din seturile de date medicale existente și este ușor accesibil, în contrast cu cultura de gate-keeping a seturilor de date medicale standard.

Noua lucrare, intitulată Evaluarea modelelor de limbaj mare pe diagnosticarea bolilor rare: Un studiu de caz utilizând House M.D., provine de la patru cercetători de la Penn State*.

Date

Pentru a popula setul de date, autorii au utilizat material public disponibil de pe site-ul de fani House Wiki bine stabilit. Conținutul narativ a fost extras și distilat utilizând cadrul popular Beautiful Soup, care poate extrage date structurale din codul sursă HTML al paginilor web.

După ce au fost recoltate astfel narativele de bază, patru modele LLM au fost utilizate pentru a transforma ieșirea într-un format standardizat de caz. Modelele utilizate au fost GPT-4o mini; GPT-5 Mini; Gemini 2.5 Flash; și Gemini 2.5 Pro. În final, a fost aplicată o filtrare a calității, pentru a se asigura că setul de date avea detalii clinice adecvate și aliniere cu stadiul actual al artei în raționament medical.

Autorii observă că ‘bolile orfane’ (cunoscute și sub numele de boli rare) sunt subreprezentate în bazele de date medicale standard; în anumite cazuri, acoperirea lor în serialul House poate reprezenta un procent neobișnuit de mare din acoperirea lor totală existentă.

Autorii admit că utilitatea unei surse de date de acest tip trebuie să fie temperată cu prudență în ceea ce privește licența artistică care poate fi prioritară uneori în dezvoltarea dramelor medicale:

‘În timp ce setul nostru de date reflectă limitările conținutului fictiv, inclusiv exagerarea dramatică și focalizarea pe cazuri complexe, aceste caracteristici pot beneficia evaluarea prin furnizarea de cazuri dificile care testează robustețea modelului.

‘Validarea educațională a House M.D. de către profesioniștii medicali oferă încredere că scenariile extrase conțin informații clinice semnificative adecvate pentru evaluarea inteligenței artificiale.’

Exemple din setul de date generat pentru proiect. Sursa [ https://www.kaggle.com/datasets/arshgupta23/housemd-data-for-rare-disease-accuracy-using-llms?resource=download ]

Exemple din setul de date generat pentru proiect. Sursa

Teste

Pentru a evalua acuratețea modelului pe sarcini diagnostice narative, autorii au proiectat o linie de flux simplă care combină generarea de prompturi, inferența modelului și evaluarea.

Cele patru modele LLM menționate anterior au fost testate, fiecare model fiind configurat cu temperatură setată la zero (asigurând ieșire deterministică și nu “creativă”), și cu o lungime maximă de token de 1.500 – o alocare destinată să accommodate raționamentul diagnostic complex. Nu au fost utilizate prompturi suplimentare pentru a încadra mai departe interogările.

Prompturile însele au respectat un format standard de prezentare a cazurilor medicale – genul pe care spectatorii îl cunosc cel mai bine din dramele medicale atunci când un nou pacient/boală este introdus, și un medic rezumă o prezentare generală pentru beneficiul altor medici prezenți (în esență, însă, pentru beneficiul spectatorilor).

Fiecare prompt a prezentat o narativă clinică care includea detalii demografice; un cronologie a simptomelor; istoric medical relevant; și descoperiri diagnostice inițiale. Modelul a fost instruit să identifice un singur diagnostic principal și să justifice concluzia sa cu raționament.

Fiecare model a generat răspunsul său diagnostic într-o singură trecere, fără nicio rafinare iterativă; și răspunsurile au fost colectate în condiții consistente pentru toate cele 176 de cazuri:

Un exemplu ilustrativ de evaluare, care arată un prompt clinic narativ și diagnosticul său de adevăr, utilizat pentru testarea Gemini 2.5 Pro. Sursa [ https://arxiv.org/pdf/2511.10912 ]

Un exemplu ilustrativ care arată un prompt clinic narativ și diagnosticul său de adevăr, utilizat pentru testarea Gemini 2.5 Pro. Sursa

Pentru metrici, predicțiile au fost evaluate utilizând o procedură de potrivire a șirurilor de caractere “încețoșată” destinată să țină cont de ambiguitatea terminologiei medicale. Abordarea a utilizat biblioteca SequenceMatcher din Python, cu un prag de similitudine de 0,8, începând cu potrivirea exactă a substraturilor și revenind la comparația pe bază de token atunci când a fost necesar. Acuratețea a fost calculată ca proporția cazurilor clasificate corect în aceste condiții:

Fluxul de lucru de potrivire “încețoșată” utilizat de cercetători.

Autorii notează că potrivirea “încețoșată” ar putea însemna că diagnosticele semantic identice care folosesc terminologie diferită ar putea fi ratate, dar prezintă abordarea lor ca fiind cea mai reproductibilă care ar putea satisface toate constrângerile proiectului.

Rezultate

Acuratețea diagnostică a variat foarte mult între modele, Gemini 2.5 Pro realizând cea mai bună performanță cu 38,64%, urmat de GPT-5 Mini cu 36,93%, Gemini 2.5 Flash cu 32,95% și GPT-4o Mini cu 16,48%. În ciuda acestor diferențe, toate modelele au luptat cu cerințele raționamentului diagnostic pentru boli rare:

Rezultate pentru acuratețea diagnostică a celor patru modele testate.

Rezultate pentru acuratețea diagnostică a celor patru modele testate.

Autorii notează, de asemenea, că performanța a variat pe parcursul sezoanelor serialului:

Acuratețe variabilă pe parcursul sezoanelor diverse ale serialului House, dar fără o curbă sau un motiv evident.

Acuratețe variabilă pe parcursul sezoanelor diverse ale serialului House, dar fără o curbă sau un motiv evident.

Articolul afirmă:

‘Sezonul 1 a atins cea mai mare acuratețe, de 56,52%, în timp ce Sezonul 5 a arătat cea mai mică, de 20,83%. Această variație sugerează că complexitatea diagnostică variază de-a lungul seriei, cu sezoanele mai târzii posibil având cazuri mai dificile de boli rare.

‘Cu toate acestea, performanța relativ puternică în Sezonul 8 (52,38%) indică faptul că progresia temporală nu explică în întregime diferențele de acuratețe; mai degrabă, complexitatea cazului pare a fi principalul factor.’

Modelele au performant mai bine atunci când au diagnosticat afecțiuni comune cu simptome recunoscute, cum ar fi meningita, infarctul miocardic și embolia pulmonară – dar au luptat constant cu boli rare, cum ar fi neurocisticercoza și boala Erdheim-Chester, precum și tulburări autoimune complexe, cum ar fi lupusul eritematos sistemic și sarcoidoza. Performanța a scăzut, de asemenea, în cazurile toxicologice care au necesitat legarea istoricului de expunere de semne clinice.

Autorii sugerează că variația în acuratețe între modele indică diferențe semnificative în arhitectură și strategie de antrenament, performanța mai bună a GPT-5 Mini și Gemini 2.5 Pro indicând faptul că generațiile mai recente de LLM beneficiază de capacități de raționament îmbunătățite – deși rezultatele lor arată încă limitări clare în gestionarea sarcinilor diagnostice complexe.

Rezultatele, susțin ei, oferă metrici de bază pentru diagnosticarea bolilor rare pe bază de narativ, indicând puternic faptul că modelele de limbaj actuale încep să arate capacități de raționament medical utile.

Săritura în performanță de la GPT-4o Mini la 16,48% la Gemini 2.5 Pro la 38,64%, concluzionează articolul, semnalează progresul constant către unelte de sprijin clinic aplicabile.

Deși cercetătorii admit că nivelurile de acuratețe rămân modeste, benchmark-ul se concentrează exclusiv pe cazuri complexe care provoacă în mod regulat chiar și medicii instruiți, iar capacitatea de a identifica corect diagnosticul în aproape 40% din aceste exemple dificile indică o capacitate reală de raționament, pregătind terenul pentru îmbunătățiri viitoare prin ajustări țintite, integrarea cunoștințelor medicale structurate sau strategii de raționament hibrid.

Concluzie

Există pericole evidente în a reutiliza narativele serialului TV în seturi de date medicale reale – chiar și în cazurile în care, ca în cazul House, materialul sursă are o contribuție medicală calificată și/sau supraveghere.

Este interesant de remarcat că un episod tipic din House funcționează efectiv ca o mașină de rezumat pentru o serie de intrări medicale care nu pot fi accesate direct de persoane obișnuite sau de surse de date care prezintă informațiile într-un mod mai fragmentat și neliniar.

Avea un medic care să scrie efectiv scenariul pentru un episod, așa cum s-a întâmplat frecvent cu House, ar putea fi utilizat de cercetători ca o formă de “aviz” pentru conținut; dar acest lucru ignoră faptul că considerente artistice ar fi putut influența prezentarea bolii în episod.

Aceasta lasă datele în starea multor alte surse de date potențial utile pentru antrenare: în nevoie de un strat proaspăt de supraveghere umană calificată și costisitoare.

 

* Vă rugăm să rețineți că acest articol scurt nu urmează șablonul obișnuit, și am adaptat acoperirea pentru a se potrivi cu acesta.

A fost publicat pentru prima dată luni, 17 noiembrie 2025

Scriitor pe machine learning, specialist în domeniul sintezei de imagini umane. Fost șef al conținutului de cercetare la Metaphysic.ai, până la dizolvarea sa în Brahma.ai a DNEG.
Portfolio site: martinanderson.ai
Contact: martin@martinanderson.ai