Погляд Anderson

Використання телешоу «House» для розвитку діагностичних можливостей штучного інтелекту

mm
Додайте Unite.AI до бажаних джерел у Google
A screen capture from the NBC TV show 'House, S04E02., 'The Right Stuff'

Хоча діагноз рідкісних захворювань є особливо складним завданням для штучного інтелекту (як і для людей), популярні мовні моделі ChatGPT і Gemini демонструють перспективну продуктивність, коли тренуються на діагностичних випадках з популярної медичної драми «House».

 

Близько половини всіх студентів медичних наук регулярно дивляться медичні драми, такі як House, Grey’s Anatomy і Scrubs. Хоча такий матеріал можна використовувати тільки для навчальних цілей з великою фільтрацією та оформленням, через ризик поширення небезпечної дезінформації, рівень досліджень для драм з медичними умовами tend до досить високого (хоча точність варіюється між виробництвами).

Не дивно, що лікарі часто починають, радять і/або письменні телевізійні медичні драми. У таких випадках, великі медичні знання є вигідними не тільки для точного передачі медичних питань, але також для створення нових і цікавих сюжетних ліній.

Одним з найбільш ретельно досліджених медичних шоу недавньої “золотої ери” телебачення є House (також відомий як House MD), де екцентричність головного персонажа і великі коливання в акторському складі, розважливо як це було, зайняли друге місце за “хворобу тижня”.

Фактично, з 177 епізодів, показаних протягом восьми сезонів, House надав 176 діагностичних випадків. Хоча шоу закінчилося в 2012 році, до 2015 року воно вже використовувалося як навчальний інструмент, з спеціальним семінаром «Доктор Хаус», який дав кращі результати порівняно зі стандартними семінарами, навіть якщо відвідування не давало жодних студентських кредитів:

З дослідження 2015 року, різні причини, чому медичні студенти хотіли відвідати діагностичний семінар, який використовував інформацію з телешоу «House».

З дослідження 2015 року, різні причини, чому медичні студенти хотіли відвідати діагностичний семінар, який використовував інформацію з телешоу «House». Джерело

House і штучний інтелект

Хоча використання House та інших різноманітних телешоу було доведено в кількох дослідженнях як ефективний допоміжний засіб для навчання, для медичних студентів, мало з цього підходу було зроблено до цього часу в контексті машинного навчання.

Тепер нова робота з Університету штату Пенсільванія зробила перший крок у цьому напрямку, розробивши набір даних, що містить усі 176 діагностичних випадків House, сформульованих у нарративно-орієнтованій діагностичній структурі, а потім оцінених на популярних моделях LLM від OpenAI і Google.

Незважаючи на складність цієї задачі (яка характеризує одну з найбільш складних галузей біологічних наук), дослідники виявили, що більш пізні версії ChatGPT і Gemini показали покращення порівняно з більш ранніми версіями, вказуючи на те, що еволюційний тренд розвитку моделей, ймовірно, буде ефективно спрямований на діагностичні процеси з часом.

Папера зазначає:

‘Результати показують значну варіацію продуктивності, від 16,48% до 38,64% точності, з більш новими поколіннями моделей, що демонструють покращення у 2,3 рази. Хоча всі моделі стикаються з суттєвими труднощами з діагнозом рідкісних захворювань, спостережуване покращення архітектури вказує на перспективні напрямки для майбутнього розвитку.

‘Наш освітньо-валідований бенчмарк встановлює базові показники продуктивності для нарративної медичної логіки та забезпечує публічно доступну оціночну основу для просування досліджень діагностики, допоміжної штучного інтелекту.’

Крім встановлення базових показників продуктивності, проти яких майбутні зусилля можуть бути оцінені, автори відзначають, що новий набір даних – який вони роблять публічно доступним – вирішує відсутність нарративного процесу всередині існуючих медичних наборів даних, і легко доступний, на відміну від культури стандартних медичних наборів даних.

Нова робота називається Оцінка великих мовних моделей на діагноз рідкісних захворювань: Випадковий аналіз з використанням House M.D, і походила від чотирьох дослідників з Університету штату Пенсільванія*.

Дані

Для створення свого набору даних автори використали публічно доступний матеріал з довгоствореного House Wiki фан-сайту. Наративний контент був видобутий і очищений за допомогою популярної Beautiful Soup фреймворку, який може видобувати структуровані дані з HTML-джерела веб-сторінок.

Після того, як базові нарративи були зібрані таким чином, чотири моделі LLM були використані для перетворення виводу у стандартизовану форму випадків. Моделі, які були використані, були GPT-4o mini; GPT-5 Mini; Gemini 2.5 Flash; і Gemini 2.5 Pro. Нарешті, було застосовано фільтрацію якості, щоб забезпечити, що набір даних мав відповідну клінічну деталізацію та відповідність сучасному стану медичної логіки.

Автори відзначають, що ‘сирітські’ захворювання (також відомі як рідкісні захворювання) недостатньо представлені в стандартних медичних базах даних; в деяких випадках їхнє висвітлення в шоу «House» може складати незвичайний відсоток їхнього загального висвітлення.

Автори погоджуються, що корисність джерела даних такого типу повинна бути поміркована обережністю щодо художньої свободи, яка може бути пріоритетною при розробці медичної драми:

‘Хоча наш набір даних відображає обмеження вигаданого контенту, включаючи драматичну перебільшення та складні випадки, ці характеристики можуть бути вигідними для оцінки, забезпечуючи складні крайні випадки, які перевіряють стійкість моделі.

‘Освітня валідність House M.D. медичними фахівцями забезпечує впевненість, що витягнуті сценарії містять клінічно значимі відомості, придатні для оцінки штучного інтелекту.’

Приклади з набору даних, згенерованого для проекту.

Приклади з набору даних, згенерованого для проекту. Джерело

Тести

Для оцінки точності моделей на нарративних діагностичних завданнях автори розробили простий трубопровід, що поєднує генерацію підказок, висновок моделі та оцінку.

Чотири згадані вище моделі LLM були протестовані, кожна з яких була сконфігурована з температурою, встановленою на нуль (забезпечуючи детермінований вивід, а не “креативний” вивід), і з максимальною токенів довжиною 1 500 – це дозволення було розроблено для розміщення складного діагностичного висновку. Не були використані жодні додаткові системні підказки для подальшого кадрування запитів.

Самі підказки відповідали стандартному структурованому формату клінічної випадкової презентації – такого, якими глядачі будуть найбільш знайомі з медичних драм, коли представляється новий пацієнт/захворювання та лікар підсумовує огляд для інших лікарів (фактично, хоча б для глядачів).

Кожна підказка складалася з клінічної розповіді, що включала демографічні дані; хронологію симптомів; відповідну медичну історію; та ранні діагностичні висновки. Модель була інструктована ідентифікувати один первинний діагноз та виправдати свій висновок обґрунтуванням.

Кожна модель генерувала свій діагностичний висновок за один прохід, без будь-якого ітеративного уточнення; та відповіді були зібрані під постійними умовами для всіх 176 випадків:

Ілюстративний приклад оцінювання, що показує нарративну клінічну підказку та відповідний діагноз, використаний для тестування Gemini 2.5 Pro.

Ілюстративний приклад оцінювання, що показує нарративну клінічну підказку та відповідний діагноз, використаний для тестування Gemini 2.5 Pro. Джерело

Для метрик прогнози були оцінені за допомогою “розмитої” процедури зіставлення рядків, розробленої для врахування неоднозначності медичної термінології. Підхід використовував бібліотеку SequenceMatcher Python, з порогом схожості 0,8, починаючи з точного підстрокового зіставлення та переходячи до токенівського порівняння, коли це потрібно. Точність була обчислена як частка випадків, класифікованих правильно під цією умовою:

«Розмитий» робочий процес зіставлення, використаний дослідниками.

«Розмитий» робочий процес зіставлення, використаний дослідниками.

Автори відзначають, що розмите зіставлення може означати, що семантично ідентичні діагнози, які використовують різну термінологію, можуть бути пропущені, але представляють свій підхід як найбільш репродуктивний, який міг задовольнити всі обмеження проекту.

Результати

Точність діагностики сильно варіювалася між моделями, з Gemini 2.5 Pro, що показала найкращу продуктивність на рівні 38,64%, за нею слідувала GPT-5 Mini на рівні 36,93%, Gemini 2.5 Flash на рівні 32,95%, і GPT-4o Mini на рівні 16,48%. Незважаючи на ці відмінності, всі моделі боролися з вимогами діагностичної логіки для рідкісних захворювань:

Результати діагностичної точності для чотирьох моделей, протестованих.

Результати діагностичної точності для чотирьох моделей, протестованих.

Автори також відзначають, що продуктивність варіювалася протягом сезонів шоу:

Змінна точність протягом різних сезонів House, але без будь-якої очевидної кривої чи ясної причини.

Змінна точність протягом різних сезонів House, але без будь-якої очевидної кривої чи ясної причини.

Папера зазначає:

‘Сезон 1 досяг найвищої точності на рівні 56,52%, тоді як сезон 5 показав найнижчу на рівні 20,83%. Ця варіація свідчить про те, що діагностична складність варіює протягом серіалу, з пізнішими сезонами, які потенційно можуть містити більш складні рідкісні захворювання.

‘Однак відносно сильна продуктивність у сезоні 8 (52,38%) вказує на те, що часовий прогрес сам по собі не повністю пояснює відмінності точності, а випадкова діагностична складність здається основним драйвером.’

Моделі працювали більш надійно при діагностиці загальних захворювань з впізнаваними симптомами, такими як менінгіт, інфаркт міокарда та легенева емболія – але постійно боролися з рідкісними захворюваннями, такими як нейроцистикеркоз і хвороба Ердгайма-Честера, а також складними аутоімунними розладами, такими як системний червоний вовчак і саркоїдоз. Продуктивність також впала у токсикологічних випадках, які вимагали зв’язку історії експозиції з клінічними ознаками.

Автори припускають, що варіація точності між моделями вказує на істотні відмінності в архітектурі та стратегії навчання, з більш сильною продуктивністю GPT-5 Mini та Gemini 2.5 Pro, що свідчить про те, що новіші покоління моделей LLM користуються покращеними можливостями висновку – хоча їхні результати все ще показують явні обмеження при обробці складних діагностичних завдань.

Результати, на їхню думку, забезпечують базові метрики для нарративної діагностики рідкісних захворювань, що свідчить про те, що поточні мовні моделі починають демонструвати корисні медичні можливості висновку.

Скок продуктивності від GPT-4o Mini на рівні 16,48% до Gemini 2.5 Pro на рівні 38,64%, папера висновує, свідчить про стабільний прогрес до клінічно-застосовних інструментів штучного інтелекту.

Хоча дослідники погоджуються, що рівні точності залишаються скромними, бенчмарк фокусується виключно на висококомплексних випадках, які регулярно викликають складності навіть у тренованих лікарів, і здатність правильно ідентифікувати діагноз у майже 40% цих складних прикладів вказує на справжню здатність висновку, закладає основу для майбутніх поліпшень через цільове тонке налаштування, інтеграцію структурованої медичної інформації або гібридні стратегії висновку.

Висновок

Є очевидні небезпеки у повторному використанні телевізійних нарративів у реальних медичних наборах даних – навіть у випадках, таких як «House», де джерельний матеріал має високий рівень кваліфікованих медичних внесків та/або нагляду.

Цікаво відзначити, що типовий епізод «House» фактично діє як машина підсумовування для серії медичних записів, які можуть не бути безпосередньо доступними в Інтернеті для середньої людини або для джерел даних, які представляють інформацію більш фрагментарним і нелінійним способом.

Якщо лікар фактично написав сценарій для епізоду, як часто траплялося з «House», це можна було б використати дослідниками як деяке підтвердження змісту; але це ігнорує той факт, що художні міркування можуть впливати на презентацію захворювання в епізоді.

Це залишає дані в стані багатьох інших потенційно корисних джерел даних для навчання: у потребі у свіжому шарі дорогого, кваліфікованого людського нагляду.

 

* Будь ласка, зверніть увагу, що ця коротка робота не слідує звичайному шаблону, і я адаптував висвітлення, щоб задовольнити це.

Перша публікація – понеділок, 17 листопада 2025 року

Письменник про машинне навчання, спеціаліст у галузі синтезу людських зображень. Колишній керівник дослідницького контенту в Metaphysic.ai, до його розформування в DNEG's Brahma.ai.
Портфоліо сайт: martinanderson.ai
Контакт: martin@martinanderson.ai