Взгляд Anderson

Использование телешоу «Доктор Хаус» для развития диагностических возможностей ИИ

mm
Добавьте Unite.AI в избранные источники в Google
A screen capture from the NBC TV show 'House, S04E02., 'The Right Stuff'

Хотя диагностика редких заболеваний является особенно сложной задачей для ИИ (как и для людей), популярные языковые модели ChatGPT и Gemini показывают перспективные результаты при обучении на диагностических случаях из популярного медицинского драматического сериала «Доктор Хаус».

 

Почти половина всех студентов медицинских наук регулярно смотрят медицинские драмы, такие как Доктор Хаус, Анатомия Грей и Скрабы. Хотя такой материал можно использовать только для дидактических целей с большим количеством фильтрации и рамок, из-за риска распространения опасной дезинформации, стандарт исследований для драм с медицинскими условиями имеет тенденцию быть довольно высоким (хотя точность варьируется в разных постановках).

Неудивительно, что врачи часто являются советниками и/или авторами телевизионных медицинских драм. В таких случаях обширные медицинские знания являются полезными не только для точного передачи медицинских проблем, но и для генерации идей для новых и интересных сюжетных линий.

Одним из наиболее тщательно исследованных медицинских шоу recent «золотого века» телевидения является Доктор Хаус (также известный как Доктор Хаус МД), где эксцентричность главного персонажа и огромные колебания в составе актеров, хотя и были интересными, занимали второе место после «заболевания недели».

Фактически, из 177 эпизодов, вышедших в эфир за восемь сезонов, Доктор Хаус предоставил 176 диагностических исследований. Хотя шоу завершилось в 2012 году, к 2015 году оно уже использовалось в качестве учебного инструмента, с специальным семинаром «Доктор Хаус», который показал лучшие результаты по сравнению со стандартными семинарами, даже если посещение семинара не давало студентам кредитов:

Из исследования 2015 года, разнообразные причины, по которым медицинские студенты хотели посетить диагностический семинар, который использовал информацию из телешоу «Доктор Хаус». Источник [  https://journals.plos.org/plosone/article/file?id=10.1371/journal.pone.0193972&type=printable ]

Из исследования 2015 года, разнообразные причины, по которым медицинские студенты хотели посетить диагностический семинар, который использовал информацию из телешоу «Доктор Хаус». Семинары были запланированы на намеренно сложное время, и не давали студентам кредитов; вопреки этим факторам, инициатива была успешной. Источник

Доктор Хаус и ИИ

Хотя использование Доктора Хауса и других разнообразных телешоу было доказано в нескольких исследованиях как эффективное дополнительное средство для обучения медицинских студентов, пока мало что было предпринято в этом направлении в контексте машинного обучения.

Теперь новая работа исследователей из Университета штата Пенсильвания сделала первый шаг в этом направлении, разработав набор данных, включающий все 176 диагностических исследований Доктора Хауса, сформулированных в нарративно-ориентированную диагностическую структуру, которая была оценена на популярных моделях LLM от OpenAI и Google.

Несмотря на сложность этой задачи (которая характеризует одну из самых сложных областей биологических наук), исследователи обнаружили, что более новые версии ChatGPT и Gemini показали улучшение по сравнению со старыми версиями, что указывает на то, что эволюционная тенденция развития моделей, скорее всего, будет эффективно внедрена в диагностические процессы со временем.

В статье говорится:

‘Результаты показывают значительные вариации в производительности, варьирующиеся от 16,48% до 38,64% точности, причем новые поколения моделей демонстрируют улучшение в 2,3 раза. Хотя все модели сталкиваются с существенными проблемами при диагностике редких заболеваний, наблюдаемое улучшение по архитектурам предполагает перспективные направления для будущего развития.

‘Наша образовательная валидация набора данных устанавливает базовые метрики производительности для нарративного медицинского рассуждения и предоставляет общедоступную оценочную основу для продвижения исследований в области ИИ-ассистированной диагностики.’

Помимо установления базовых метрик производительности, по которым можно оценить будущие усилия, авторы отмечают, что новый набор данных — который они делают общедоступным — решает проблему отсутствия нарративного процесса внутри существующих медицинских наборов данных и легко доступен, в отличие от культуры, охраняемой стандартными медицинскими наборами данных.

Новая работа называется Оценка больших языковых моделей на диагностике редких заболеваний: Кейс-стади по «Доктору Хаусу» и исходит от четырех исследователей из Университета штата Пенсильвания*.

Данные

Для создания своего набора данных авторы использовали общедоступный материал с lâu устоявшегося House Wiki фан-сайта. Нарративный контент был извлечен и очищен с помощью популярной Beautiful Soup фреймворка, который может извлекать структурированные данные из HTML-источника веб-страниц.

После того, как базовые нарративы были собраны таким образом, четыре LLM были использованы для преобразования вывода в стандартизированную форматировку дел. Модели, использованные в работе, были GPT-4o mini; GPT-5 Mini; Gemini 2.5 Flash; и Gemini 2.5 Pro. Наконец, был применен фильтр качества, чтобы обеспечить, что набор данных имел соответствующую клиническую детальность и соответствие текущему состоянию медицинского рассуждения.

Авторы отмечают, что ‘орфанные’ заболевания (т.е. редкие заболевания) недопредставлены в стандартных медицинских базах данных; в определенных случаях их освещение в шоу «Доктор Хаус» может представлять собой необычный процент их общего существующего освещения.

Авторы признают, что полезность источника данных такого типа должна быть сдержана осторожностью в отношении художественной свободы, которая может иметь приоритет в некоторых случаях при разработке медицинской драмы:

‘Хотя наш набор данных отражает ограничения художественного контента, включая драматические преувеличения и сложные случаи, эти характеристики могут принести пользу оценке, предоставляя сложные краевые случаи, которые проверяют прочность модели.

‘Образовательная валидация «Доктора Хауса» медицинскими специалистами дает уверенность в том, что извлеченные сценарии содержат клинически значимую информацию, подходящую для оценки ИИ.’

Примеры из набора данных, сгенерированного для проекта. Источник [   https://www.kaggle.com/datasets/arshgupta23/housemd-data-for-rare-disease-accuracy-using-llms?resource=download    ]

Примеры из набора данных, сгенерированного для проекта.  Источник

Тесты

Для оценки точности моделей на нарративных диагностических задачах авторы разработали простую трубу, объединяющую генерацию подсказок, вывод модели и оценку.

Четыре вышеупомянутых LLM были протестированы, причем каждая модель была настроена с температурой, установленной на ноль (обеспечивая детерминированный вывод, а не «креативный»), и с максимальной длиной токена в 1500 — это было сделано для того, чтобы вместить сложное диагностическое рассуждение. Не были использованы дополнительные системные подсказки для дальнейшего кадрирования запросов.

Сами подсказки соответствовали стандартному структурированному медицинскому формату представления дел — тому, с которым зрители наиболее знакомы из медицинских драм, когда новый пациент/заболевание представляется, и врач суммирует обзор для других врачей (эффективно, хотя, для зрителей).

Каждая подсказка представляла собой клинический нарратив, включающий демографические детали; хронологию симптомов; соответствующую медицинскую историю; и ранние диагностические результаты. Модель была проинструктирована определить основной диагноз и обосновать свое заключение рассуждением.

Каждая модель сгенерировала диагностический ответ в одном проходе, без какого-либо итеративного уточнения; и ответы были собраны при постоянных условиях для всех 176 случаев:

Иллюстративный пример оценки, показывающий нарративную клиническую подсказку и соответствующий диагноз, использованный для тестирования Gemini 2.5 Pro. Источник [  https://arxiv.org/pdf/2511.10912  ]

Иллюстративный пример, показывающий нарративную клиническую подсказку и соответствующий диагноз, использованный для тестирования Gemini 2.5 Pro. Источник

Для метрик предсказания использовалась процедура «размытого» совпадения строк, предназначенная для учета двусмысленности медицинской терминологии. Подход использовал Python-библиотеку SequenceMatcher, с порогом подобия 0,8, начиная с точного совпадения подстрок и переходя к сравнению токенов при необходимости. Точность рассчитывалась как доля случаев, классифицированных правильно при этих условиях:

«Размытое совпадение» рабочий процесс, используемый исследователями.

«Размытое совпадение» рабочий процесс, используемый исследователями.

Авторы отмечают, что «размытое совпадение» может означать, что семантически идентичные диагнозы, использующие разную терминологию, могут быть пропущены, но представляют свой подход как наиболее воспроизводимый, который может удовлетворить всем ограничениям проекта.

Результаты

Точность диагноза варьировалась широко среди моделей, причем Gemini 2.5 Pro показал лучший результат на уровне 38,64%, за ним следовал GPT-5 Mini на уровне 36,93%, Gemini 2.5 Flash на уровне 32,95% и GPT-4o Mini на уровне 16,48%. Несмотря на эти различия, все модели испытывали трудности с требованиями диагностического рассуждения для редких заболеваний:

Результаты диагностической точности для четырех протестированных моделей.

Результаты диагностической точности для четырех протестированных моделей.

Авторы также отмечают, что производительность варьировалась в разных сезонах шоу:

Вариативная точность в разных сезонах «Доктора Хауса», но без какой-либо очевидной кривой или четкой причины.

Вариативная точность в разных сезонах «Доктора Хауса», но без какой-либо очевидной кривой или четкой причины.

В статье говорится:

‘Сезон 1 достиг наивысшей точности на уровне 56,52%, в то время как сезон 5 показал наименьшую точность на уровне 20,83%. Это вариация предполагает, что диагностическая сложность варьируется на протяжении всего сериала, и что более поздние сезоны могут включать более сложные редкие заболевания.

‘Однако относительно сильная производительность в сезоне 8 (52,38%) указывает на то, что временная прогрессия сама по себе не полностью объясняет различия в точности; кажется, что основным фактором является сложность диагностического случая.’

Модели показали более надежные результаты при диагностике распространенных состояний с узнаваемыми симптомами, такими как менингит, инфаркт миокарда и легочная эмболия, но последовательно испытывали трудности с редкими заболеваниями, такими как нейроцистикеркоз и болезнь Эрдхайма-Честера, а также с сложными аутоиммунными расстройствами, такими как системная красная волчанка и саркоидоз. Производительность также снижалась в токсикологических случаях, требующих связи между историей воздействия и клиническими признаками.

Авторы предполагают, что вариация точности между моделями указывает на существенные различия в архитектуре и стратегии обучения, и что более сильная производительность GPT-5 Mini и Gemini 2.5 Pro указывает на то, что более новые поколения LLM получают пользу от улучшенных возможностей рассуждения — хотя их результаты все еще показывают явные ограничения в обработке сложных диагностических задач.

Результаты, по их мнению, предоставляют базовые метрики для нарративной диагностики редких заболеваний, сильно указывая на то, что текущие языковые модели начинают показывать полезные медицинские возможности рассуждения.

Прыжок в производительности от GPT-4o Mini на уровне 16,48% до Gemini 2.5 Pro на уровне 38,64%, по мнению авторов, сигнализирует о стабильном прогрессе к клинически применимым инструментам поддержки ИИ.

Хотя исследователи признают, что уровни точности остаются скромными, эталон фокусируется исключительно на высоко сложных случаях, которые регулярно бросают вызов даже обученным врачам, и способность правильно определить диагноз в почти 40% этих сложных примеров указывает на реальную способность рассуждения, закладывая основу для будущих улучшений посредством целевого уточнения, интеграции структурированных медицинских знаний или гибридных стратегий рассуждения.

Заключение

Есть некоторые очевидные опасности в повторном использовании нарративов телешоу в реальных медицинских наборах данных — даже в случаях, таких как «Доктор Хаус», где исходный материал имеет высокий уровень квалифицированных медицинских вкладов и/или надзора.

Интересно отметить, что типичный эпизод «Доктора Хауса» эффективно действует как машина для суммирования серии медицинских записей, которые могут быть недоступны обычному человеку или источникам данных, представляющим информацию в более фрагментированной и нелинейной форме.

Иметь врача, который фактически пишет сценарий для эпизода, как часто бывало с «Доктором Хаусом», можно было бы использовать исследователями как некоторую форму «подтверждения» контента; но это игнорирует тот факт, что художественные соображения могли повлиять на представление заболевания в эпизоде.

Это оставляет данные в состоянии многих других потенциально полезных источников данных для обучения: в необходимости свежего слоя дорогого, квалифицированного человеческого надзора.

 

* Пожалуйста, обратите внимание, что эта очень короткая статья не следует обычному шаблону, и я адаптировал освещение, чтобы удовлетворить это.

Опубликовано впервые в понедельник, 17 ноября 2025 года

Писатель о машинном обучении, специалист в области синтеза человеческого изображения. Бывший руководитель исследовательского контента в Metaphysic.ai, до его распада в DNEG's Brahma.ai.
Портфолио: martinanderson.ai
Контакт: [email protected]