Взгляд Anderson
Многолетние анонимные медицинские данные могут сейчас приводить к ошибочным диагнозам ИИ

Согласно новому исследовательскому сотрудничеству между Германией и Великобританией, анонимные записи пациентов, включённые в медицинские наборы данных ещё десятилетия назад, могут заставить ИИ‑системы, обученные на них, распознавать характеристики реального пациента спустя годы — и относиться к пациенту 2026 года так, как будто это был 2012 год (или любой другой год, когда их анонимные данные впервые попали в набор данных).
Это может означать, например, что пациент, у которого 20 лет назад фиксировалось лечение рака и который впоследствии перешёл в длительную ремиссию, теперь может быть обработан ИИ‑системой в контексте их более старой, страдающей от рака версии — логически даже повышая вероятность ложного диагноза рецидива.
Напротив, если версия данных этого пациента 2012 года отражала идеальное здоровье при рутинных осмотрах, такой оптимистичный взгляд может потенциально быть навязан более старой, текущей версии пациента, скрывая обнаружение новых состояний или проблем, требующих лечения.

Из новой статьи — иллюстрация того, как предвзятость к запоминанию может влиять на возвращающегося пациента. Модель, обученная на ранних здоровых ЭКГ Элис, назначает лишь 15 % вероятности её будущего сердечного приступа, по сравнению с 73 % для модели, которая никогда не видела её исторических записей. Источник
Сдерживание «иммиграции данных»
Сценарий становится более вероятным из‑за различных национальных и региональных директив, рекомендующих, чтобы данные пациентов для подобных целей по возможности брались из страны, в которой предполагается использовать системы, построенные на этих данных; это «локализует» пул пациентов в наборах данных и заметно повышает вероятность такого невыявленного события деанонимизации.
Следовательно, ограничение объёма доступных данных только национальным набором повышает вероятность запоминания — возможности того, что модель будет видеть одни и те же данные столько раз во время обучения, что она «зафиксируется» на этих переобученных шаблонах. Наоборот, чем больше и разнообразнее набор данных, тем вероятнее, что он будет обобщать на невидимые данные после обучения, а не запоминать конкретные точки данных или конфигурации.
Однако добавление «иностранных» медицинских данных рискует внести доказательства национальных тенденций в здравоохранении и особенностей, которые не будут применимы в стране, где развертывается обученная модель; в этом отношении, как признаёт новая статья, определённый уровень запоминания уместен и полезен, поскольку помогает модели работать в рамках наиболее вероятных общих медицинских характеристик конкретного населения.
В статье указано*:
‘[When] модели развертываются проспективно, запоминание создает специфический и недооцененный риск. Поскольку записи пациента высоко самоподобны во времени, будущая запись может выступать в качестве частичного сигнала для запомненной исторической записи, смещая предсказания модели в сторону предыдущего состояния здоровья пациента.’
Это не гипотетический сценарий. Медицинские ИИ‑модели регулярно развертываются на той же популяции, из которой были получены их обучающие данные.
‘Например, национальная программа скрининга рака молочной железы в Германии программа использует ИИ‑модель, обученную на 1,2 млн маммограмм, полученных из той же популяции скрининга, которой она теперь служит.’
‘Сравнительное развертывание происходит и в других странах, включая национальные программы скрининга рака молочной железы в Соединённом Королевстве и Швеции. ‘
‘Регулятивные рекомендации активно поддерживают это, с EU AI Act требующим, чтобы обучающие данные отражали географический и контекстный окружение предполагаемого использования (Art. 10(4)), и подобные международные рекомендации для разработки медицинского ИИ, призывающие обеспечить достаточное представление целевой популяции пациентов в обучающем наборе модели.’
Постоянная историческая катастрофа..?
Хотя статья не рассматривает этот вопрос, статистически логично, что пациенты, которые не регулярно проходили медицинские осмотры в течение жизни, и чьи анонимные записи периодически попадали в поток данных ИИ, вероятнее всего появляются в анонимных данных пациентов почти исключительно в те моменты, когда им требовалось лечение — что, в свою очередь, увеличивает шанс «переноса» давно излечённого состояния на того же пациента сейчас, поскольку записи не имеют противоположного баланса «хорошего здоровья».
Это подтверждается предыдущими исследованиями в области ‘смещение информированного присутствия’ в электронных медицинских записях, обнаружившими, что медицинские наборы данных непропорционально представляют периоды, когда пациенты больны и взаимодействуют с системой здравоохранения.
Одно исследование обнаружило, что у тяжело больных пациентов было в 5,05 раза больше дней с лабораторными данными и в 6,85 раза больше дней с назначениями лекарств, чем у самых здоровых пациентов.
В 2022 году около 76 % взрослых в США сообщали о прохождении планового осмотра в течение предыдущего года, который CDC определяет как общий физический осмотр, а не лечение конкретного заболевания; а в Европе в 2023 году многостраничный опрос выявил, что 58 % участников проходили хотя бы один профилактический осмотр, но только 15 % посещали все профилактические приёмы, считающиеся для них актуальными.
Степень воздействия
Исследование проверило эффект на четырёх крупных медицинских наборах данных, охватывающих ЭКГ‑записи, рентген грудной клетки и электронные медицинские карты; а именно, MIMIC-CXR chest X-ray database и MIMIC-IV-ED записи экстренной помощи, а также MIMIC-ECG и гораздо более крупную коллекцию ЭКГ HEEDB. Размер наборов варьировался от десятков тысяч пациентов до более чем 1,8 млн человек.
Авторы отмечают, что рассчитанный эффект значительно варьируется, при этом изменения предсказанной вероятности в некоторых случаях превышают 70 процентных пунктов:

Результаты, показывающие, как исторические данные пациента меняют последующие предсказания. Верхние панели сравнивают частоту и величину этих изменений в четырёх наборах данных; нижние панели показывают, как эффект меняется со временем с момента последней обучающей записи пациента. Значительные эффекты становятся реже со временем, но остаются обнаружимыми спустя десятилетия.
В качестве контроля исследователи случайным образом разделили модели на группы и повторили сравнение, однако это не привело к значительным изменениям в будущих предсказаниях.
Авторы отмечают, что эффект может сохраняться десятилетиями. Хотя он обычно ослабевал и становился реже по мере увеличения интервала между записями, набор данных HEEDB, содержащий ЭКГ, собранные с 1980‑х по 2025‑й годы, показал значительные изменения в предсказаниях более 25 лет после самой последней обучающей записи пациента.
Диагностический вред
Исследователи новой статьи — под названием Memorisation bias in medical AI — затем смоделировали, как запоминание может влиять на точность диагностики, когда пациенты позже сталкиваются с моделью, обученной на их ранних записях.
Будущие случаи были разделены в зависимости от того, развило ли у пациента новое состояние, отсутствующее в их исторических обучающих данных, или пациент возвращался с практически тем же состоянием здоровья.
Для новых состояний эффект оказался последовательно отрицательным: модели, ранее видевшие исторические записи пациента, демонстрировали более низкую чувствительность по ряду диагнозов, представленных в четырёх наборах данных. Это включало инфаркты и другие аномалии ЭКГ, заболевания лёгких и более широкие критические исходы.
На практике модели генерировали больше ложных отрицательных результатов, когда состояние здоровья пациента изменилось; но когда состояние пациента не изменилось, память модели о их ранних записях повышала вероятность правильного диагноза. И чувствительность, и специфичность увеличивались, потому что текущее состояние пациента напоминало состояние, уже представленное в обучающих данных.
Авторы отмечают, что это может затруднить точную оценку таких систем: если у большинства возвращающихся пациентов сохраняются те же заболевания, модель будет показывать лучшую работу на них, потенциально скрывая её более низкую чувствительность к пациентам, у которых развились новые состояния.
Средства
В качестве возможной защиты исследователи протестировали differential privacy (которая ограничивает, сколько информации о любом отдельном обучающем примере может сохраняться в модели) во время обучения.
Хотя защита отдельных записей уменьшила эффект запоминания, она не устранила его даже при самом сильном тестируемом параметре. Применение защиты на уровне пациента, охватывающее все записи одного человека, оказалось гораздо эффективнее и почти полностью устранило эффект.
Следует отметить, однако, что если набор данных был безвозвратно анонимизирован, данные пациента нельзя изолировать таким образом, чтобы такие методы были применимы; и, как наблюдают исследователи, если набор данных обучается без включённой дифференциальной приватности, membership inference attacks становятся риском; если же она включена, необходимые ресурсы для обучения заметно возрастают.
Заключение
Авторы завершают, отмечая, что хотя тревожные инциденты сейчас происходят относительно редко, в будущем это может измениться*:
‘Есть основания полагать, что количество пропущенных диагнозов, обусловленных смещением памяти, увеличится в будущем, хотя мы не тестируем это напрямую. Предыдущие исследования показали, что доля обучающих данных, которую модель запоминает, растёт с увеличением ёмкости модели [6, 7, 9, 10, 40].
‘Это вызывает обеспокоенность, учитывая, что текущая разработка AI‑моделей руководствуется «законами масштабирования» [41], которые стимулируют быстрый рост как размеров моделей, так и наборов данных в стремлении к повышению производительности.
‘По мере того как более крупные AI‑модели обучаются на исторических данных, полученных из всё более крупных популяций пациентов, абсолютное число людей, затронутых смещением памяти, вероятно, резко возрастёт, усиливая выявленные нами здесь риски.’
* Моя конверсия встроенных ссылок авторов в гиперссылки, с некоторой интерпретацией там, где точное воспроизведение невозможно или нецелесообразно.
Первый раз опубликовано в пятницу, 18 сентября 2026 г.












