Взгляд Anderson
Борьба ИИ с определением левой и правой стороны в медицинских снимках

Новое исследование показывает, что модели ИИ-изображений, такие как ChatGPT, могут неправильно интерпретировать перевернутую или повернутую анатомию, что увеличивает риск опасных ошибок в диагностике, и тесты показывают, что они часто не проходят базовую пространственную логику в медицинских снимках – угадывая, где должны находиться органы, а не фактически смотря на изображение. Возможно, более широкий интерес представляет собой тот факт, что это исследование демонстрирует, что эти модели могут не читать ваши загруженные PDF-файлы или смотреть на ваши изображения вовсе.
Каждый, кто регулярно загружал данные, такие как содержимое PDF, в ведущую языковую модель, подобную ChatGPT, знает, что модели крупномасштабного языкового моделирования (LLM) не всегда обязательно читают или изучают то, что вы им представляете; скорее, они очень часто делают предположения о материале, основанные на том, что вы написали о нем в вашем запросе, когда вы его загрузили.

Может быть сложно убедить языковую модель в том, что ее ответ был получен из предварительных знаний, метаданных или общих предположений, а не из содержимого, которое было ей дано. Source: https://chatgpt.com
Одной из возможных причин этого может быть увеличение скорости ответа за счет рассмотрения загруженного материала как “избыточного” и полагания на текстовый запрос для использования предварительных знаний системы – избегая загрузки и минимизации сетевого трафика.
Другой причиной может быть сохранение ресурсов (хотя поставщики вряд ли раскрыли бы это, если бы это было правдой), когда существующие метаданные, которые LLM извлекла из предыдущих обменов в чате, используются в качестве основы для дальнейших ответов, даже когда эти обмены и метаданные не содержат достаточно информации для этого.
Левая. Правая?
Какова бы ни была причина различной концентрации внимания и способности фокусироваться у текущего поколения LLM, есть ситуации и контексты, в которых угадывание чрезвычайно опасно. Одним из них является ситуация, когда ИИ запрашивается для предоставления медицинских услуг, таких как скрининг или оценка риска радиологического материала.
На этой неделе исследователи из Германии и США опубликовали новое исследование, в котором изучалась эффективность четырех ведущих моделей видения-языка, включая ChatGPT-4o, когда их просили определить местоположение органов в медицинских снимках.
Удивительно, но, несмотря на то, что они представляют собой состояние дел в этой области, базовые модели достигают успеха не выше случайного большинство времени – видимо, потому, что они не могут достаточно хорошо отключить свои обученные знания человеческой анатомии и фактически смотреть на изображения, представленные им, вместо того, чтобы полагаться на легкий обученный приоритет из их обучающих данных.
Исследователи обнаружили, что модели LLM, которые они протестировали, справились значительно лучше, когда разделы, которые необходимо было учитывать, были обозначены другими индикаторами (такими как точки и алфавитно-числовые последовательности) и были названы – и лучше всего, когда никаких упоминаний органов или анатомии не было включено в запрос вообще:

Уровни успеха варьируются, увеличиваясь, когда способность модели полагаться на обученные данные уменьшается, и она вынуждена сосредоточиться на данных перед ней. Source: https://wolfda95.github.io/your_other_left/
В статье отмечается*:
‘Модели видения-языка уже обладают сильными предварительными знаниями анатомии, встроенными в их языковые компоненты. Другими словами, они “знают”, где анатомические структуры обычно расположены в стандартной человеческой анатомии.
‘Мы предполагаем, что модели видения-языка часто основывают свои ответы на этих предварительных знаниях, а не анализируют фактическое содержимое изображения. Например, когда их спрашивают, находится ли печень справа от желудка, модель может ответить положительно, не осматривая изображение, полагаясь исключительно на выученный норм, что печень обычно находится справа от желудка.
‘Такое поведение может привести к критическим неправильным диагнозам в случаях, когда фактические положения отклоняются от типичных анатомических закономерностей, таких как в situs inversus, послеоперационных изменениях или смещении опухоли.’
Чтобы смягчить эту проблему в будущих усилиях, авторы разработали набор данных, предназначенный для решения этой проблемы.
Результаты исследования могут быть удивительными для многих читателей, которые следили за развитием медицинского ИИ, поскольку радиография была отмечена очень рано как одна из работ, наиболее подверженных риску автоматизации с помощью машинного обучения.
Новая работа называется Ваша другая левая! Модели видения-языка не могут определить относительные положения в медицинских изображениях, и исходит от семи исследователей из двух факультетов Ульмского университета и Axiom Bio в США.
Метод и данные
Исследователи поставили перед собой цель ответить на четыре вопроса: могут ли модели видения-языка определить относительные положения в радиологических изображениях; улучшает ли использование визуальных маркеров их производительность в этой задаче; полагаются ли они больше на предварительные анатомические знания, чем на фактическое содержимое изображения; и как хорошо они справляются с задачами относительного позиционирования, когда лишены любого медицинского контекста.
Для этого они создали набор данных Медицинское изображение относительного позиционирования (MIRP).
Хотя большинство существующих визуальных вопросов-ответов для срезов CT или MRI включают анатомические и локализационные задачи, эти старые коллекции упускают из виду основную задачу определения относительных положений, оставляя многие задачи, которые можно решить, используя предварительные медицинские знания в одиночку.
MIRP предназначен для решения этой проблемы, тестируя вопросы относительного положения между анатомическими структурами, оценивая влияние визуальных маркеров и применяя случайные повороты и перевороты для блокирования зависимости от выученных норм. Набор данных фокусируется на срезах CT брюшной полости, из-за их сложности и распространенности в радиологии.
MIRP содержит равное количество да и нет ответов, с анатомическими структурами в каждом вопросе, необязательно отмеченными для ясности.
Были протестированы три типа визуальных маркеров: черные цифры в белом ящике; черные буквы в белом ящике; и красная и синяя точка:

Различные визуальные маркеры, использованные в MIRP. Source: https://arxiv.org/pdf/2508.00549
Коллекция была получена из существующих наборов данных За пределами краниального свода (BTCV) и Сегментация множества органов брюшной полости (AMOS).

Аннотированные срезы из набора данных AMOS. Source: https://arxiv.org/pdf/2206.08023
Проект TotalSegmentator был использован для извлечения плоских анатомических изображений из объемных данных:

Некоторые из 104 анатомических структур, доступных в TotalSegmentator. Source: https://arxiv.org/pdf/2208.05868
Затем были получены аксиальные срезы изображений с помощью фреймворка SimpleITK.
Местоположения “вызывающих” изображений должны были находиться на расстоянии не менее 50 пикселей друг от друга и иметь размер не менее двойного размера маркеров, чтобы сгенерировать пары вопросов и ответов.
Тесты
Четыре модели видения-языка, которые были протестированы, были GPT-4o; Llama3.2; Pixtral; и JanusPro от DeepSeek.
Исследователи протестировали каждый из четырех исследовательских вопросов в свою очередь, с первым (Q1), который был ‘Могут ли текущие лучшие модели видения-языка точно определить относительные положения в радиологических изображениях? Для этого исследования исследователи протестировали модели на простых, повернутых или перевернутых срезах CT, используя стандартный формат вопросов, такой как Расположена ли левая почка ниже желудка?.
Результаты (показаны ниже) показали точность, близкую к 50 процентам во всех моделях, что указывает на производительность на уровне случайности и неспособность надежно судить о относительных положениях без визуальных маркеров:

Средняя точность для всех экспериментов, используя оценку на основе изображения в наборе данных MIRP (RQ1–RQ3) и наборе данных абляции (AS).
Чтобы протестировать, могут ли визуальные маркеры помочь моделям видения-языка определить относительные положения в радиологических изображениях, исследование повторно провело эксперименты, используя срезы CT, аннотированные буквами, цифрами или красными и синими точками; и здесь формат вопроса был изменен для ссылки на эти маркеры – например, Расположена ли левая почка (А) ниже желудка (Б)? или Расположена ли левая почка (красная) ниже желудка (синяя)?.
Результаты показали небольшие приросты точности для GPT-4o и Pixtral, когда использовались маркеры букв или цифр, в то время как JanusPro и Llama3.2 увидели мало или не увидели никакой пользы, что предполагает, что маркеры одни могут быть недостаточны для значительного улучшения производительности.

Точность для всех экспериментов, используя оценку на основе изображения. Для RQ2, RQ3 и AS результаты показаны с лучшим типом маркера для каждой модели: буквами для GPT-4o и красными-синими точками для Pixtral, JanusPro и Llama3.4.
Чтобы решить третий вопрос, Полагаются ли модели видения-языка больше на предварительные анатомические знания, чем на визуальный ввод, при определении относительных положений в радиологических изображениях?, авторы изучили, полагаются ли модели видения-языка больше на предварительные анатомические знания, чем на визуальные данные, при определении относительных положений в радиологических изображениях.
Когда их тестировали на повернутых или перевернутых срезах CT, GPT-4o и Pixtral часто производили ответы, согласные со стандартными анатомическими положениями, а не отражающие то, что было показано на изображении, с GPT-4o, достигающим более 75 процентов точности на анатомической оценке, но только на уровне случайности на оценке на основе изображения.
Удаление анатомических терминов из запросов и использование только визуальных маркеров заставило модели полагаться на содержимое изображения, что привело к заметным выигрышам, с GPT-4o, превышающим 85 процентов точности с маркерами букв, и Pixtral более 75 процентов с точками.

Сравнение четырех моделей видения-языка при определении относительных положений анатомических структур в медицинских изображениях – ключевой требование для клинического использования. Производительность находится на уровне случайности с простыми изображениями (RQ1) и показывает только незначительные выигрыши с визуальными маркерами (RQ2). Когда анатомические имена удаляются и модели должны полагаться исключительно на маркеры, GPT-4o и Pixtral достигают значительных улучшений точности (RQ3). Результаты показаны с использованием лучшего типа маркера для каждой модели.
Это предполагает, что, хотя обе модели могут выполнить задачу, используя данные изображения, они склонны полагаться на выученные анатомические приоритеты, когда им даны анатомические имена – закономерность, не четко наблюдаемая в JanusPro или Llama3.2.
Хотя мы обычно не освещаем исследования абляции, авторы рассмотрели четвертый и последний исследовательский вопрос таким образом. Таким образом, чтобы протестировать способность относительного позиционирования без какого-либо медицинского контекста, исследование использовало простые белые изображения с случайно размещенными маркерами и задавало простые вопросы, такие как Расположен ли номер 1 выше номера 2?. Pixtral показал улучшенные результаты с точками, в то время как другие модели показали производительность, аналогичную их результатам RQ3.
JanusPro, и особенно Llama3.2, испытывали трудности даже в этом упрощенном контексте, что указывает на основные слабости в относительном позиционировании, которые не ограничиваются медицинскими изображениями.
Авторы отмечают, что GPT-4o показал лучшую производительность с маркерами букв, в то время как Pixtral, JanusPro и Llama3.2 достигли более высоких баллов с красными-синими точками. GPT-4o был лучшим исполнителем в целом, с Pixtral, лидирующим среди открытых моделей.
Заключение
Лично для меня эта статья вызвала интерес не столько из-за ее медицинского значения, сколько потому, что она подчеркивает одну из наиболее недооцененных и фундаментальных недостатков текущей волны моделей LLM – что, если задачу можно избежать, и если вы не представите свой материал тщательно, они не прочитают тексты, которые вы загружаете, или не изучат изображения, которые вы им представляете.
Далее, исследование показывает, что, если ваш текстовый запрос каким-либо образом объясняет, что такое представленный материал, LLM склонен рассматривать его как “телеологический” пример и предполагать/предполагать многие вещи о нем на основе предварительных знаний, вместо того, чтобы изучать и учитывать то, что вы представили.
По сути, на этом этапе модели видения-языка будут иметь большие трудности с определением “аномального” материала – одного из наиболее важных навыков в диагностической медицине. Хотя возможно обратить логику и заставить систему искать аномалии вместо результатов в распределении, модель потребует исключительной кюрации, чтобы избежать перегрузки сигнала ненужными или ложными примерами.
* Внутренние цитаты опущены, поскольку нет элегантного способа включить их в качестве гиперссылок. Пожалуйста, обратитесь к исходной статье.
Опубликовано впервые в понедельник, 4 августа 2025 года












