Погляд Anderson
Штучні інтелектуальні системи мають труднощі з визначення лівої та правої сторони в медичних зображеннях

Нове дослідження показало, що моделі штучного інтелекту, такі як ChatGPT, можуть неправильно інтерпретувати перевернуту або повернуту анатомію, що підвищує ризик небезпечних помилок у діагнозі, а результати тестів свідчать про те, що вони часто не проходять базові просторові тести в медичних зображеннях – вгадуючи, де повинні бути органи, а не фактично дивлячись на зображення. Можливо, це буде цікаво для більш широкої аудиторії, дослідження демонструє, що ці моделі можуть не читати ваші завантажені PDF-файли або дивитися на ваші зображення зовсім.
Хтось, хто регулярно завантажує дані, такі як вміст PDF, до провідної мови моделі, наприклад ChatGPT, знає, що великі мови моделі не завжди обов’язково читають або вивчають те, що ви їм надаєте; натомість вони часто роблять припущення про матеріал, засновані на тому, що ви написали про нього в своєму запиті, коли завантажили його.

Це може бути складно змусити мовну модель визнати, що її відповідь була отримана з попередніх знань, метаданих або загальних припущень, а не з вмісту, який їй був наданий. Джерело: https://chatgpt.com
Одна з можливих причин цього полягає в тому, щоб збільшити швидкість відповіді, розглядаючи завантажений матеріал як “надлишковий” і покладаючись на текст-пrompt для використання попередніх знань системи – таким чином уникнувши завантаження зовсім, і в процесі мінімізуючи мережевий трафік.
Інша причина – це збереження ресурсів (хоча постачальники навряд чи розголосять це, якщо це правда), коли існуючі метадані, які велика мова моделі витягнула з раніших обмінів у чаті, використовуються як основа для подальших відповідей, навіть якщо ці обміни та метадані не містять достатньої інформації для виконання цієї мети.
Ліворуч. Праворуч?
Незалежно від причини різної уваги та можливостей фокусування поточної генерації великих мов моделей, є ситуації та контексти, в яких вгадування надзвичайно небезпечно. Одним з таких є випадок, коли штучний інтелект запитується про надання медичних послуг, таких як скринінг або оцінка ризику радіологічного матеріалу.
Цього тижня дослідники з Німеччини та США опублікували нове дослідження, яке вивчає ефективність чотирьох провідних моделей мови та зору, включаючи ChatGPT-4o, коли їх запитують про визначення місця розташування органів у медичних зображеннях.
Дивно, що, незважаючи на те, що вони представляють стан справ у цій сфері, базові моделі не досягли вищого рівня успіху, ніж чиста випадковість більшість часу – очевидно, тому що вони не можуть достатньо відокремити свої навчені знання людської анатомії та фактично дивитися на зображення, які їм надаються, а не звертатися до легкого навченого пріоритету з їхніх навчальних даних.
Дослідники виявили, що великі мови моделей показали значно кращі результати, коли розділи, які мали бути розглянуті, позначалися іншими індикаторами (такими як крапки та алфавітно-числові послідовності) та назвами – і найкраще з усіх, коли жодної згадки про органи чи анатомію не було включено до запиту зовсім:

Різні рівні успіху, що збільшуються, коли здатність моделі звертатися до навчених даних зменшується, і вона змушена концентруватися на даних перед нею. Джерело: https://wolfda95.github.io/your_other_left/
The paper observes*:
‘Сучасні моделі мови та зору вже володіють сильними попередніми анатомічними знаннями, закладеними у своїх мовних компонентах. Інакше кажучи, вони “знають”, де анатомічні структури зазвичай розташовані в стандартній людській анатомії.
‘Ми припускаємо, що моделі мови та зору часто базують свої відповіді на цих попередніх знаннях, а не аналізують фактичний вміст зображення. Наприклад, коли їх запитують, чи знаходиться печінка праворуч від шлунка, модель може відповісти позитивно, не оглядаючи зображення, а покладаючись лише на вивчений норм, що печінка зазвичай розташована праворуч від шлунка.
‘Таке поведінка може привести до критичних неправильних діагнозів у випадках, коли фактичні положення відхиляються від типових анатомічних моделей, таких як у situs inversus, післяхірургічних змін або зміщення пухлини.’
Щоб пом’якшити проблему в майбутніх зусиллях, автори створили набір даних, призначений для вирішення цієї проблеми.
Видання дослідження може бути несподіваним для багатьох читачів, які слідкували за розвитком медичного штучного інтелекту, оскільки радіографія була відзначена дуже рано як одна з робіт, яка найбільш піддається автоматизації через машинне навчання.
The нове дослідження називається Ваш лівий! Моделі мови та зору не можуть визначити відносні положення в медичних зображеннях, і походять від семи дослідників з двох факультетів Університету Ульма та Axiom Bio в США.
Метод і дані
Дослідники поставили за мету відповісти на чотири питання: чи можуть сучасні моделі мови та зору правильно визначити відносні положення в радіологічних зображеннях; чи покращує використання візуальних маркерів їхню продуктивність у цьому завданні; чи вони покладаються більше на попередні анатомічні знання, ніж на фактичний вміст зображення; і як вони справляються з відносним позиціонуванням завдань, коли позбавлені будь-якого медичного контексту.
Для цього вони створили набір даних Медичне зображення відносного позиціонування (MIRP).
Хоча більшість існуючих візуальних питань-відповідей для зрізів КТ або МРТ включають анатомічні та локалізаційні завдання, ці старіші колекції не беруть до уваги основну проблему визначення відносних положень, залишаючи багато завдань, які можна вирішити, використовуючи попередні медичні знання самостійно.
MIRP призначений для вирішення цієї проблеми, тестуючи відносні питання положення між анатомічними структурами, оцінюючи вплив візуальних маркерів і застосовуючи випадкові оберти та повороти, щоб заблокувати залежність від вивчених норм. Набір даних фокусується на зрізах КТ живота, через їхню складність і поширеність у радіології.
MIRP містить рівну кількість так і ні відповідей, з анатомічними структурами в кожному запиті, опціонально позначеними для ясності.
Було протестовано три типу візуальних маркерів: чорні цифри у білому полі; чорні букви у білому полі; і червона та синя крапка:

Різні візуальні маркери, використані в MIRP. Джерело: https://arxiv.org/pdf/2508.00549
Збірка була отримана з існуючих наборів даних Поза краніальним склепінням (BTCV) і Абдомінальна сегментація多органів (AMOS).

Позначені зрізи з набору даних AMOS. Джерело: https://arxiv.org/pdf/2206.08023
Проект TotalSegmentator був використаний для витягування анатомічних плоских зображень з об’ємних даних:

Деякі з 104 анатомічних структур, доступних у TotalSegmentator. Джерело: https://arxiv.org/pdf/2208.05868
Затем були отримані аксіальні зрізи зображень за допомогою фреймворку SimpleITK.
Локалізації “виклику” мали бути хоча б 50 пікселів одна від одної, і мали розмір не менше подвійного розміру маркерів, щоб сформувати пару запит-відповідь.
Тести
Чотири моделі мови та зору, які були протестовані, були GPT-4o; Llama3.2; Pixtral; і DeepSeek’s JanusPro.
Дослідники протестували кожне зі своїх чотирьох дослідницьких питань по черзі, з першим (Q1) ‘Чи можуть сучасні топові моделі мови та зору точно визначити відносні положення в радіологічних зображеннях? Для цього питання дослідники протестували моделі на звичайних, повернутих або перевернутих зрізах КТ, використовуючи стандартний формат питання, такий як Чи знаходиться лівий нирка нижче шлунка?.
Результати (показані нижче) показали точність близько 50 відсотків у всіх моделей, вказуючи на виконання на рівні випадковості, і неможливість надійного судження про відносні положення без візуальних маркерів:

Середня точність усіх експериментів, використовуючи оцінку на основі зображення на бенчмарку MIRP (RQ1–RQ3) і наборі даних аบลації (AS).
Щоб протестувати, чи можуть візуальні маркери допомогти моделям мови та зору визначити відносні положення в радіологічних зображеннях, дослідження повторили експерименти, використовуючи зрізи КТ, позначені буквами, цифрами або червоними та синіми крапками; і тут запитувальний формат був змінений, щоб посилатися на ці маркери – наприклад, Чи знаходиться лівий нирка (А) нижче шлунка (Б)? або Чи знаходиться лівий нирка (червоний) нижче шлунка (синій)?.
Результати показали невеликі збільшення точності для GPT-4o і Pixtral, коли використовувалися буквені або цифрові маркери, тоді як JanusPro і Llama3.2 побачили мало або жодної вигоди, що свідчить про те, що маркери самі по собі можуть бути недостатніми для значного покращення продуктивності.

Точність усіх експериментів, використовуючи оцінку на основі зображення. Для RQ2, RQ3 і AS результати показані з найкращим виконанням маркера для кожної моделі: букви для GPT-4o, і червоні-сині крапки для Pixtral, JanusPro і Llama3.4.
Щоб відповісти на третє питання, Чи моделі мови та зору пріоритезують попередні анатомічні знання над візуальними даними при визначенні відносних положень в радіологічних зображеннях?, автори вивчили, чи моделі мови та зору покладаються більше на попередні анатомічні знання, ніж на візуальні дані при визначенні відносних положень в радіологічних зображеннях.
Коли їх тестували на повернутих або перевернутих зрізах КТ, GPT-4o і Pixtral часто давали відповіді, які були сумісні зі стандартними анатомічними положеннями, а не відображали те, що було показано на зображенні, з GPT-4o, який досяг понад 75 відсотків точності на основі анатомічних оцінок, але тільки на рівні випадковості на основі оцінки зображення.
Видалення анатомічних термінів з запитів і використання лише візуальних маркерів змусило моделі покладатися на вміст зображення, що призвело до помітних вигод, з GPT-4o, який перевищив 85 відсотків точності з буквеними маркерами, і Pixtral понад 75 відсотків з крапками.

Порівняння чотирьох моделей мови та зору при визначенні відносних положень анатомічних структур в медичних зображеннях – ключовий вимір для клінічного використання. Продуктивність знаходиться на рівні випадковості з простими зображеннями (RQ1) і показує лише незначні вигоди з візуальними маркерами (RQ2). Коли анатомічні назви видалені, і моделі повинні покладатися виключно на маркери, GPT-4o і Pixtral досягають суттєвих покращень точності (RQ3). Результати показані з найкращим виконанням маркера для кожної моделі.
Це свідчить про те, що хоча обидві можуть виконувати завдання, використовуючи дані зображення, вони схильні звертатися до вивчених анатомічних припущень, коли їм надаються анатомічні назви – закономерність, яка не спостерігається явно в JanusPro або Llama3.2.
Хоча ми зазвичай не висвітлюємо дослідження аบลації, автори відповіли на четверте і останнє дослідницьке питання саме так. Тому, щоб протестувати відносне позиціонування без будь-якого медичного контексту, дослідження використовувало прості білі зображення з випадково розміщеними маркерами і запитувало прості питання, такі як Чи знаходиться номер 1 вище номера 2?. Pixtral показав покращені результати з маркерами-крапками, тоді як інші моделі показали подібні результати до їхніх оцінок RQ3.
JanusPro, і особливо Llama3.2, боролися навіть у цьому спрощеному середовищі, вказуючи на основні слабкості відносного позиціонування, які не обмежуються медичними зображеннями.
Автори спостерігають, що GPT-4o показав найкращу продуктивність з буквеними маркерами, тоді як Pixtral, JanusPro і Llama3.2 досягли вищої продуктивності з червоніми-синіми крапками. GPT-4o був загальним переможцем, тоді як Pixtral очолив серед відкритих моделей.
Висновок
На особистій ноті, ця робота привернула мою увагу не так сильно через її медичне значення, а тому, що вона підкреслює одну з найбільш недооцінених і фундаментальних слабкостей поточної генерації моделей мови – те, що, якщо завдання можна уникнути, і якщо ви не надаєте свій матеріал ретельно, вони не прочитají тексти, які ви завантажуєте, або не розглянуть зображення, які ви їм надаєте.
Далі дослідження вказує на те, що якщо ваш текст-пrompt у будь-який спосіб пояснює, який є наданий матеріал, мова моделі буде схильна розглядати його як “телеологічний” приклад, і буде припускати/припускати багато речей про нього на основі попередніх знань, а не вивчати і розглядати те, що ви надали.
Ефектно, на цьому етапі моделі мови та зору будуть мати велику трудність у визначенні “відхильного” матеріалу – одного з найбільш важливих навичок у діагностичній медицині. Хоча можливо обернути логіку і змусити систему шукати аутлієри замість результатів у розподілі, модель потребуватиме виняткової кураторської обробки, щоб уникнути перевантаження сигналу неважливими або хибними прикладами.
* Внутрішні посилання опущені, оскільки немає елегантного способу включити їх як гіперпосилання. Будь ласка, зверніться до джерельної статті.
Опубліковано в понеділок, 4 серпня 2025 року












