Kąt Andersona

Trudności AI z rozróżnianiem lewej i prawej strony w badaniach medycznych

mm
Dodaj Unite.AI do preferowanych źródeł w Google
A robot doctor confused by an x-ray of a hand – ChatGPT-40 and Firefly (Oct 2024).

Naukowcy odkryli, że modele obrazowe AI, takie jak ChatGPT, mogą źle odczytywać odwróconą lub obróconą anatomię, zwiększając ryzyko niebezpiecznych błędów w diagnozie, a testy wskazują, że często nie radzą sobie z podstawowym rozumowaniem przestrzennym w badaniach medycznych – głosząc, gdzie powinny się znajdować narządy, zamiast rzeczywistego spojrzenia na obraz.

 

Osoby, które regularnie przesyłają dane, takie jak zawartość PDF, do wiodących modeli językowych, takich jak ChatGPT, wiedzą, że LLM nie zawsze koniecznie czytają lub badają to, co im się przedstawia; często robią założenia o materiale, opierając się na tym, co napisano o nim w prompcie podczas przesyłania.

Może być trudno nakłonić model językowy do przyznania, że jego odpowiedź została wygenerowana na podstawie wiedzy wcześniej nabytej, metadanych lub ogólnych założeń, a nie na podstawie zawartości, której został przedstawiony. Źródło: https://chatgpt.com

Może być trudno nakłonić model językowy do przyznania, że jego odpowiedź została wygenerowana na podstawie wiedzy wcześniej nabytej, metadanych lub ogólnych założeń, a nie na podstawie zawartości, której został przedstawiony. Źródło: https://chatgpt.com

Jednym z powodów może być zwiększenie szybkości odpowiedzi poprzez uznanie przesłanych materiałów za “nadmierne” i poleganie na tekście-prompt, aby skorzystać z wcześniej nabytej wiedzy – unikając przesyłania i minimalizując ruch sieciowy.

Inne mogą być zachowaniem zasobów (chociaż dostawcy niechętnie ujawniają to, jeśli jest to prawda), gdzie istniejące metadane, które LLM wyodrębniły z poprzednich wymian w czacie, są używane jako podstawa do dalszych odpowiedzi, nawet wtedy, gdy te wymiany i metadane nie zawierają wystarczającej ilości informacji do tego celu.

Left. Right?

Niezależnie od powodu zmiennej uwagi i zdolności koncentracji bieżącej generacji LLM, istnieją sytuacje i konteksty, w których zgadywanie jest niezwykle niebezpieczne. Jednym z nich jest, gdy AI jest proszony o świadczenie usług medycznych, takich jak przesiewanie lub szacowanie ryzyka materiału radiologicznego.

W tym tygodniu naukowcy z Niemiec i USA opublikowali nowe badanie, które bada skuteczność czterech wiodących modeli językowo-wizualnych, w tym ChatGPT-4o, w identyfikowaniu położenia narządów w badaniach medycznych.

Zaskakująco, pomimo reprezentowania stanu sztuki w tym zakresie, modele podstawowe osiągają nie wyższą szybkość powodzenia niż czysty przypadek większości czasu – najwyraźniej dlatego, że nie są w stanie oddzielić swojej wiedzy anatomicznej od wiedzy wcześniej nabytej i spojrzeć na przedstawione im obrazy, zamiast sięgać po łatwą wiedzę wcześniej nabytą.

Badacze stwierdzili, że LLM testowane radziły sobie znacznie lepiej, gdy sekcje do rozważenia były oznaczone innymi wskaźnikami (takimi jak kropki i sekwencje alfanumeryczne) oraz nazwane – i najlepiej, gdy nie było żadnej wzmianki o narządach lub anatomii w pytaniu w ogóle:

Różne poziomy powodzenia, zwiększające się wraz ze zmniejszaniem się zdolności modelu do odwoływania się do wiedzy wcześniej nabytej i zmuszaniem go do koncentrowania się na danych przed nim. Źródło: https://wolfda95.github.io/your_other_left/

Różne poziomy powodzenia, zwiększające się wraz ze zmniejszaniem się zdolności modelu do odwoływania się do wiedzy wcześniej nabytej i zmuszaniem go do koncentrowania się na danych przed nim. Źródło: https://wolfda95.github.io/your_other_left/

The paper observes*:

‘Modele językowo-wizualne już posiadają silną wiedzę anatomiczną wbudowaną w swoje składniki językowe. Innymi słowy, “wiedzą”, gdzie struktury anatomiczne są zwykle zlokalizowane w standardowej anatomii ludzkiej.

‘Przypuszczamy, że VLM często opierają swoje odpowiedzi na tej wiedzy wcześniej nabytej, zamiast analizować rzeczywistą zawartość obrazu. Na przykład, gdy pytamy, czy wątroba jest po prawej stronie żołądka, model może odpowiedzieć twierdząco, nie oglądając obrazu, polegając wyłącznie na nabytej normie, że wątroba jest zwykle zlokalizowana po prawej stronie żołądka.

‘Taka zachowanie mogłoby prowadzić do krytycznych błędów diagnostycznych w przypadkach, w których rzeczywiste położenia odbiegają od typowych wzorców anatomicznych, takich jak w situs inversus, zmiany pooperacyjne lub przesunięcia guza.’

Aby złagodzić problem w przyszłych wysiłkach, autorzy opracowali zestaw danych zaprojektowany w celu rozwiązania tego problemu.

Wyniki badania mogą być zaskakujące dla wielu czytelników, którzy śledzili rozwój sztucznej inteligencji medycznej, ponieważ radiografia została wskazana bardzo wcześnie jako jeden z zawodów, które są najbardziej narażone na automatyzację za pomocą uczenia maszynowego.

The nowa praca nosi tytuł Twoja inna lewa! Modele językowo-wizualne nie potrafią określić względnych położeń w obrazach medycznych i pochodzi od siedmiu naukowców z dwóch wydziałów Uniwersytetu w Ulm i Axiom Bio w USA.

Metoda i dane

Badacze postawili sobie za cel odpowiedzieć na cztery problemy: czy wiodące modele językowo-wizualne mogą poprawnie określić względne położenia w obrazach radiologicznych; czy użycie wskaźników wizualnych poprawia ich wydajność w tym zadaniu; czy polegają bardziej na wiedzy anatomicznej wcześniej nabytej niż na rzeczywistej zawartości obrazu; i jak dobrze radzą sobie z zadaniami względnego położenia, gdy pozbawione są jakiegokolwiek kontekstu medycznego.

W tym celu opracowali zestaw danych Medical Imaging Relative Positioning (MIRP).

Chociaż większość istniejących benchmarków pytań wizualnych dla plasterków CT lub MRI obejmuje zadania anatomiczne i lokalizacyjne, te starsze kolekcje pomijają podstawowe wyzwanie określania względnych położeń, pozostawiając wiele zadań, które można rozwiązać za pomocą wiedzy medycznej wcześniej nabytej.

MIRP został zaprojektowany w celu rozwiązania tego problemu, testując pytania o względne położenia między strukturami anatomicznymi, oceniając wpływ wskaźników wizualnych i stosując losowe obroty i odwrócenia, aby zablokować poleganie na normach wcześniej nabytych. Zestaw danych koncentruje się na plasterkach CT jamy brzusznej ze względu na ich złożoność i powszechność w radiologii.

MIRP zawiera równą liczbę tak i nie odpowiedzi, a struktury anatomiczne w każdym pytaniu są opcjonalnie oznaczone dla wyjaśnienia.

Przetestowano trzy rodzaje wskaźników wizualnych: czarne numery w białym polu; czarne litery w białym polu; i czerwony i niebieski punkt:

Różne wskaźniki wizualne użyte w MIRP. Źródło: https://arxiv.org/pdf/2508.00549

Różne wskaźniki wizualne użyte w MIRP. Źródło: https://arxiv.org/pdf/2508.00549

Zbiór został pozyskany z istniejących zestawów danych Beyond the Cranial Vault (BTCV) i Abdominal Multi-Organ Segmentation (AMOS).

Annotowane plasterki z zestawu danych AMOS. Źródło: https://arxiv.org/pdf/2206.08023

Annotowane plasterki z zestawu danych AMOS. Źródło: https://arxiv.org/pdf/2206.08023

Projekt TotalSegmentator został użyty do wyodrębnienia płaskich obrazów anatomicznych z danych wielowymiarowych:

Niektóre z 104 struktur anatomicznych dostępnych w TotalSegmentator. Źródło: https://arxiv.org/pdf/2208.05868

Niektóre z 104 struktur anatomicznych dostępnych w TotalSegmentator. Źródło: https://arxiv.org/pdf/2208.05868

Plasterki obrazu osiowego zostały następnie uzyskane za pomocą frameworka SimpleITK.

Lokalizacje “wyzwań” musiały być oddalone o co najmniej 50 pikseli i mieć rozmiar co najmniej dwukrotnie większy niż wskaźniki, aby wygenerować pary pytań i odpowiedzi.

Testy

Cztery testowane modele językowo-wizualne to GPT-4o; Llama3.2; Pixtral; i DeepSeek’s JanusPro.

Badacze przetestowali każde ze swoich czterech pytań badawczych z kolei, a pierwsze (Q1) było ‘Czy bieżące topowe modele językowo-wizualne mogą poprawnie określić względne położenia w obrazach radiologicznych? Dla tego pytania badacze przetestowali modele na zwykłych, odwróconych lub obróconych plasterkach CT, używając standardowego formatu pytań, takiego jak Czy lewa nerka jest poniżej żołądka?.

Wyniki (pokazane poniżej) wykazały dokładności w pobliżu 50 procent we wszystkich modelach, wskazując na poziom losowości i niezdolność do niezawodnego osądu względnych położeń bez wskaźników wizualnych:

Średnia dokładność wszystkich eksperymentów przy użyciu oceny opartej na obrazie w benchmarku MIRP (RQ1–RQ3) i zestawie danych ablacjacji (AS).

Średnia dokładność wszystkich eksperymentów przy użyciu oceny opartej na obrazie w benchmarku MIRP (RQ1–RQ3) i zestawie danych ablacjacji (AS).

Aby przetestować, czy wskaźniki wizualne mogą pomóc modelom językowo-wizualnym w określaniu względnych położeń w obrazach radiologicznych, badanie powtórzono z użyciem plasterków CT z adnotacjami liter, numerów lub czerwonych i niebieskich punktów; i tutaj format pytań został dostosowany do odniesienia tych wskaźników – na przykład, Czy lewa nerka (A) jest poniżej żołądka (B)? lub Czy lewa nerka (czerwona) jest poniżej żołądka (niebieska)?.

Wyniki wykazały niewielkie zyski dokładności dla GPT-4o i Pixtral, gdy użyto wskaźników liter lub numerów, podczas gdy JanusPro i Llama3.2 nie wykazały znaczących korzyści, co sugeruje, że wskaźniki same mogą nie być wystarczające, aby znacząco poprawić wydajność.

Dokładność wszystkich eksperymentów przy użyciu oceny opartej na obrazie. Dla RQ2, RQ3 i AS wyniki są pokazane z najlepszym rodzajem wskaźnika dla każdego modelu: litery dla GPT-4o i czerwono-niebieskie punkty dla Pixtral, JanusPro i Llama3.4.

Dokładność wszystkich eksperymentów przy użyciu oceny opartej na obrazie. Dla RQ2, RQ3 i AS wyniki są pokazane z najlepszym rodzajem wskaźnika dla każdego modelu: litery dla GPT-4o i czerwono-niebieskie punkty dla Pixtral, JanusPro i Llama3.4.

Aby rozwiązać trzecie pytanie, Czy modele językowo-wizualne priorytetowo traktują wiedzę anatomiczną wcześniej nabytą nad wejściem wizualnym przy określaniu względnych położeń w obrazach radiologicznych?, autorzy sprawdzili, czy modele językowo-wizualne polegają bardziej na wiedzy anatomicznej wcześniej nabytej niż na dowodach wizualnych przy określaniu względnych położeń w obrazach radiologicznych.

Gdy przetestowano je na odwróconych lub obróconych plasterkach CT, GPT-4o i Pixtral często produkowały odpowiedzi zgodne ze standardowymi położeniami anatomicznymi, zamiast odzwierciedlać to, co było pokazane na obrazie, z GPT-4o osiągając ponad 75 procent dokładności w ocenie opartej na anatomii, ale tylko poziom losowości w ocenie opartej na obrazie.

Usunięcie terminów anatomicznych z podpowiedzi i użycie tylko wskaźników wizualnych zmusiło modele do polegania na zawartości obrazu, prowadząc do znaczących zysków, z GPT-4o przekraczając 85 procent dokładności z wskaźnikami liter, a Pixtral ponad 75 procent z punktami.

Porównanie czterech modeli językowo-wizualnych w określaniu względnych położeń struktur anatomicznych w obrazach medycznych – kluczowy wymóg dla użycia klinicznego. Wydajność jest na poziomie losowości z zwykłymi obrazami (RQ1) i pokazuje tylko niewielkie zyski z wskaźnikami wizualnymi (RQ2). Gdy nazwy anatomiczne są usunięte i modele muszą polegać wyłącznie na wskaźnikach, GPT-4o i Pixtral osiągają znaczące poprawy dokładności (RQ3). Wyniki są pokazane z najlepszym rodzajem wskaźnika dla każdego modelu.

Porównanie czterech modeli językowo-wizualnych w określaniu względnych położeń struktur anatomicznych w obrazach medycznych – kluczowy wymóg dla użycia klinicznego. Wydajność jest na poziomie losowości z zwykłymi obrazami (RQ1) i pokazuje tylko niewielkie zyski z wskaźnikami wizualnymi (RQ2). Gdy nazwy anatomiczne są usunięte i modele muszą polegać wyłącznie na wskaźnikach, GPT-4o i Pixtral osiągają znaczące poprawy dokładności (RQ3). Wyniki są pokazane z najlepszym rodzajem wskaźnika dla każdego modelu.

To sugeruje, że chociaż oba mogą wykonywać to zadanie przy użyciu danych obrazu, tendencja do polegania na wiedzy anatomicznej wcześniej nabytej, gdy podane są nazwy anatomiczne, nie jest wyraźnie obserwowana w JanusPro lub Llama3.2.

Chociaż zwykle nie pokrywamy badań ablacjacji, autorzy rozwiązywali czwarte i ostatnie pytanie badawcze w ten sposób. Dlatego, aby przetestować zdolność do określania względnych położeń bez żadnego kontekstu medycznego, badanie użyło zwykłych białych obrazów z losowo umieszczonymi wskaźnikami i zadawało proste pytania, takie jak Czy numer 1 jest powyżej numeru 2?. Pixtral pokazał poprawione wyniki z punktami, podczas gdy inne modele radziły sobie podobnie do swoich wyników RQ3.

JanusPro, a szczególnie Llama3.2, miał trudności nawet w tym uproszczonym ustawieniu, wskazując na podstawowe słabości w określaniu względnych położeń, które nie są ograniczone do obrazów medycznych.

Autorzy zauważają, że GPT-4o radził sobie najlepiej z wskaźnikami liter, podczas gdy Pixtral, JanusPro i Llama3.2 osiągały lepsze wyniki z czerwono-niebieskimi punktami. GPT-4o był najlepszym wykonawcą, a Pixtral liderem wśród modeli open-source.

Wnioski

Z osobistej perspektywy, ten artykuł zainteresował mnie nie tyle ze względu na jego znaczenie medyczne, ale dlatego, że podkreśla jeden z najmniej zgłaszanych i podstawowych braków bieżącej fali modeli językowych – że, jeśli tylko można uniknąć zadania, a chyba że przedstawisz materiał starannie, nie przeczytają teksty, które przesyłasz, ani nie będą oglądać obrazów, które przedstawiasz im.

Dalej, badanie wskazuje, że jeśli Twoja podpowiedź w jakikolwiek sposób wyjaśnia, co to jest za materiał, model językowy będzie tendencja do traktowania go jako “teleologiczny” przykład i będzie przypuszczał/założenie wiele rzeczy o nim na podstawie wiedzy wcześniej nabytej, zamiast studiować i brać pod uwagę to, co przesłałeś.

Skutecznie, w tym stanie rzeczy, modele językowo-wizualne będą miały ogromne trudności z identyfikacją “odstających” materiałów – jednej z najważniejszych umiejętności w medycynie diagnostycznej. Chociaż jest możliwe, aby odwrócić logikę i mieć system, który szuka odstających wyników zamiast wyników wewnątrz rozkładu, model wymagałby wyjątkowej kuracji, aby uniknąć zdominowania sygnału przez nieistotne lub fałszywe przykłady.

 

* Przypisy wewnętrzne pominięte, ponieważ nie ma eleganckiego sposobu, aby je uwzględnić jako odnośniki. Proszę odnieść się do oryginalnego artykułu.

Pierwotnie opublikowane w poniedziałek, 4 sierpnia 2025

Pisarz specjalizujący się w dziedzinie machine learning, specjalista w dziedzinie syntezowania obrazów ludzi. Były szef działu treści badawczych w Metaphysic.ai, do czasu jego rozwiązania i połączenia z DNEG's Brahma.ai.
Portfolio site: martinanderson.ai
Contact: martin@martinanderson.ai