Andersonův úhel
Umí AI rozlišit levou a pravou stranu na medicínských snímcích?

Nová studie zjistila, že modely AI obrazů, jako je ChatGPT, mohou špatně interpretovat otočenou nebo rotovanou anatomii, což zvyšuje riziko nebezpečných chyb v diagnostice, a testy ukazují, že často selhávají v základních prostorových úsudcích na medicínských snímcích – odhadují, kde by měly být orgány, místo aby se skutečně dívaly na obraz, který jim byl předložen. Možná širšího zájmu je, že výzkum ukazuje, že tyto modely možná ani nečtou vaše nahrávané PDF soubory nebo nekoukají na vaše obrázky.
Kdokoli, kdo pravidelně nahrává data, jako je obsah PDF, do předního jazykového modelu, jako je ChatGPT, ví, že LLMs (Large Language Models) ne vždy nutně čtou nebo prohlíží to, co jim předkládáte; spíše velmi často dělají předpoklady o materiálu na základě toho, co jste o něm napsali v promptu, když jste ho nahráli.

Může být obtížné přesvědčit jazykový model, aby uznal, že jeho odpověď byla odvozena z předchozích znalostí, metadat nebo obecných předpokladů, místo aby byla založena na obsahu, který mu byl dán. Zdroj: https://chatgpt.com
Jedním z možných důvodů je zvýšení rychlosti odpovědi tím, že se nahrávaný materiál považuje za “nepotřebný” a spoléhá se na textový prompt, aby využil předchozích znalostí systému – a tím se vyhne nahrávání entirely a minimalizuje síťový provoz.
Jiným důvodem je úspora zdrojů (i když poskytovatelé se zdají nepravděpodobní, že by to uvedli, pokud je to pravda), kde existující metadata, která LLM extrahovala z předchozích výměn v chatu, se použijí jako základ pro další odpovědi, i když tyto výměny a metadata neobsahují dostatek informací pro tento účel.
Levá, pravá?
Jakýkoli důvod pro různorodou pozornost a schopnost soustředit se na současnou generaci LLMs, existují situace a kontexty, ve kterých je odhadování extrémně nebezpečné. Jedním z nich je, když se AI žádá o poskytování medicínských služeb, jako je screening nebo odhad rizika radiologického materiálu.
Tento týden výzkumníci z Německa a USA zveřejnili novou studii, která zkoumá účinnost čtyř předních modelů vidění-jazyka, včetně ChatGPT-4o, při určování polohy orgánů na medicínských snímcích.
Překvapivě, navzdory tomu, že reprezentují stav umění v tomto ohledu, základní modely dosahují úspěšní pouze na úrovni náhody většinu času – zřejmě proto, že nejsou schopny dostatečně oddělit své tréninkové znalosti lidské anatomie a skutečně prohlédnout obrázky, které jim byly předloženy, místo aby se uchýlili k snadnému tréninkovému předpokladu z jejich tréninkových dat.
Výzkumníci zjistili, že testované LLMs dosáhly významně lepších výsledků, když byly sekce, které měly být zváženy, označeny jinými indikátory (jako tečky a alfanumerické sekvence) a pojmenovány – a nejlépe, když nebyla zmínka o orgánech nebo anatomii zahrnuta do dotazu vůbec:

Různé úrovně úspěchu, zvyšující se, jak je modelova schopnost uchýlit se k tréninkovým datům snížena, a je nucen soustředit se na data před ním. Zdroj: https://wolfda95.github.io/your_other_left/
The paper observes*:
‘Stav umění VLMs (Vision-Language Models) již obsahuje silné předchozí anatomické znalosti vložené do svých jazykových komponent. Jinými slovy, “vědí”, kde jsou anatomické struktury typicky umístěny v standardní lidské anatomii.
‘Hypotézujeme, že VLMs často založily své odpovědi na těchto předchozích znalostech, místo aby analyzovaly skutečný obsah obrázku. Například, když se zeptají, zda je játra vpravo od žaludku, model může odpovědět kladně, aniž by prohlédl obrázek, a spoléhá se pouze na naučenou normu, že játra jsou obvykle umístěna vpravo od žaludku.
‘Takové chování by mohlo vést k kritickým chybným diagnózám v případech, kdy se skutečné pozice odchylují od typických anatomických vzorců, jako je situs inversus, post-surgické úpravy nebo tumorové přemístění.’
Aby se problém zmírnil v budoucích úsilích, autoři vyvinuli dataset navržený pro řešení tohoto problému.
Zjištění studie mohou být překvapující pro mnoho čtenářů, kteří sledovali vývoj medicínské AI, protože radiografie byla označena velmi brzy jako jedna z prací, která je nejvíce ohrožena automatizací prostřednictvím strojového učení.
Nová práce se nazývá Vaše druhá levá! Modely vidění-jazyka selhávají při určování relativních pozic v medicínských obrazech a pochází od sedmi výzkumníků z dvou fakult na Univerzitě v Ulmu a Axiom Bio v USA.
Metoda a data
Výzkumníci se snažili odpovědět na čtyři otázky: zda modely vidění-jazyka mohou správně určit relativní pozice v radiologických obrazech; zda použití vizuálních markerů zlepšuje jejich výkon v této úloze; zda se spoléhají více na předchozí anatomické znalosti než na skutečný obsah obrázku; a jak dobře zvládají relativní pozicování, když je zbaveny jakéhokoli medicínského kontextu.
K tomuto účelu vytvořili Medical Imaging Relative Positioning (MIRP) dataset.
Ačkoli většina existujících vizuálních otázek a odpovědí pro CT nebo MRI řezy zahrnuje anatomické a lokalizační úkoly, tyto starší sbírky přehlížejí základní výzvu určení relativních pozic, což mnoho úkolů činí řešitelnými pomocí předchozích medicínských znalostí.
MIRP je navržen tak, aby řešil tuto výzvu testováním relativních pozic mezi anatomickými strukturami, hodnocení dopadu vizuálních markerů a aplikací náhodných rotací a otočení, aby se zabránilo závislosti na naučených normách. Dataset se zaměřuje na abdominální CT řezy kvůli jejich složitosti a prevalenci v radiologii.
MIRP obsahuje stejný počet ano a ne odpovědí, s anatomickými strukturami v každé otázce volitelně označenými pro jasnost.
Byly testovány tři typy vizuálních markerů: černá čísla v bílém poli; černá písmena v bílém poli; a červená a modrá tečka:

Různé vizuální markery používané v MIRP. Zdroj: https://arxiv.org/pdf/2508.00549
Sbírka byla získána z existujících Beyond the Cranial Vault (BTCV) a Abdominal Multi-Organ Segmentation (AMOS) datasetů.

Anotované řezy z datasetu AMOS. Zdroj: https://arxiv.org/pdf/2206.08023
TotalSegmentator projekt byl použit k extrahování anatomických plochých obrazů z volumetrických dat:

Některé z 104 anatomických struktur dostupných v TotalSegmentatoru. Zdroj: https://arxiv.org/pdf/2208.05868
Axial image slices byly poté získány pomocí SimpleITK frameworku.
The ‘challenge’ image locations had to be at least 50px apart, and to have a size at least double that of the markers, in order to generate question/answer pairs.
Testy
The four vision-language models tested were GPT-4o; Llama3.2; Pixtral; and DeepSeek’s JanusPro.
Výzkumníci testovali každou ze svých čtyř výzkumných otázek, s první (Q1) ‘Můžou současné špičkové VLMs přesně určit relativní pozice v radiologických obrazech? Pro tuto otázku testovali modely na obyčejných, otočených nebo rotovaných CT řezech pomocí standardního formátu otázky, jako je Je levá ledvina pod žaludkem?.
Výsledky (zobrazené níže) ukázaly přesnost kolem 50 procent napříč všemi modely, ukazující výkon na úrovni náhody a neschopnost spolehlivě posoudit relativní pozice bez vizuálních markerů:

Průměrná přesnost pro všechny experimenty pomocí image-based evaluation na MIRP benchmarku (RQ1–RQ3) a ablation datasetu (AS).
Pro test, zda vizuální markery mohou pomoci modelům vidění-jazyka určit relativní pozice v radiologických obrazech, studie opakovala experimenty pomocí CT řezů anotovaných písmeny, čísly nebo červenými a modrými tečkami; a zde byl formát otázky upraven tak, aby odkazoval na tyto markery – například Je levá ledvina (A) pod žaludkem (B)? nebo Je levá ledvina (červená) pod žaludkem (modrá)?.
Výsledky ukázaly malé zlepšení přesnosti pro GPT-4o a Pixtral, když byly použity písmenné nebo číselné markery, zatímco JanusPro a Llama3.2 viděly málo nebo žádné zlepšení, naznačující, že markery samotné nemusí být dostatečné pro významné zlepšení výkonu.

Přesnost pro všechny experimenty pomocí image-based evaluation. Pro RQ2, RQ3 a AS jsou výsledky zobrazeny s nejlepšími markerovými typy pro každý model: písmena pro GPT-4o a červené-modré tečky pro Pixtral, JanusPro a Llama3.4.
Pro třetí otázku, Do VLMs upřednostňují předchozí anatomické znalosti před vizuálním vstupem při určování relativních pozic v radiologických obrazech?, autoři zkoumali, zda modely vidění-jazyka spoléhají více na předchozí anatomické znalosti než na vizuální důkazy při určování relativních pozic v radiologických obrazech.
Když byly testovány na otočených nebo rotovaných CT řezech, GPT-4o a Pixtral často produkovaly odpovědi konzistentní se standardními anatomickými pozicemi, místo aby odrážely, co bylo ukázáno na obrázku, s GPT-4o dosahujícím přes 75 procent přesnosti na anatomickém hodnocení, ale pouze na úrovni náhody na image-based evaluation.
Odstranění anatomických termínů z promptů a použití pouze vizuálních markerů donutilo modely spoléhat se na obsah obrázku, vedoucí k výrazným ziskům, s GPT-4o překračujícím 85 procent přesnosti s písmennými markery a Pixtral přes 75 procent s tečkami.

Srovnání čtyř modelů vidění-jazyka při určování relativních pozic anatomických struktur v medicínských obrazech – klíčový požadavek pro klinické použití. Výkon je na úrovni náhody s obyčejnými obrázky (RQ1) a ukazuje pouze malé zlepšení s vizuálními markery (RQ2). Když jsou anatomické názvy odstraněny a modely musí se spoléhat pouze na markery, GPT-4o a Pixtral dosahují podstatných zlepšení přesnosti (RQ3). Výsledky jsou zobrazeny pomocí nejlepších markerových typů pro každý model.
To naznačuje, že zatímco oba modely mohou provádět úlohu pomocí image dat, tendenci defaultovat na naučené anatomické předpovědi, když jsou jim dány anatomické názvy – vzorec, který není jasně pozorován u JanusPro nebo Llama3.2.
JanusPro a zejména Llama3.2 bojovali i v tomto zjednodušeném nastavení, ukazující základní slabiny v relativním pozicování, které nejsou omezeny na medicínské obrazy.
Autoři pozorují, že GPT-4o dosáhl nejlepších výsledků s písmennými markery, zatímco Pixtral, JanusPro a Llama3.2 dosáhly vyšších skórů s červenými-modrými tečkami. GPT-4o byl celkovým nejlepším performerem, s Pixtral vedoucím mezi otevřenými modely.
Závěr
Z osobní stránky mě tato práce zaujala nejen pro její medicínský význam, ale také proto, že zdůrazňuje jednu z nejvíce podhodnocených a základních nedostatků současné vlny SOTA LLMs – že, pokud je to možné, a pokud nepředložíte materiál pečlivě, ne budou číst texty, které nahráváte, nebo prohlížet obrázky, které jim předkládáte.
Dále studie ukazuje, že pokud váš textový prompt vysvětluje, co je sekundární materiál, LLM bude mít tendenci jej považovat za “teleologický” příklad a bude předpokládat mnoho věcí o něm na základě předchozích znalostí, místo aby studoval a zvažoval, co jste předložili.
Účinně, v tomto stavu věcí, VLMs budou mít velké potíže s identifikací “aberrantního” materiálu – jedné z nejzákladnějších dovedností v diagnostické medicíně. Zatímco je možné obrátit logiku a mít systém, který hledá outliers místo in-distribution výsledků, model by potřeboval výjimečnou kuraci, aby se zabránilo zahlcení signálu irelevantními nebo falešnými příklady.
* Inline citace byly vynechány, protože neexistuje žádný elegantní způsob, jak je zahrnout jako hypertextové odkazy. Prosím, odkážete se na původní článek.
Poprvé zveřejněno v pondělí, 4. srpna 2025












