Andersons vinkel
AI har svårt att skilja vänster från höger på medicinska bilder

En ny studie visar att AI-bildmodeller som ChatGPT kan missförstå omvänd eller roterad anatomi, vilket ökar risken för farliga fel i diagnosen, med tester som visar att de ofta misslyckas med grundläggande rumslig resonemang i medicinska bilder – gissar var organen ska vara, snarare än att faktiskt titta på bilden. Kanske av större intresse, visar forskningen att dessa modeller kanske inte läser din uppladdade PDF-filer eller tittar på dina bilder alls.
Den som har uppladdat data, såsom PDF-innehåll, till en ledande språkmodell som ChatGPT, vet att LLM inte alltid nödvändigtvis läser eller granskar det du presenterar för dem; snarare gör de ofta antaganden om materialet, baserat på vad du skrev om det i din prompt när du uppladdade det.

Det kan vara svårt att övertyga en språkmodell om att dess svar var baserat på tidigare kunskap, metadata eller allmänna antaganden snarare än på innehållet som gavs till den. Källa: https://chatgpt.com
En möjlig anledning till detta är att öka hastigheten på svaret genom att betrakta det uppladdade materialet som “överflödigt” och förlita sig på text-prompten för att dra nytta av systemets tidigare kunskap – och på så sätt undvika uppladdningen helt och minska nätverkstrafiken.
En annan anledning är resursbesparing (även om leverantörer verkar osannolika att avslöja detta, om det är sant), där befintlig metadata som LLM extraherade från tidigare utbyten i chatten används som grund för ytterligare svar, även när dessa utbyten och den metadata som inte innehåller tillräcklig information för att tjäna detta syfte.
Vänster. Höger?
Oavsett anledningen till den varierande uppmärksamhetsförmågan och fokuseringsförmågan hos den nuvarande generationen LLM, finns det situationer och sammanhang där gissning är extremt farlig. En av dessa är när AI i fråga begärs att tillhandahålla medicinska tjänster som screening eller riskbedömning av radiologiskt material.
Denna vecka släppte forskare från Tyskland och USA en ny forskningsstudie som undersöker effektiviteten hos fyra ledande vision-språkmodeller, inklusive ChatGPT-4o, när de tillfrågas om att identifiera organens läge i medicinska bilder.
Förvånansvärt, trots att de representerar den senaste utvecklingen inom detta område, uppnår basmodellerna ingen högre framgångsgrad än ren chans de flesta gångerna – tydligen för att de inte kan koppla loss sin tränade kunskap om mänsklig anatomi tillräckligt och faktiskt titta på de bilder som presenteras för dem, snarare än att nå efter en lätt tränad prior från deras träningsdata.
Forskarna fann att LLM-testerna fungerade betydligt bättre när de sektioner som skulle beaktas var markerade med andra indikatorer (såsom punkter och alfanumeriska sekvensindikatorer) samt namngivna – och bäst av allt när ingen nämnande av organ eller anatomi ingick i frågan alls:

Varierande framgångsgrader, ökande allteftersom modellens förmåga att lita på tränad data minskar, och den tvingas koncentrera sig på data framför den. Källa: https://wolfda95.github.io/your_other_left/
The paper observerar*:
‘State-of-the-art VLMs already possess strong prior anatomical knowledge embedded within their language components. In other words, they “know” where anatomical structures are typically located in standard human anatomy.
‘We hypothesize that VLMs often base their answers on this prior knowledge rather than analyzing the actual image content. For example, when asked whether the liver is to the right of the stomach, a model might answer affirmatively without inspecting the image, relying solely on the learned norm that the liver is usually located to the right of the stomach.
‘Such behavior could lead to critical misdiagnoses in cases where the actual positions deviate from typical anatomical patterns, such as in situs inversus, post-surgical alterations, or tumor displacement.’
För att mildra problemet i framtida ansträngningar har författarna utvecklat en dataset som är utformad för att ta itu med detta problem.
Studiens resultat kan vara förvånande för många läsare som har följt utvecklingen av medicinsk AI, eftersom radiografi var utmärkt tidigt som en av de jobb som är mest utsatta för att automatiseras genom maskinlärning.
The nya arbetet heter Your other Left! Vision-Language Models Fail to Identify Relative Positions in Medical Images, och kommer från sju forskare på två fakulteter vid Ulm University, och Axiom Bio i USA.
Metod och data
Forskarna satte ut för att besvara fyra frågor: om state-of-the-art vision-språkmodeller kan korrekt bestämma relativ position i radiologiska bilder; om användningen av visuella markörer förbättrar deras prestanda i denna uppgift; om de förlitar sig mer på tidigare anatomi-kunskap än på den faktiska bildinnehållet; och hur väl de hanterar relativ positionering när de berövas all medicinsk kontext.
För detta ändamål skapade de Medical Imaging Relative Positioning (MIRP) dataset.
Även om de flesta befintliga visuella frågesvarsbenchmark för CT- eller MRI-skivor innehåller anatomi- och lokaliseringsuppgifter, förbiser dessa äldre samlingar den centrala utmaningen att bestämma relativa positioner, vilket lämnar många uppgifter som kan lösas med hjälp av tidigare medicinsk kunskap ensam.
MIRP är utformad för att ta itu med detta genom att testa relativ positionering mellan anatominnehåll, utvärdera effekten av visuella markörer och applicera slumpmässiga rotationer och vändningar för att blockera tillit till inlärda normer. Datasetet fokuserar på abdominala CT-skivor, på grund av deras komplexitet och förekomst i radiologi.
MIRP innehåller ett lika stort antal ja och nej svar, med de anatominnehåll i varje fråga valfritt markerade för tydlighet.
Tre typer av visuella markörer testades: svarta siffror i en vit ruta; svarta bokstäver i en vit ruta; och en röd och en blå punkt:

De olika visuella markörerna som används i MIRP. Källa: https://arxiv.org/pdf/2508.00549
Samlingen hämtades från de befintliga Beyond the Cranial Vault (BTCV) och Abdominal Multi-Organ Segmentation (AMOS) dataset.

Annoterade skivor från AMOS-dataset. Källa: https://arxiv.org/pdf/2206.08023
TotalSegmentator-projektet användes för att extrahera anatomiska platta bilder från volymetriska data:

Några av de 104 anatominnehåll som finns tillgängliga i TotalSegmentator. Källa: https://arxiv.org/pdf/2208.05868
Axiala bildskivor erhölls sedan med SimpleITK-ramverket.
The ‘challenge’ image locations had to be at least 50px apart, and to have a size at least double that of the markers, in order to generate question/answer pairs.
Tester
De fyra vision-språkmodellerna som testades var GPT-4o; Llama3.2; Pixtral; och DeepSeek’s JanusPro.
Forskarna testade var och en av sina fyra forskningsfrågor i tur och ordning, med den första (Q1) som var ‘Kan nuvarande toppmodeller av VLM korrekt bestämma relativ position i radiologiska bilder? För denna undersökning testade forskarna modellerna på vanliga, roterade eller vända CT-skivor med en standardfrågeformat, såsom Är vänster njure under magen?.
Resultaten (visade nedan) visade noggrannheter nära 50 procent över alla modeller, vilket indikerar prestanda på chansnivå, och en oförmåga att tillförlitligt bedöma relativ position utan visuella markörer:

Genomsnittlig noggrannhet för alla experiment med bildbaserad utvärdering på MIRP-benchmarken (RQ1–RQ3) och ablationsdataset (AS).
För att testa om visuella markörer kunde hjälpa vision-språkmodeller att bestämma relativ position i radiologiska bilder, upprepade studien experimenten med CT-skivor annoterade med bokstäver, siffror eller röda och blå punkter; och här, justerades frågeformatet för att hänvisa till dessa markörer – till exempel, Är vänster njure (A) under magen (B)? eller Är vänster njure (röd) under magen (blå)?.
Resultaten visade små noggrannhetsvinster för GPT-4o och Pixtral när bokstäver eller siffror användes som markörer, medan JanusPro och Llama3.2 såg liten eller ingen fördel, vilket tyder på att markörer ensamma kanske inte räcker för att betydligt förbättra prestanda.

Noggrannhet för alla experiment med bildbaserad utvärdering. För RQ2, RQ3 och AS visas resultaten med den bäst presterande markörtypen för varje modell: bokstäver för GPT-4o, och röd-blå punkter för Pixtral, JanusPro och Llama3.4.
För att besvara den tredje frågan, Do VLMs prioritize prior anatomical knowledge over visual input when determining relative positions in radiological images?, undersökte författarna om vision-språkmodeller förlitar sig mer på tidigare anatomi-kunskap än på visuell inmatning när de bestämmer relativ position i radiologiska bilder.
När de testades på roterade eller vända CT-skivor producerade GPT-4o och Pixtral ofta svar som var förenliga med standardanatomiska positioner, snarare än vad som visas i bilden, med GPT-4o som uppnådde över 75 procents noggrannhet på anatomi-baserad utvärdering, men endast chansnivåprestanda på bildbaserad utvärdering.
Att ta bort anatominnehåll från prompten och använda endast visuella markörer tvingade modellerna att förlita sig på bildinnehåll, vilket ledde till betydande vinster, med GPT-4o som översteg 85 procents noggrannhet med bokstäver som markörer, och Pixtral över 75 procent med punkter.

En jämförelse av de fyra vision-språkmodellerna i att bestämma relativ position mellan anatominnehåll i medicinska bilder – en nyckelkrav för klinisk användning. Prestanda är på chansnivå med vanliga bilder (RQ1) och visar endast mindre vinster med visuella markörer (RQ2). När anatominnehåll tas bort och modellerna måste förlita sig helt på markörerna, uppnår GPT-4o och Pixtral betydande noggrannhetsförbättringar (RQ3). Resultaten visas med varje modells bäst presterande markörtyp.
Detta tyder på att båda kan utföra uppgiften med hjälp av bilddata, men tenderar att förlita sig på inlärda anatomi-priorer när de ges anatominnehållsnamn – ett mönster som inte tydligt observeras i JanusPro eller Llama3.2.
Även om vi vanligtvis inte täcker ablationsstudier, besvarade författarna den fjärde och sista forskningsfrågan på detta sätt. Därför, för att testa relativ positioneringsförmåga utan någon medicinsk kontext, använde studien vanliga vita bilder med slumpmässigt placerade markörer och ställde enkla frågor som Är nummer 1 ovanför nummer 2?. Pixtral visade förbättrade resultat med punkter som markörer, medan de andra modellerna presterade liknande deras RQ3-poäng.
JanusPro, och särskilt Llama3.2, kämpade även i denna förenklade inställning, vilket indikerar underliggande svagheter i relativ positionering som inte är begränsade till medicinska bilder.
Författarna observerar att GPT-4o presterade bäst med bokstäver som markörer, medan Pixtral, JanusPro och Llama3.2 uppnådde högre poäng med röd-blå punkter. GPT-4o var den övergripande bästa presteraren, med Pixtral som ledde bland öppen källkodsmodeller.
Slutsats
På ett personligt plan drog denna artikel till mig inte så mycket för dess medicinska betydelse, utan för att den belyser en av de mest underrapporterade och grundläggande bristerna i den nuvarande vågen av SOTA LLM – att, om uppgiften kan undvikas, och om du inte presenterar ditt material noggrant, kommer de inte att läsa texterna du laddar upp eller granska bilderna som du presenterar för dem.
Studien indikerar dessutom att om din text-prompt på något sätt förklarar vad det sekundära inskickade materialet är, kommer LLM att tendera att behandla det som ett “teleologiskt” exempel, och kommer att anta/anta många saker om det baserat på tidigare kunskap, snarare än att studera och överväga vad du skickade in.
Effektivt, i detta skede, kommer VLM att ha svårt att identifiera “avvikande” material – en av de viktigaste färdigheterna i diagnostisk medicin. Medan det är möjligt att vända på logiken och ha ett system som letar efter avvikelser istället för in-distributionresultat, skulle modellen behöva exceptionell kurering för att undvika att överväldiga signalen med irrelevanta eller spuriösa exempel.
* Inline-citaten utelämnade, eftersom det inte finns något elegant sätt att inkludera dem som hyperlänkar. Vänligen se den ursprungliga artikeln.
Publicerad första gången måndagen den 4 augusti 2025












