Andersons vinkel

AI har svært ved at skelne mellem venstre og højre i medicinske scanninger

mm
Føj Unite.AI til dine foretrukne kilder på Google
A robot doctor confused by an x-ray of a hand – ChatGPT-40 and Firefly (Oct 2024).

En ny studie viser, at AI-billedmodeller som ChatGPT kan misfortolke flippede eller roterede anatomiske strukturer, hvilket øger risikoen for farlige fejl i diagnosen, med tests, der indikerer, at de ofte fejler grundlæggende rumlig fornuft i medicinske scanninger – gætter, hvor organerne skal være, i stedet for at se på billedet. Måske af bredere interesse viser forskningen, at disse modeller måske ikke læser dine uploaded PDF-filer eller ser på dine billeder overhovedet.

 

Enhver, der nogensinde har uploadet data, såsom PDF-indhold, til en førende sprogmodel som ChatGPT, ved, at LLM’er ikke altid nødvendigvis læser eller undersøger, hvad du præsenterer for dem; i stedet gør de ofte antagelser om materialet, baseret på, hvad du skrev om det i din prompt, da du uploaded det.

Det kan være svært at få en sprogmodel til at indrømme, at den ikke faktisk har set på indholdet, du præsenterede for den, men baserede sin besvarelse på forhåndsviden, metadata eller generelle antagelser. Kilde: https://chatgpt.com

Det kan være svært at få en sprogmodel til at indrømme, at dens besvarelse var baseret på forhåndsviden, metadata eller generelle antagelser i stedet for på indholdet, det fik. Kilde: https://chatgpt.com

En mulig årsag til dette er at øge svarets hastighed ved at betragte det uploaded materiale som ‘overflødigt’ og i stedet basere sig på tekst-prompten for at trække på systemets forhåndsviden – og undgå uploadet helt, og på den måde minimere netværkstrafik.

En anden årsag kan være ressourcebesparelse (selv om udbyderne synes usandsynlige at afsløre dette, hvis det er sandt), hvor eksisterende metadata, som LLM’en har udtrukket fra tidligere udvekslinger i chatten, bruges som grundlag for yderligere svar, selv når disse udvekslinger og det pågældende metadata ikke indeholder nok information til at kunne bruges til dette formål.

Venstre. Højre?

Uanset årsagen til den varierede opmærksomheds- og fokuserings-evne hos den nuværende generation af LLM’er, er der situationer og sammenhænge, hvor gætning er ekstremt farlig. En af disse er, når AI’en i spørgsmål bedes om at yde medicinske tjenester såsom screening eller risikovurdering af radiologisk materiale.

Denne uge offentliggjorde forskere fra Tyskland og USA en ny forskningsstudie, der undersøger effikassen af fire førende vision-sprog-modeller, herunder ChatGPT-4o, når de bedes om at identificere organernes placering i medicinske scanninger.

Overraskende, på trods af at de repræsenterer den nyeste udvikling på dette område, opnår grundmodellerne ikke en højere succesrate end ren chance det meste af tiden – åbenbart fordi de ikke kan frigøre deres trænede viden om menneskets anatomi tilstrækkeligt og faktisk kigger på billederne, der præsenteres for dem, i stedet for at nå efter en let trænet prior fra deres træningsdata.

Forskerne fandt, at LLM’erne, der blev testet, klarede sig betydeligt bedre, når de sektioner, der skulle overvejes, var markeret med andre indikatorer (såsom punkter og alfanumeriske sekvensindikatorer) samt navngivet – og bedst af alt, når der ikke var nævnt noget om organer eller anatomi i spørgsmålet overhovedet:

Varierende succesniveauer, der øges, efterhånden som modellens evne til at appellere til trænet data mindskes, og den tvinges til at koncentrere sig om dataen foran den. Kilde: https://wolfda95.github.io/your_other_left/

Varierende succesniveauer, der øges, efterhånden som modellens evne til at appellere til trænet data mindskes, og den tvinges til at koncentrere sig om dataen foran den. Kilde: https://wolfda95.github.io/your_other_left/

The paper observerer*:

‘State-of-the-art VLMs already possess strong prior anatomical knowledge embedded within their language components. In other words, they “know” where anatomical structures are typically located in standard human anatomy.

‘We hypothesize that VLMs often base their answers on this prior knowledge rather than analyzing the actual image content. For example, when asked whether the liver is to the right of the stomach, a model might answer affirmatively without inspecting the image, relying solely on the learned norm that the liver is usually located to the right of the stomach.

‘Such behavior could lead to critical misdiagnoses in cases where the actual positions deviate from typical anatomical patterns, such as in situs inversus, post-surgical alterations, or tumor displacement.’

For at afhjælpe problemet i fremtidige bestræbelser har forfatterne udviklet en dataset, der er designet til at løse dette problem.

Papirets resultater kan være overraskende for mange læsere, der har fulgt udviklingen af medicinsk AI, da radiografi blev tidligt udpeget som en af de jobs, der er mest udsat for at blive automatiseret gennem maskinlæring.

Den nye arbejde hedder Din anden venstre! Vision-sprog-modeller fejler i at identificere relative positioner i medicinske billeder og kommer fra syv forskere på to fakulteter på Ulm Universitet og Axiom Bio i USA.

Metode og Data

Forskerne satte sig for at besvare fire spørgsmål: om state-of-the-art vision-sprog-modeller kan korrekt bestemme relative positioner i radiologiske billeder; om brugen af visuelle markører forbedrer deres præstation i denne opgave; om de afhænger mere af forhåndsviden om anatomi end af den faktiske billedindhold; og hvordan godt de klarer relative positioneringsopgaver, når de berøves enhver medicinsk kontekst.

Til dette formål kuraterede de Medical Imaging Relative Positioning (MIRP) datasettet.

Selv om de fleste eksisterende visuelle spørgsmål-benchmarks for CT eller MRI-snit indeholder anatomiske og lokaliseringsopgaver, overser disse ældre samlinger den centrale udfordring ved at bestemme relative positioner, og efterlader mange opgaver, der kan løses ved hjælp af forhåndsviden om medicin alene.

MIRP er designet til at løse dette ved at teste relative positionsspørgsmål mellem anatomiske strukturer, og vurderer effekten af visuelle markører og anvender tilfældige rotationer og flips for at blokere afhængighed af lært normer. Datasettet fokuserer på abdominale CT-snit på grund af deres kompleksitet og hyppighed i radiologi.

MIRP indeholder et lige antal ja og nej svar, med de anatomiske strukturer i hvert spørgsmål valgfrit markeret for klarhed.

Der blev testet tre typer visuelle markører: sorte numre i en hvid boks; sorte bogstaver i en hvid boks; og en rød og en blå prik:

De forskellige visuelle markører, der blev brugt i MIRP. Kilde: https://arxiv.org/pdf/2508.00549

De forskellige visuelle markører, der blev brugt i MIRP. Kilde: https://arxiv.org/pdf/2508.00549

Samlingen blev hentet fra de eksisterende Beyond the Cranial Vault (BTCV) og Abdominal Multi-Organ Segmentation (AMOS) datasetter.

Annotated snit fra AMOS-datasettet. Kilde: https://arxiv.org/pdf/2206.08023

Annotated snit fra AMOS-datasettet. Kilde: https://arxiv.org/pdf/2206.08023

TotalSegmentator-projektet blev brugt til at trække anatomiske flade billeder fra volumetrisk data:

Nogle af de 104 anatomiske strukturer, der er tilgængelige i TotalSegmentator. Kilde: https://arxiv.org/pdf/2208.05868

Nogle af de 104 anatomiske strukturer, der er tilgængelige i TotalSegmentator. Kilde: https://arxiv.org/pdf/2208.05868

Axiale billedsnit blev derefter erhvervet med SimpleITK-rammen.

De ‘udfordrings’-billeddata skulle være mindst 50px fra hinanden og have en størrelse, der er mindst dobbelt så stor som markørerne, for at generere spørgsmål/svar-par.

Tests

De fire vision-sprog-modeller, der blev testet, var GPT-4o; Llama3.2; Pixtral; og DeepSeek’s JanusPro.

Forskerne testede hver af deres fire forsknings-spørgsmål i tur, med det første (Q1) være ‘Kan nuværende top-tier VLM’er korrekt bestemme relative positioner i radiologiske billeder? For dette spørgsmål testede forskerne modellerne på almindelige, roterede eller flippede CT-snit ved hjælp af en standard spørgsmålsformat, såsom Er venstre nyre under maven?.

Resultaterne (vist nedenfor) viste nøjagtigheder nær 50 procent på tværs af alle modeller, hvilket indikerer en præstation på niveau med tilfældighed, og en manglende evne til pålideligt at dømme relative positioner uden visuelle markører:

Gennemsnitlig nøjagtighed for alle eksperimenter ved hjælp af billedbaseret evaluering på MIRP-benchmarket (RQ1–RQ3) og ablations-datasettet (AS).

Gennemsnitlig nøjagtighed for alle eksperimenter ved hjælp af billedbaseret evaluering på MIRP-benchmarket (RQ1–RQ3) og ablations-datasettet (AS).

For at teste, om visuelle markører kan hjælpe vision-sprog-modellerne med at bestemme relative positioner i radiologiske billeder, gentog studiet eksperimenterne ved hjælp af CT-snit annoteret med bogstaver, numre eller røde og blå prikker; og her var spørgsmålsformatet tilpasset til at reference disse markører – for eksempel, Er venstre nyre (A) under maven (B)? eller Er venstre nyre (rød) under maven (blå)?.

Resultaterne viste små nøjagtighedsgevinster for GPT-4o og Pixtral, når bogstaver eller numre-markører blev brugt, mens JanusPro og Llama3.2 så lidt eller ingen fordel, hvilket tyder på, at markører alene måske ikke er nok til at betydeligt forbedre præstationen.

Nøjagtighed for alle eksperimenter ved hjælp af billedbaseret evaluering. For RQ2, RQ3 og AS vises resultaterne med den bedst fungerende markørtype for hver model: bogstaver for GPT-4o og rød-blå prikker for Pixtral, JanusPro og Llama3.4.

Nøjagtighed for alle eksperimenter ved hjælp af billedbaseret evaluering. For RQ2, RQ3 og AS vises resultaterne med den bedst fungerende markørtype for hver model: bogstaver for GPT-4o og rød-blå prikker for Pixtral, JanusPro og Llama3.4.

For at besvare det tredje spørgsmål, Prioriterer VLM’er forhåndsviden om anatomi over visuelt input, når de bestemmer relative positioner i radiologiske billeder?, undersøgte forfatterne, om vision-sprog-modellerne afhænger mere af forhåndsviden om anatomi end af visuelt bevis, når de bestemmer relative positioner i radiologiske billeder.

Når de blev testet på roterede eller flippede CT-snit, producerede GPT-4o og Pixtral ofte svar, der var konsistente med standard anatomiske positioner, i stedet for at reflektere, hvad der blev vist i billedet, med GPT-4o, der opnåede over 75 procents nøjagtighed på anatomi-baseret evaluering, men kun tilfældighedsniveau på billedbaseret evaluering.

Fjernelse af anatomiske termer fra prompterne og brug af kun visuelle markører tvang modellerne til at afhænge af billedindholdet, hvilket resulterede i markante gevinster, med GPT-4o, der overgik 85 procents nøjagtighed med bogstaver-markører, og Pixtral over 75 procent med prikker.

En sammenligning af de fire vision-sprog-modeller i bestemmelse af relative positioner af anatomiske strukturer i medicinske billeder – en nøglekrav til klinisk brug. Præstationen er på niveau med tilfældighed med almindelige billeder (RQ1) og viser kun mindre gevinster med visuelle markører (RQ2). Når anatomiske navne fjernes, og modellerne må afhænge helt af markørerne, opnår GPT-4o og Pixtral betydelige nøjagtighedsforbedringer (RQ3). Resultaterne vises med hver models bedst fungerende markørtype.

En sammenligning af de fire vision-sprog-modeller i bestemmelse af relative positioner af anatomiske strukturer i medicinske billeder – en nøglekrav til klinisk brug. Præstationen er på niveau med tilfældighed med almindelige billeder (RQ1) og viser kun mindre gevinster med visuelle markører (RQ2). Når anatomiske navne fjernes, og modellerne må afhænge helt af markørerne, opnår GPT-4o og Pixtral betydelige nøjagtighedsforbedringer (RQ3). Resultaterne vises med hver models bedst fungerende markørtype.

Dette tyder på, at selv om begge kan udføre opgaven ved hjælp af billeddata, tenderer de til at falde tilbage til lært anatomisk priorer, når de får anatomiske navne – en mønster, der ikke tydeligt observeres i JanusPro eller Llama3.2.

For at teste relative positionerings-evnen uden nogen medicinsk kontekst brugte studiet en ablations-studie. Derfor testede studiet relative positionerings-evnen uden nogen medicinsk kontekst ved hjælp af almindelige hvide billeder med tilfældigt placerede markører og stillede simple spørgsmål såsom Er nummer 1 over nummer 2?. Pixtral viste forbedrede resultater med prik-markører, mens de andre modeller opnåede lignende resultater som deres RQ3-scores.

JanusPro og især Llama3.2 kæmpede endda i denne simplificerede sammenhæng, hvilket tyder på underliggende svagheder i relative positionering, der ikke er begrænset til medicinske billeder.

Forfatterne observerer, at GPT-4o opnåede bedst resultat med bogstaver-markører, mens Pixtral, JanusPro og Llama3.2 opnåede bedre resultater med rød-blå prikker. GPT-4o var den samlede bedste performer, mens Pixtral var den bedste open-source-model.

Konklusion

På en personlig note fik denne artikel min opmærksomhed ikke så meget på grund af dens medicinske betydning, men fordi den fremhæver en af de mest underrapporterede og grundlæggende svagheder hos den nuværende bølge af SOTA LLM’er – at, hvis opgaven kan undgås, og medmindre du præsenterer dit materiale omhyggeligt, vil de ikke læse teksten, du uploader, eller undersøge billederne, du præsenterer for dem.

Dertil kommer, at studiet indikerer, at hvis din tekst-prompt på nogen måde forklarer, hvad det sekundære indsendte materiale er, vil LLM’en tende til at behandle det som et ‘teleologisk’ eksempel og antage/forudsætte mange ting om det baseret på forhåndsviden, i stedet for at studere og overveje, hvad du har indsendt.

Effektivt, på dette tidspunkt, vil VLM’er have store vanskeligheder med at identificere ‘afvigende’ materiale – en af de mest essentielle færdigheder i diagnostisk medicin. Selv om det er muligt at omskrive logikken og have et system, der søger efter outliers i stedet for in-distribution resultater, ville modellen kræve en ekstraordinær kuratering for at undgå at overvælde signalet med irrelevante eller spurious eksempler.

 

* Inline-citationer er udeladt, da der ikke er nogen elegant måde at inkludere dem som hyperlinks. Se venligst den oprindelige artikel.

Først udgivet mandag, 4. august 2025

Forfatter til maskinlæringsartikler, domæneekspert i menneskesynssyntese. Tidligere leder af forskningsindhold på Metaphysic.ai, indtil opløsningen i DNEG's Brahma.ai.
Portfolio site: martinanderson.ai
Kontakt: martin@martinanderson.ai