Andersonin kulma
Tekoäly kamppailee vasemman ja oikean erottamisessa lääketieteellisissä kuvissa

Uusi tutkimus osoittaa, että tekoälykuvamallit, kuten ChatGPT, voivat tulkita väärin käännetyt tai pyörityt anatomiset rakenteet, mikä lisää vaarallisten virheiden riskiä diagnosoinnissa. Tutkimus osoittaa, että nämä mallit usein epäonnistuvat perustason avaruudellisessa päättelyssä lääketieteellisissä kuvissa – arvaamalla, missä elimet pitäisi olla, sen sijaan, että ne tarkastelisivat itse kuvaa.
Kuka tahansa, joka on koskaan ladannut säännöllisesti tietoja, kuten PDF-sisältöä, johtavaan kielen malliin, kuten ChatGPT, tietää, että LLM:t eivät aina välttämättä lue tai tarkastele esittämääsi sisältöä; sen sijaan ne usein tekevät oletuksia materiaalista, perustuen siihen, mitä kirjoitit siitä, kun latoit sen.

On haastavaa saada kielen malli myöntämään, että se ei oikeasti tarkastellut esittämääsi sisältöä, vaan perusti vastauksensa aikaisempiin tietoihin, metatietoihin tai yleisiin oletuksiin. Lähde: https://chatgpt.com
Toinen mahdollinen syy tähän on vastauksen nopeuden lisääminen, kun ladattava materiaali katsotaan “tarpeettomaksi” ja riippuu tekstipromptista, joka perustuu järjestelmän aikaisempiin tietoihin – välttäen latauksen kokonaan ja siten minimoiden verkkoliikenteen.
Toinen on resurssien säästö (vaikka tarjoajat eivät ole todennäköisesti paljastaneet tätä, jos se on totta), jossa olemassa oleva metadata, jonka LLM on poistanut aiemmista vaihdoista keskustelussa, käytetään perustana vastauksille, vaikka nämä vaihdot ja metadata eivät sisällä riittävästi tietoa tämän tarkoituksen toteuttamiseksi.
Vasen, oikea?
Riippumatta siitä, mikä on syy nykyisen LLM-sukupolven vaihtelevaan tarkkuuteen ja fokukseen, on tilanteita ja konteksteja, joissa arvaaminen on erittäin vaarallista. Yksi näistä on, kun tekoälyä pyydetään tarjoamaan lääketieteellisiä palveluita, kuten seulontaa tai radiologisen aineiston riskiarviota.
Tällä viikolla Saksasta ja Yhdysvalloista tulleet tutkijat julkaisivat uuden tutkimuksen, jossa tutkittiin neljän johtavan visuaalisen kielen mallin, mukaan lukien ChatGPT-4o, kykyä tunnistaa elinten sijainti lääketieteellisissä kuvissa.
Yllättäen nämä perusmallit saavuttivat vain 50 prosentin osumatarkkuuden useimmissa tapauksissa, mikä osoittaa, että ne eivät pysty luotettavasti arvioimaan suhteellisia sijainteja ilman visuaalisia merkkejä:

Vaihtelevat onnistumistasot, jotka kasvavat, kun mallin kyky turvautua koulutusdataan vähenee, ja se joutuu keskittymään esittämääsi dataan. Lähde: https://wolfda95.github.io/your_other_left/
Tutkimusraportti toteaa*:
‘Viimeisimmän sukupolven VLM:t omistavat jo vahvan aikaisemman anatominen tiedon kielen komponenteissaan. Toisin sanoen, ne “tiedostavat”, missä anatominen rakenteet sijaitsevat tyypillisesti ihmisanatomiassa.
‘Oletamme, että VLM:t usein perustavat vastauksensa tähän aikaisempaan tietoon sen sijaan, että analysoisivat itse kuvaa. Esimerkiksi, kun kysytään, onko maksa oikealla puolella vatsaa, malli voi vastata myöntävästi ilman kuvan tarkastelua, turvautuen ainoastaan oppimaansa normiin, jonka mukaan maksa on yleensä oikealla puolella vatsaa.
‘Tällainen käyttäytyminen voi johtaa kriittisiin väärään diagnosointiin tapauksissa, joissa todelliset sijainnit poikkeavat tyypillisistä anatominen malleista, kuten situs inversus, post-surgical muutokset tai kasvainsiirto.
Tutkijat ovat kehittäneet tietokannan, joka on suunniteltu ratkaisemaan tämä ongelma.
Tutkimuksen tulokset saattavat olla yllättäviä monille lukijoille, jotka ovat seuranneet lääketieteellisen tekoälyn kehitystä, koska radiografia oli merkitty hyvin varhain yhdeksi työksi, jota voidaan automatisoida koneoppimisen avulla.
Uusi tutkimus on nimeltään Toinen vasen! Visuaalisen kielen mallit eivät pysty tunnistamaan suhteellisia sijainteja lääketieteellisissä kuvissa, ja se on tehty seitsemän tutkijan toimesta kahdessa tiedekunnassa Ulmin yliopistossa ja Axiom Bio Yhdysvalloissa.
Menetelmä ja data
Tutkijat pyrkivät vastaamaan neljään kysymykseen: voivatko viimeisimmän sukupolven visuaaliset kielen mallit määrittää suhteelliset sijainnit radiologisissa kuvissa; parantavatko visuaaliset merkit niiden suorituskykyä tässä tehtävässä; riippuvatko ne enemmän aikaisemmasta anatominen tietosta kuin itse kuvan sisällöstä; ja miten hyvin ne käsittelevät suhteellisia sijainteja, kun niistä poistetaan kaikki lääketieteellinen konteksti.
Tähän tarkoituksiin he loivat Lääketieteellisen kuvien suhteellisen sijainnin (MIRP) -tietokannan.
Vaikka useimmat olemassa olevat visuaaliset kysymys-vastaus -mittarit CT- tai MRI-leikkauksille sisältävät anatominen ja lokalisaatiotehtäviä, nämä vanhemmat kokoelmat jättävät huomiotta suhteellisten sijaintejen määrittämisen keskeisen haasteen, jolloin useimmat tehtävät voidaan ratkaista ainoastaan aikaisemman lääketieteellisen tiedon avulla.
MIRP on suunniteltu ratkaisemaan tämä ongelma testaamalla suhteellisia sijaintikysymyksiä anatominen rakenteiden välillä, arvioiden visuaalisten merkkien vaikutusta ja soveltamalla satunnaisia rotaatioita ja käännöksiä estämään oppimisen normeja. Tietokanta keskittyy vatsan CT-leikkauksiin niiden monimutkaisuuden ja yleisyyden vuoksi radiologiassa.
MIRP sisältää yhdenmukaisen määrän kyllä ja ei -vastauksia, ja anatominen rakenteet kussakin kysymyksessä on valinnaisesti merkitty selkeyden vuoksi.
Kolmea visuaalista merkintätyyppiä testattiin: mustat numerot valkoisessa ruudussa; mustat kirjaimet valkoisessa ruudussa; ja punainen ja sininen piste:

MIRP:ssä käytetyt visuaaliset merkit. Lähde: https://arxiv.org/pdf/2508.00549
Kokoelma perustui olemassa oleviin Beyond the Cranial Vault (BTCV) ja Abdominal Multi-Organ Segmentation (AMOS) -tietokantoihin.

AMOS-tietokannan merkittyjä leikkauksia. Lähde: https://arxiv.org/pdf/2206.08023
TotalSegmentator -projekti käytettiin anatominen tasokuvien poistamiseen tilavuusdatasta:

Jotkut TotalSegmentatorissa saatavilla olevista 104 anatominen rakenteista. Lähde: https://arxiv.org/pdf/2208.05868
Aksiaaliset kuvaleikkaukset saatiin SimpleITK -kehyksellä.
‘Haaste’ -kuvien sijainteja oli oltava vähintään 50px erillään toisistaan, ja niiden koko oli oltava vähintään kaksi kertaa suurempi kuin merkkien, jotta voitiin luoda kysymys-vastaus -parit.
Testit
Neljä visuaalista kielen mallia, jotka testattiin, olivat GPT-4o; Llama3.2; Pixtral; ja DeepSeekin JanusPro.
Tutkijat testasivat jokaisen neljästä tutkimuskysymyksestä vuorotellen, ja ensimmäinen (Q1) oli ‘Voivatko nykyiset huipputason VLM:t määrittää suhteelliset sijainnit radiologisissa kuvissa? Tässä kysymyksessä tutkijat testasivat malleja yksinkertaisilla, käännetyillä tai pyörityillä CT-leikkauksilla standardin kysymysmuodolla, kuten Onko vasen munuainen vatsan alapuolella?.
Tulokset (näkyvissä alla) osoittivat, että mallien tarkkuus oli lähellä 50 prosenttia, mikä osoittaa, että ne eivät pysty luotettavasti arvioimaan suhteellisia sijainteja ilman visuaalisia merkkejä:

Kaikkien kokeiden keskimääräinen tarkkuus MIRP-benchmarkin (RQ1–RQ3) ja ablaatioaineiston (AS) kuvapohjaisessa arvioinnissa.
Toiseksi tutkijat testasivat, voivatko visuaaliset merkit auttaa visuaalisen kielen malleja määrittämään suhteelliset sijainnit radiologisissa kuvissa, ja toistivat kokeet CT-leikkauksilla, jotka oli merkitty kirjaimilla, numeroin tai punaisilla ja sinisillä pisteillä; ja tässä kysymysmuotoa sovellettiin näihin merkkeihin – esimerkiksi Onko vasen munuainen (A) vatsan (B) alapuolella? tai Onko vasen munuainen (punainen) vatsan (sininen) alapuolella?.
Tulokset osoittivat pieniä tarkkuuden parannuksia GPT-4o:lle ja Pixtralille, kun kirjain- tai numeromerkit käytettiin, kun taas JanusPro ja Llama3.2 näkivät vain vähän tai ei ollenkaan hyötyä, mikä viittaa siihen, että merkit yksin eivät riitä parantamaan suorituskykyä merkittävästi.

Kaikkien kokeiden tarkkuus kuvapohjaisessa arvioinnissa. RQ2:lle, RQ3:lle ja AS:lle tulokset on esitetty kunkin mallin parhaan suorituskyvyn mukaan: kirjaimet GPT-4o:lle ja punainen-sininen piste Pixtralille, JanusPro:lle ja Llama3.4:lle.
Toisessa kysymyksessä tutkijat selvittivät, riippuvatko VLM:t enemmän aikaisemmasta anatominen tietosta kuin visuaalisesta syötteestä, kun määritetään suhteelliset sijainnit radiologisissa kuvissa? Tutkijat tutkivat, riippuvatko visuaaliset kielen mallit enemmän aikaisemmasta anatominen tietosta kuin visuaalisesta todisteesta, kun määritetään suhteelliset sijainnit radiologisissa kuvissa.
Kun testattiin käännetyillä tai pyörityillä CT-leikkauksilla, GPT-4o ja Pixtral usein tuottivat vastauksia, jotka olivat yhdenmukaisia standardin anatominen sijainnilla, sen sijaan, että ne heijastivat, mitä kuvassa näkyi, GPT-4o saavutti yli 75 prosentin tarkkuuden anatominen arvioinnissa, mutta vain satunnaisen tason suorituskyvyn kuvapohjaisessa arvioinnissa.
Visuaalisten merkkien poistaminen kysymyksistä ja käyttäminen ainoastaan visuaalisten merkkien perusteella pakotti mallit riippumaan kuvan sisällöstä, mikä johti merkittäviin parannuksiin, GPT-4o ylitti 85 prosentin tarkkuuden kirjainmerkeillä, ja Pixtral ylitti 75 prosentin tarkkuuden pisteillä.

Neljän visuaalisen kielen mallin vertailu suhteellisten anatominen rakenteiden sijainnin määrittämisessä lääketieteellisissä kuvissa – avainvaatimus kliinisessä käytössä. Suorituskyky on satunnaisen tason kuvilla (RQ1) ja näyttää vain vähäisiä parannuksia visuaalisten merkkien kanssa (RQ2). Kun anatominen nimet poistetaan ja mallit joutuvat turvautumaan ainoastaan merkkeihin, GPT-4o ja Pixtral saavuttavat merkittäviä tarkkuuden parannuksia (RQ3). Tulokset on esitetty kunkin mallin parhaan suorituskyvyn mukaan.
Tämä viittaa siihen, että vaikka molemmat pystyvät suorittamaan tehtävän käyttäen kuvadataa, ne usein turvautuvat oppimien anatominen etuoletuksiin, kun niille annetaan anatominen nimet – mallissa, jota ei havaittu selvästi JanusPro:lla tai Llama3.2:lla.
Neljännessä tutkimuskysymyksessä tutkijat testasivat, miten hyvin visuaaliset kielen mallit käsittelevät suhteellisia sijainteja ilman lääketieteellistä kontekstia. Tutkijat käyttivät tähän tarkoituksiin ablaatiotutkimusta.
Pixtral osoitti parannettua suorituskykyä pisteillä, kun taas muut mallit suorittivat samalla tasolla kuin RQ3-tulokset. JanusPro, erityisesti Llama3.2, kamppailivat jopa yksinkertaisissa olosuhteissa, mikä viittaa perustavanlaatuiseen heikkouteen suhteellisissa sijainneissa, joka ei rajoitu lääketieteellisiin kuvauksiin.
Tutkijat huomauttavat, että GPT-4o suoriutui parhaiten kirjainmerkeillä, kun taas Pixtral, JanusPro ja Llama3.2 saavuttivat parempia tuloksia punaisilla ja sinisillä pisteillä. GPT-4o oli yleisesti paras suorittaja, ja Pixtral johti avoimia malleja.
Johtopäätös
Henkilökohtaisesti tämä tutkimus herätti mielenkiintoni ei niinkään sen lääketieteellisen merkityksen vuoksi, vaan koska se korostaa yhtä tekoälymallien nykyisen aallon alle raportoiduista ja perustavista puutteista – sitä, että, jos tehtävä voidaan välttää, ja jos esität materiaalisi huolellisesti, ne eivät lue tekstiä, jonka lataat, eivätkä tarkastele kuvia, jotka esität niille.
Lisäksi tutkimus osoittaa, että jos tekstipromptissasi mainitset, mitä toissijaisessa materiaalissa on, tekoälymalli taipuu käsittämään sen “teleologisena” esimerkkinä ja olettaa/olettaa monia asioita siitä aikaisemman tiedon perusteella, sen sijaan, että se tutkisi ja tarkastelisi, mitä olet lähettänyt.
Teollisesti tämä tarkoittaa, että VLM:t kohtaavat suuria vaikeuksia “poikkeavan” materiaalin tunnistamisessa – yksi lääketieteellisen diagnostiikan tärkeimmistä taidoista. Vaikka on mahdollista kääntää logiikka toisin päin ja saada järjestelmä etsimään poikkeamia sen sijaan, että etsisi malleja, malli tarvitsisi poikkeuksellista kuraattorin toimintaa välttääksesi signaalin peittämisen merkityksettömillä tai väärillä esimerkeillä.
* Sisäiset viitteet on jätetty pois, koska niiden sisällyttäminen hyperlinkkeinä ei ole eleganttia. Lue alkuperäinen tutkimusraportti.
Julkaistu ensimmäisen kerran maanantaina 4. elokuuta 2025












