Unghiul lui Anderson
Lupta inteligenței artificiale de a distinge între stânga și dreapta în scanări medicale

O nouă studiu a descoperit că modelele de imagine ale inteligenței artificiale, cum ar fi ChatGPT, pot citi greșit anatomia răsturnată sau rotită, ridicând riscul unor erori periculoase în diagnostic, cu teste care indică faptul că adesea nu reușesc să facă față unor raționamente spațiale de bază în scanări medicale – ghicind unde ar trebui să se afle organele, mai degrabă decât să se uite efectiv la imagine. Poate de un interes mai larg, cercetarea demonstrează că aceste modele nu citesc întotdeauna fișierele PDF încărcate sau nu se uită la imaginile dvs. deloc.
Oricine a încărcat în mod regulat date, cum ar fi conținutul PDF, într-un model de limbaj de top, cum ar fi ChatGPT, știe că LLM-urile nu citesc întotdeauna sau examinează ceea ce li se prezintă; mai degrabă, ele fac adesea presupuneri despre material, pe baza a ceea ce ați scris despre el în promptul dvs. atunci când l-ați încărcat.

Poate fi dificil să faceți un model de limbaj să recunoască că a folosit cunoștințe anterioare, metadate sau presupuneri generale pentru a răspunde, mai degrabă decât conținutul pe care i l-ați dat. Sursă: https://chatgpt.com
Unul dintre motivele posibile pentru acest lucru este creșterea vitezei de răspuns prin considerarea materialului încărcat ca “redundant” și prin folosirea promptului text pentru a se baza pe cunoștințele anterioare ale sistemului – evitând încărcarea și minimizând astfel traficul de rețea.
Un alt motiv este conservarea resurselor (deși furnizorii par să nu dezvăluie acest lucru, dacă este adevărat), unde metadatele existente extrase din schimburile anterioare din chat sunt folosite ca bază pentru răspunsuri ulterioare, chiar și atunci când aceste schimburi și metadatele nu conțin suficiente informații pentru a servi acestui scop.
Stânga. Dreapta?
Indiferent de motivul pentru care generația curentă de LLM-uri are o atenție și capacități de focalizare variate, există situații și contexte în care ghicirea este extrem de periculoasă. Unul dintre acestea este atunci când inteligența artificială în cauză este solicitată să furnizeze servicii medicale, cum ar fi screeningul sau estimarea riscului de material radiologic.
Acestă săptămână, cercetători din Germania și Statele Unite au lansat un nou studiu de cercetare care examinează eficacitatea a patru modele de viziune-lingvistică de top, inclusiv ChatGPT-4o, atunci când li s-a cerut să identifice locația organelor în scanări medicale.
În mod surprinzător, în ciuda faptului că reprezintă stadiul actual al tehnologiei în acest sens, modelele de bază obțin un nivel de succes nu mai mare decât cel al întâmplării, majoritatea timpului – aparent pentru că nu pot să-și detașeze cunoștințele anterioare despre anatomia umană și să se uite efectiv la imaginile prezentate, în loc să ajungă la o concluzie ușoară și anterioară din datele de antrenament.
Cercetătorii au descoperit că LLM-urile testate au obținut rezultate semnificativ mai bune atunci când secțiunile care urmau să fie luate în considerare au fost denumite de alți indicatori (cum ar fi puncte și secvențe alfanumerice) și numite – și cel mai bine atunci când nu s-a făcut nicio mențiune despre organe sau anatomie în întrebare deloc:

Nivele de succes variate, care cresc pe măsură ce capacitatea modelului de a se baza pe date anterioare este diminuată și este forțat să se concentreze pe datele din fața lui. Sursă: https://wolfda95.github.io/your_other_left/
Articolul observă*:
‘Modelele de viziune-lingvistică de ultimă generație posedă deja cunoștințe anatomice anterioare puternice încorporate în componentele lor lingvistice. Cu alte cuvinte, ele “știu” unde structurile anatomice sunt de obicei localizate în anatomia umană standard.
‘Noi presupunem că LLM-urile se bazează adesea pe aceste cunoștințe anterioare mai degrabă decât pe analiza conținutului real al imaginii. De exemplu, atunci când li se cere dacă ficatul este în dreapta stomacului, un model poate răspunde afirmativ fără a inspecta imaginea, bazându-se exclusiv pe norma învățată că ficatul este de obicei localizat în dreapta stomacului.
‘Un astfel de comportament ar putea duce la diagnostice critice în cazurile în care pozițiile reale se abat de la tiparele anatomice standard, cum ar fi în situs inversus, modificări post-chirurgicale sau deplasări de tumor.
Pentru a mitigă problema în eforturile viitoare, autorii au dezvoltat un set de date conceput pentru a aborda această problemă.
Rezultatele studiului pot fi surprinzătoare pentru mulți cititori care au urmărit dezvoltarea inteligenței artificiale medicale, deoarece radiografia a fost marcată foarte devreme ca una dintre ocupațiile care sunt cel mai mult în pericol de a fi automate prin învățarea automată.
Noul studiu se numește Cellălalt tău stânga! Modelele de viziune-lingvistică nu reușesc să identifice pozițiile relative în imagini medicale, și provine de la șapte cercetători de la două facultăți de la Universitatea din Ulm și Axiom Bio din Statele Unite.
Metodă și date
Cercetătorii au încercat să răspundă la patru întrebări: dacă modelele de viziune-lingvistică de ultimă generație pot determina corect pozițiile relative în imagini radiologice; dacă utilizarea marcajelor vizuale îmbunătățește performanța lor în această sarcină; dacă se bazează mai mult pe cunoștințele anatomice anterioare decât pe conținutul real al imaginii; și cum se descurcă cu sarcinile de poziționare relativă atunci când sunt lipsite de orice context medical.
Pentru acest scop, ei au creat setul de date Imagine medicală relativă (MIRP).
Deși majoritatea benchmark-urilor existente de întrebări și răspunsuri vizuale pentru felii de CT sau RMN includ sarcini de localizare și anatomie, aceste colecții mai vechi ignoră provocarea centrală de a determina poziții relative, lăsând multe sarcini rezolvabile folosind cunoștințe medicale anterioare.
MIRP este conceput pentru a aborda această problemă prin testarea întrebărilor de poziție relativă între structuri anatomice, evaluând impactul marcajelor vizuale și aplicând rotații și răsturnări aleatorii pentru a bloca dependența de norme învățate. Setul de date se concentrează pe felii de CT abdominale, datorită complexității și prevalenței lor în radiologie.
MIRP conține un număr egal de da și nu răspunsuri, cu structurile anatomice din fiecare întrebare marcate opțional pentru claritate.
Au fost testate trei tipuri de marcaje vizuale: numere negre într-o cutie albă; litere negre într-o cutie albă; și un punct roșu și un punct albastru:

Diferitele marcaje vizuale utilizate în MIRP. Sursă: https://arxiv.org/pdf/2508.00549
Colecția a fost sursă din seturile de date existente Beyond the Cranial Vault (BTCV) și Abdominal Multi-Organ Segmentation (AMOS).

Felii de CT annotate din setul de date AMOS. Sursă: https://arxiv.org/pdf/2206.08023
Proiectul TotalSegmentator a fost utilizat pentru a extrage imagini anatomice plate din date volumetrice:

Unele dintre cele 104 de structuri anatomice disponibile în TotalSegmentator. Sursă: https://arxiv.org/pdf/2208.05868
Feliile de imagine axiale au fost obținute cu framework-ul SimpleITK.
Locațiile “provocării” imagini trebuiau să fie la cel puțin 50px distanță și să aibă o mărime de cel puțin dublă față de marcaje, pentru a genera perechi de întrebări și răspunsuri.
Teste
Cele patru modele de viziune-lingvistică testate au fost GPT-4o; Llama3.2; Pixtral; și DeepSeek’s JanusPro.
Cercetătorii au testat fiecare dintre cele patru întrebări de cercetare, prima (Q1) fiind ‘Pot modelele de viziune-lingvistică de ultimă generație să determine corect pozițiile relative în imagini radiologice? Pentru această întrebare, cercetătorii au testat modelele pe felii de CT simple, rotite sau răsturnate, utilizând un format de întrebare standard, cum ar fi Este rinichiul stâng sub stomac?.
Rezultatele (prezentate mai jos) au arătat acuratețe aproape de 50 la sută pentru toate modelele, indicând o performanță la nivelul întâmplării și o incapacitate de a judeca în mod fiabil pozițiile relative fără marcaje vizuale:

Acuratețe medie pentru toate experimentele utilizând evaluarea pe baza imaginii pe benchmark-ul MIRP (RQ1–RQ3) și setul de date de ablație (AS).
Pentru a testa dacă marcajele vizuale pot ajuta modelele de viziune-lingvistică să determine pozițiile relative în imagini radiologice, studiul a repetat experimentele utilizând felii de CT annotate cu litere, numere sau puncte roșii și albastre; și aici, formatul de întrebare a fost ajustat pentru a se referi la aceste marcaje – de exemplu, Este rinichiul stâng (A) sub stomac (B)? sau Este rinichiul stâng (roșu) sub stomac (albastru)?.
Rezultatele au arătat câștiguri mici de acuratețe pentru GPT-4o și Pixtral atunci când s-au utilizat marcaje de litere sau numere, în timp ce JanusPro și Llama3.2 au văzut puțin sau deloc beneficii, sugerând că marcajele singure nu pot fi suficiente pentru a îmbunătăți semnificativ performanța.

Acuratețe pentru toate experimentele utilizând evaluarea pe baza imaginii. Pentru RQ2, RQ3 și AS, rezultatele sunt prezentate cu cel mai bun tip de marcaj pentru fiecare model: litere pentru GPT-4o și puncte roșu-albastre pentru Pixtral, JanusPro și Llama3.4.
Pentru a aborda a treia întrebare, Se bazează modelele de viziune-lingvistică pe cunoștințe anatomice anterioare mai mult decât pe intrarea vizuală atunci când determină pozițiile relative în imagini radiologice?, autorii au examinat dacă modelele de viziune-lingvistică se bazează mai mult pe cunoștințe anatomice anterioare decât pe dovezi vizuale atunci când determină pozițiile relative în imagini radiologice.
Când au fost testate pe felii de CT rotite sau răsturnate, GPT-4o și Pixtral au produs adesea răspunsuri consistente cu pozițiile anatomice standard, mai degrabă decât reflectând ceea ce se arăta în imagine, cu GPT-4o obținând peste 75 la sută acuratețe pe baza evaluării anatomice, dar doar o performanță la nivelul întâmplării pe baza evaluării pe baza imaginii.
Eliminarea termenilor anatomici din prompturi și utilizarea doar a marcajelor vizuale a forțat modelele să se bazeze pe conținutul imaginii, ducând la câștiguri semnificative, cu GPT-4o depășind 85 la sută acuratețe cu marcaje de litere și Pixtral peste 75 la sută cu puncte.

O comparație a celor patru modele de viziune-lingvistică în determinarea pozițiilor relative ale structurilor anatomice în imagini medicale – o cerință cheie pentru utilizarea clinică. Performanța este la nivelul întâmplării cu imagini simple (RQ1) și arată doar câștiguri mici cu marcaje vizuale (RQ2). Când numele anatomice sunt eliminate și modelele trebuie să se bazeze în întregime pe marcaje, GPT-4o și Pixtral obțin îmbunătățiri semnificative ale acurateței (RQ3). Rezultatele sunt prezentate utilizând cel mai bun tip de marcaj pentru fiecare model.
Acest lucru sugerează că, deși ambele pot efectua sarcina utilizând datele imaginii, ele tind să se bazeze pe cunoștințe anatomice anterioare atunci când li se furnizează nume anatomice – un model pe care nu a fost clar observat la JanusPro sau Llama3.2.
Deși de obicei nu acoperim studii de ablație, autorii au abordat a patra și ultima întrebare de cercetare în acest fel. Prin urmare, pentru a testa capacitatea de poziționare relativă fără niciun context medical, studiul a utilizat imagini albe simple cu marcaje plasate aleator și a pus întrebări simple, cum ar fi Este numărul 1 deasupra numărului 2?. Pixtral a arătat rezultate îmbunătățite cu marcaje de puncte, în timp ce celelalte modele au performant similar cu scorurile lor RQ3.
JanusPro, și în special Llama3.2, au luptat chiar și în acest mediu simplificat, indicând slăbiciuni subiacente în poziționarea relativă care nu sunt limitate la imagini medicale.
Autorii observă că GPT-4o a performant cel mai bine cu marcaje de litere, în timp ce Pixtral, JanusPro și Llama3.2 au obținut scoruri mai mari cu puncte roșu-albastre. GPT-4o a fost cel mai bun performer general, cu Pixtral conducând printre modelele open-source.
Concluzie
Pe o notă personală, acest articol mi-a atras atenția nu atât pentru semnificația sa medicală, ci pentru că subliniază una dintre cele mai puțin raportate și fundamentale lipsuri ale valului actual de LLM-uri – că, dacă sarcina poate fi evitată, și dacă nu prezentați materialul cu atenție, ele nu vor citi textele pe care le încărcați sau examinează imaginile pe care le prezentați.
Mai mult, studiul indică faptul că, dacă promptul dvs. text explică în orice mod materialul suplimentar încărcat, LLM-ul va tendința să-l trateze ca pe un exemplu “teleologic” și va presupune/înțelege multe despre el pe baza cunoștințelor anterioare, mai degrabă decât să studieze și să ia în considerare ceea ce ați încărcat.
În esență, în acest stadiu, LLM-urile vor avea dificultăți mari în identificarea materialului “aberrant” – una dintre cele mai esențiale abilități în medicina de diagnostic. Deși este posibil să se inverseze logica și să se facă un sistem să caute outlier-i în loc de rezultate în distribuție, modelul ar necesita o curățenie excepțională pentru a evita copleșirea semnalului cu exemple irelevante sau spurii.
* Trimiteri interne omise, deoarece nu există o modalitate elegantă de a le include ca legături hipertext. Vă rugăm să consultați articolul sursă.
Publicat pentru prima dată luni, 4 august 2025












