Anderson의 관점

AI는 의료 영상에서 왼쪽과 오른쪽을 구분하기 어려워

mm
Unite.AI를 Google의 선호 소스에 추가
A robot doctor confused by an x-ray of a hand – ChatGPT-40 and Firefly (Oct 2024).

새로운 연구에 따르면 ChatGPT와 같은 AI 이미지 모델은 해부학적 구조의 상대적 위치를 식별할 때 어려움을 겪는 것으로 나타났습니다. 이는 의료 영상을 사용하여 진단을 내릴 때 위험한 오류를 일으킬 수 있습니다. 테스트 결과, 이러한 모델은 기본적으로 성공률이 50%에 불과하여 상대적 위치를 신뢰성 있게 판단할 수 없다는 것을 보여주었습니다.

 

ChatGPT와 같은 주요 언어 모델을 사용하여 데이터를 업로드한 사람들은 이러한 모델이 항상 제공된 데이터를 읽거나 검토하는 것은 아니라는 것을 알게 될 것입니다. 대신, 이러한 모델은 업로드된 데이터에 대한 가정이나 전제를 기반으로 답변을 생성하는 경우가 많습니다.

언제나 언어 모델이 실제로 내용을 검토했는지 여부를 확인하기는 어렵지만, 이는 모델이 제공된 데이터를 기반으로 답변을 생성하는지 여부를 확인하는 데 도움이 될 수 있습니다. 출처: https://chatgpt.com

언제나 언어 모델이 실제로 내용을 검토했는지 여부를 확인하기는 어렵지만, 이는 모델이 제공된 데이터를 기반으로 답변을 생성하는지 여부를 확인하는 데 도움이 될 수 있습니다. 출처: https://chatgpt.com

이러한 모델이 제공된 데이터를 읽지 않고 답변을 생성하는 이유 중 하나는 답변 속도를 높이기 위해 업로드된 데이터를 불필요한 것으로 간주하고 텍스트 프롬프트에만 의존하는 것입니다. 이는 네트워크 트래픽을 최소화하는 데 도움이 될 수 있습니다.

또 다른 이유는 자원 보존입니다(그러나 제공업체는 이것이 사실인지 여부를 공개하지 않을 수 있습니다). 이전에 채팅에서 추출한 메타데이터를 사용하여 추가 답변을 생성하는 경우가 있습니다. 그러나 이러한 메타데이터에는 충분한 정보가 포함되어 있지 않을 수 있습니다.

왼쪽, 오른쪽?

이러한 모델의 관심사와 집중력의 다양성에 대한 이유는 무엇이든 간에, 이러한 모델이 의료 서비스를 제공하는 상황에서는 추측이 매우 위험할 수 있습니다. 이러한 상황 중 하나는 의료 영상에서 해부학적 구조의 위치를 식별하는 것입니다.

이번 주 독일과 미국의 연구자들은 4개의 주요 비전-언어 모델(包括 ChatGPT-4o)을 테스트하여 의료 영상에서 해부학적 구조의 위치를 식별하는 능력을 평가했습니다.

놀랍게도, 이러한 모델은 대부분의 경우 순수한 우연에 불과한 성공률을 달성했습니다. 이는 이러한 모델이 실제로 제공된 이미지를 검토하는 대신에 훈련된 해부학적 지식을 기반으로 답변을 생성한다는 것을 의미합니다.

연구자들은 이러한 모델이 더 나은 성능을 보이는지 테스트하기 위해 시각적 표시기를 사용하여 실험을 반복했습니다. 여기서 질문 형식은 표시기를 참조하도록 조정되었습니다.

표시기를 사용할 때 모델의 성능이 향상되는 것을 보여주는 그래프. 출처: https://wolfda95.github.io/your_other_left/

표시기를 사용할 때 모델의 성능이 향상되는 것을 보여주는 그래프. 출처: https://wolfda95.github.io/your_other_left/

연구 논문은 다음과 같이 관찰합니다*:

‘최첨단 비전-언어 모델은 이미 강력한 해부학적 지식을 언어 구성 요소에 내장하고 있습니다. 즉, 이러한 모델은 “해부학적 구조가 일반적으로 인간 해부학에서 어디에 위치하는지 알고 있습니다.”‘

‘우리는 비전-언어 모델이 실제 이미지 내용을 분석하는 대신에 이러한 이전 해부학적 지식을 기반으로 답변을 생성한다고 가정합니다. 예를 들어, 모델이 간이 위장의 오른쪽에 있는지 여부를 묻는 경우, 모델은 이미지를 검토하는 대신에 간이 일반적으로 위장의 오른쪽에 위치한다는 것을 알면서 긍정적으로 답변할 수 있습니다.’

‘이러한 행동은 실제 위치가 일반적인 해부학적 패턴에서 벗어나는 경우(예: 시투스 인버수스, 수술 후 변경 또는 종양 이주) 치명적인 오진으로 이어질 수 있습니다.’

이 문제를 해결하기 위해 연구자들은 이러한 문제를 해결하기 위한 데이터셋을 개발했습니다.

이 연구의 결과는 의료 AI의 발전에 관심을 가진 많은 사람들에게 놀라운 소식일 수 있습니다. 방사선학은 초기에 기계 학습을 통해 자동화될 수 있는 직업 중 하나로 지명되었습니다.

이 새로운 연구는 당신의 다른 왼쪽! 비전-언어 모델은 의료 영상에서 상대적 위치를 식별하지 못합니다.라는 제목으로 독일과 미국의 7명의 연구자에 의해 수행되었습니다.

방법과 데이터

연구자들은 네 가지 문제에 대한 답변을 찾고자 했습니다. 첫째, 최첨단 비전-언어 모델이 의료 영상에서 상대적 위치를 정확하게 결정할 수 있는지 여부입니다. 둘째, 시각적 표시기가 이러한 모델의 성능을 향상시키는지 여부입니다. 셋째, 이러한 모델이 실제 이미지 내용보다 이전 해부학적 지식을 더 많이 신뢰하는지 여부입니다. 마지막으로, 이러한 모델이 의료.context 없이 상대적 위치를 처리하는 능력입니다.

이를 위해 연구자들은 의료 영상 상대적 위치(MIRP) 데이터셋을 구축했습니다.

대부분의 기존 시각적 질문-답변 벤치마크는 해부학적 구조와 위치를 포함하지만, 이러한 이전 데이터셋은 상대적 위치를 결정하는 핵심 문제를 무시합니다.

MIRP는 이러한 문제를 해결하기 위해 설계되었으며, 해부학적 구조 사이의 상대적 위치 질문을 평가하고 시각적 표시기의 영향을 평가하며, 이전 규범에 대한 의존도를 차단하기 위해 임의로 회전하고 뒤집습니다. 이 데이터셋은 복부 CT 영상을 중점으로 합니다.

MIRP에는 “예”와 “아니요”答案이 같은 수로 포함되어 있으며, 각 질문의 해부학적 구조는 명확성을 위해 선택적으로 표시될 수 있습니다.

검토된 세 가지 유형의 시각적 표시기에는 검은 숫자가 포함된 흰색 상자, 검은 문자가 포함된 흰색 상자 및 빨간색과 파란색 점이 있습니다.

MIRP에서 사용된 다양한 시각적 표시기. 출처: https://arxiv.org/pdf/2508.00549

MIRP에서 사용된 다양한 시각적 표시기. 출처: https://arxiv.org/pdf/2508.00549

이 컬렉션은 기존의 뇌의 해부학을 넘어서(BTCV)와 복부 다중 장기 분할(AMOS) 데이터셋에서 가져왔습니다.

AMOS 데이터셋의 주석이 달린 슬라이스. 출처: https://arxiv.org/pdf/2206.08023

AMOS 데이터셋의 주석이 달린 슬라이스. 출처: https://arxiv.org/pdf/2206.08023

TotalSegmentator 프로젝트를 사용하여 볼륨 데이터에서 평면 해부학적 이미지를 추출했습니다.

TotalSegmentator에서 사용할 수 있는 104개의 해부학적 구조 중 일부. 출처: https://arxiv.org/pdf/2208.05868

TotalSegmentator에서 사용할 수 있는 104개의 해부학적 구조 중 일부. 출처: https://arxiv.org/pdf/2208.05868

이미지 슬라이스는 SimpleITK 프레임워크를 사용하여 얻었습니다.

‘도전’ 이미지 위치는 표시기보다 적어도 50px 떨어져 있었으며, 표시기의 크기보다 두 배 이상의 크기를 가졌습니다.

테스트

테스트된 네 가지 비전-언어 모델은 GPT-4o, Llama3.2, Pixtral 및 DeepSeek의 JanusPro입니다.

연구자들은 각 모델에 대해 네 가지 연구 질문을 테스트했습니다. 첫 번째 질문(Q1)은 ‘현재 최첨단 비전-언어 모델이 의료 영상에서 상대적 위치를 정확하게 결정할 수 있는가?’ 이었습니다.

결과(아래에 표시됨)는 모든 모델에서 약 50%의 정확도를 보여주었으며, 이는 이러한 모델이 상대적 위치를 신뢰성 있게 판단할 수 없다는 것을 나타냅니다.

MIRP 벤치마크(RQ1-RQ3) 및 절단 데이터셋(AS)을 사용한 모든 실험의 평균 정확도.

MIRP 벤치마크(RQ1-RQ3) 및 절단 데이터셋(AS)을 사용한 모든 실험의 평균 정확도.

시각적 표시기가 이러한 모델의 성능을 향상시킬 수 있는지 테스트하기 위해 연구자들은 표시된 CT 슬라이스를 사용하여 실험을 반복했습니다.

결과는 GPT-4o와 Pixtral에서 문자 또는 숫자 표시기를 사용할 때 작은 정확도 향상을 보여주었지만, JanusPro와 Llama3.2에서는 거의 또는 전혀 향상이 없었습니다.

이미지 기반 평가를 사용한 모든 실험의 정확도. RQ2, RQ3 및 AS의 경우 각 모델의 최선의 표시기 유형을 사용하여 결과가 표시됩니다.

이미지 기반 평가를 사용한 모든 실험의 정확도. RQ2, RQ3 및 AS의 경우 각 모델의 최선의 표시기 유형을 사용하여 결과가 표시됩니다.

세 번째 질문은 ‘비전-언어 모델이 의료 영상에서 상대적 위치를 결정할 때 이전 해부학적 지식을 시각적 입력보다 우선하는가?’ 이었습니다.

결과는 GPT-4o와 Pixtral이 이전 해부학적 지식을 기반으로 답변을 생성하는 경향이 있음을 보여주었습니다.

네 번째 질문은 비전-언어 모델이 의료.context 없이 상대적 위치를 처리하는 능력에 대한 것입니다.

연구자들은 GPT-4o와 Pixtral이 상대적 위치를 결정할 때 이전 해부학적 지식을 기반으로 하는 경향이 있음을 관찰했습니다.

결론

이 연구는 현재의 최첨단 언어 모델이 제공된 데이터를 읽거나 검토하지 않는다는 것을 보여주었습니다. 이는 의료 영상을 사용하여 진단을 내릴 때 위험한 오류를 일으킬 수 있습니다.

이 연구는 또한 이러한 모델이 제공된 데이터에 대한 가정이나 전제를 기반으로 답변을 생성하는 경향이 있음을 보여주었습니다.

이러한 모델이 제공된 데이터를 읽지 않고 답변을 생성하는 이유 중 하나는 답변 속도를 높이기 위해 업로드된 데이터를 불필요한 것으로 간주하고 텍스트 프롬프트에만 의존하는 것입니다.

이러한 모델의 이러한 행동은 의료.context에서 치명적인 오류를 일으킬 수 있습니다.

연구자들은 이러한 문제를 해결하기 위해 데이터셋을 개발했습니다.

이 연구는 의료 영상을 사용하여 진단을 내릴 때 이러한 모델의 한계를 이해하는 것이 중요하다는 것을 보여주었습니다.

 

* 인라인 인용문은 포함할 수 있는 방법이 없으므로 생략되었습니다. 원본 논문을 참조하십시오.

2025년 8월 4일 처음 게시되었습니다.

기계 학습 분야 작가, 인간 이미지 합성 분야 전문가입니다. Metaphysic.ai의 연구 콘텐츠 책임자였으며, DNEG의 Brahma.ai로의 합병으로 해체될 때까지 그 역할을 수행했습니다.
포트폴리오 사이트: martinanderson.ai
연락처: martin@martinanderson.ai