헬스케어

Google의 AMIE 1차 진료 타당성 연구, The Lancet에 게재

mm
Unite.AI를 Google의 선호 소스에 추가

Google 및 Beth Israel Deaconess Medical Center 연구원들이 이끄는 전향적 임상 연구로, 실제 응급 1차 진료 클리닉에서 Google의 AMIE 대화형 진단 AI를 평가한 결과가 2026년 10월 8일 The Lancet에 게재되었으며, 이는 Google의 발표에 따르면이다. 연구에서는 98명의 환자가 응급 진료 방문 전에 AMIE 챗봇과 상담했으며, 감독 의사가 실시간으로 상호작용을 모니터링했으며, 사전 정의된 안전 기준에 따라 중단된 대화는 없었다.

Google은 이 논문을 The Lancet 주요 저널에 실린 최초의 논문이라고 설명했다. 회사는 규모에 맞는 환자 대상 AI를 평가하기 위해 더 큰 임상 시험이 필요하다고 말했으며, 연구 결과가 AI가 환자와 의사의 관계를 강화하고 의료 종사자의 부담을 완화할 잠재력이 있음을 시사한다고 밝혔다.

연구 설계 및 안전 감독

이 시스템은 정식 명칭이 Articulate Medical Intelligence Explorer (AMIE)이며, BIDMC 의사와의 응급 1차 진료 예약 후 환자들이 집에서 사용할 수 있는 의료 AI 챗봇이다. Google Research 팀의 보고서에 따르면, 100명의 성인 환자가 AMIE와 사전 방문 상호작용을 완료했으며, 그 중 98명이 예약된 진료에 참석했다. 신규이며 비응급인 일시적 증상으로 예약된 참여자들은 방문 5일 전까지 보안 텍스트 채팅 인터페이스를 통해 시스템과 상호작용했다. 시스템은 증상을 묻고, 병력을 수집하며, 환자가 의사와 논의할 수 있는 잠재적 진단을 제시하고, 임상의가 사전에 검토할 수 있는 요약을 생성했다. 이 전향적 단일군 단일센터 연구는 ClinicalTrials.gov에 사전 등록되었으며, 기관생명윤리위원회 승인 프로토콜 하에 수행되었고, 환자들에게 참여 결정이 치료에 영향을 미치지 않을 것임을 보장했다.

참여자들은 클리닉 전체 응급 진료 인구보다 연령이 더 낮은 편이었다. 연구 기간 동안 총 1,452건의 응급 진료 방문 중 절반 이상이 60세 이상 환자였으며, 샘플의 여성 및 백인 비율은 클리닉 인구와 일치한다고 Google Research가 밝혔다.

BIDMC는 연구가 2025년 4월부터 11월까지 진행되었으며 114명의 환자를 등록했으며, 모든 대화가 실시간으로 보드 인증 내과 전문의가 화면 공유와 라이브 영상 통화로 모니터링했다고 보고했다. 감독자는 네 가지 사전 정의된 기준에 따라 개입하도록 교육받았다: 자신이나 타인에 대한 즉각적인 위험, AI 상호작용과 관련된 심각한 정서적 고통, 감독자가 확인한 임상적 위험 가능성, 혹은 환자의 명시적인 세션 종료 요청. 98건의 완료된 상담 전체에서 안전 중단이 필요한 대화는 없었으며, 감독 의사는 한 건의 환각을 확인하고 다섯 건에서 추가 임상 설명을 제공했으며, 이는 BIDMC의 2026년 10월 9일 발표에 따르면이다. “이 연구는 실제 환경 대화의 기본 특성을 규정하는 데 도움이 된다”고 BIDMC의 심혈관 내과 임상 펠로우이자 공동 제1저자 Peter Brodeur가 발표문에서 말했다. BIDMC는 이번 연구가 1차 진료에서 환자 대상 대화형 AI 시스템에 대한 최초의 전향적 실제 연구라고 믿는다고 밝혔다.

진단 추론 결과

연구팀에 따르면 AMIE의 감별 진단은 각 상담 후 8주 차 차트 검토를 통해 확정된 최종 진단을 90%의 사례에서 상위 7개 가능성 내에 포함했으며, 상위 3개 정확도는 75%, 최종 진단을 가장 가능성이 높은 단일 진단으로 식별한 비율은 56%였다. 최종 진단이 실험실, 미생물학, 병리학 또는 영상 결과와 같은 진단 검사로 확인된 46명 환자 하위 집합에서도 정확도는 높은 수준을 유지했다.

블라인드 및 무작위 비교에서 각 사례당 3명의 임상 평가자 패널이 AMIE와 1차 진료 제공자의 감별 진단 및 치료 계획을 평가했으며, 감별 진단의 전반적인 품질(p = 0.6)과 치료 계획의 적절성(p = 0.1) 및 안전성(p = 1.0)이 유사함을 연구의 사전 인쇄 기록에 따라 확인했다. 의사들은 실용성(p = 0.003)과 비용 효율성(p = 0.004)에서 AMIE보다 우수한 성과를 보였다. Google Research는 이러한 차이를 AMIE가 환자의 전자 건강 기록에 접근할 수 없고, 신체 검사를 수행할 수 없으며, 환자의 전반적인 외모와 같은 다중모달 입력이 부족한 데 기인한다고 설명했다.

환자 및 임상의 경험

환자들은 채팅 전, 채팅 후, 그리고 진료 후에 일반 인공지능 태도 척도를 작성했으며, 연구진에 따르면 AMIE와 상호작용한 후 태도가 크게 긍정적으로 전환(p < 0.001)했고, 진료 후에도 높은 수준을 유지했다. BIDMC는 환자들이 시스템의 경청, 정보 설명, 편안함 제공 측면에서 높은 평가를 내렸지만, 시스템에 공유된 정보의 기밀성에 대한 신뢰와 챗봇의 정직성 및 신뢰성에 대한 우려는 남아 있다고 밝혔다. BIDMC의 Carl J. Shapiro 연구·교육 연구소 AI 프로그램 이사 Adam Rodman은 향후 연구에서 어떤 상호작용 특성이 환자 신뢰를 구축할 수 있는지, AI 상호작용이 환자-의사 관계를 어떻게 강화할 수 있는지를 탐구해야 한다고 말했다.

1차 진료 제공자들은 44건의 사례에서 환자를 만나기 전에 AI가 생성한 전사본 또는 요약을 검토했으며, 의사들은 이것이 75%의 경우에 방문 준비에 도움이 되었고 57%의 경우에 임상 접근 방식에 영향을 미쳤을 수 있다고 BIDMC가 보고했습니다. 한 사례에서는 제공자가 상호작용을 다소 해롭다고 설명했으며, AMIE가 가능한 진단 중 림프종을 포함한 후 환자가 불안을 경험했을 가능성에 대한 우려를 제기했습니다. Google Research가 보고한 정성적 인터뷰에서 의사들은 AMIE가 단순 데이터 수집에서 데이터 검증으로 방문 역학을 전환시켜 보다 협업적인 대화와 공동 의사결정을 가능하게 했다고 말했습니다.

제한 사항, 자금 지원 및 사전 공개

연구팀은 이 작업을 통제된 비교가 없는 단일 센터 타당성 연구로 설명하며, 이는 기준 워크플로에 대한 정량적 효능 주장을 뒷받침하지 않으며, 텍스트 전용 인터페이스와 건강 문해력, 기술 문해력, 챗봇 친숙도에 대한 미탐색 효과 등을 포함한 추가 제한 사항을 나열했습니다. Rodman과 동료들은 이 연구가 AI가 건강 결과를 개선하는지를 판단하기보다 타당성을 평가하도록 설계되었다고 강조했습니다.

BIDMC는 이 연구가 Alphabet의 자금 지원을 받았으며 Rodman이 연구 기간 중 일부에 Google에서 방문 연구원으로 근무했음을 공개했습니다. Brodeur와 Jacob M. Koshy는 논문의 공동 제1저자이며, Rodman은 저자 명단의 마지막에 기재되어 있고, Marc L. Cohen은 공동 선임 저자입니다.

연구 결과는 2026년 3월에 처음 공개되었습니다: 사전 인쇄본은 2026년 3월 9일 arXiv에 제출되었으며, Google Research 팀은 2026년 3월 11일 상세 보고서를 발표했고, 2026년 10월 8일 해당 게시물을 업데이트하여 Lancet 게재를 알렸습니다. 연구팀은 향후 통제된 비교가 포함된 더 큰 연구에서 이러한 시스템의 유용성과 영향을 지속적으로 평가할 계획이라고 밝혔습니다.

Aria Bloom은 AI로 생성된 리서치 에이전트로, 인공지능이 바이오테크놀로지와 유전체 연구를 어떻게 변화시키는지 탐구합니다. 그녀의 글은 정확성과 생명 과학 미래에 대한 깊은 호기심을 결합합니다.

합성생물학부터 맞춤형 의학까지, Aria는 머신러닝이 인간 건강 혁신을 어떻게 가속화하고 있는지 분석합니다.

Aria Bloom이 작성한 기사들은 AI 생성이며, 정확성과 준수를 위해 Unite.AI의 편집 팀이 검토합니다.