AI 모델 및 플랫폼

OpenEvidence, 다윈 프리뷰와 함께 의료 AI 모델 패밀리 출시

mm
Unite.AI를 Google의 선호 소스에 추가

OpenEvidence는 2026년 9월 3일에 새로운 의료 AI 검색 모델 패밀리를 출시했으며, 검증된 임상의에게는 세 가지 생산 모델을 무료로 제공하고, 네 번째 모델은 가장 진보된 모델로 연구자에게는 신청을 통해서만 이용할 수 있다고 설명했습니다.

세 가지 생산 모델은 의학 역사에 등장하는 인물들의 이름을 따서 명명되었습니다. Osler는 회사가 가장 빠른 모델이라고 설명하며 답변당 약 5초가 소요되며, 이전에 OpenEvidence 답변을 구동하던 모델의 후속 모델로 플랫폼의 기본 모델이 됩니다. Sackett은 증거의 무게에 따라 답변이 약 30초가 소요되는 더 깊은 검색 모델로 위치합니다. Snow는 OpenEvidence Deep Consult 기능의 후속 모델로, 답변당 약 5분이 소요되는 가장 깊은 생산 모델이며, 의료 문헌을 완전하게 조사한 후 보고서를 생성합니다.

모델들은 openevidence.com 및 회사의 iOS와 Android 앱을 통해 모든 OpenEvidence 사용자에게 순차적으로 제공되며, 임상의는 인터페이스의 모델 선택기를 통해 모델을 선택할 수 있습니다. OpenEvidence는 패밀리의 모든 모델이 동일한 임상 정확성 기준을 충족한다고 밝혔으며, 차이는 모델이 생각하는 시간과 검색 깊이에 있습니다.

이름의 유래는 William Osler(의료 교육을 강의실에서 침대로 옮긴 인물), David Sackett(근거 기반 의학의 아버지로 기억되는 인물), 그리고 John Snow(1854년 브로드 스트리트 콜레라 발병을 단일 급수 펌프로 추적하고 현대 역학의 기초를 닦은 인물)입니다.

연구 프리뷰에서의 다윈

네 번째 모델인 Darwin은 연구 프리뷰 단계에 있으며 일반적으로는 공개되지 않습니다. 공지에서 OpenEvidence는 Darwin을 세계에서 가장 진보된 의료 AI 모델이라고 설명하며, MedQA에서 완벽한 점수를 달성한 최초의 AI 모델이라고 밝혔습니다. MedQA는 회사가 의료 AI 분야의 가장 독립적인 벤치마크라고 부르는 시험입니다. 또한 회사는 Darwin이 MedXpertQA에서 72.8%, HealthBench Professional에서 82.7%, NOHARM에서 87.2%의 성능을 기록해 차세대 모델인 Claude Fable 5와 Gemini 3.7보다 앞선다고 보고했습니다.

접근은 신청을 통해서만 가능합니다. OpenEvidence는 그 이유가 이중 사용 위험: 바이러스학, 면역학, 인간 유전학의 최전선에서 추론할 수 있는 모델이 잘못된 손에 들어가면 생물무기 관련 연구나 주류 과학적 감독 밖의 생식세포 편집과 같이 엄격히 규제되는 작업을 가속화할 수 있기 때문이라고 설명했습니다. 현재 접근은 희귀질환 국가기구(National Organization for Rare Disorders)와 같은 기관 파트너, 연구 협력자, 그리고 임상 의학에서 AI의 정확성과 안전성을 평가하는 학술 기관의 인증된 AI 연구자들을 포함합니다. 회사는 Darwin의 기능이 이러한 파트너와 함께 보호 장치가 검증되는 동안 Osler, Sackett, Snow에 적용될 것이라고 밝혔습니다.

벤치마크 방법론

동반 기술 포스트 여기에서 OpenEvidence는 평가 설정을 상세히 설명했습니다. MedQA의 경우, 회사는 벤치마크의 1,273문제 4지선다 테스트 분할에 대해 의사들이 재주석을 달은 것을 시작점으로 삼고, 누락된 정보, 모호성, 라벨 오류에 대한 제외 기준을 적용했으며, 2026년 8월에 세 명의 OpenEvidence 의사가 잘못 답한 모든 질문을 재검토하는 두 번째 검토 과정을 거쳤습니다. 이를 통해 최종 평가 세트인 660문제가 만들어졌으며, Darwin은 이 질문들을 오류 없이 모두 답했습니다. 회사는 네 가지 벤치마크에 대한 주석과 Darwin의 전체 응답을 공개하고 있습니다.

MedXpertQA에서는 Darwin을 다중모달 하위집합을 제외한 전체 2,450문제 텍스트 분할에 대해 평가했습니다. HealthBench Professional의 경우, 회사는 공개된 테스트 세트에서 다중 턴 사례를 제외하여 525개 과제 중 410개만 남겼으며, Anthropic이 발표한 LLM-as-a-judge 구성으로 Claude Opus 4.8을 사용해 최대 32,000 토큰의 사고 예산으로 응답을 채점했습니다. NOHARM은 실제 상담 사례에서 유해 권고의 빈도와 심각성을 평가하는 벤치마크로, 30건의 공개 하위집합에 대해 공식 오픈소스 패키지를 사용해 채점했습니다.

기준 모델은 claude-fable-5(적응형 사고), gpt-5.6-sol(기본 추론 노력), gemini-3.7-flash(기본 추론 노력)로 실행했으며, 각 제공자의 API 기본값을 사용하고 도구나 맞춤형 시스템 프롬프트는 사용하지 않았습니다. HealthBench Professional 점수는 모델당 최소 다섯 번 이상의 독립적인 실험을 평균한 것이며, 다른 데이터셋은 단일 평가로 점수를 매겨 평균 점수가 전체에 보고되었습니다.

포스트에 따르면, Darwin의 MedXpertQA 점수는 가장 강력한 기준 모델보다 7.7점 높았으며, HealthBench Professional 점수는 다음 최우수 모델보다 12.1점 높았고, NOHARM의 심각도 가중 F1 점수는 0.872로 가장 근접한 기준 모델의 0.740을 앞섰습니다. 회사는 Darwin의 NOHARM에서 가중되지 않은 정밀도가 몇몇 기준 모델보다 낮다는 점을 인정했으며, 이 메트릭은 루브릭에 없는 모든 권고를 거짓 양성으로 계산하고, Darwin은 의사에게 모든 관련 옵션을 제공하도록 조정되었다고 설명했습니다. 또한 Darwin의 심각도 가중 정밀도는 0.9라고 보고했습니다.

가용성 및 향후 단계

Osler, Sackett, Snow는 검증된 모든 임상의에게 비용 없이 무제한으로 이용할 수 있습니다. Darwin은 회사 웹사이트의 신청 절차를 통해 연구자에게 제공됩니다.

OpenEvidence는 향후 종양학, 방사선학, 임상 유전학 등 전문 분야를 위한 모델을 포함하여 모델 패밀리를 지속적으로 개선·확장·접근성을 높여 나갈 것이라고 밝혔습니다.

아리아 블룸은 생명 과학 및 유전체 연구에서 인공지능이 어떻게 변화를 가져오는지를 탐구하는 인공지능 생성 저널리스트입니다. 그녀의 글은 정밀함과 생명 과학의 미래에 대한 깊은 호기심을 결합합니다.
합성 생물학에서 개인화된 의학까지, 아리아는 기계 학습이 인간 건강 혁신을 가속화하는 방법을 분석합니다.
아리아 블룸이 작성한 기사들은 인공지능에 의해 생성되어 Unite.AI의 편집 팀에 의해 정확성과 준수를 위해 검토됩니다.