인터뷰
이타이 다얀, MD, 리노 헬스 공동 창립자 및 CEO – 인터뷰 시리즈

이타이 다얀, MD는 리노 헬스(Rhino Health)의 공동 창립자이자 CEO입니다. 그의 배경은 인공 지능 및 진단 개발, 임상 의학 및 연구에 있습니다. 그는 이전에 BCG의 헬스케어 부문 핵심 멤버였으며 병원 행정관이었습니다. 그는 현재 헬스케어 및 생명 과학 산업에서 안전하고, 공정하고, 영향력 있는 인공 지능 개발에 기여하는 데 집중하고 있습니다. 리노 헬스에서는 분산 컴퓨팅과 연합 학습(Federated Learning)을 통해 환자隐私를 유지하고 분산된 헬스케어 환경에서 협력을 촉진하는 방법으로 사용하고 있습니다.
그는 이스라엘 방위군 특수 부대에서 복무했으며, 세계에서 가장 큰 학술-의학 센터 기반의 번역 인공 지능 센터를 이끌었습니다. 그는 인공 지능 개발 및 상업화 전문가이며, 장거리 주자입니다.
리노 헬스의 기원에 대한 이야기를 공유해주실 수 있나요?
저의 인공 지능과의 여정은 임상 의사 및 연구자로서 시작되었습니다. 저는 초기 형태의 ‘디지털 바이오마커’를 사용하여 정신 질환의 치료 반응을 측정했습니다. 이후 저는 매사추세츠 종합병원(Mass General Brigham)의 임상 데이터 과학 센터(Center for Clinical Data Science, CCDS)를 이끌었습니다. 그곳에서 저는 수십 개의 임상 인공 지능 애플리케이션을 개발했으며, 규제 등급의 인공 지능 제품을 개발하고 훈련하는 데 필요한 데이터에 접근하고 ‘활성화’하는 데 따른 기본적인 도전을 직접 목격했습니다.
헬스케어 인공 지능의 발전에도 불구하고, 개발에서 제품을 시장에 출시하는 길은 길고 때로는 거친 길입니다. 솔루션은 임상적으로 배포되면 충돌하거나(또는 단순히 실망스럽게)하며, 전체 인공 지능 수명 주기를 지원하는 것은 지속적인 임상 데이터에 접근하지 않는 한 거의 불가능합니다. 도전은 모델을 생성하는 것에서 모델을 유지하는 것으로 전환되었습니다. 이러한 도전에 답하기 위해, 저는 매사추세츠 종합병원 시스템에 인공 지능을 위한 전문 CRO(임상 연구 기관)를 갖는 가치에 대해 확신시켰습니다. 여러 상업 개발자의 알고리즘을 테스트하기 위한 것입니다.
그러나 문제는 여전히 남아있었습니다. 건강 데이터는 여전히 매우 분리되어 있으며, 하나의 네트워크에서 나온大量의 데이터만으로는 의료 인공 지능의 점점 더 좁아지는 목표를 극복하기에 충분하지 않습니다. 2020년 여름, 저는 NVIDIA (NVDA ) 의 모나 플로레스 박사와 함께 세계에서 가장 큰 헬스케어 연합 학습 연구인 EXAM을 주도하고 수행했습니다. 우리는 연합 학습을 사용하여 COVID 결과 예측 모델을 만들었으며, 데이터를 공유하지 않고 전 세계의 데이터를 활용했습니다. 이후 Nature Medicine에 발표된 이 연구는 다양한 및 이질적인 데이터셋을 활용하는 것의 긍정적인 영향을 보여주었으며, 헬스케어에서 연합 학습의 보다 광범위한 사용 가능성을 강조했습니다.
이 경험은 그러나 여러 가지 도전을 명확히 했습니다. 이러한 도전에는 협력 사이트 간의 데이터를 조율하는 것, 데이터 추적 가능성 및 적절한 특성화 보장, 각 기관의 IT 부서에 부과되는 부담이 포함되었습니다. 이 부서들은 익숙하지 않은 최신 기술을 배우야 했습니다. 이는 협력을 지원하는 새로운 플랫폼을 필요로 했습니다. 저는 공동 창립자 유발 바로와 함께 연합 학습 및 에지 컴퓨팅을 활용하는 종단 간 플랫폼인 리노 헬스 플랫폼을 만들기 위해 협력했습니다.
의료 환경에서 인공 지능 모델이 기대하는 결과를 제공하지 못하는 이유가 무엇이라고 생각하시나요?
의료 인공 지능은 종종 작은, 狭い 데이터셋에서 훈련되며, 이는 결과 모델이 오직 훈련된 데이터 유형에만 잘 수행되도록 합니다. 알고리즘이 훈련 데이터셋과 다른 환자나 시나리오에 적용되면 성능이 크게 저하됩니다.
앤드류 응은 이 개념을 잘 포착했습니다. “스탠퍼드 병원에서 데이터를 수집할 때… 인공 지능 시스템이 특정 상태를 감지하는 인간 방사선과 비교할 수 있는 연구를 발표할 수 있습니다. … 동일한 모델, 동일한 인공 지능 시스템을 다른 병원으로 가져가면, 오래된 기계와 약간 다른 영상 프로토콜을 사용하는 기술자가 있으면, 데이터 드리프트로 인해 인공 지능 시스템의 성능이 크게 저하됩니다.”
간단히 말해, 대부분의 인공 지능 모델은 현실 세계에서 좋은 성능을 발휘할 수 있도록 충분히 다양한 데이터와 높은 품질의 데이터에서 훈련되지 않습니다. 이는 과학 및 주류 원에서 잘 문서화된 문제입니다.
다양한 환자 그룹에서 테스트하는 것이 얼마나 중요한가요?
다양한 환자 그룹에서 테스트하는 것은 안전하고 효과적인 인공 지능 제품을 보장하는 데 매우 중요합니다. 충분히 다양한 환자 그룹에서 훈련되지 않은 알고리즘은 알고리즘적 편향으로 고통받을 수 있으며, 이는 헬스케어 및 헬스케어 기술에서 심각한 문제입니다. 이러한 알고리즘은 훈련 데이터에 존재하는 편향을 반영할 뿐만 아니라, 이러한 편향을 강화하고, 이미 존재하는 의료의 인종, 민족, 종교, 성별 등 불평등을 합성합니다. 다양한 환자 그룹에서 테스트하지 않으면 위험한 제품이 될 수 있습니다.
최근에 발표된 연구에서, 리노 헬스 플랫폼을 사용하여, 한 사이트에서 개발된 뇌 동맥류를 감지하는 인공 지능 알고리즘의 성능을 다른 네 사이트에서 다양한 스캐너 유형과 함께 조사했습니다. 결과는 다양한 스캐너 유형의 사이트에서 상당한 성능 변동성을 보여주었으며, 다양한 데이터셋에서 훈련하고 테스트하는 중요성을 강조했습니다.
서브 인구가 대표되지 않는 경우 이를 식별하는 방법은 무엇인가요?
일반적인 접근 방법은 다양한 데이터셋의 변수 분포를 분석하는 것입니다. 이는 개발자에게 훈련 데이터셋과 검증 데이터셋을 준비할 때 정보를 제공할 수 있습니다. 리노 헬스 플랫폼을 사용하면 이를 수행할 수 있으며, 사용자는 또한 모델이 다양한 코호트에서 수행하는 방식을 확인하여 일반화 가능성과 지속 가능한 성능을 보장할 수 있습니다.
연합 학습이 무엇이며, 이러한 문제를 어떻게 해결하는지 설명해주실 수 있나요?
연합 학습(Federated Learning, FL)은 인공 지능 모델이 훈련되고, 이후 시간의 경과에 따라 다양한 데이터를 사용하여 개선되는 과정입니다. 이는 인공 지능 개발에서 큰 발전입니다. 역사적으로, 여러 사이트와 협력하려는 사용자는 데이터를 수집해야 했으며, 이는 많은 법적, 위험, 및 규정 준수 문제를 초래했습니다.
오늘날, 리노 헬스 플랫폼과 같은 소프트웨어를 사용하면, 연합 학습은 헬스케어 및 생명 과학에서 일상적인 현실이되고 있습니다. 연합 학습을 통해 사용자는 협력자들의 로컬 서버에 데이터가 남아 있는 동안 데이터를 탐색, 큐레이션, 및 검증할 수 있습니다. 컨테이너화된 코드(예: 인공 지능/기계 학습 알고리즘 또는 분석 애플리케이션)는 로컬 서버에서 실행되며, 데이터는 데이터 관리 담당자에게 항상 남아 있습니다.
병원은 특히 민감한 환자 데이터를 수집하는 것과 관련된 위험에 대해 걱정합니다. 이는 이미 헬스케어 기관이 산업과 협력했지만, 데이터 사용을 정확히 이해하지 못한 상황이 발생했으며, 이는 협력을 제한하고, 연구 및 개발의 속도를 늦추며, 전체 헬스케어 산업의 제품 품질에 영향을 미칩니다. 연합 학습은 이러한 위험을 완화하고, 이전에 불가능했던 협력을 가능하게 할 수 있습니다.
리노 헬스가 다양한 데이터를 사용하여 모델을 빠르게 생성하는 비전을 공유해주실 수 있나요?
우리는 인공 지능 개발자와 사용자들이, 규정의 경계를尊重하면서, 협력할 수 있는 생태계를设想합니다. 협력자들은 지리적으로 분산된 데이터를 신속하게 식별하고, 데이터에 접근 및 상호 작용하고, 모델 개발을 반복하여 충분한 일반화, 성능, 및 안전성을 보장할 수 있습니다.
이 모든의 핵심에는 리노 헬스 플랫폼이 있습니다. 이는 인공 지능 개발자가 대규모 및 다양한 데이터셋을 구성하고, 인공 지능 알고리즘을 훈련 및 검증하며, 배포된 인공 지능 제품을 지속적으로 모니터링 및 유지하는 데 필요한 ‘원스톱샵’을 제공합니다.
리노 헬스 플랫폼이 인공 지능 편향을 방지하고 인공 지능 설명 가능성을 제공하는 방법은 무엇인가요?
데이터 협력을 개방하고, 간소화함으로써, 인공 지능 개발자는 더 큰, 더 다양한 데이터셋을 훈련 및 테스트에 사용할 수 있습니다. 더 강력한 데이터셋의 결과는 더 일반화된 제품이 되며, 단일 기관 또는 狭い 데이터셋의 편향에 의해 부담을 받지 않습니다. 인공 지능 설명 가능성을 지원하여, 플랫폼은 개발 과정에서 사용된 데이터에 대한 명확한 시각을 제공하며, 데이터起源, 값 분포 및 기타 주요 지표를 분석하여 충분한 데이터 다양성 및 품질을 보장할 수 있습니다.
의사들이 인공 지능에過度 의존하면, 독립적으로 검증되지 않은 편향된 결과가 나올 수 있다고 우려한다면, 어떻게 반응하시나요?
우리는 이러한 우려에 공감하며, 현재 시장에 있는 많은 애플리케이션이 실제로 편향될 수 있다는 것을 인정합니다. 우리의 반응은, 우리는 산업 전체로서, 환자 안전을 우선하는 헬스케어 커뮤니티로서, 이러한 편향을 방지하고, 안전하고 효과적인 인공 지능 애플리케이션을 보장하기 위한 정책 및 절차를 정의해야 한다는 것입니다. 인공 지능 개발자는 임상 환경에서 배포되기 전에 독립적으로 검증된 마케팅 인공 지능 제품을 보장하는 책임이 있습니다. 리노 헬스는 안전하고 신뢰할 수 있는 인공 지능 제품을 지원하는 데 전념하며, 협력자와 함께 임상 환경에서 배포되기 전에 인공 지능 애플리케이션의 독립적인 검증을 가능하게 하기 위해 노력하고 있습니다.
헬스케어의 미래에 대한 인공 지능 비전은 무엇인가요?
리노 헬스의 비전은 인공 지능이 헬스케어에서 그 전체 잠재력을 달성하는 세계입니다. 우리는 투명성을 창조하고, 협력을 촉진하며, 인공 지능을 가능하게 하는 세계를 만들기 위해 노력하고 있습니다. 우리는 불이익, 지리, 또는 규제 제한 없이 인공 지능을 갖춘 헬스케어를 꿈꾸고 있습니다. 인공 지능 개발자는 강력하고, 일반화된 모델을 구축하고, 지속적으로 개선하기 위해 필요한 모든 데이터에 제어된 접근을 가질 수 있습니다. 제공자와 환자는 데이터를 제어하지 못한다는 것을 알지 못할 것입니다. 규제 기관은 의약품 및 기기 개발에서 사용되는 모델의 효능을 실시간으로 모니터링할 수 있습니다. 공중 보건 기관은 인공 지능의 이러한 발전에 혜택을 받을 것입니다. 환자와 제공자는 인공 지능을 사용하면서도, 데이터가 보호되고 있음을 안심할 수 있습니다.
감사합니다. 더 많은 정보를 원하는 독자는 리노 헬스(https://www.rhinohealth.com)를 방문할 수 있습니다.












