헬스케어

예측에서 책임 있는 행동으로: 불확실성을 설계하는 Femtech AI

mm
Unite.AI를 Google의 선호 소스에 추가

여성의 건강에서 정확도는 필수적이지만 제품 안전성의 첫 번째 계층에 불과합니다. 시스템이 예측을 신뢰할 수 있는지 여부와 신뢰할 수 없는 경우 이를 알릴 수 있는지 여부가 중요합니다.

대부분의 생식능력 추적 앱이나 생리 추적 앱을 열면 깨끗한 결과가 나타납니다. 예를 들어, 15일째에 생리가 나타날 것이라는 결과와 78%의 확신度가 나타날 수 있습니다. 숫자는 정확해 보이지만, 그 아래에 있는 생리는 그렇지 않습니다.

생리는 사용자가 관찰한 것입니다. 생식능력은 소비자 기기가 직접 측정하지 않는 잠재적인 이벤트입니다. 이는 대리 변수에서 추론됩니다. 피부 온도는 프로게스테론뿐만 아니라 수면, 음주, 질병, 주변 환경 및 센서의 위치도 반영합니다. 증상 입력은 생리학과 인식, 기억 및 사용자의 로그인 결정이 혼합됩니다. 이러한 모든 요소가 “15일, 78%”라는 결과로 결론지어질 때, 여러 종류의 불확실성이 하나의 확신 있는 문장으로 압축됩니다.

저가 작업한 여성 건강 제품에서 어려운 문제는 정확도가 아닙니다. 저는 계속해서 돌아오는 패턴은 의사 결정의 완전성이 아니라는 것을 발견했습니다. 정확도는 모델이 얼마나 잘 예측하는지 알려줍니다. 그러나 시스템이 예측을 신뢰할 수 있는지 여부에 대해서는 아무것도 말하지 않습니다. 동일한 출력이 계획 또는 피임 결정에 영향을 줄 수 있는 영역에서 이러한 차이는 신뢰를 얻거나 잃는 곳입니다.

저의 주장은 Femtech AI가 예측을 더 잘해야 하는 것이 아니라 불확실성을 더 잘 설계해야 한다는 것입니다. 불확실성 설계는 출시 전 부가적인 내용이 아닙니다. 그것은 구조입니다. 저는 6개의 계층으로 구성된 Calibrated Decision-to-Action Product Method를 구조화합니다. 이 방법은 건강 데이터에서 시작하여 의사 결정 구조를 거쳐 책임 있는 행동으로 이어지는 신호를 전달합니다. 이 방법에는 데이터 자격, 추론 보정, 결과 매핑, 제어 정책, 워크플로우 실행 및 책임성 루프가 포함됩니다.

1. 데이터를 신뢰하기 전에 데이터를 평가하십시오

첫 번째 계층은 시스템이 실제로 무엇을 알고 있는지 결정합니다. Femtech 제품은 매우 다른 출처에서 데이터를 가져옵니다. 사용자가 직접 관찰한 항목, 예를 들어 생리 날짜 또는 주관적인 보고서와 같은 통증 또는 기분, 그리고 사용자自身에서 생성된 변수와 같이 다양한 항목이 포함될 수 있습니다. 이러한 항목을 상호 교환 가능한 입력으로 취급하는 것은 원래의 잘못입니다.

각 신호는 시스템이 읽을 수 있는 출처를 필요로 합니다. 즉, 어디에서 왔는지, 언제, 얼마나 자주 샘플링되었는지, 무엇이 그것을 혼동시키는지, 그리고 무엇을 실제로 예측하는지에 대한 정보가 필요합니다. 생식능력은 이벤트입니다. 온도, 자궁頸粘液, LH 및 생리 날짜는 각자 고유의 지연과 오류를 갖는 그 이벤트에 대한 증거입니다.

결측값은 특별한 주의를 필요로 합니다. 건강 추적에서 결측값은 거의 무작위적으로 발생하지 않습니다. 사용자는 걱정할 때 더 많이 로그인하고 괜찮을 때 중단하므로 결측값은 실제로 정보를 포함할 수 있습니다. 60만 개 이상의 생식능력 주기를 분석한 연구에서 생식능력은 140만 개의 주기 중 665,603개에서 감지되지 않았습니다. 그 중 3/4는 주기 중 절반의 날에 유효한 온도 읽기가 없었습니다. 데이터 충분성은 알고리즘이 추론할 수 있는 한계가 되었습니다. 이러한 상황에서 확신 있는 생식능력 레이블을 내놓는 제품은 확신을 가지고 있지 않습니다. 그것은 실제로 가지고 있지 않은 정밀도를 제조하는 것입니다.

2. 증거에 따라 추론을 보정하십시오

단일 확신도는 실제로 발생하는 것을 대표할 수 없습니다. 이러한 시스템은 동시에 여러 가지 불확실성에 직면하기 때문입니다. 이는 생리학적 변이성, 측정 품질, 자가 추적의 결측값, 모델의 불확실성, 훈련 데이터의 희박성 및 모델을 검증한 인구와 현재 사용자가 다를 때 발생하는 분포 이동을 포함합니다.

同じ 분석에서, 주기 중 13%만이 정확히 28일이었으며, 평균 포도막 단계는 16.9일로, достаточно 넓은 범위로 인해 “14일”이라는 가정은 ввод식으로 작용할 수 있습니다. Apple 여성 건강 연구에서 주기 길이와 개인 내 변동성은 나이, 자가 보고民族성, 체질량지수와 관련이 있었습니다. 개인화는 인구 평균을 개인 점으로 바꾸는 것이 아닙니다. 그것은 증거가 축적됨에 따라 분포를 좁히는 것입니다.

예를 들어, 두 가지 AI 기반 예측이 모두 “75%”를 읽는 경우를 고려하십시오. 하나는 1년의 기록과 밀도 있는 측정에 기반하고 있으며, 그 불확실성은 대부분 실제 생물학적입니다. 다른 하나는 2개의 주기, 5개의 온도 읽기, 최근 여행, 알 수 없는 약에 기반하고 있습니다. 여기서 불확실성은 대부분 결측값으로 인한 것입니다. 동일한 숫자이지만, 제품은 두 경우에 대해 동일하게 반응해서는 안 됩니다. 이것이 왜 보정을 하위 그룹 내에서 확인해야 하는 이유입니다. 집계 성능은 불규칙한 주기 또는 폐경기 사용자를 위한 과신 모델을 숨길 수 있습니다. 임상-AI 문헌은 정확히 이 이유로 인해 차별, 보정 및 의사 결정 유틸리티를 구분합니다. 모델은 사용자를 잘 ран킹할 수 있지만 실제 결정에 대한 잘못된 확률을 생성할 수 있습니다.

3. 잘못된 경우의 결과를 매핑하십시오

세 번째 계층은 시스템이 잘못된 경우에 발생하는 상황을 묻고, 허용된 반응을 해당 비용에 연결합니다. 생리 주기 요약, 생식능력 창 예측, 피임 지침으로 사용되는 저생식능력 레이블 및 치료를 결정하는 증상 해석은 동일한 모델을 사용하는 동일한 제품이 아닙니다.

저는 출력을 4개의 계층으로 구분합니다. 정보, 행동, 생식, 임상 계층으로 나뉩니다. 각 계층에는 자신의 증거 임계값, 허용 언어 및 에스컬레이션 경로가 있습니다. 70%의 확률은 생리가 언제 시작될지猜测하는 데 충분할 수 있지만, 임신을 피하려고 하는 사람에게 충분한 확신을 줄 수는 없습니다.

이것은 디자인과 규제가 만나는 곳입니다. 소프트웨어가 의료 기기 영역으로 넘어가는지 여부는 의료 결정에서 출력이 차지하는 역할과 의도된 사용에 달려 있습니다. FDA의 현재 임상 의사 결정 지원 소프트웨어 지침은 2026년 1월에 업데이트되었으며, 환자와 간호자를 위한 기능이 기기의 정의를 충족할 수 있다고 명시하고 있습니다. 규제적 위치는 마지막에 법적 검토가 아닙니다. 그것은 임계값, 단어 선택, 에스컬레이션 논리에서부터 코딩된 것입니다.

4. 불확실성을 제어 정책으로 전환하십시오

일괄적인 “결과는 부정확할 수 있음”은 해석 문제를 사용자에게 돌려보냅니다. 제어 정책은 반대입니다. 특정 증거 상태에 대해, 시스템이 관찰을 표시하거나, 범위를 제공하거나, 추가 측정을 요청하거나, 임상의에게 지시하거나, 답변을 거부할지 결정합니다. 답변을 거부하는 것은 제품의 능력입니다. 실패가 아닙니다. “우리는 아직 확신할 수 없습니다”는 설계된 상태여야 하며, 다음 단계를 가져야 합니다. 오류 화면이 아닙니다.

구체적으로, “생식능력: 15일, 78%”라는 문구 대신, 다음과 같은 응답을 생성할 수 있습니다. 생식능력은 4일 동안 가장 가능성이 높습니다. 확신도는 결측 온도 데이터와 방해된 수면으로 제한됩니다. 몇 가지 더 읽기가 예측을 더 정확하게 만들 수 있으며, LH 테스트를 통해 더 좁은 가능성의 창을 제공할 수 있습니다. 사용자는 추정치, 그 이유, 그리고 추정치를 변경할 수 있는 단일 동작을 얻습니다.

5. 출력이 암시하는 행동을 지원하십시오

소비자 앱이라도 워크플로우를 생성합니다. 로그를 추가하거나, 테스트를 반복하거나, 관찰을 계속하거나, 데이터를 내보내거나, 임상의에게 연락할 수 있습니다. 시스템은 각 응답이 어떤 행동을 가리키는지 알고, 그 행동을 안전하게 지원할 수 있는지 여부를 알아야 합니다.

제품 지침과 의료 조언 사이의 경계는 여기 살고 있으며, 이는 고정된 선이 아닙니다. 일반적으로 어떤 신호가 의미하는지에 대한 교육 콘텐츠는 제품 지침의 안전한 영역에 있습니다. 그러나 제품은 개인의 데이터를 질병으로 해석하거나 치료를 지시하거나, 실제 임상적 중요성을 가진 안심을 제공할 때 더 위험한 영역으로 이동합니다. 이러한 경계는 모든 상호작용에서, 약관에만 있지 않아야 합니다.

6. 책임성 루프를 닫으십시오

마지막 계층은 모델뿐만 아니라 전체 시스템을 평가합니다. 표준 모델 메트릭은 여전히 중요하며, 차별, 보정, 하위 그룹 성능 및 외부 및 시간적 검증에 초점을 맞춥니다. 그러나 제품 수준의 메트릭도 중요합니다. 시스템이 입력을 Enough으로 행동할 수 있었는지, 얼마나 자주 시스템이 행동을 거부했는지 물어야 합니다. 그리고 제가 주장하는 메트릭은 잘못된 안심도율, 즉 시스템이 주장할 수 없는 증거에서 모든 것이 괜찮다고 말한 빈도입니다.

의미 있는 모든 응답은事後에 재구성 가능해야 합니다. 규제 기관, 표준 기관 및 글로벌 건강 관리 기관은 모두 라이프사이클 관점을 채택하고 있습니다. IMDRF의 좋은 기계 학습 관행 원칙은 신뢰할 수 있는 의료 AI를 설계, 배포 및 모니터링을 포함하는 전체 라이프사이클 책임으로 다룹니다. WHO의 AI 건강 지침과도 일치합니다.

구조가 실제로 어떻게 보이는지

제품이 3개월의 생리 날짜, 6박의 온도, 1개의 양성 LH 테스트, 증상 입력의 산재 및 1주의 나쁨 수면을 가지고 있다고 가정해 보십시오. 모델의最高 생식능력 확률은 15일째에 있습니다. 점 추정 앱은 “생식능력: 15일, 78% 확신”을 표시합니다.

구조는 다른 것을 생성합니다. 온도 데이터를 희박하고 수면에 방해를 받은 것으로 표시합니다. 후보日の 여러 후보일을 걸쳐 분포를 생성합니다. 주기 인식에 대한 완만한 임계값을 적용하지만, 피임과 관련된 출력에는 더 엄격한 임계값을 적용합니다. 범위와 다음 유용한 측정을 제공합니다. 그리고 증거 상태를 저장하여 결정이事後에 재구성될 수 있도록 합니다. 동일한 기본 모델이지만, 매우 다른 제품입니다.

행동의 권리

Femtech 시스템은 더 많은 데이터를 축적하고 있습니다. 앱, 웨어러블 기기, 홈 테스트, 의료 기록 및 대화형 계층이 쌓여 있습니다. 더 많은 데이터는 추론을 더 정확하게 만들 수 있지만, 잘못된 정밀도의 표면도 넓힙니다. 신뢰를 얻는 팀은 가장 깨끗한 확신도 점수를 가진 팀이 아닙니다. 그것은 제품이 무엇을 모르는지 알고, 모르는 것을 말할 수 있는 팀입니다.

정확도는 예측의 품질을 설명합니다. 의사 결정의 완전성은 제품이 예측을 신뢰할 수 있는지 여부를 결정합니다.

Mariia Kulikovskaia는 건강 관련 데이터 제품에 대한 제품 전략 전문가로서 건강 관련, 환경 건강, AI를 사용한 기술 제품 전반에 걸쳐 작업합니다. 그녀의 업무에는 환경 건강 모니터링 시스템 및 의료 규정 준수 분석 제품을 위한 B2B 제품 전략이 포함됩니다.