ヘルスケア

予測から説明責任のある行動へ:フェムテックAIの不確実性設計

mm
Unite.AI を Google の優先ソースに追加

女性の健康において、精度は必要ですが、最初の層のみです。システムが予測を信頼できるかどうかを知ることが重要であり、信頼できない場合はそう言えるように設計する必要があります。

ほとんどの生殖能力や周期追跡アプリを開くと、きれいな結果が表示されます:15日目の排卵、78%の高生殖能力ラベル。数字は正確に見えますが、その下にある生物学はそうではありません。

月経日はユーザーが観察したものです。排卵は、消費者機器が直接測定できない潜在的なイベントです。代替指標から推測されます。皮膚温度は、プロゲステロンだけでなく、睡眠、アルコール、病気、周囲の条件、センサーの位置なども反映します。症状の入力は、生理学、認識、記憶、ユーザーの入力の決定などを混合します。すべてが「15日目、78%」という一つの信頼性の高い文に解決されるまでに、さまざまな種類の不確実性がすでに圧縮されています。

私が女性の健康で取り組んできた製品では、難しい問題は精度ではありません。繰り返し出てくるパターンは、決定の完全性です。精度は、モデルがどれほどよく予測するかを示しますが、製品が予測を信頼できるかどうかについては何も示しません。同じ出力が、計画や避妊の決定を下すことができる領域では、そのギャップが信頼を勝ち取ったり失ったりする場所です。

私の主張は、フェムテックAIが主に予測の向上を必要としているのではなく、不確実性設計の向上を必要としているということです。不確実性設計は、製品のアーキテクチャであり、生の入力から説明責任のある行動までの信号を6つの層に分けて構成します。私は、不確実性のある健康信号を許可された行動に変換する方法を6つの層に分けて設計しています。その方法には、データの適性、推論の較正、結果のマッピング、制御ポリシー、ワークフローの実行、説明責任のループが含まれます。

1. 信頼する前にデータを適性させる

最初の層は、システムが実際に何を知っているかを決定します。フェムテック製品は、非常に異なるソースから情報を引き出します。ユーザーが直接観察したもの、例えば月経日や主観的な報告のような痛みや気分、そして、着用可能な機能のように皮膚温度や心拍変動、モデルが自分で生成した変数などが含まれます。これらの信号を交換可能な入力として扱うことは、最初の罪です。

各信号には、システムが読み取ることができる出典が必要です:どこから来たか、いつ、どれくらいの頻度でサンプリングされるか、どのような混乱要因があるか、そして、実際に予測しようとしているものにどのように関連するか。排卵はイベントです。温度、子宮頸粘液、LH、周期日は、それぞれ異なる遅れと異なる誤差を持つ、そのイベントについての証拠です。

欠損データは特に注意が必要です。健康追跡では、欠損データはほとんどの場合ランダムではありません。ユーザーは心配なときに多くログを記録し、気分が良くなるとログを停止します。したがって、ギャップはエントリーよりも多くの情報を含むことがあります。60万を超える排卵周期の実世界分析では、140万周期のうち665,603周期で排卵を検出できませんでした。そのうち3/4が周期の半分以下の日数に有効な温度読み取り値を持っていました。データの十分性は、アルゴリズムが推論できることの重大な制限要因でした。そうした状況で、きれいな生殖可能ラベルを出力する製品は、信頼性を生み出しているのではなく、精度を生み出しているのです。

2. 証拠に基づいて推論を較正する

単一の信頼性スコアでは、実際に起こっていることを表現することはできません。なぜなら、これらのシステムは同時に複数の異なる不確実性源に直面しているからです。これには、生物学的変動、測定の品質、自己追跡からの欠損、薄いトレーニングデータからのモデル不確実性、モデルが検証された人口と現在のユーザーが似ていない場合の分布シフトが含まれます。

同じ分析では、周期の13%のみが正確に28日間でした。平均卵巣期は16.9日で、範囲は広く、「14日目」という固定的な仮定を誤解するほどでした。Apple Women’s Health Studyでは、周期の長さと個人内変動は、年齢、自己報告された民族、体重指数と関連していたことがわかりました。個人化とは、平均人口値を単一の個人のポイントに置き換えることではありません。蓄積された証拠によって分布を絞り込むことを意味します。

2つのAIベースの予測を考えてみましょう。どちらも「75%」と読みます。1つは1年の履歴と密な測定に基づいており、その不確実性はほとんど実際の生物学的なものです。他の1つは2つの周期、5つの温度読み取り、最近の旅行、睡眠の混乱などに基づいており、その不確実性は主に欠損データによるものです。同じ数字ですが、製品はそれらに同じように対応するべきではありません。これは、較正がサブグループ内でチェックされる必要がある理由でもあります。集団的なパフォーマンスは、特に不規則な周期や更年期前のユーザーにとって、過信のモデルを隠すことができます。臨床AIの文献では、差別、較正、意思決定の有用性を区別しています。モデルはユーザーをうまくランク付けできますが、実際の意思決定には不正確な確率を生み出す可能性があります。

3. 誤りの結果をマッピングする

3番目の層は、システムが誤ったときに何が起こるかを尋ね、許可された応答をそのコストに結び付けます。周期の要約、生殖可能窓の推定、避妊ガイダンスとして読まれる低生殖可能ラベル、ケアを求めるかどうかを決定する症状の解釈は、同じモデルを共有していても、異なる製品です。

私は、結果を4つの階層に分けます。情報、行動、生殖、臨床です。各階層には、独自の証拠のしきい値、許可された言語、エスカレーションパスがあります。70%の確率は、月経の開始を予測するには十分かもしれませんが、避妊を試みている誰かを安心させるには十分ではありません。

ここでは設計が規制と出会います。ソフトウェアが医療機器の領域に越境するかどうかは、意図された使用と健康上の意思決定におけるその出力の役割によって決まります。FDAの現在のClinical Decision Support Softwareガイダンスは、患者や介護者向けの機能が医療機器の定義を満たす可能性があることを明確にしています。規制上の位置付けは、最終的な法律上のレビューではありません。設計の初期段階からしきい値、言葉遣い、エスカレーションロジックにコード化されています。

4. 不確実性を制御ポリシーに変える

「結果は不正確になる可能性があります」というブランケットは、解釈の問題をユーザーに返します。制御ポリシーはその逆をします。特定の証拠状態に対して、システムが観察を表示するか、範囲を提供するか、別の測定を求めるか、臨床医に指示するか、回答を拒否するかを決定します。回答を拒否することは、製品の機能です。失敗ではありません。「まだわかりません」というのは、設計された状態で次のステップが必要です。エラースクリーンではありません。

具体的には、「排卵:15日目、78%」の代わりに、次のような回答が得られます。排卵はおそらく4日間のウィンドウ内にあります。信頼性は、温度データの不足と睡眠の混乱によって制限されています。さらにいくつかの読み取りが推定を絞り込むでしょう。LHテストは、将来の証拠を追加して、可能性のあるウィンドウを狭めることができます。ユーザーは推定値、不確実性の理由、そしてそれを変える単一のアクションを受け取ります。

5. 出力が示唆するアクションをサポートする

消費者向けアプリでも、ワークフローが存在します。別の読み取りをログする、テストを繰り返す、観察を続ける、データをエクスポートする、臨床医に連絡する。システムは、各応答がどのアクションを指しているか、それを安全にサポートできるかを知る必要があります。

製品のガイダンスと医療アドバイスの境界はここにあり、固定された線ではありません。一般的なシグナルについて説明する教育コンテンツは、ガイダンスの側に安全に座ります。製品は、1人のユーザーのデータを疾患として解釈したり、治療を指示したり、臨床的に重要な重みを持つ安心感を提供したりするときに、リスクの高い領域に入ります。その境界は、利用規約だけでなく、すべてのやり取りで保持される必要があります。

6. 説明責任のループを閉じる

最終的な層は、システム全体を判断します。標準的なモデルメトリックはまだ重要であり、差別、較正、サブグループのパフォーマンス、外部および時間的検証に焦点を当てています。しかし、製品レベルのメトリックも同等に重要です。システムが入力を受け取って行動した頻度、システムが回答を拒否した頻度を尋ねる必要があります。さらに、私が強調したいのは、誤った安心感の率です。つまり、証拠が主張を裏付けることができないにもかかわらず、すべてが正常であるとユーザーに伝えた頻度です。

すべての重大な応答は、事後的に再構築可能でなければなりません。規制機関、規格団体、世界の保健ガバナンス機関は、設計、展開、監視を包含するライフサイクルビューを採用しています。IMDRFの信頼できる医療機器用の良い機械学習の実践原則は、信頼できる医療AIを、設計、展開、監視を包含する総ライフサイクルの責任として扱います。これは、WHOのAIによる保健ガイダンスと一致しています。

実践におけるアーキテクチャの見た目

製品が3ヶ月の月経日、6晩の温度、1つの陽性LHテスト、散在する症状のエントリ、1週間の悪い睡眠を持っている場合、モデルの最高の排卵確率は15日目にあります。点推定アプリは「排卵:15日目、78%の信頼性」と表示します。

アーキテクチャは、別のものを生成します。温度データを希薄で睡眠に影響されたものとしてマークし、1つの候補日の代わりに複数の候補日をまたがる分布を生成します。周期認識のための穏やかなしきい値を適用し、妊娠防止に触れる出力の場合はより厳しいしきい値を適用します。範囲と次の有用な測定を提供し、証拠状態全体を保存して、決定を後で再構築できるようにします。同じ基本的なモデルですが、全く異なる製品です。

行動する権利

フェムテックシステムは、アプリ、着用可能なデバイス、自宅テスト、医療レコード、会話の層を積み重ねて、ますますデータに富んでいます。データが増えると、推論が鋭くなりますが、誤った精度の表面も広がります。信頼を勝ち取るチームは、きれいな信頼性スコアを持っているのではなく、製品が何を知らないかを知り、言うように設計されているチームです。

精度は予測の品質を記述します。決定の完全性は、製品がそれに基づいて行動する権利を獲得しているかどうかを決定します。

マリイア・クリコフスカヤは、ヘルス関連データ製品のプロダクトストラテジー専門家であり、ヘルス関連、環境ヘルス、AIを活用した技術製品を横断して働いています。彼女の仕事には、環境ヘルスモニタリングシステムとヘルスケアに準拠した分析製品のB2Bプロダクトストラテジーが含まれます。