医疗健康

从预测到负责行动:在女性健康AI中设计不确定性

mm
将 Unite.AI 添加到您在 Google 上的首选来源

在女性健康领域,准确性是必要的,但它只是产品安全的第一层。系统需要知道何时预测足够强大可以采取行动,并在不确定时能够说明这一点。

打开大多数生育或周期跟踪应用程序,您会看到一个干净的结果:在第15天排卵,高生育标签,78%的置信度。数字看起来很精确,但底层生物学并不精确。

月经日期是用户观察到的东西。排卵是一个潜在事件,消费者设备无法直接测量。它是从代理指标中推断出来的。皮肤温度不仅反映孕激素,还反映睡眠、酒精、疾病、环境条件和传感器的位置。症状输入混合了生理学、感知、记忆和用户决定记录它的意愿。到所有这些都解析为“第15天,78%”时,已经压缩了几种不同类型的不确定性到一个自信的句子中。

在我参与的女性健康产品中,困难的不是准确性。反复出现的模式是决策完整性。准确性告诉你模型预测得多好,但它没有告诉你产品是否知道何时预测足够强大可以采取行动。在一个领域中,相同的输出可以告知非正式规划或避孕决定,这个差距就是赢得或失去信任的地方。

因此,我的论点是,女性健康AI不需要更好的预测,而是需要更好的不确定性设计。并且不确定性设计不是在发布前添加的免责声明,而是一种架构。我将其结构为六层,从原始输入到系统可以证明和审计的行动。应用六层版本的校准决策到行动产品方法,旨在管理不确定的健康信号如何转化为允许和负责的行动。该方法包括数据资格、推理校准、后果映射、控制策略、工作流执行和责任循环。其管理路径从健康数据开始,导致决策架构,并以负责行动为结论。

1. 在信任之前资格数据

第一层决定系统实际知道什么。女性健康产品从非常不同的来源获取数据。它可以包括用户直接观察到的内容,例如月经日期或主观报告,如疼痛或情绪,以及可穿戴功能,如皮肤温度和心率变异性,以及模型生成的变量。将这些视为可互换的输入是最初的错误。

每个信号需要系统可以读取的来源:它来自哪里,何时,多久采样一次,什么会混淆它,以及它如何与实际预测的事件相关。排卵是事件。温度、宫颈粘液、LH和周期日期都是关于该事件的证据,每个都有自己的滞后和错误。

缺失数据值得特别关注,因为在健康跟踪中,它很少是随机的。人们在担心时记录更多,当他们感觉良好时就会停止记录,因此缺失可能带来与记录一样多的信息。在对超过60万个排卵周期的实际分析中,排卵无法在最初考虑的140万个周期中检测到665,603个周期。其中四分之三的周期在周期中不到一半的天数内有有效的温度读数。数据充分性是算法可以推断的主要限制因素。发出清晰的生育标签的产品在这种情况下不是自信的。它制造了它没有的精度。

2. 将推理校准到证据

单个置信度得分无法代表实际发生的情况,因为这些系统同时面临多个不同来源的不确定性。这些包括生物过程本身的生物变异性、测量质量、自我跟踪的缺失、薄训练数据的模型不确定性以及当前用户不类似于模型验证的人口的分布转变。

在同一分析中,只有13%的周期正好是28天长,平均卵巢期跨度为16.9天,范围足够宽以使任何固定的“第14天”假设具有误导性。苹果女性健康研究发现周期长度和个人内变异性与年龄、自我报告的民族和身体质量指数有关。因此,个性化不能仅仅是用个人点替换人口平均值。它意味着生成一个随着证据积累而收紧的分布。

考虑两个AI预测,均读取“75%”。一个基于一年历史和密集的测量,其不确定性主要是真正的生物学。另一个基于两个周期、五个温度读数、最近的旅行和未知的药物。在这里,不确定性主要是由于缺失数据。相同的数字。产品不应该被允许以相同的方式响应它们。这也是为什么校准必须在子组中检查的原因——总体性能可能隐藏一个过于自信的模型,特别是对于不规则的周期或围绝经期的用户。临床AI文献现在将区分鉴别、校准和决策效用,正是出于这个原因。模型可以很好地对用户进行排名,但仍然会为实际决策产生不正确的概率。

3. 映射错误的后果

第三层询问系统错误时会发生什么,并将允许的响应与该成本联系起来。周期摘要、生育窗口估计、低生育标签作为避孕指导以及决定是否寻求医疗保健的症状解释并不是同一个产品,即使模型在后面是相同的。

我将输出分为四个层次,根据后果:信息、行为、生殖和临床。每个层次都有自己的证据阈值、允许的语言和升级路径。70%的概率可能足以猜测周期何时开始,但对于试图避免怀孕的人来说,这还不够接近确定性。

这是设计与法规相遇的地方。软件是否进入医疗设备领域取决于其预期用途和其输出在健康决策中的作用。FDA当前的临床决策支持软件指南明确指出,针对患者和护理者的功能可以满足设备的定义。法规定位不是最后的法律审查,而是从第一天就编码在阈值、措辞和升级逻辑中。

4. 将不确定性转化为控制策略

一个通用的“结果可能不准确”将整个解释问题交回给用户。控制策略则相反。对于给定的证据状态,它决定系统是否显示观察结果、提供有界范围、要求另一个测量、指向临床医生或拒绝回答。放弃是一个产品能力,而不是失败。“我们还不确定”应该是一个设计状态,具有下一步骤,而不是错误屏幕。

具体来说,相比“排卵:第15天,78%”,一个受控的响应更接近这样:排卵最可能在四天窗口内;置信度受到缺失温度数据和睡眠中断的限制;几次更多的读数将使估计更加精确,LH测试可以提供前瞻性证据并缩小可能的窗口。用户获得估计、不确定性的原因以及改变它的单一操作。

5. 支持输出所暗示的操作

即使是消费者应用程序也会创建一个工作流程:记录另一个读数、重复一个测试、继续观察、导出数据、联系临床医生。系统应该知道每个响应指向哪个操作,以及是否可以安全地支持该操作。

产品指导和医疗建议之间的边界就在这里,它不是一个固定的线。解释信号的一般含义的教育内容可以安全地放在指导的一侧。产品进入更高风险的领域,当它解释一个人的一些数据作为疾病、指导治疗或提供具有真正的临床重量的安慰时。这种边界必须在每次交互中保持,而不仅仅是在服务条款中。

6. 关闭责任循环

最后一层判断整个系统,而不仅仅是模型。标准模型指标仍然很重要,关注鉴别、校准、子组性能、外部和时间验证。但产品级指标同样重要。我们应该问系统有多少次有足够的输入可以采取行动,有多少次它放弃了。另外,我会坚持的一个是虚假安慰率,即它多久告诉某人一切看起来很好,但证据却无法支持这一说法。

每个后果响应都应在事后可以重建。监管机构、标准组织和全球卫生管理机构越来越多地采用这种生命周期视图。IMDRF的良好机器学习实践原则将可信的医疗AI视为一种涵盖设计、部署和监测的整个生命周期的责任,呼应了WHO关于健康AI的指导方针。

架构在实践中的样子

假设一个产品有三个月的月经日期、六个晚上的温度、一个阳性LH测试、症状条目和一个星期的糟糕睡眠。模型的最高排卵概率落在第15天。点估计应用程序显示“排卵:第15天,置信度78%”。

架构产生了其他东西。它将温度数据标记为稀疏和睡眠混乱。它在几个候选日子上生成一个分布,而不是一个。它对周期意识应用了一个温和的阈值,但如果输出涉及避孕,则应用了一个更严格的阈值。它提供了一个范围和下一个有用的测量值。并且它存储整个证据状态,以便可以在后期重建决策。相同的底层模型,但产品却大不相同。

行动的权利

女性健康系统正在变得越来越数据丰富,具有应用程序、可穿戴设备、家庭测试、医疗记录和对话层。更多的数据可以使推理更加精确,但也会扩大虚假精度的表面。赢得信任的团队将不是那些具有最干净的置信度得分的团队,而是那些产品知道自己不知道什么并且能够说明这一点的团队。

准确性描述了预测的质量。决策完整性决定了产品是否有权利在此基础上采取行动。

马里亚·库利科夫斯卡娅是一位专业从事健康相关数据产品的产品策略师,跨健康相关、环境健康和人工智能启用的技术产品工作。她的工作包括环境健康监测系统和医疗保健合规分析产品的B2B产品策略。