思想领袖

医院采用人工智能之前没有完全理解他们所采用的内容

mm
将 Unite.AI 添加到您在 Google 上的首选来源

医院并没有在一个刻意的时刻采用人工智能。它是通过不同的部门、不同的需求和不同的预算进入的:一个图像算法、一个文档助手、一个人员预测、一个患者信息生成器、一个拒绝预测模型、一个排班工具。每个产品都进入了不同的部门,满足了不同的需求,并根据不同的预算进行了评估。

这种分散的方式使得采用感觉是可以管理的。它也掩盖了医院实际上采用的内容。

人工智能产品不仅仅是一个软件应用程序。它是一个可能影响判断、重新分配工作、改变责任、从不断变化的数据中学习并产生难以在事后重建的输出的系统。医院经常在建立必要的语言、治理和运营纪律来理解这些后果之前就购买了这种能力。

通过与医疗组织密切合作,我看到人工智能采用的最困难部分很少从模型本身开始。它始于技术进入一个从未为其设计的工作流程,并且人们必须决定如何在其输出周围放置信心、权威和责任。

这不是反对采用的论点。医疗保健需要更好的工具,人工智能已经创造了真正的价值。这是对采用的更成熟定义的论点——一种从采购之后开始而不是结束的定义。

人工智能通过“效率”门进入

早期的医院人工智能案例是实际的。行政工作量在增加,劳动力压力在加剧,临床医生在非临床判断任务上花费了太多时间。这种需求只会增长。2026年,美国医学会报告称,81%的受访医生在实践中使用人工智能,高于2023年的两倍。

这种吸引力是可以理解的。医院面临着提高可及性、减少倦怠、管理成本和加快信息流动的压力。一个可以草拟笔记、优先处理队列、预测延迟或总结图表的工具可能看起来像是一个狭窄的运营改进。

但是人工智能很少在进入工作流程后仍然保持狭窄。一个文档系统改变了记录中捕获的内容。一个优先级模型改变了首先看到的案例。一个预测工具改变了人员配备决策。一个患者沟通助手改变了如何将临床意图转化为语言。即使最初的目的是行政的,运营效应也可能达到护理交付。

因此,医院采用了不仅仅是效率。他们采用了新的影响决策、顺序、注意力和责任的形式。

第一个误解:将人工智能视为传统软件

传统软件通常根据其是否可靠地执行定义的功能来判断。人工智能需要更广泛的问题。哪些数据塑造了模型?性能在哪里削弱?输出如何随着本地工作流程与测试环境的不同而改变?谁审查结果?模型更新时会发生什么?当决策被质疑几个月后,哪些证据被保留?

这些问题正在成为正式的医疗技术政策的一部分。 国家医疗信息技术协调办公室的HTI-1规则 为认证的医疗信息技术中的预测算法引入了透明度要求,包括帮助用户评估公平性、适当性、有效性和安全性的信息。这种语言很重要,因为它将评估从工具演示的可行性转变为这里、针对这个人群、在这个工作流程中、在这些条件下、由这些人负责输出的可行性。

医院需要知道它是否适用于这里、这个人群、这个工作流程、这些条件和这些人负责其输出。

这是一个非常不同的采购问题。它不能仅仅通过功能列表或供应商演示来回答。

第二个误解:假设人工监督可以解决一切问题

“人在环路中”已经成为医疗保健人工智能中一个令人放心的短语。它表明一个人仍然控制着并且可以纠正机器。在实践中,人工监督只有在人类有时间、权威、背景和明确的理由来质疑输出时才有意义。

一名接收到数百个人工智能辅助推荐的临床医生不会从第一原则审查每一个。一个高容量队列的工作人员可能会接受建议的优先级,因为界面将其作为默认值呈现。审查者可能在技术上有权覆盖模型,但缺乏了解模型产生其结果的原因所需的信息。

世界卫生组织关于健康人工智能的指导 将自主性、责任、透明度、安全性和公平性置于实施的中心。这些原则并不能仅仅因为一个人点击了最终按钮就得到满足。

人工监督必须被设计为一个运营功能。医院应该定义哪些输出需要审查、审查者看到什么证据、什么时候升级是强制的、如何记录不同意见以及审查输出的人是否实际上能够干预。

考虑一个患者信息助手,它在出院后草拟随访说明。临床医生可能仍然负责批准,但实际的安全措施取决于工作流程。草稿是否明确标记为机器生成的?审查者是否看到生成它的临床原始材料?工作人员是否能够识别出语言中省略了警告或夸大了确定性?如果信息在繁忙的班次中被批准并后来引起混淆,责任不能仅仅归咎于一个人点击了“发送”按钮。审查过程的设计与审查者的存在一样重要。

第三个误解:认为验证是一个一次性的事件

许多组织在启动前验证人工智能,然后将该系统视为稳定。这种方法反映了传统的实施思维:测试、批准、部署、维护。

人工智能的性能可能会由于周围环境的变化而发生变化。患者人群会改变。编码实践会改变。临床文档会改变。新设备被引入。工作人员适应了工具。供应商更新了模型。数据接口会悄悄地中断。一个在启动时性能可以接受的系统可能会在没有明显故障消息的情况下变得不那么可靠。

NIST人工智能风险管理框架 将风险管理视为一个围绕治理、映射、测量和管理风险的持续生命周期活动。医院应该在运营中应用同样的原则。

部署后监控不应仅限于正常运行时间。它还应包括按患者群体、覆盖模式、异常输出分布、工作流延迟、用户投诉、下游更正和工作人员以从未预期的方式依赖系统的迹象进行的性能监控。

模型可以在技术上可用和运营上不安全的同时。

第四个误解:将监管批准与机构准备混淆

美国食品和药物管理局维护着一个人工智能启用的医疗设备清单,这些设备已满足了适用的预市场要求。这是对受监管产品的重要保证层,但监管授权和医院准备回答了不同的问题。

监管机构可能会确定设备对于其预期用途来说是足够安全和有效的。医院仍然需要确定其自身的数据、人员、基础设施、培训、升级路径和患者人群是否支持负责任的使用。

同样的区别也适用于非设备人工智能。安全审查不能确立临床适当性。隐私审查不能确立工作流安全性。法律批准不能确立用户能力。成功的试点不能确立企业就绪性。

医院需要一个统一的决策过程,将这些问题结合起来,而不是让每个部门批准风险的一个部分。

医院实际上采用人工智能时会发生什么

一个成熟的组织应该认识到,每个人工智能实施都会同时引入至少五件事情:

  • 决策影响:即使人工智能不做出最终决定,也会影响人们注意、优先或相信什么。
  • 数据依赖:系统继承了周围数据的优势、缺陷、偏见和不稳定性。
  • 工作流重设计:任务在人员、系统和部门之间移动,通常以微妙的方式改变责任。
  • 监控义务:部署后必须观察性能,而不是假设来自预部署证据的性能。
  • 信任关系:患者和工作人员需要了解人工智能的存在和作用。

这种更广泛的定义解释了为什么医院可以部署数十种人工智能工具,但仍然感到没有准备。该组织已经获得了能力,但不一定建立了必要的连接组织来治理它们作为一个组合。

从人工智能库存到人工智能问责

第一个实际步骤不是另一个策略文件。它是一个可靠的库存。

一些医院仍然缺乏对人工智能当前操作位置的完整视图,因为它嵌入在更大的平台中,通过部门购买引入,或者以更柔和的术语描述,例如自动化、智能、预测、优化或决策支持。

库存应该记录每个系统的目的、它影响的决策、使用的数据、影响的人口、供应商和模型版本、人类所有者、审查过程、升级路径和批准所用证据。

但是,库存本身并不是治理。问责开始于每个系统都有一个命名的执行所有者和运营所有者。执行所有者接受是否使用案例仍然合适的责任。运营所有者了解系统在日常工作中的行为,并且可以识别出何时现实与政策发生偏差。

新的标准:在扩大规模之前了解

医院不需要在实现完美确定之前暂停每个人工智能计划。完美确定在医疗保健或技术中是不存在的。他们需要用证据驱动的扩大取代热情驱动的扩大。

这意味着从特定问题开始,定义人工智能的可接受角色,测试本地环境,记录限制,衡量真实结果,并且只有当组织能够解释利益和风险时才扩大规模。

最重要的问题不再是“这个工具是否使用人工智能?”这个问题太宽泛了,无法提供有用的信息。更好的问题是:它影响什么判断?当它出错时会发生什么?谁会注意到?谁可以阻止它?什么证据将证明扩大其角色的合理性?

最近的世界卫生组织关于健康人工智能的政策指南也提出了类似的论点,主张明智的决策,超越炒作,检查安全性、偏见、治理、监管和信任。医院应该期望领导团队具备与技术团队相同的知识水平。

真正的机会是机构学习

从人工智能中受益最大的医院不一定是那些采用了最多工具的医院。他们将是那些从每次部署中学习最快的医院。

他们将实施视为机构知识的来源:数据质量在哪里中断,工作流程在哪里抵制自动化,工作人员在哪里需要更清晰的界限,患者在哪里需要更大的透明度,以及治理在哪里必须变得更加具体。

这种学习不能仅仅停留在创新办公室。它必须传达给临床领导、运营、合规、技术、财务、质量和董事会。人工智能现在已经太分散了,无法仅仅由一小群专家来管理,也太重要了,无法仅仅被理解为一个技术主题。

医院在完全理解他们所采用的内容之前就采用了人工智能。这在快速技术变革时期并不罕见。更重要的问题是他们在差距变得明显时会做什么。

负责任的回应不是撤退。它是建立理解人工智能的能力:在决策、工作流程、关系和机构中实际运行。只有这样,采用才会成为准备就绪。

Ramkumar P 是 Rytsense Technologies 的创始人和 CEO,在那里他领导了 Agentic AI 和智能自动化解决方案的开发,用于医疗保健收入周期管理。凭借在 AI 产品开发和企业自动化方面的深入专业知识,他帮助医疗保健组织将劳动密集型的行政流程转变为自治、可扩展的系统。他热衷于实用的人工智能采用,以实现真正的商业成果,而不是实验技术。