思想领袖

为什么 AI 模型不能解决放射学的核心问题

mm
将 Unite.AI 添加到您在 Google 上的首选来源

目前在放射学领域的大多数 AI 工作都是集中在诊断模型上。重点是通过训练更多的数据和改进模型来提高准确性。这种方法主要将放射学视为一个视觉识别任务,期望通过更好的检测来提高整个系统的质量。乍一看,这似乎是合理的:如果检测改进,诊断质量也应该改进。然而,这种观点忽略了主要问题。

放射学中的核心问题是诊断本身的结构。它不是模式识别的局限性,而是工作如何组织和决策如何产生。并且,改进模型并不能解决这个问题。下面,我们来看看为什么会这样以及需要什么样的改变来超越模型的准确性。

问题是结构性的

CV 模型可以帮助识别图像中的模式。在受控研究中,它们可以达到与放射科医生相当的性能,AUC 通常在 0.90 以上,并且在某些筛查设置中,甚至可以达到或超过专家性能。然而,在许多领域,检测结果的能力已经不再是主要的限制因素。

同时,它们只适用于图像数据。它们可以突出可能的发现,但不参与诊断过程本身。它们不能将不同的输入组合成单一的诊断,也不能指导决策的制定。在许多领域,检测结果的能力已经不再是主要的限制因素。它们被设计为识别模式,而不是参与诊断过程。

在实践中,这意味着结构没有改变。放射科医生仍然负责审查结果并做出最终的决定,AI 输出通常需要额外的验证。责任仍然在医生身上。工作流程没有改变。瓶颈仍然存在。每个研究仍然被分配给单个放射科医生,谁负责审查、解释、验证和报告。研究表明,临床医生的表现仍然严重依赖于如何处理 AI 错误,错误的输出可能会对决策产生负面影响。

模型不能重新审视自己的决定。如果它犯了一个错误,就没有办法重新考虑这个案例并添加更多的背景。结果仍然是固定的,而真正的诊断需要不断的调整。它们的输出是静态的,而临床推理本质上是迭代的。

因此,瓶颈仍然存在,变异性仍然存在,过程仍然依赖于单个放射科医生。随着成像量的增长,围绕单个专家处理每个案例的系统不可避免地会达到其极限。

信任危机

放射学中的 AI 也引发了一个信任问题。

放射科医生不仅仅会质疑模型的输出。他们会质疑模型背后的系统,特别是当 AI 被呈现为替代品,而不是他们可以控制的工具时。对模型的信任是不稳定的。经验较少的医生可能过度依赖它并错过错误。经验较丰富的医生在遇到一个错误后,可能会停止使用它。这些两种模式——过度依赖和脱离——都会引入新的风险,而不是减少风险。

当模型犯错时,它通常会从决策过程中退出。它不再被用作工具,而是被简单地忽略。这打破了连续性并限制了其实际价值。在实践中,这导致了不一致的使用,而不是稳定的工作流程集成。

这反映了与医学工作方式的更深层次的冲突。放射科医生不能将诊断的责任转移给系统。临床和法律责任仍然在医生身上。将 AI 视为替代品违反了医学实践的结构。

这造成了一个结构性的冲突,即模型建议但医生必须验证。识别可以被自动化。责任不能被转移。只要责任不能被转移,每个模型输出都必须被检查,这限制了其减少工作量的能力。

效率的幻觉

AI 并没有从放射科医生那里移除工作。它添加了一个控制层。医生仍然需要解释研究并验证模型的输出。这创建了双重工作,而不是节省时间。与其消除努力,AI 通常将其重新分配到验证和纠正的额外步骤中。

系统可能看起来更快,但在实践中,时间转移到了额外的检查,而不是被减少。随着时间的推移,工具的积累增加了运营开销,而没有从根本上改进诊断的产生方式。

AI 也引入了碎片化。大多数模型都是为狭窄的任务构建的:单个解剖学区域、模态或病理学。为了覆盖真正的临床需求,诊所必须使用多个模型。与其成为一个统一的系统,这导致了工具的碎片化。

每个模型都带来了自己的界面、集成和维护要求。这增加了系统的复杂性并添加了更多的交互点。

因此,系统变得更难以管理,而核心的诊断过程仍然没有改变。

扩展 AI 的局限性

每个新版本的模型都需要重新建立信任。工作流程开始适应模型,而不是支持医生。这进一步将焦点从改进系统本身转移到适应个别工具上。

这变得更加困难,因为大多数模型的焦点都很狭窄。每个模型都是为特定的任务或解剖学区域设计的。在实践中,这意味着诊所需要同时使用多个模型,每个都有其自己的约束、集成和成本。系统变得更难以操作。

与此同时,很明显 AI 在哪里今天有最大的影响。不是在解释图像上,而是在改进周围的系统——路由研究、管理队列、将案例分配给正确的专家以及预测工作量。这些领域从协调中受益,而不是孤立的预测。

实践中的情况

在我们的诊所网络中,跨越三个国家的 40 多个诊所,每年进行超过一百万次 MRI 和 CT 研究,我们实施了几个 AI 模型,包括 FDA 批准的解决方案。设置很简单:模型分析图像研究,生成报告,放射科医生审查和确认。预期结果是更快的周转时间和更少的错误。

在实践中,经验丰富的放射科医生继续自己解释每个研究,然后查看模型的输出。使用生成的文本通常需要比从头写作更多的努力,因为它不符合他们的报告风格。过程没有加速,在许多情况下变得更慢。在某些情况下,与模型交互增加了更多的摩擦而不是价值。

用户行为也创造了风险。当模型犯错时,经验丰富的放射科医生倾向于失去信任并停止使用它。经验较少的医生更可能依赖系统,增加了错过错误和相关的临床和法律风险的机会。

这些观察指向了一个更深层次的问题。改进个别工具并不能改变系统的工作方式。瓶颈在于围绕单个放射科医生处理每个研究的工作流程中。这些约束使得仅通过添加更多工具就很难改进系统。

在 DICO,我们以不同的方式处理这个问题。与其将 AI 添加到现有的工作流程中,我们专注于结构本身。案例可以被分解成部分,每个部分由相关的专家直接在图像数据中处理。最终的报告是由这些输入组装而成的,AI 支持协调。诊断在这个模型中不再由一个人撰写——它是由多个贡献组装而成的。

这些并不是模型质量的问题。它们是结构的问题。

重新思考诊断系统

现代放射学是建立在一个单一的假设之上的:一个研究,一个放射科医生。这造成了瓶颈、变异性和可扩展性限制。主要问题不是模型会犯错误。系统不是为与它们一起工作而设计的。它是建立在一个不可扩展的基础上的。

一个非迭代工具被放入一个依赖于迭代的过程中。在临床实践中,放射学不是一个单次决策。研究表明,在 ~30% 的情况下,初步和第二次解释之间存在不同意见,并且在 ~18-20% 的情况下,临床上显著的差异会影响管理。第二意见不是例外,而是诊断工作的常规部分。

更广泛地说,整个医学领域,第二意见可以导致诊断在 10-62% 的情况下发生变化,取决于环境。

没有重新审视、协调和重新评估的能力,模型输出仍然是静态的,而真正的诊断需要不断的调整。

下一步不是更准确的模型,而是诊断系统的重新设计。

转变是从单独的 AI 工具到统一的诊断管理方式——诊断不再是一个单一的决定,而是一个跨多个步骤路由和解释的过程。限制不是缺乏智能模型,而是缺乏一个可以将诊断工作作为一个过程来协调的系统。

Yaroslav Dokuchaev 是 DICO 的 CEO 和创始人,DICO 是一家正在建设分布式、集体诊断基础设施的公司,用于放射学领域,诊断是由多个专家贡献组成,而不是由单个医生制作的。

他在大规模放射学运营方面具有丰富的经验,曾参与建设欧洲最大的远程放射中心之一,处理每年数百万项研究,跨多个诊所。通过在临床工作流程中实践人工智能的实施,他对诊断过程形成了系统层面的视角,专注于工作流程设计如何定义现代放射学中的性能和可扩展性,而不是模型准确性。