思想领袖

AI 已经比你的医生更聪明。这并不是可怕的部分。

mm
将 Unite.AI 添加到您在 Google 上的首选来源

我希望 AI 能解决这个问题。

多年来,我一直在收集复杂的患者病史、实验室检查结果、症状、药物、补充剂以及多年以往的治疗记录,并尝试将所有信息整合成一个连贯的临床方案。一个复杂的病例可能需要耗费三小时的研究,才能让我对哪些重要、接下来该怎么做感到满意。

随后生成式 AI 出现了。

我第一反应是显而易见的:终于。

这是一项能够吞噬海量信息、比我更快检索医学知识并在几秒钟内发现病例之间关联的技术。我以为只要在大型语言模型周围套一个界面,构建一些安全防护,就可以大功告成。

那本来会是极好的。

然而,大约一年后,耗资 100 万美元,软件工程师与一个 10 人的临床团队并肩工作时,我们仍在建设中。

原因并不是 AI 不够智能。

而是智能只是容易的部分。

我得到的 AI 与其他人不同

我的第一个线索出现在我们尝试构建临床软件之前。我不断发现,使用与坐在我旁边的人相同的 AI 工具,却能得到显著更好的结果。

为什么?因为我并不是单纯提问并接受答案。我在与它争论。挑战假设。提供它遗漏的上下文。纠正错误。改变框架。再次推动。

技术上,我们使用的是同一工具。功能上,却并非如此。

在撰写广告时,这是一种有趣的生产力问题。而当对象是患者时,则是完全不同的问题。

我曾与超过 70,000 名从业者合作。有人在临床上非常出色,却在从 AI 系统获取有用信息方面表现糟糕。

这两者是不同的技能。

然而,医疗界的许多答案似乎是,临床医生只需学习“提示工程”。

我认为这并不是一个切实的解决方案。

如果临床 AI 系统要求医生在系统可靠之前必须成为精通提示工程的专家,那么我们还没有完成临床 AI 的构建。

研究已经向我们透露了一些令人不安的事实

一项 2024 年的随机临床试验让 50 位医生处理困难的诊断案例。使用 GPT-4 的医生得分为 76%;使用常规资源的医生得分为 74%,差异在统计上并不显著。

随后研究人员单独测试了 GPT-4。它比使用常规资源的医生高出 16 个百分点。

一项 2026 年在巴基斯坦的试验发现,经过 AI 素养培训后,使用 GPT-4o 的医生在诊断推理上得分为 71.4%,而使用常规资源的医生为 42.6%。但单独使用 GPT-4o 的得分为 82.9%。

一项 2026 年在英国的复制研究发现了类似的差距:在 AI 辅助下医生有所提升,但仍比单独使用大型语言模型低 21 个以上百分点。

我们必须直言不讳:在某些认知任务上,AI 已经优于单个医生。

没有任何医生能阅读所有医学论文,或在相关时刻立即记起每一种罕见疾病、相互作用或禁忌。AI 能在不感到疲倦或耗尽时间的情况下处理海量信息。

错误在于以为只要把聊天机器人放在临床医生面前就能解决问题。

空白提示框才是问题所在

想象一下,医生上传了一份包含 150 项指标的实验室报告,并请大型语言模型进行分析。

答案返回得非常有条理。但只有一个问题:系统未能可靠地提取全部 150 项指标。

通用大型语言模型并非确定性的临床文档解析器。表格和密集的医学报告仍然尤为困难。令人恐惧的是,最终的响应可能并不会提示“我遗漏了 50 条数值”。

它可能仅仅给出答案。

现在想象其中一个遗漏的数值需要紧急的医学评估。

这不是我愿意妥协的限制。我们必须先开发不同的提取技术,以在系统进行临床推理之前,准确且可重复地处理实验室报告。

那次经历改变了我对 AI 安全的思考方式。

一个告诉你它不知道某件事的 AI 系统是令人不便的。

一个不知道自己遗漏了什么的 AI 系统是危险的。

为什么我们必须超越 AI 进行构建

临床工作需要一种通用生成式 AI 自然无法提供的东西:可重复性。

我们需要对输入和输出进行控制:可靠的数据提取、结构化知识、确定性逻辑、安全防护以及能够评估患者历史关系的系统。

临床推理并非仅仅是一系列 if-then(如果-那么)语句。有时信号是多个标记之间的关系。有时,单独看并不显著的五项发现,放在一起时会变得重要。

工程师需要足够明确的软件可执行规则。临床医生则终其一生在说:“是的,除了……”。

人体生物学充满了例外、修饰因素、情境和相互竞争的解释。有时,构建系统的感觉就像一方使用手语交流,而另一方说克林贡语。

答案从来不是“AI”或“非 AI”。而是准确弄清它们各自的定位。

AI 能读取病历, 人类能读懂现场。

如果使用得当,AI 可以扩展临床医生的记忆,加速研究,发掘不常见的可能性,并在海量信息中识别模式。

这看起来更像是构建一个仿生的从业者,而不是取代现有的从业者。

但患者并非临床案例的抽象情景。

从业者会在答案之前听到犹豫。她会注意到故事的变化。她了解到有的患者习惯性地淡化症状,而另一些患者则把每一种感受都报告到最大强度。她清楚地知道“我很好”并不一定真的好。

这些信息可能永远不会出现在病历中。

医学中的人际互动并不仅仅是机器完成智力工作后我们添加的一个愉快层面,它是另一来源的临床数据。

AI 能读取病历。人类能读懂现场。

最佳的临床系统需要两者兼备。

停止询问 AI 是否会取代医生

我们问错了问题。

未来不一定会归属于拥有最聪明聊天机器人或最智能基础模型的公司。重要的创新正日益围绕模型本身展开:信息如何被捕获和验证、提供何种知识、系统被允许推断什么、确定性控制何时接管以及何时必须让人类保持在环路中。

原始智能正变得充裕。

将这种智能付诸应用的可靠系统更难构建。

我们不应通过要求每位临床医生都成为业余 AI 开发者来解决此问题。复杂性应存在于技术内部,而不是医生的提示中。

未来的医生不会在记忆力上胜过 AI。那场竞争已经变得毫无意义。

相反,我们应构建能够为临床医生提供机器的记忆、处理能力和模式识别,同时保留从业者的情境、判断、怀疑精神和人际联系的系统。

我们称之为仿生从业者。

我猜患者最终会给它起一个更简单的称呼。

他们的医生。

Dr. Brandy Zachary, DC, IFMCP,绰号 Dr. Z,是 TDZ Functional Medicine Academy(TDZ-FMA)、LabDX 和 DiagnoseThis 的创始人兼首席执行官。她是一名脊椎指压医生,也是功能医学研究所认证从业者。她在没有外部投资的情况下将 TDZ-FMA 打造成一家在 2026 年入选 Inc. 5000 的公司,实现了 2,095% 的三年增长。Dr. Z 是首位获得金 Stevie® 奖最佳女性企业家奖的得主,并且是八本书的作者,其中包括一本 McGraw-Hill 出版的著作。