访谈
Gradient Health CEO Josh Miller – 采访系列

Josh Miller 是 Gradient Health 的 CEO,Gradient Health 是一家基于这样一个理念而成立的公司:自动化诊断必须存在于医疗保健中,以使其公平地和可及地提供给每个人。Gradient Health 致力于加速自动化 AI 诊断,并提供有组织、标记和可用的数据。
您能否分享 Gradient Health 的创立故事?
我的联合创始人 Ouwen 和我刚刚离开了我们的第一家创业公司 FarmShots,我们利用计算机视觉来帮助减少农业中使用的杀虫剂的数量,我们正在寻找下一个挑战。
我们一直受到这样的动力:找到一个艰难的问题,并利用技术来解决它,这不仅能做很多好事,还能带来一个良好的商业机会。Ouwen 正在攻读他的医学学位,我们在计算机视觉方面有经验,医学成像对我们来说是一个自然的选择。由于乳腺癌的毁灭性影响,我们选择了乳腺 X 光摄影作为潜在的第一个应用。所以我们说:“好吧,我们从哪里开始?我们需要数据。我们需要一千张乳腺 X 光片。在哪里可以得到这样的数据?”答案是“无处可寻”。我们意识到,任何想要在这个领域做好事的人都不应该为了获取数据而奋斗和挣扎。于是我们说:“也许这就是我们要解决的问题”。
当前市场中不具代表性的数据带来的风险是什么?
从无数研究和现实例子中,我们知道,如果我们使用西海岸的数据构建算法,并将其带到东南部,它就不会起作用。一次又一次,我们听到这样的故事:在东北部医院创建的 AI 在其他地方部署时,其准确率会降低到 50% 以下。
我认为 AI 的基本目的,在伦理层面上,是减少健康差异。目标是使高质量的医疗服务变得廉价和可及于所有人。但是,当你使用糟糕的数据构建 AI 时,你实际上会增加差异。我们在医疗保健 AI 的使命中失败了,如果我们让它只为白人海岸居民服务,而不是所有人服务。来自代表性不足的背景的人将会因 AI 而遭受更多的歧视,而不是减少歧视。
您能否讨论 Gradient Health 如何获取数据?
当然,我们与世界各地的各种健康系统合作,他们的数据原本被存储起来,花费了他们的钱,并没有造福任何人。我们在源头彻底去识别他们的数据,然后仔细地为研究人员组织这些数据。
Gradient Health 如何确保数据不偏不倚且尽可能多样化?
有很多方法。例如,当我们收集数据时,我们确保包括许多社区诊所,在那里你经常会有更具代表性的数据,以及更大的医院。我们还从大量的临床网站获取数据。我们尝试从尽可能多的不同人群中获取尽可能多的网站。因此,不仅仅是拥有大量的网站,还要拥有地理和社会经济上多样化的网站。如果所有的网站都来自市中心的医院,那么这仍然不是代表性的数据,对吧?
为了验证这一点,我们在所有这些数据集中运行统计数据,并根据客户的需求定制这些数据,以确保他们获得的数据在技术和人口统计学方面都是多样化的。
为什么这种数据控制对于设计强大的 AI 算法如此重要?
有很多变量,AI 可能会在现实世界中遇到,我们的目标是确保算法尽可能地健壮。为了简化,我们认为我们的数据中有五个关键变量。第一个变量是“设备制造商”。这是显而易见的,如果你只使用来自 GE 扫描仪的数据构建算法,它在 Hitachi 扫描仪上就不会表现得那么好。
类似地,另一个变量是“设备型号”。这是一个很有趣的健康不平等观点。我们知道,大型、资金充足的研究医院往往拥有最新、最好的扫描仪版本。如果他们只使用自己的 2022 年型号来训练 AI,那么它在 2010 年型号上就不会表现得那么好。这些旧系统正是那些不太富裕和农村地区所拥有的。因此,通过只使用来自新型号的数据,他们无意中地对这些社区的人们引入了进一步的偏见。
其他关键变量是性别、种族和年龄,我们竭尽全力确保我们的数据在所有这些方面都得到比例平衡。
医疗技术公司面临的监管障碍是什么?
我们开始看到 FDA 正在调查数据集中的偏见。我们有研究人员来找我们,说“FDA 因为缺乏 15% 的非裔美国人人口而拒绝了我们的算法”(大约是非裔美国人在美国人口中的百分比)。我们还听说过开发者被告知需要在他们的训练数据中包含 1% 的太平洋夏威夷岛民。
因此,FDA 正在意识到这些仅在单个医院训练的算法在现实世界中不起作用。如果你想获得 CE 标志和 FDA 批准,你必须带来一个代表人口的数据集。这不再是可以接受的,即仅使用一个小的或不具代表性的群体来训练 AI。
对于医疗技术公司来说,风险在于他们投资数百万美元来开发他们的技术,以至于他们认为自己已经准备好获得监管批准,但如果他们无法获得批准,他们将永远无法获得报销或收入。最终,通往商业化和对医疗保健产生有益影响的道路需要他们关心数据偏见。
从数据角度来看,克服这些障碍的选项是什么?
近年来,数据管理方法已经演变,AI 开发人员现在比以往任何时候都有更多的选择。从数据中间件和合作伙伴到联邦学习和合成数据,有新的方法来解决这些障碍。无论他们选择哪种方法,我们始终鼓励开发人员考虑他们的数据是否真正代表了将使用该产品的人口。这是获取数据中最困难的方面。
Gradient Health 提供的一种解决方案是 Gradient Label,它是什么以及如何实现大规模标记数据?
医疗成像 AI 不仅需要数据,还需要专家注释。我们帮助公司获得这些注释,包括来自放射科医生的注释。
您对医疗保健领域 AI 和数据的未来有什么展望?
已经有成千上万的 AI 工具可以检查从手指尖到脚趾尖的所有东西,我认为这将继续下去。我认为每个医学教科书中的每个病症都将至少有 10 个算法,每个算法都将有多个、可能是竞争性的工具来帮助临床医生提供最好的护理。
我不认为我们会看到一个类似《星际迷航》风格的三录仪,可以扫描一个人并解决从头到脚的所有问题。相反,我们将拥有针对每个子集的专用应用程序。
您是否还有其他关于 Gradient Health 的信息想要分享?
我对未来感到兴奋。我认为我们正在朝着一个医疗保健廉价、公平、可及于所有人的方向发展,我希望 Gradient 能够在实现这一目标中发挥基本作用。我们团队中的每个人都真正相信这一使命,并且他们之间存在着一种团结的热情,这在每家公司中都很难找到。我爱它!
感谢这次精彩的采访,希望了解更多的读者可以访问 Gradient Health。












