访谈

伊泰·达扬(Ittai Dayan),MD,犀牛健康(Rhino Health)联合创始人兼首席执行官 – 采访系列

mm
将 Unite.AI 添加到您在 Google 上的首选来源

伊泰·达扬(Ittai Dayan),MD,是犀牛健康(Rhino Health)的联合创始人兼首席执行官。他的背景是在开发人工智能和诊断,以及临床医学和研究方面。他曾是波士顿咨询公司(BCG)医疗保健实践的核心成员和医院高管。他目前专注于为医疗保健和生命科学行业开发安全、公平和有效的人工智能。犀牛健康公司使用分布式计算和联邦学习来维护患者隐私并促进医疗保健领域的合作。

他曾在以色列国防军(IDF)特种部队服役,领导了世界上最大的学术医疗中心的人工智能中心。他是人工智能开发和商业化的专家,也是一名长距离跑者。

您能否分享犀牛健康背后的创立故事?

我进入人工智能领域的起点是在我还是一名临床医生和研究人员的时候,我使用了一种早期的“数字生物标志”来衡量精神障碍的治疗反应。后来,我在马萨诸塞州布莱根妇女医院(Mass General Brigham)领导了临床数据科学中心(CCDS)。在那里,我监督了几十个临床人工智能应用的开发,并亲眼目睹了开发和训练法规级人工智能产品所需的数据访问和“激活”的潜在挑战。

尽管医疗保健人工智能取得了许多进步,但从开发到推出产品的道路往往漫长而坎坷。解决方案在临床部署时可能会崩溃(或仅仅令人失望),而没有持续的临床数据支持,几乎不可能支持整个人工智能生命周期。挑战已经从创建模型转变为维护模型。为了应对这一挑战,我说服马萨诸塞州布莱根妇女医院系统相信拥有自己的“专门的AI临床研究组织”(CRO)的价值,以测试来自多个商业开发者的算法。

然而,问题仍然存在 – 医疗保健数据仍然非常分散,即使来自一个网络的大量数据也不足以应对医疗人工智能日益狭窄的目标。2020年夏天,我与NVIDIA (NVDA ) 的Mona Flores博士一起发起并领导了当时世界上最大的医疗保健联邦学习(FL)研究——EXAM。我们使用FL创建了一个预测COVID结果的模型,利用来自世界各地的数据,而无需共享任何数据。该研究结果发表在《自然医学》上,展示了利用多样和不同的数据集的积极影响,并强调了在医疗保健中更广泛使用联邦学习的潜力。

这种经历使我认识到了一系列挑战,包括协调合作网站的数据、确保数据可追溯性和适当的特征化,以及合作机构的IT部门所承担的负担,因为他们必须学习他们不熟悉的尖端技术。这需要一个新的平台来支持这些新型的“分布式数据”合作。我决定与我的联合创始人Yuval Baror合作,创建一个支持隐私保护合作的端到端平台。该平台是“犀牛健康平台”,利用FL和边缘计算。

您为什么认为人工智能模型经常无法在医疗保健环境中达到预期的效果?

医疗人工智能通常是在小型、狭窄的数据集上训练的,例如来自单个机构或地理区域的数据集,这导致生成的模型仅在训练数据中看到的数据类型上表现良好。一旦算法应用于与训练数据集不同的患者或场景,性能就会严重受损。

Andrew Ng准确地表达了这一概念,他说:“当我们从斯坦福医院收集数据时……我们可以发表论文,证明[算法]在发现某些条件方面与人类放射科医生相当。……[当]您将同样的模型、同样的AI系统应用于街上另一家较旧的医院,使用较旧的机器,技术人员使用略有不同的成像协议时,数据漂移会导致AI系统的性能显著下降。”

简单来说,大多数人工智能模型都没有在足够多样和高质量的数据上进行训练,导致它们在“现实世界”中的性能较差。这一问题已经在科学和主流圈子中得到充分记录,例如在科学Politico中。

在不同患者群体中测试的重要性如何?

在不同患者群体中测试对于确保生成的AI产品不仅有效和高效,而且安全至关重要。未经充分多样化患者群体训练或测试的算法可能会受到算法偏见的影响,这是医疗保健和医疗技术中的严重问题。这些算法不仅会反映训练数据中的偏见,还会加剧这些偏见并加剧医疗保健中的现有种族、民族、宗教、性别等不平等。如果不在多样化的患者群体中测试,可能会导致危险的产品。

最近发表的一项研究5,利用犀牛健康平台,研究了在一个网站开发的用于检测脑动脉瘤的AI算法在四个具有不同扫描仪类型的网站上的性能。结果表明,在具有不同扫描仪类型的网站上性能有显著的可变性,强调了在多样化的数据集上训练和测试的重要性。

您如何识别一个子群体是否没有被代表?

一种常见的方法是分析不同数据集中的变量分布,包括单独和组合的分布。这可以在准备“训练”数据集和验证数据集时为开发人员提供信息。犀牛健康平台允许您执行此操作,并且可以查看模型在不同队列上的性能,以确保普遍适用性和可持续的性能。

您能否描述什么是联邦学习以及它如何解决一些问题?

联邦学习(FL)可以被广泛定义为人工智能模型的训练和改进过程,使用不同的数据,而无需共享或集中数据。这是人工智能开发的一个巨大飞跃。历史上,任何希望与多个网站合作的人都必须汇集这些数据,导致一系列繁琐、昂贵和耗时的法律、风险和合规问题。

今天,随着犀牛健康平台等软件的出现,FL正在医疗保健和生命科学领域成为日常现实。联邦学习允许用户在数据仍留在合作伙伴的本地服务器上时探索、策划和验证数据。容器化代码,例如AI/ML算法或分析应用程序,被发送到本地服务器,在那里执行代码,例如训练或验证AI/ML算法。数据始终留在“数据托管方”手中。

医院尤其担心聚合敏感患者数据的风险。这已经导致了一些令人尴尬的情况,很明显医疗保健组织在不知道其数据使用方式的情况下与行业合作。因此,他们限制了行业和学术研究人员可以进行的合作,这减缓了研发并影响了整个医疗保健行业的产品质量。FL可以减轻这种情况,并像以前一样实现数据合作,同时控制这些合作的风险。

您能否分享犀牛健康关于使用更多样化的数据实现快速模型创建的愿景?

我们设想一个生态系统,AI开发人员和用户可以在不受恐惧或限制的情况下进行合作,同时尊重法规的界限。合作伙伴可以快速识别开发和测试所需的数据,访问和与数据交互,并迭代模型开发,以确保足够的普遍适用性、性能和安全性。

在这一切的核心是犀牛健康平台,为AI开发人员提供了一个“一站式”平台来构建大型和多样化的数据集,训练和验证AI算法,并持续监测和维护部署的AI产品。

犀牛健康平台如何防止AI偏见并提供AI可解释性?

通过解锁和简化数据合作,AI开发人员可以利用更大、更多样化的数据集来训练和测试他们的应用程序。使用更强大的数据集的结果是一个更具普遍性的产品,不受单个机构或狭窄数据集的偏见的影响。为了支持AI可解释性,我们的平台提供了对开发过程中使用的数据的清晰视图,包括分析数据来源、值分布和其他关键指标,以确保足够的数据多样性和质量。另外,我们的平台还实现了在数据集中添加其他变量(例如从现有数据点计算出的变量)以调查因果关系和缓解混杂因素等功能,这些功能在数据集中并不可能实现。

您如何回应担心过度依赖AI可能导致偏见结果且未经独立验证的医生?

我们理解这种担忧,并承认市场上的一些应用程序可能确实存在偏见。我们的回应是,我们必须作为一个行业,作为一个首先关心患者安全的医疗保健社区,共同制定政策和程序以防止这种偏见,并确保安全、有效的AI应用程序。AI开发人员有责任确保他们的上市AI产品经过独立验证,以获得医疗保健专业人员和患者的信任。犀牛健康致力于支持安全、值得信赖的AI产品,并与合作伙伴合作,以便在临床环境中部署AI应用程序之前实现独立验证所需的验证数据的解锁。

您对医疗保健领域人工智能的未来有什么展望?

犀牛健康的愿景是,人工智能在医疗保健领域已经实现了其全部潜力。我们正在努力创造透明度和合作伙伴关系,以确保隐私并实现这一愿景。我们设想的医疗保健人工智能不受防火墙、地理位置或法规限制的限制。AI开发人员将能够获得他们需要的所有数据来构建强大、普遍适用的模型,并能够实时监测和改进这些模型。提供者和患者将能够确保他们不会失去对其数据的控制,并且可以确保其被用于善事。监管机构将能够实时监测用于制药和设备开发的模型的有效性。公共卫生组织将从人工智能的进步中受益,患者和提供者将能够安心地知道隐私得到保护。

感谢您接受这次精彩的采访,希望了解更多的读者可以访问犀牛健康

安托万是一位具有远见的领导者和Unite.AI的联合创始人,他对塑造和推广人工智能和机器人技术的未来充满热情。作为一位连续创业者,他相信人工智能将对社会产生电力的影响一样的颠覆性影响,并经常对颠覆性技术和通用人工智能的潜力大加赞扬。

作为一位未来学家Securities.io的创始人,这是一个专注于投资尖端技术的平台,这些技术正在重新定义未来并重塑整个行业。