访谈

赛尔生物首席数据官塞拉菲姆·巴茨格鲁博士 – 采访系列

mm
将 Unite.AI 添加到您在 Google 上的首选来源

塞拉菲姆·巴茨格鲁博士是赛尔生物的首席数据官。在加入赛尔生物之前,塞拉菲姆曾担任Insitro的首席数据官,领导机器学习和数据科学在其药物发现方法中的应用。在Insitro之前,他曾担任Illumina的应用和计算生物学副总裁,领导人工智能和分子测定技术的研究和开发,以使基因组数据在人类健康方面更易于解释。

是什么最初吸引你进入基因组学领域?

我在计算机科学博士学期间开始对计算生物学感兴趣,当时我在MIT跟随邦妮·伯格和大卫·吉福德学习这门课程。人类基因组计划在我的博士学期间逐渐展开,埃里克·兰德尔,谁当时是MIT基因组中心的负责人,成为了我的博士联合指导老师,并让我参与了这个项目。人类基因组计划的动力促使我从事整体基因组组装和人类和小鼠DNA的比较基因组学的研究。

然后,我搬到斯坦福大学,成为计算机科学系的教师,在那里度过了15年,我有幸指导了30多位非常有天赋的博士生和许多博士后研究人员和本科生。我的团队的重点是应用算法、机器学习和软件工具来分析大规模的基因组和生物分子数据。我于2016年离开斯坦福大学,加入Illumina,领导一个研究和技术开发团队。从那时起,我很高兴能够在行业中领导研发团队。我发现团队合作、商业方面以及对社会的直接影响是行业与学术界的区别。我曾在整个职业生涯中为创新公司工作:DNAnexus,我于2009年联合创立的公司,Illumina,Insitro和现在的Seer。计算和机器学习在生物技术的整个技术链中都是必不可少的,从技术开发到数据采集,再到生物数据解释和转化为人类健康。

在过去的20年里,测序人类基因组的成本和速度已经大大降低。这导致基因组测序市场迅速增长,并在生命科学行业中得到更广泛的应用。我们现在正处于拥有足够规模的人口基因组、多组学和表型数据的门槛,可以从根本上改变医疗保健,包括预防、诊断、治疗和药物发现。我们可以通过对基因组数据的计算分析,越来越多地发现个体疾病的分子基础,并且患者有机会接受针对性和个性化的治疗,特别是在癌症和罕见遗传疾病等领域。除了在医学中的明显应用外,机器学习与基因组信息的结合还可以让我们在生活的其他领域获得见解,例如我们的家谱和营养。未来几年将会看到个性化、数据驱动的医疗保健的采用,首先是针对特定人群,如罕见疾病患者,然后是广大公众。

在您当前职位之前,您曾担任Insitro的首席数据官,领导机器学习和数据科学在其药物发现方法中的应用。在此期间,您有哪些关键的收获?

传统的药物发现和开发的“试错”范式饱受低效和漫长时间线的困扰。仅仅为了让一种药物上市,就可能需要花费10亿美元以上,并且需要十多年的时间。通过将机器学习纳入这些努力中,我们可以在几个步骤中大大降低成本和时间。其中一个步骤是目标识别,即通过大规模的遗传和化学干扰以及表型读出来识别调节疾病表型或将疾病细胞状态恢复到更健康状态的基因或基因集。另一个步骤是化合物识别和优化,即通过机器学习驱动的计算预测和体外筛选来设计小分子或其他方式,并且可以优化所需的药物性质,如溶解度、渗透性、特异性和非毒性。最难也是最重要的方面可能是翻译到人类身上。在这里,选择适合疾病的正确模型——诱导多能干细胞衍生的细胞系与原发性患者细胞系、组织样本与动物模型——是一个非常重要的权衡,最终反映在数据加机器学习能够翻译到患者身上的能力。

Seer Bio正在开创新的方法来解码蛋白质组的秘密,以改善人类健康。对于不熟悉这个术语的读者,什么是蛋白质组?

蛋白质组是指生物体在某一时间点或对环境、营养和健康状态的反应中产生或修饰的蛋白质集合。蛋白质组学是指在特定细胞类型或组织样本中研究蛋白质组的学科。人类或其他生物体的基因组是静态的:除了体细胞突变,出生时的基因组就是一生都有的基因组,在身体的每个细胞中都被精确地复制。蛋白质组是动态的,并且会随着时间的推移而变化,变化的时间尺度可以是几年、几天,甚至几分钟。因此,蛋白质组比基因组更接近于表型,最终更接近于健康状态,因此更有信息量,可以用于监测健康状况和理解疾病。

在Seer,我们已经开发了一种新的方法来获取蛋白质组,这种方法可以对复杂样本中的蛋白质和蛋白质异型进行更深入的了解,例如血浆,这是一种高度可访问的样本,但迄今为止,对于传统的质谱蛋白质组学来说,仍然是一个巨大的挑战。

Seer的蛋白质图谱平台是什么,它如何提供对蛋白质组的新视角?

Seer的蛋白质图谱平台利用了一种专有的工程纳米颗粒,通过一个简单、快速和自动化的工作流程,实现了对蛋白质组的深入和可扩展的提问。

蛋白质图谱平台在提问复杂样本时表现出色,例如血浆,这些样本具有大动态范围——样本中不同蛋白质的丰度相差几个数量级——传统的质谱方法无法检测到蛋白质组中丰度较低的部分。Seer的纳米颗粒具有可调节的物理化学性质,可以以无偏见的方式收集整个动态范围内的蛋白质。在典型的血浆样本中,我们的技术可以比不使用蛋白质图谱处理的纯血浆检测到5倍到8倍更多的蛋白质。因此,从样品制备到仪器到数据分析,我们的蛋白质图谱产品套件帮助科学家找到可能在其他情况下无法检测到的蛋白质组疾病标志。我们喜欢说,在Seer,我们正在打开通往蛋白质组的新门户。

此外,我们还使科学家能够轻松地进行大规模的蛋白质组学研究。蛋白质组学是指将基因组数据与蛋白质组数据相结合,以识别和量化蛋白质变异体,关联基因组变异体与蛋白质丰度水平,并最终将基因组和蛋白质组与表型和疾病联系起来,并开始解开与疾病相关的因果和下游遗传途径。

您能否讨论一下Seer Bio目前使用的机器学习技术?

Seer正在从技术开发到下游数据分析的所有步骤中利用机器学习。这些步骤包括:(1)我们专有的纳米颗粒的设计,其中机器学习帮助我们确定哪些物理化学性质和纳米颗粒的组合将与特定的产品线和测定方法合作;(2)从质谱仪产生的读出数据中检测和量化肽、蛋白质、变体和蛋白质异型;(3)在大规模人群队列中进行下游蛋白质组学和蛋白质组学分析。

去年,我们在《高级材料》杂志上发表了一篇论文,结合了蛋白质组学方法、纳米工程和机器学习,以提高我们对蛋白质冠形成机制的理解。这篇论文揭示了纳米-生物相互作用,并为Seer创建改进的未来纳米颗粒和产品提供了信息。

除了纳米颗粒开发外,我们还开发了识别变体肽和翻译后修饰的新算法。我们最近开发了一种方法来检测蛋白质量化性状位点(pQTLs),该方法对蛋白质变体具有鲁棒性,这是基于亲和力的蛋白质组学的一个已知的混杂因素。我们正在将这项工作扩展到直接从原始光谱中使用基于深度学习的新序列方法来识别这些肽段,而无需膨胀光谱库的大小。

我们的团队还在开发方法,以使没有深厚机器学习专业知识的科学家能够在他们的发现工作中优化和利用机器学习模型。这是通过基于AutoML工具的Seer ML框架实现的,该框架允许通过贝叶斯优化高效地进行超参数调优。

最后,我们正在开发方法来减少批次效应并提高质谱读出值的量化准确性,方法是将测量的量化值建模为最大化预期指标,例如肽段内强度值的相关性。

幻觉是LLM的一个常见问题,有什么解决方案可以防止或减轻这种问题?

LLM是生成方法,给定一个大型语料库,并训练生成类似的文本。它们捕获训练文本的底层统计属性,从简单的局部属性(如某些单词或标记的组合的频率)到更高级的属性(模拟对上下文和含义的理解)。然而,LLM主要不是为了正确而训练的。强化学习和人类反馈(RLHF)等技术有助于训练它们以获得理想的属性,包括正确性,但并非完全成功。给定一个提示,LLM将生成最能模仿训练数据统计属性的文本。通常,这个文本也是正确的。例如,如果询问“亚历山大大帝出生于何时”,正确答案是公元前356年,LLM很可能会给出这个答案,因为在训练数据中,亚历山大大帝的出生经常被提及为这个值。然而,如果询问“雷吉内拉女皇出生于何时”,一个在训练语料库中不存在的虚构人物,LLM很可能会产生幻觉并编造一个关于她出生的故事。同样,如果询问一个LLM可能无法检索正确答案的问题(无论是因为正确答案不存在,还是由于其他统计原因),它很可能会产生幻觉并回答,好像它知道。这种行为产生的幻觉是严重的应用问题,例如“如何治疗某种癌症”。

目前尚无完美的解决方案来防止幻觉。幻觉是LLM设计的固有问题。一个部分解决方案是适当的提示,例如要求LLM“一步一步地思考”。更复杂的方法是使用知识图。知识图提供结构化数据:知识图中的实体以逻辑方式连接到其他实体。为特定领域构建知识图当然是一个具有挑战性的任务,但可以通过自动化和统计方法以及人工策划来完成。有了内置的知识图,LLM可以将它们生成的陈述与已知事实的结构集进行交叉检查,并且可以被约束以避免生成与知识图相矛盾或不受支持的陈述。

由于幻觉的根本问题,以及可以说是由于它们缺乏足够的推理和判断能力,LLM目前对于检索、连接和提炼信息非常有力,但不能在严肃的应用中取代人类专家,例如医学诊断或法律建议。然而,它们可以极大地提高这些领域人类专家的效率和能力。许多现有的创新人工智能药物发现公司无疑已经开始朝这个方向思考和发展,我们应该期待看到更多公司和公共努力的成立,旨在部署LLM在人类健康和药物发现方面。感谢您这次详细的采访,希望读者能够通过访问Seer的网站来了解更多信息。

安托万是一位具有远见的领导者和Unite.AI的联合创始人,他对塑造和推广人工智能和机器人技术的未来充满热情。作为一位连续创业者,他相信人工智能将对社会产生电力的影响一样的颠覆性影响,并经常对颠覆性技术和通用人工智能的潜力大加赞扬。

作为一位未来学家Securities.io的创始人,这是一个专注于投资尖端技术的平台,这些技术正在重新定义未来并重塑整个行业。