インタビュー

セラフィム・バツォグルー博士、Seerのチーフデータオフィサー – インタビューシリーズ

mm
Unite.AI を Google の優先ソースに追加

セラフィム・バツォグルー博士は、Seerのチーフデータオフィサーです。Seerに参加する前、セラフィム博士はInsitroのチーフデータオフィサーとして、機械学習とデータサイエンスを薬剤発見へのアプローチで導きました。Insitro以前は、Illuminaの応用計算生物学担当VPとして、AIと分子アッセイの研究開発を人間の健康におけるゲノムデータの解釈を容易にするために率いました。

ゲノミクス分野に最初に惹かれたのは何ですか?

私は、MITでのコンピューターサイエンスの博士課程の開始時に、ボニー・バーガー氏とデビッド・ギフォード氏によって教えられた計算生物学のクラスに参加したときに、計算生物学の分野に興味を持ちました。ヒトゲノムプロジェクトは、私の博士課程中に進展していました。MITのゲノムセンターの責任者であるエリック・ランダー氏は、私の博士課程の共同指導教員となり、私をプロジェクトに参加させました。ヒトゲノムプロジェクトによって動機づけられた私は、全ゲノムアセンブリとヒトとマウスのDNAの比較ゲノミクスに取り組みました。

その後、私はスタンフォード大学のコンピューターサイエンス学部の教員となり、15年間そこで過ごし、約30人の非常に才能のある博士課程の学生と多くのポスドク研究者や大学生を指導することができました。私のチームの焦点は、大規模なゲノムと生物分子データの分析のためのアルゴリズム、機械学習、ソフトウェアツールの開発への応用でした。2016年にスタンフォードを離れて、Illuminaの研究開発チームを率いるために業界に入りました。以来、私は業界でのR&Dチームのリーダーとしての経験を楽しんでいます。チームワーク、ビジネス面、社会へのより直接的な影響が、学術界とは異なる業界の特徴であると感じています。私は、DNAnexus(2009年に共同設立)、Illumina、Insitro、そして現在のSeerのような革新的な会社でキャリアを積んできました。計算と機械学習は、バイオテクノロジーにおけるテクノロジー開発、データ取得、生物データ解釈、人間の健康への応用という技術チェーン全体で不可欠です。

過去20年間で、ヒトゲノムのシーケンシングは、劇的に安くなり、迅速化しました。これにより、ゲノムシーケンシング市場が大幅に成長し、ライフサイエンス業界での採用が広まりました。現在、人口ゲノミクス、多重オミクス、表現型データが十分なサイズで利用可能になり、医療を革命的に変えることができます。計算分析を使用して、個人のゲノムデータの分子基盤を発見し、患者は個別化された治療を受けることができます。特にがんや希少な遺伝性疾患の分野で、ターゲット化された治療を受けることができます。医学以外の分野でも、機械学習とゲノム情報を組み合わせることで、遺伝子、栄養、生活習慣についての洞察を得ることができます。次の数年間で、個別化されたデータ駆動型医療が、希少な疾患の患者を始めとして、徐々に広く普及することが予想されます。

現在の役職に就く前は、Insitroのチーフデータオフィサーとして、薬剤発見へのアプローチで機械学習とデータサイエンスを率いていました。その期間中に得た機械学習が薬剤発見を加速する上での重要な教訓は何ですか?

従来の薬剤発見と開発の「試行錯誤」のパラダイムは、非効率性と非常に長いタイムラインに悩まされています。1つの薬剤が市場に出るまでに、10億ドル以上かかり、10年以上かかることがあります。機械学習をこれらの努力に組み込むことで、コストとタイムラインを大幅に削減できます。1つのステップは、ターゲットの同定であり、大規模な遺伝的および化学的変異と表現型の読み出しを通じて、疾患の表現型を調節する遺伝子または遺伝子のセットを同定することができます。もう1つのステップは、化合物の同定と最適化であり、機械学習によって推論されるインシリコ予測とインビトロスクリーニングを使用して、小分子または他のモダリティを設計し、望ましい特性を最適化することができます。最も難しく重要な側面は、人間への翻訳です。ここでは、適切なモデル(induced pluripotent stem cell-derived lines、一次患者細胞線、組織サンプル、動物モデル)の選択が、結果のデータと機械学習の翻訳可能性に大きく影響します。

Seer Bioは、プロテオームの秘密を解読する新しい方法を開発し、人間の健康を改善しています。プロテオームとは何ですか?

プロテオームは、生物が時間の経過とともに、環境、栄養、健康状態への応答として生成または修飾するタンパク質の変化するセットです。プロテオミクスは、特定の細胞タイプまたは組織サンプル内のプロテオームの研究です。ヒトや他の生物のゲノムは静的です。生まれつきのゲノムは、体の中のすべての細胞で同じです。プロテオームは、動的で、時間の経過とともに変化します。したがって、プロテオームは、ゲノムよりも表現型や健康状態に近いものであり、健康を監視し、疾患を理解する上でより情報量が豊富です。

Seerでは、複雑なサンプルである血漿に対するプロテオームへの新しいアクセス方法を開発しました。血漿は、従来のマススペクトロメトリーによるプロテオミクスでは大きな課題でした。

SeerのProteographプラットフォームとは何ですか? それはいかにしてプロテオームの新しい視点を提供しますか?

SeerのProteographプラットフォームは、特性の調整可能な独自のエンジニアリングナノ粒子ライブラリを使用し、シンプルで迅速で自動化されたワークフローを提供し、プロテオームの深い解析を可能にします。

Proteographプラットフォームは、血漿やその他の複雑なサンプルを調査する際に優れています。これらのサンプルでは、さまざまなタンパク質の豊富度に大きな差があります。従来のマススペクトロメトリー法では、低豊富度のプロテオームを検出することができません。Seerのナノ粒子は、偏りのない方法でタンパク質を集めるために、特性を調整することができます。典型的な血漿サンプルでは、私たちの技術により、Proteographを使用せずに処理した場合よりも5〜8倍多くのタンパク質を検出することができます。結果として、サンプル準備から機器まで、データ分析まで、私たちのProteograph製品スイートは、検出できない可能性のあるプロテオームの疾患シグネチャーを見つけるのに役立ちます。私たちは、プロテオームへの新しいゲートウェイを開いていると言います。

さらに、私たちは、大規模なプロテオゲノミクス研究を容易に行うことができます。プロテオゲノミクスは、ゲノムデータとプロテオミクスデータを組み合わせて、タンパク質バリアントを同定し、ゲノムバリアントとタンパク質豊富度レベルを関連付け、ゲノムとプロテオームを表現型や疾患と関連付けて、疾患に関連する因果的およびダウンストリームの遺伝的経路を解明することです。

Seer Bioで現在使用されている機械学習技術について説明できますか?

Seerでは、テクノロジー開発から下流のデータ分析まで、すべてのステップで機械学習を利用しています。これらのステップには、次のものが含まれます。(1) 独自のナノ粒子の設計、機械学習によって、どの物理化学的特性とナノ粒子の組み合わせが特定の製品ラインとアッセイで機能するかを決定します。(2) MS機器からの読み出しデータからのペプチド、タンパク質、バリアント、プロテオフォームの検出と定量化。(3) 大規模な集団コホートでの下流のプロテオミクスとプロテオゲノミクス分析。

昨年、私たちはAdvanced Materialsに、プロテオミクス方法、ナノエンジニアリング、機械学習を組み合わせたタンパク質コロナ形成メカニズムの理解を向上させる研究を発表しました。この研究により、ナノバイオ相互作用が明らかになり、Seerの将来のナノ粒子と製品の開発に役立っています。

ナノ粒子開発以外に、バリアントペプチドと翻訳後修飾の同定ための新しいアルゴリズムを開発しています。最近、タンパク質定量特性遺伝子座の検出方法を開発しました。これは、プロテオミクスにおけるアフィニティーベースの混乱因子に対してロバストです。生のスペクトルから直接ペプチドを同定するためのディープラーニングベースのデノボシーケンシング方法を使用して、スペクトルライブラリのサイズを膨張させることなくこれらのペプチドを検出することを目指しています。

私たちのチームは、機械学習モデルを最適に調整して利用するための、AutoMLツールに基づくSeer MLフレームワークを開発しています。これにより、ベイジアン最適化を使用してハイパーパラメーターの効率的な調整が可能になります。

最後に、バッチ効果を減らし、質量分析の定量的精度を高めるために、測定された定量値をモデル化して、強度値の相関などの予測メトリックを最大化する方法を開発しています。

LLMの一般的な問題である「ホールシネーション」について、どのような解決策がありますか?

LLMは、与えられた大規模なコーパスで訓練された生成モデルであり、コーパス内の基本的な統計的特性を捉えます。ローカルな特性、たとえば単語(またはトークン)の組み合わせがどのくらい頻繁に一緒に出現するか、から、高レベルの特性、たとえばコンテキストと意味の理解のエミュレーションまで、幅広い特性を捉えます。

しかし、LLMは、主に正確性に訓練されていません。強化学習による人間のフィードバック(RLHF)やその他の技術は、正確性を含む望ましい特性のために訓練に役立ちますが、完全に成功しているわけではありません。質問が与えられたとき、LLMは、訓練データの統計的特性に最も近いテキストを生成します。たとえば、「アレクサンダー大王はいつ生まれたか」と問われても、正解は356 BC(または BCE)であり、LLMはその答えを出す可能性が高いでしょう。なぜなら、訓練データ内でアレクサンダー大王の生年が頻繁に出現するからです。しかし、「エンペレス・レジネラはいつ生まれたか」と問われても、訓練コーパスに存在しない架空の人物について、LLMはホールシネーションを起こして物語を作り出すでしょう。同様に、LLMが正しい答えを取得できない、または統計的な理由で、質問に対してホールシネーションを起こして答えます。医療のような重大なアプリケーションでは、これは明らかな問題です。

ホールシネーションに対する完璧な解決策はまだありません。ホールシネーションは、LLMの設計に内在するものです。部分的な解決策の1つは、適切なプロンプティング、たとえばLLMに「慎重に、段階的に考える」というように指示することです。これにより、LLMが物語を作り出す可能性が低くなります。より洗練されたアプローチは、ナレッジグラフの使用です。ナレッジグラフは、事前に定義された論理的な方法で他のエンティティに接続されたエンティティで構成される構造化されたデータです。特定のドメインのナレッジグラフを構築することは、自動化された統計的方法とキュレーションの組み合わせで実行可能な課題です。組み込まれたナレッジグラフを使用して、LLMは生成したステートメントを事実の構造化されたセットに照合し、ナレッジグラフによってサポートされていない、または矛盾するステートメントを生成しないように制限できます。

ホールシネーションの根本的な問題と、推論力と判断力の不足により、LLMは現在、情報の取得、接続、濃縮に強力ですが、医療診断や法律アドバイスのような重大なアプリケーションでは、人間の専門家を置き換えることはできません。ただし、これらの分野の人間の専門家の効率性と能力を大幅に向上させることができます。

生物学がデータによって導かれる未来、仮説によって導かれない未来についてのあなたのビジョンを共有してください。

従来の仮説駆動型アプローチは、新しいパラダイムに置き換わりつつあります。この新しいパラダイムでは、研究者は、仮説なしで、大規模なデータ生成から始めます。次に、機械学習モデル、たとえばLLMを、隠されたデータの正確な再構成、強力な回帰または分類パフォーマンスなどの下流タスクの目的で訓練します。モデルがデータを正確に予測し、実験的レプリカ間の類似性に相当する精度に達したとき、研究者はモデルを調査して、生物システムとその根底にある生物学的原理についての洞察を抽出できます。

LLMは、特にバイオ分子データのモデリングに優れています。バイオ分子システムの正確なモデリングを可能にする、仮説駆動型からデータ駆動型への移行を促進するでしょう。この移行は、次の10年間でさらに顕著になるでしょう。

疾患診断と薬剤発見への潜在的な影響は何ですか?

私は、LLMと生成型AIがライフサイエンス業界に大きな変化をもたらすと考えています。1つの分野は、特に希少で診断が難しい疾患やがんの亜型に対する臨床診断です。包括的な患者情報、ゲノムプロファイル、治療反応、医療記録、家族歴を利用して、正確でタイムリーな診断を促進できます。すべてのデータを簡単にアクセスできるようにコンパイルする方法を見つけることができれば、診断の精度を大幅に改善できます。これは、機械学習モデル、包括LLMが診断を自律的に行うことを意味するわけではありません。技術的な限界により、予測可能な将来、自律的に動作することはできません。代わりに、医師が情報に基づいた評価と診断を迅速に行うための強力なツールとなり、患者と医療提供者のネットワーク全体に診断を適切に文書化して伝えることができます。

業界はすでに、機械学習を薬剤発見と開発に利用しています。従来のパラダイムに比べてコストとタイムラインを削減する能力を誇っています。LLMは、利用可能なツールボックスにさらに追加され、ゲノム、プロテオーム、機能ゲノミクス、エピゲノミクス、シングルセルデータなど、大規模なバイオ分子データをモデル化するための優れたフレームワークを提供します。予測可能な将来、基礎LLMは、これらのすべてのデータモダリティ間で、そして大規模な集団コホート間で接続され、薬剤発見に役立つでしょう。たとえば、有望な薬剤ターゲットの生成、疾患に関連する生物学的機能を調節できるタンパク質の活性化ポケットの同定、または薬剤を他の疾患の適応に転用するための経路と複雑な細胞機能の提案などです。遺伝的感受性に基づいて薬剤反応者と非反応者を同定するためにLLMを利用することもできます。

多くの既存の革新的なAIベースの薬剤発見企業は、間違いなくこの方向で既に考え、開発を始めています。LLMを人間の健康と薬剤発見に導入することを目的とした、企業間で新しい企業の設立や公共の取り組みが見られるでしょう。感謝します。詳しく知りたい読者は、Seerを訪問してください。

アントワーヌは、Unite.AIのビジョナリーレーダーであり共同創設者です。彼は、AIとロボティクスの未来を形作り、推進するための不屈の情熱に駆り立てられています。シリアルエントレプレナーである彼は、AIが電気と同様に社会に大きな変革をもたらすと信じており、破壊的な技術とAGIの可能性について語ることがよくあります。

彼はフューチャリストとして、これらのイノベーションが私たちの世界をどのように形作るかを探求することに尽力しています。さらに、彼はSecurities.ioの創設者であり、未来を再定義し、全セクターを再構築する最先端技術への投資に焦点を当てたプラットフォームです。