ヘルスケア
ギンコデータポイントがVCPIを発表:AIによる医薬品発見のデータ問題を解決するための大胆な計画

数年間、AIによる医薬品発見は、デCEPTIVELY単純な問題によって妨げられてきた:データが十分に良くない。シーケンシング、プールドパートバーションスタディ、混合セル実験などの山のようなデータは、進歩の印象を与えるが、実際のブレークスルーをもたらさない。予測の飛躍が期待されたが、実際にはノイズが生じた。再現性が期待されたが、ドリフトが生じた。仮想細胞モデルを訓練するために必要な、薬理学に特有の正確な測定値が得られなかった。
この環境の中で、ギンコデータポイントは、仮想細胞薬理学イニシアチブ(VCPI)を立ち上げている。このプロジェクトは、単に多くのデータを提供するのではなく、AIモデルが実際の生物システムを予測するために必要な、より良いデータを提供することを目的としている。会社の公式発表では、VCPIは、120億のデータポイントを生成し、10万化合物をプロファイリングし、仮想細胞モデリングのための最初の標準化された薬理学データセットを確立することが強調されている。
「より多くのデータ」が失敗した理由
VCPIを紹介するブログ投稿では、ギンコは、分野の誤った軌道を完璧に捉えたアナロジーを使用している。ネズミの檻にハンドフルのお薬を入れ、それぞれのネズミがどのお薬を食べたかを判断しようとすることを想像してみてください。次に、それを1万匹のネズミが入った巨大な檻にスケールアップします。これが、プールドシングルセル薬理学実験の根本的な欠陥です。大量のデータを生成しますが、下層の設計により、化合物と表現型の間のクリーンな帰属が不可能になる。
問題は技術ではなく、実験設計である。より大きなデータセットが必ずしもより良いモデルを教えるという仮定は誤りである。ブログでは、このマインドセットを「データ中毒」と呼び、クリーンな入力がなければ、最も高度なAIでも誤ったパターンを学習することを主張している。
VCPIは、このロジックから離れたものである。サイズを称賛するのではなく、生物学的トレーサビリティ、実験の厳格性、AIが実際に薬理学を学ぶために必要な制御された構造に重点を置いている。
VCPIがデータパイプラインを再構築する方法
プールドシングルセルアッセイに頼るのではなく、VCPIはDRUG-seqを使用する。これは、各化合物が分離されたバーコード化されたウェルで処理される、高スループットバルクRNAシーケンシング法である。これにより、ギンコはプールデザインよりもはるかにクリーンなシグナルノイズ比で処理特異的な応答を測定できる。プレスリリースによると、会社の自動化インフラストラクチャは、1週間で384ウェルプレートを100枚以上実行でき、産業規模で数百万の高忠実度RNA測定を生成できる。
同様に重要なのは、V-Ref293という新しく開発された標準化された参照細胞の導入である。各研究所が独自の変異体やドリフトした細胞を使用するのではなく、VCPIは、仮想細胞の新しいクラスに「有機的双子」を作成する。薬理学ゲノミクスの再現性の長年の源となるものを排除し、AIモデルが必要とする安定した基準を提供する。
このイニシアチブの下で、ギンコは、以下の定義要素を備えたコミュニティ主導のデータセットを開催している。
- 研究者、製薬チーム、AI開発者のためのオープンパートシペーション
- 提出された化合物のための無料の高スループットRNAプロファイリング
- 貢献者のためのオプションのエンバーゴまたは恒久的なプロプライエタリアクセス
- コミュニティ投票に基づく毎月のデータリリース
- モデル共有、化合物の優先順位付け、早期アクセス「スーパーユーザー」ステータスの機会
コミュニティビルドモデル、データダンプではない
VCPIの最も特徴的な側面の1つは、データセットが存在する前に立ち上げるという決定である。完成したリソースをアップロードするのではなく、ギンコは科学コミュニティに、どの化合物が最も重要であるかを決定し、データセットが成長するにつれてリアルタイムで共同するように求めている。
このアプローチは参加をデリスクする。初期段階のバイオテック企業は化合物を提出し、高スループットスクリーニングに貴重な予算を費やすことなく、実際の薬理学データを受け取ることができる。AIチームは、データセットがモデル訓練に必要な変化を反映していることを確認できる。アカデミック研究所は貢献しながらも、90日間の独占ウィンドウの可能性を保持できる。
構造はデータ生成を参加型の科学的プロセスに変える——静的な製品ではない。
これがBio-AIの将来に与える影響
VCPIのより広範な影響は、ギンコまたは仮想細胞イニシアチブを超えて存在する。仮想細胞モデルが科学的に信頼できるものになるためには、再現可能で、処理特異的で、安定した生物学的参照に基づいたデータで訓練される必要がある。そうでない場合、AIは続けて幻覚を見たり、誤って予測したり、またはアーティファクトに過剰適合したりする。
VCPIのようなイニシアチブは、分野がデータ自体について考える方法の変化を示唆している。実験設計はモデルアーキテクチャと同等の重要性を持つようになっている。再現性は、任意の理想ではなく、中心的な要件として戻ってきている。オープンインフラストラクチャプロジェクトは、イノベーションを加速する能力において、クローズドプロプライエタリデータセットを上回り始めている。
仮想細胞が最終的に信頼できる予測エンジン——化合物をランク付け、毒性をフラグ付け、またはパイプェットを人間が触れる前に経路を照らすツール——になる場合、それはVCPIのようなプロジェクトが必要な構造化された、信頼できるデータ環境を作成したからである。
ギンコは、単に多くのデータではなく、より良いデータを優先することで、AIによる生物学の基礎を再定義している。VCPIは、医薬品発見におけるデータ危機にただ反応するのではなく、新しい時代の舞台を設ける——生物学的実験とAI訓練パイプラインが一緒に、オープンに、目的を持って進化する時代。












