AIモデルとプラットフォーム

Evo 1 から Evo 2 へ: NVIDIA がゲノム研究と AI ドリブンの生物学的革新を再定義する方法

mm
Unite.AI を Google の優先ソースに追加

文字のシーケンスを分析するだけで生命の挙動を予測できる世界を想像してみてください。これは科学フィクションや魔法の世界ではなく、科学者が何年にもわたって達成しようとしてきた現実の世界です。これらのシーケンスは、4 つの核酸(A、T、C、G)で構成されており、地球上の生命、最小の微生物から最大の哺乳動物までの基本的な指示を含みます。これらのシーケンスを解読することで、個別化医療や環境の持続可能性などの分野で複雑な生物学的プロセスを解明することができます。

しかし、この巨大な潜在能力にもかかわらず、最も単純な微生物ゲノムを解読することは非常に複雑なタスクです。これらのゲノムは、DNA、RNA、タンパク質の相互作用を調節する数百万の DNA ベースペアで構成されており、分子生物学の中央ドグマの 3 つの重要な要素です。この複雑さは、個々の分子から全ゲノムまで、数十億年の間に進化した遺伝情報の広大な分野を形成しています。

従来の計算ツールは、生物学的シーケンスの複雑さに対処するのに苦労してきました。しかし、生成的な AI の出現により、数兆のシーケンスを処理し、トークンのシーケンス全体で複雑な関係を理解することが可能になりました。この進歩に基づいて、Arc インスティテュート、スタンフォード大学、NVIDIA (NVDA ) の研究者は、生物学的シーケンスを理解する AI システムを構築するために取り組んでいます。彼らは、中央ドグマの多様な性質と進化の複雑さの両方を捉えるモデルを作成するという画期的な開発を達成しました。この革新は、個々の分子から全ゲノムまで、新しい生物学的シーケンスを予測および設計する可能性をもたらします。この記事では、このテクノロジーの仕組み、潜在的な応用、課題、ゲノムモデリングの将来について探ります。

EVO 1: ゲノムモデリングにおける先駆的なモデル

この研究は、2024 年後半に NVIDIA とその共同研究者が Evo 1 を紹介したときに注目を集めました。Evo 1 は、DNA、RNA、タンパク質を横断する生物学的シーケンスの分析と生成のための画期的なモデルです。270 万の原核生物とファージゲノム、合計 300 億の核酸トークンでトレーニングされたこのモデルは、分子生物学の中央ドグマを統合し、DNA から RNA への遺伝情報の流れをモデル化しました。StripedHyena アーキテクチャは、畳み込みフィルタとゲートを使用するハイブリッドモデルで、最大 131,072 トークンの長いコンテキストを効率的に処理できます。この設計により、Evo 1 は、小さなシーケンスの変更と、より広範なシステム全体および生物全体の影響をリンクすることができ、分子生物学と進化ゲノミクスのギャップを埋めることができました。

Evo 1 は生物学的進化の計算モデリングにおける第一歩でした。進化パターンを分析することで、分子相互作用と遺伝的変異を成功的に予測しました。ただし、科学者がそれをより複雑な真核生物ゲノムに適用しようとしたとき、モデルの限界が明らかになりました。Evo 1 は、長い DNA シーケンス上での単一核酸解像度と、より大きなゲノムに対する計算コストの面で苦労しました。これらの課題は、生物学的データを複数のスケールで統合できる、より高度なモデルが必要であることを示しました。

EVO 2: ゲノムモデリングの基礎となるモデル

Evo-1 から得られた教訓を基に、研究者は 2025 年 2 月に Evo 2 を立ち上げ、生物学的シーケンスモデリングの分野を進歩させました。 トレーニング された 9.3 兆の DNA ベースペアで、モデルは、すべての生物ドメイン、バクテリア、古細菌、植物、菌類、動物を含む、遺伝的変異の機能的結果を予測および理解することを学びました。40 億のパラメータを超える Evo-2 のモデルは、以前のモデル、Evo-1 を含め、以前のモデルでは処理できなかった最大 100 万ベースペアのシーケンス長を処理できます。

Evo 2 をその前身から区別するのは、DNA シーケンスだけでなく、DNA、RNA、タンパク質の相互作用、つまり分子生物学の中央ドグマ全体をモデル化する能力です。これにより、Evo 2 は、最小の核酸変更からより大きな構造的変異まで、遺伝子変異の影響を以前考えられなかった方法で正確に予測できます。

Evo 2 の重要な特徴は、その強力なゼロショット予測能力です。これにより、タスク固有のファインチューニングを必要とせずに、変異の機能的影響を予測できます。たとえば、DNA シーケンスのみを分析することで、乳がん研究の重要な要素である BRCA1 変異体を正確に分類できます。

生物分子科学における潜在的な応用

Evo 2 の機能により、ゲノム、分子生物学、生物技術の新しいフロンティアが開けられます。最も有望な応用例の 1 つは次のとおりです:

  • ヘルスケアと薬剤発見: Evo 2 は、特定の疾患に関連する遺伝子変異を予測できます。たとえば、テストでは、乳がん関連遺伝子 BRCA1 の変異で、Evo 2 は、90% を超える精度で良性と潜在的に病原性の変異を予測しました。このような洞察は、新薬と個別化された治療の開発を加速する可能性があります。
  • 合成生物学と遺伝子工学: Evo 2 の全ゲノムを生成する能力は、特定の特性を持つ合成生物を設計する新しいアベニューを開きます。研究者は、特定の機能を持つ遺伝子を設計するために Evo 2 を使用できます。バイオ燃料、環境に優しい化学物質、または新しい治療法の開発を促進できます。
  • 農業生物技術: Evo 2 は、耐旱性や病気耐性などの改良された特性を持つ遺伝子組み換え作物を設計するために使用できます。世界的な食糧安全保障と農業の持続可能性に貢献できます。
  • 環境科学: Evo 2 は、バイオ燃料を設計したり、石油やプラスチックなどの環境汚染物質を分解するタンパク質を設計したりするために使用できます。持続可能性への取り組みに貢献できます。

課題と将来の方向性

Evo 2 は、計算の複雑さという課題に直面しています。100 万ベースペアのコンテキストウィンドウと 40 儱のパラメータを備えた Evo 2 では、効果的に機能するために大量の計算リソースが必要です。これにより、ハイパフォーマンス コンピューティング インフラストラクチャへのアクセスがない小規模な研究チームが、その潜在能力を完全に活用することが困難になります。

さらに、Evo 2 が遺伝子変異の影響を予測する能力が優れているにもかかわらず、ゼロから新しい生物システムを設計する方法を理解するにはまだ多くのことがあります。現実的な生物学的シーケンスを生成することは最初のステップに過ぎません。機能的で持続可能な生物システムを作成するためのこの力の使用方法を理解することが、本当の課題です。

AI のゲノムへのアクセシビリティと民主化

Evo 2 の最も興奮する側面の 1 つは、その オープンソース の利用可能性です。ゲノム モデリング ツールへのアクセスを民主化するために、NVIDIA はモデル パラメータ、トレーニング コード、およびデータセットを公開しました。このオープン アクセス アプローチにより、世界中の研究者が Evo 2 の機能を探索および拡張できます。科学コミュニティ全体の革新を加速します。

まとめ

Evo 2 は、AI を使用して生命の複雑な遺伝言語を解読するという点で、ゲノム モデリングにおける重要な進歩です。DNA シーケンスと RNA およびタンパク質との相互作用をモデル化する能力により、新しい可能性が開けられます。ヘルスケア、薬剤発見、合成生物学、環境科学などです。Evo 2 は、遺伝子変異を予測し、新しい生物学的シーケンスを設計することができます。個別化医療と持続可能な解決策に変革的な可能性を提供します。ただし、その計算の複雑さは、特に小規模な研究チームにとって課題を提起します。Evo 2 をオープンソース化することで、NVIDIA は、世界中の研究者がその機能を探索および拡張できるようにし、ゲノムと生物技術における革新を推進しています。テクノロジーが進化を続けるにつれて、生物科学と環境の持続可能性の将来を形作る可能性があります。

Dr. Tehseen ZiaはCOMSATS University Islamabadの正教授であり、オーストリアのVienna University of TechnologyでAIのPh.D.を取得しています。人工知能、機械学習、データサイエンス、コンピュータビジョンを専門とし、信頼性の高い科学雑誌に掲載された出版物で著しい貢献をしています。Dr. Tehseenは、主な調査員としてさまざまな産業プロジェクトを率い、AIコンサルタントとしても務めています。