AIモデルとプラットフォーム

AI 研究者がゲノムの規則を発見するための説明可能なニューラルネットワークを開発

mm
Unite.AI を Google の優先ソースに追加

研究者の一団は最近、説明可能なニューラルネットワークを作成しました。このネットワークは、生物学者が人間のゲノムのコードを支配する謎の規則を発見するのを助けることを目的としています。研究チームは、タンパク質と DNA の相互作用の地図に基づいてニューラルネットワークをトレーニングしました。これにより、AI は、特定の DNA シーケンスが特定の遺伝子を調節する方法を発見することができます。研究者はまた、モデルを説明可能なものにしました。つまり、モデルがどのように結論に達したかを分析し、シーケンス モチーフが遺伝子を調節する方法を決定することができます。

生物学における大きな謎の 1 つは、ゲノムの規制コードです。DNA は 4 つの核酸塩基、つまりアデニン、グアニン、チミン、シトシンで構成されていることがわかっています。しかし、これらの塩基がどのようにして遺伝子の活動を調節するかはわかっていません。4 つの核酸塩基は、タンパク質を構築するための指示を符号化しますが、遺伝子がどのようにして発現されるかも制御します (つまり、生物の中でタンパク質をどのようにして作るか)。特定の塩基の組み合わせと配置は、DNA の特定の部分に結合する規制コードのセクションを作成しますが、これらの組み合わせが何であるかは不明です。

コンピュータ科学者と生物学者の間で構成される研究チームは、この謎を解決するために説明可能なニューラルネットワークを作成することを目指しました。研究チームは「ベースペアネットワーク (Base Pair Network)」または「BPNet」と呼ばれるニューラルネットワークを作成しました。BPNet によって生成される予測モデルは、規制コードを特定するために解釈できます。これは、転写因子と呼ばれるタンパク質が DNA シーケンスにどのように結合するかを予測することで実現されました。

研究者は、転写因子と DNA がどのように結合するかを決定するために、さまざまな実験と包括的なコンピュータ モデリングを行いました。個々の核酸塩基のレベルまで詳細な地図を作成しました。詳細な転写因子と DNA の表現により、研究者は、重要な DNA シーケンス パターンと規制コードとして機能する規則を解釈できるツールを作成することができました。

スタンフォード大学の生物学者でありコンピュータ科学者のジュリア・ツァイトリンガー (Julia Zeitlinger) 博士は、説明可能なニューラルネットワークから得られた結果は、既存の実験結果と一致しているが、ゲノムの規制コードに関する驚くべき洞察も含んでいると説明しています。例えば、AI モデルにより、研究チームはナノグ (Nanog) と呼ばれる転写因子がどのように作用するかを発見することができました。ナノグ モチーフが DNA の同じ側に複数存在する場合、それらは DNA に協調的に結合します。ツァイトリンガーは、ScienceDaily を通じて次のように説明しています。

“モチーフの周期性が規制コードに存在するという実験的証拠は長い間ありました。しかし、正確な状況は不明であり、ナノグはそのようなパターンを持つ可能性は考えられませんでした。ナノグがそのようなパターンを持つこと、そしてその相互作用の詳細を発見したことは驚くべきことでした。私たちはそのパターンを特に探していたわけではありませんでした。”

最近の研究論文は、DNA を分析するために AI を使用した最初の研究ではありませんが、ゲノム内の遺伝子を調節する DNA シーケンスを判別するために、AI の「ブラックボックス」を開く最初の研究である可能性があります。ニューラルネットワークは、データ内のパターンを見つけることに優れていますが、その洞察はモデルから抽出するのが難しいです。研究者は、モデルがどの特徴を重要であると判断するかを分析する方法を開発しました。つまり、より繊細なモデルをトレーニングして新しい発見につなげることができます。

BPNet のアーキテクチャは、画像内の顔を認識するために使用されるネットワークに似ています。コンピュータ ビジョン システムが画像内の顔を認識する場合、ネットワークは最初にエッジを検出してからそれらを結合します。違いは、BPNet が DNA シーケンスから学習し、シーケンス モチーフを検出して、それらをより高いレベルの規則に結合して、ベース解像度でのデータの結合を予測できることです。

モデルが高い精度のしきい値に達した後、モデルによって学習されたパターンは、元の入力シーケンスに戻され、シーケンス モチーフが明らかになります。最後に、モデルは体系的な DNA シーケンスのクエリを提供され、研究者はシーケンス モチーフがどのように結合して機能するかを理解することができます。ツァイトリンガーによると、モデルは、研究者が従来の実験的な方法でテストできるよりもはるかに多くのシーケンスを予測できます。さらに、実験的異常の結果を予測することで、研究者はモデルを検証する際に最も情報量の多い実験を特定することができます。

ブログ作家およびプログラマーで、 Machine Learning と Deep Learning のトピックを専門としています。Danielは、AIの力を社会のために利用する手助けを他者に与えることを希望しています。