AIモデルとプラットフォーム

AI手法がゲノムモデルがDNAから学んだ内容を明らかにし、隠れた実験バイアスを露呈する

mm
Unite.AI を Google の優先ソースに追加

Stowers Institute for Medical Research の研究者は、ディープラーニングモデルがDNAから学んだことを塩基ごとに示す解釈手法を構築し、これを用いてゲノムデータに潜む実験的バイアスを除去しました。この手法は PISA と呼ばれ、2026年8月にpaper published in Nature Communicationsで紹介され、2026年8月25日にannounced by the instituteしました。

シーケンス‑ツー‑ファンクションのニューラルネットワークは、生のDNAを入力として受け取り、転写因子結合からヌクレオソーム配置まで、ゲノミクス実験の読み取り結果を予測します。しかし、予測がどのように導かれたかは通常示されません。PISA(pairwise influence by sequence attribution の略)は、特定のゲノム位置での予測を、影響を与えたすべての他の塩基に遡らせ、モデルが学んだ内容を二次元マップとして単塩基分解能で可視化します。

この研究は Stowers の Julia Zeitlinger が主導し、スタンフォード大学の Anshul Kundaje と共同で行われ、Stowers AI フェローの Charles McAnany が第一著者として参加しました。PISA は BPReveal 内で動作し、これはチームが2021年に初めて開発した深層学習フレームワーク BPNet の最新拡張です。

How PISA Separates Experimental Bias From Biology

チームは、ヌクレオソームをマッピングする広く用いられるアッセイである MNase‑seq に PISA を適用しました。このアッセイは、露出したDNAを切断する酵素を用い、ヌクレオソームで保護されたDNAは残りますが、酵素は特定の配列を好む傾向があります。そのためデータには二重のシグナルが重なり合っており、モデルは両方を学習してしまいます。

従来の解釈ツールは各塩基の影響を単一の値に圧縮するため、正負の効果が相殺されて見えなくなることがあります。PISA は情報をフル分解能で保持し、その結果酵素の配列嗜好がマップ上に特徴的な指紋として現れました。チームはそのシグネチャを数式的に抽出し、バイアスだけを学習する別モデルを訓練して差し引き、純粋に生物学的情報だけを学んだ第二のモデルを得ました。

「これは超解像顕微鏡のようなものです」と Zeitlinger は研究所の発表で語ります。「従来の解釈手法でもブラックボックスを開くことはできましたが、さらにピクセルを足すことで、これまで見えなかったものが見えるようになるのです。」

The Surprise Hiding in Clean Data

バイアス補正済みモデルの内部で、PISA はヌクレオソーム配置を助けるDNA配列を明らかにし、その効果は数百塩基対にわたって両方向に広がっていることを示しました。多くは非対称で、一方の側にだけ影響を与えます。その非対称性を追跡することで、チームはクロマチン領域境界—どの調節配列がどの遺伝子に届くかを決定する境界—にたどり着きました。これらの境界は通常、膨大なシーケンス深度を必要とする3次元クロマチン手法でマッピングされますが、モデルはヌクレオソームデータだけから何千もの境界を抽出し、しばしば3次元データよりも高精度で特定できたと論文は報告しています。

続いて、チームは生物学に焦点を当てたモデルを用いて、特定のヌクレオソーム配置を実現すると予測される合成DNA配列を設計し、そのうちの一部を実験的に検証しました。予測は実証され、モデルが学んだ規則が単なる既存データの記述に留まらず、検証可能な仮説を生成できることが示されました。

この研究は、ますます大規模な配列モデルに多額の投資が行われている分野に位置付けられます。Google DeepMind の AlphaGenome(2026年初頭に発表、PISA 論文の序論で引用)は、ゲノム全体の調節バリアント効果を予測します。PISA は補完的な課題—モデルが予測を行った後、実際にどの配列特徴を使用したかを理解する—に取り組んでいます。この手法は Zeitlinger ラボ以外にも広がっており、共同研究者が別ソフトウェアパッケージとして実装し、Stowers の神経科学者 Neşet Özel が別の生物学的課題に採用しています。

PISA by the Numbers

  • 2021 – BPNet 深層学習フレームワーク、PISA の基盤がチームによって初めて開発された年
  • 2025年4月8日 – PISA のプレプリントが最初にbioRxivに掲載された日
  • 2026年8月Nature Communications に査読付き論文が掲載された月
  • Hundreds of base pairs – モデルが明らかにした個々のヌクレオソーム配置配列の影響範囲
  • Thousands – ヌクレオソームデータだけから特定されたクロマチン領域境界の数

The Limits the Authors State

本稿は手法とゲノミクスに関する論文であり、疾患への直接的な関連性は結果ではなく方向性として示されています。多くの疾患関連遺伝変異は遺伝子自体ではなく調節DNAに位置し、Zeitlinger は変異を結合部位や領域境界に置くことはメカニズムを提案できても薬剤を生み出すわけではないと明言しています。また、本研究は深層学習と実験生物学の両方に精通したラボが必要であり、著者はこの二重の専門性が分野の永続的なギャップであると指摘しています。

設計されたDNA配列は実験的に検証された一部のみが評価対象であり、論文のバイアス補正デモは MNase‑seq に特化したものです。ただし、著者は PISA を複数のデータタイプに適用した例も示しています。プレプリントの改訂履歴によれば、クロマチン領域解析はピアレビュー中に追加され、2026年1月5日にrevised version posted on 2026年1月5日として公開されています。

本研究が現在確立したのは、ゲノムモデルがトレーニングデータから吸収した情報を監査し、実験由来で生物学的でない部分を修正し、実際の生体に対して設計・検証できるほど精密な配列規則を抽出する方法です。

アリア・ブルームは、人工知能が生物技術とゲノム研究をどのように変革しているかを探るAI生成ジャーナリストです。彼女の文章は、精度とライフサイエンスの将来に対する深い好奇心を融合させています。
合成生物学から個別化医療まで、アリアは機械学習が人間の健康イノベーションをどのように加速させているかを分析しています。
アリア・ブルームが執筆した記事は、AIによって生成され、Unite.AIの編集チームによって精度とコンプライアンスのためにレビューされています。