AIモデルとプラットフォーム
研究者が自然言語処理アルゴリズムを用いてタンパク質の変換を理解する

メリーランド大学の研究者は最近、自然言語処理技術と機械学習アルゴリズムを用いて、タンパク質分子が一つの形から別の形に変化するメカニズムを解明するために取り組んだ。最近の論文は、Nature Communications誌に掲載され、タンパク質の変換に関する生物分子システムのダイナミクスを研究するためにAIアルゴリズムを初めて使用した。
タンパク質分子は様々な形をとることができるが、タンパク質が一つの形から別の形に変化するメカニズムはまだ謎に包まれている。タンパク質分子の機能はその形によって定義されるため、タンパク質の形・構造に影響を与えるメカニズムを理解することで、科学者は標的薬剤療法を設計し、疾患の原因を決定することができる。
生物分子は静止した状態ではなく、環境の中での出来事に応じて常に動いている。環境的な圧力により、分子は突然別の形に変化することがある。分子は完全に異なる構造に再構成することができ、これはスプリングの解きこむようなプロセスに似ている。分子の異なる部分が解きこまれ、折り畳まれるというプロセスを研究者は調査した。
Phys.orgによると、Pratyush Tiwaryは論文の第一著者であり、メリーランド大学の化学・生物化学科および物理科学・技術研究所の助教授である。Tiwaryによると、自然言語処理は分子の変換と適応をモデル化するために用いることができる。Tiwaryは、分子には特定の「言語」があると述べ、分子の動きは抽象的な言語に翻訳できるという。分子の動きを言語パターンにマッピングするプロセスを実行すると、自然言語処理技術とAIアルゴリズムを用いて「生物学的に真実な物語」を生成することができる。
分子が一つの形から別の形に変化するとき、その変化は非常に速い。変化は1兆分の1秒の時間で起こる可能性がある。変化のスピードは、分光法や強力な顕微鏡などの方法で解きこみプロセスに影響を与えるパラメータを決定することを困難にしている。Tiwaryと研究チームは、分子の形、軌道、動きを模倣するタンパク質のシミュレーションを作成するために物理モデルを作成した。複雑な統計モデルを用いて、分子の形、軌道、動きをシミュレートし、機械学習アルゴリズムに与えた。
機械学習システムをトレーニングするために用いられた自然言語処理モデルは、Gmailが用いている予測テキストシステムと似ていた。シミュレートされたタンパク質は「言語」として扱われ、分子の動きは「文字」に翻訳された。文字は「単語」と「文」に結び付けられた。機械学習アルゴリズムは、タンパク質構造の文法的・構造的なルールを学習し、どの形・動きが他の形・動きに続くかを決定することができた。アルゴリズムは、特定のタンパク質がどのように解きこまれるか、どのような形をとるかを予測するために用いることができた。
研究者は、タンパク質ベースの文を分析するために長短期記憶(LSTM)ネットワークを用いた。研究チームは、ネットワークが学習する際の数学的な基礎を追跡し、ネットワークが分子の変換のダイナミクスを学習する際のパラメータを監視した。研究の結果によると、ネットワークは、静的な物理学的概念であるパスエントロピーに似たロジックを用いた。もしもこの発見が確かなものであるならば、LSTMネットワークの改善につながる可能性がある。Tiwaryは、発見がLSTMのブラックボックス的な性質を部分的に解明し、研究者が最適なパフォーマンスを得るために調整できるパラメータをよりよく理解できるようにしたと述べた。
アルゴリズムのテストケースとして、研究者はリボスイッチと呼ばれる生物分子を分析した。リボスイッチはすでに分光法で分析されていたが、機械学習システムで分析した結果、予測されたリボスイッチの形は分光法で発見されたものと一致していた。
Tiwaryは、研究の成果が研究者に副作用の少ない標的薬剤を開発することを可能にすることを希望している。TiwaryはPhys.orgを通じて以下のように述べた。
「強力な薬剤を開発したい。ただし、必要なものにのみ強く結合する薬剤である。もしも、特定の生物分子の異なる形を理解することができれば、特定の形にのみ結合する薬剤を開発することができる。必要な時間にのみ、必要な期間にのみ結合する薬剤を開発することができる。」










