Модели и платформы ИИ
Исследователи используют алгоритмы обработки естественного языка для понимания трансформации белков

Исследователи из Университета Мэриленда недавно применили техники обработки естественного языка и алгоритмы машинного обучения, чтобы получить представление о том, как молекулы белков меняют свою форму от одной к другой. Недавняя статья, опубликованная в журнале Nature Communications, является первым случаем, когда алгоритм искусственного интеллекта был использован для изучения динамики биомолекулярных систем в отношении трансформации белков.
Молекулы белков могут принимать различные формы, но механизмы, которые заставляют белок изменить свою форму от одной к другой, все еще остаются немного загадочными. Функция молекулы белка определяется ее формой, и лучшее понимание механизмов, которые влияют на форму/структуру белка, может позволить ученым разработать целевые методы лечения и определить причину заболеваний.
Биологические молекулы не являются неподвижными, они постоянно движутся в ответ на события в их окружении. Давление окружающей среды может заставить молекулы изменить свою форму, часто очень быстро. Молекула может внезапно изменить свою структуру, в процессе, очень похожем на расплетение пружины. Разные части молекулы разворачиваются и сворачиваются, и исследователи изучали промежуточные стадии между различными молекулярными формами.
По данным Phys.org, Пратуш Тивари был старшим автором статьи и является помощником профессора в департаменте химии и биохимии и Институте физических наук и технологий Мэриленда. По словам Тивари, обработка естественного языка может быть использована для моделирования того, как молекулы трансформируются и адаптируются. Тивари отмечает, что молекулы имеют определенный “язык”, который они говорят, и движения, которые молекулы совершают, могут быть переведены в абстрактный язык. Когда этот процесс сопоставления движения молекул с языковыми закономерностями осуществляется, методы обработки естественного языка и алгоритмы искусственного интеллекта могут быть использованы для “создания биологически правдивых историй из полученных абстрактных слов”.
Когда молекула переходит из одной формы в другую, переход происходит очень быстро. Переход может занять всего одну триллионную долю секунды. Такая высокая скорость перехода делает его трудным для ученых определить, какие параметры влияют на процесс разворачивания с помощью методов, таких как спектроскопия или даже высокомощные микроскопы. Чтобы определить, какие параметры влияют на разворачивание белков, Тивари и остальная часть исследовательской команды создали физические модели, которые симулировали белки. Были использованы сложные статистические модели для создания симуляций белков, которые имитировали форму, траекторию и движение молекул. Затем модели были переданы алгоритму машинного обучения, основанному на методах обработки естественного языка.
Модели обработки естественного языка, использованные для обучения системы машинного обучения, были очень похожи на алгоритмы, используемые в системах предсказательного текста, которые использует Gmail. Симулированные белки были обработаны как язык, где движения молекул были переведены в “буквы”. Буквы были затем связаны вместе, чтобы образовать слова и предложения. Алгоритмы машинного обучения смогли выучить грамматические и синтаксические правила, лежащие в основе структуры белков, определяя, какие формы/движения следуют за другими. Алгоритмы могли затем быть использованы для предсказания того, как определенные белки будут разворачиваться и какие формы они будут принимать.
Исследователи использовали сеть с долгой краткосрочной памятью (LSTM), чтобы проанализировать предложения, основанные на белках. Исследовательская команда также отслеживала математику, на которой была основана сеть, контролируя параметры, пока сеть училась динамике молекулярной трансформации. Согласно результатам исследования, сеть использовала логику, похожую на статистическую физику, известную как энтропия пути. Если это открытие окажется постоянным, оно может потенциально привести к улучшению сетей LSTM. Тивари объяснил, что открытие позволяет лучше понять параметры, которые могут быть настроены для оптимальной производительности.
В качестве тестового случая для своего алгоритма исследователи проанализировали биомолекулу под названием рибосвич. Рибосвич уже был проанализирован с помощью спектроскопии, и когда рибосвич был проанализирован с помощью системы машинного обучения, предсказанные формы рибосвича совпадали с теми, которые были обнаружены с помощью спектроскопии.
Тивари надеется, что их открытия позволят разработать целевые лекарства с меньшим количеством побочных эффектов. Как объяснил Тивари через Phys.org:
“Вы хотите иметь эффективные лекарства, которые связываются очень сильно, но только с тем, что вы хотите, чтобы они связались. Мы можем добиться этого, если сможем понять различные формы, которые может принимать биомолекула, поскольку мы можем создать лекарства, которые связываются только с одной из этих конкретных форм в подходящее время и только столько, сколько мы хотим.”










