Здравоохранение
ИИ используется для выявления последовательностей активации генов и обнаружения генов, вызывающих заболевания

Искусственный интеллект играет все более значимую роль в науке геномики каждый день. Недавно команда исследователей из Университета Калифорнии в Сан-Диего использовала ИИ для открытия ДНК-кода, который может проложить путь для контроля активации генов. Кроме того, исследователи из Австралийской национальной научной организации CSIRO использовали алгоритмы ИИ для анализа более одного триллиона генетических данных, продвигая наше понимание человеческого генома и локализацию определенных генов, вызывающих заболевания.
Человеческий геном, как и вся ДНК, состоит из четырех различных химических оснований: аденина, гуанина, тимина и цитозина, сокращенно обозначаемых как А, Г, Т и Ц соответственно. Эти четыре основания соединяются в различных комбинациях, кодирующих разные гены. Около одной четверти всех человеческих генов кодируются генетическими последовательностями, примерно равными TATAAA, с незначительными вариациями. Эти производные TATAAA составляют «TATA-бокс», некодирующие последовательности ДНК, играющие роль в инициализации транскрипции генов, состоящих из TATA. Однако неизвестно, как активируется примерно 75% человеческого генома, благодаря огромному количеству возможных комбинаций последовательностей оснований.
По сообщению ScienceDaily, исследователи из Университета Калифорнии в Сан-Диего смогли выявить код активации ДНК, используемый так же часто, как активации TATA-бокса, благодаря использованию искусственного интеллекта. Исследователи называют этот код активации ДНК «нижней核心 промоторной областью» (DPR). Согласно старшему автору статьи, профессору биологических наук Университета Калифорнии в Сан-Диего Джеймсу Кагонаге, открытие DPR показывает, как примерно одна четверть до одной трети наших генов активируются.
Кагонага изначально открыл последовательность активации генов, соответствующую частям DPR, работая с плодовыми мухами в 1996 году. С тех пор Кагонага и его коллеги работали над определением, какие последовательности ДНК коррелировали с активностью DPR. Команда исследователей начала с создания полумиллиона различных последовательностей ДНК и определения, какие последовательности проявляли активность DPR. Около 200 000 последовательностей ДНК были использованы для обучения модели ИИ, которая могла предсказать, будет ли наблюдаться активность DPR в фрагментах человеческой ДНК. Модель оказалась очень точной. Кагонага описал производительность модели как «абсурдно хорошую» и ее предсказательную силу как «невероятную». Процесс создания модели оказался настолько надежным, что исследователи в итоге создали подобную модель ИИ, ориентированную на обнаружение новых случаев TATA-бокса.
В будущем искусственный интеллект может быть использован для анализа закономерностей последовательностей ДНК и предоставления исследователям большего понимания того, как происходит активация генов в человеческих клетках. Кагонага считает, что, как и в случае с помощью его команды исследователей в выявлении DPR, ИИ также поможет другим ученым обнаружить важные последовательности и структуры ДНК.
В другом случае использования ИИ для изучения человеческого генома, по сообщению MedicalExpress, исследователи из Австралийской национальной научной организации CSIRO использовали платформу ИИ под названием VariantSpark для анализа более одного триллиона точек геномных данных. Надеются, что исследования на основе ИИ помогут ученым определить местоположение определенных генов, связанных с заболеваниями.
Традиционные методы анализа генетических признаков могут занять годы, но, как объяснил лидер биоинформатики CSIRO доктор Денис Баузер, ИИ имеет потенциал значительно ускорить этот процесс. VariantSpark – это платформа ИИ, которая может анализировать такие признаки, как склонность к определенным заболеваниям, и определять, какие гены могут на них влиять. Баузер и другие исследователи использовали VariantSpark для анализа синтетического набора данных из примерно 100 000 человек всего за 15 часов. VariantSpark проанализировал более десяти миллионов вариантов из одного триллиона точек геномных данных, задача, которая заняла бы даже у самых быстрых конкурентов, использующих традиционные методы, тысячи лет.
Как объяснил доктор Дэвид Хансин, генеральный директор Центра электронного здравоохранения CSIRO в Австралии по сообщению MedicalExpress :
«Несмотря на недавние технологические прорывы в исследованиях с использованием секвенирования целых геномов, молекулярные и генетические истоки сложных заболеваний все еще плохо поняты, что делает предсказание, применение соответствующих профилактических мер и персонализированное лечение трудным».
Баузер считает, что VariantSpark может быть масштабирован до наборов данных уровня популяции и помочь определить роль генов в развитии сердечно-сосудистых и нейронных заболеваний. Такая работа может привести к раннему вмешательству, персонализированному лечению и лучшим результатам здоровья в целом.












