Лидеры мнений
Проблема данных в сердце открытия препаратов с помощью ИИ

По мере того, как ИИ быстро становится неотъемлемой частью открытия препаратов, возможно, наиболее важным вопросом не является то, насколько мощным будет следующая модель, а то, какие данные эти модели фактически изучают.
Недавнее расширение Anthropic в разработку препаратов является последним признаком того, что искусственный интеллект выходит за рамки общих рассуждений и входит в прикладную науку. Это отражает реальный импульс в этой области и растущую уверенность в том, что ИИ может существенно изменить то, как открываются новые лекарства. Но если цель состоит в том, чтобы улучшить клинические показатели успеха, а не просто ускорить открытие, мы должны задаваться вопросом, способна ли биологическая основа, лежащая в основе этих систем, научить их тому, что представляет собой человеческая биология.
На протяжении многих лет основное внимание отрасли было сосредоточено на создании все более сложных алгоритмов. Более крупные модели, больше вычислительных ресурсов и лучшие архитектуры привели к замечательным достижениям в предсказании структуры белков, определении мишеней, проектировании молекул и других областях биомедицинских исследований. Эти инновации заслуживают внимания, которое они получили.
Что получило гораздо меньше внимания, так это биологическая основа, лежащая в их основе.
ИИ исключительно хорош в нахождении закономерностей. Но он не может различать биологию, которая просто измерима, и биологию, которая действительно предсказывает, что происходит у пациентов. Потолок для открытия препаратов с помощью ИИ в конечном итоге будет определяться не только интеллектом моделей, но и точностью человеческих данных, используемых для их обучения, проверки и оценки. Если мы хотим, чтобы ИИ давал лучшие лекарства, а не просто быстрые гипотезы, построение высококачественной инфраструктуры человеческих биологических данных может оказаться столь же важным, как и создание следующего поколения ИИ.
ИИ может учиться только на биологии, которую мы ему предоставляем
Каждая модель ИИ ограничена информацией, которую она изучает. Разработка препаратов представляет собой особенно сложную задачу, поскольку биология чрезвычайно сложна. Человеческие заболевания подвержены влиянию генетики, возраста, пола, сопутствующих заболеваний, иммунных реакций, воздействия окружающей среды и тысяч взаимодействующих молекулярных путей, которые остаются только частично понятыми.
Исторически большая часть экспериментальных данных, используемых при разработке препаратов, исходила из исследований на животных, бессмертных клеточных линий, упрощенных в vitro-систем и компьютерных симуляций. Эти инструменты существенно продвинули биомедицинскую науку и остаются незаменимыми на многих этапах исследований. Однако десятилетия опыта также показали, что они не могут полностью воспроизвести человеческую физиологию.
Примерно 90% кандидатов на препарат, поступающих в клинические испытания, в конечном итоге терпят неудачу, и отсутствие эффективности и неожиданные находки по безопасности являются основными вкладчиками. Хотя многие факторы способствуют этим неудачам, одной из повторяющихся тем является то, что доклинические модели часто испытывают трудности в предсказании того, что на самом деле происходит у пациентов.
Если системы ИИ обучаются в основном на данных, сгенерированных из моделей, которые сами имеют известные ограничения трансляции, не должно быть удивительным, если эти ограничения сохраняются. ИИ может распознавать закономерности замечательно, но он не может изобрести биологическую истину, которая никогда не присутствовала в его обучающих данных.
Больше данных не обязательно означает лучшие данные
Сообщество ИИ часто говорит о законах масштабирования: наблюдении, что более крупные наборы данных часто улучшают производительность модели. В биологии, однако, количество и качество не являются взаимозаменяемыми. Миллионы точек данных, собранных из экспериментальных систем, которые плохо отражают человеческую физиологию, могут предложить меньше предсказательной ценности, чем меньшие наборы данных, полученные непосредственно из клинически актуальной человеческой биологии. Это различие становится особенно важным при разработке препаратов, где цель состоит не только в предсказании, но и в предсказании, которое переводится в успешные результаты для пациентов.
Высококачественные человеческие биологические данные отличаются от традиционных лабораторных наборов данных несколькими важными способами. Они захватывают биологическую функцию, а не статичные снимки. Они сохраняют отношения между тканями, клеточной архитектурой, перфузией, метаболизмом и фармакологией. Они включают историю пациента, клинические характеристики, молекулярные измерения и функциональные реакции в рамках одной и той же биологической системы. Самое главное, они измеряют биологию, которая на самом деле существует у людей.
По мере того, как ИИ становится все более способным извлекать тонкие закономерности из сложных данных, качество этих закономерностей становится неразрывным от качества лежащей в основе биологии.
Следующее конкурентное преимущество может быть инфраструктура человеческих данных
На протяжении последних нескольких лет огромные инвестиции были вложены в основные модели, вычислительную инфраструктуру и специализированные архитектуры ИИ. Гораздо меньше внимания было уделено инфраструктуре, необходимой для систематического генерирования высококачественных человеческих биологических данных в масштабе.
Человеческие биологические образцы внутренне ограничены и требуют интеграции с некоторой формой инфраструктуры донорства. Стандартизация остается сложной. Протоколы экспериментов должны быть воспроизводимыми. Метаданные должны быть всесторонними. Мультомерные измерения, визуализация, функциональные тесты и клинический контекст все должны быть интегрированы в наборы данных, которые достаточно последовательны для компьютерного обучения.
Ничто из этого не напоминает традиционное программное обеспечение. Вместо этого это требует скоординированных биологических операций, способных производить воспроизводимые, готовые к регулированию наборы данных на протяжении многих лет. Как и облачная инфраструктура стала необходимой для современного разработки программного обеспечения, человеческая биологическая инфраструктура может стать основной для следующего поколения препаратов, управляемых ИИ. Организации, инвестирующие в эту инфраструктуру сегодня, могут в конечном итоге сформировать то, что завтрашние модели ИИ будут способны изучать.
Регуляторы движутся в этом направлении
Важно отметить, что этот разговор выходит за рамки академического любопытства. Регуляторы сами все больше подчеркивают человеческую актуальность доказательств. FDA расширила свою поддержку новых подходов к методологиям (NAM), изложив пути, которыми компьютерные модели, технологии “орган на чипе”, продвинутые в vitro-системы и другие подходы, актуальные для человека, могут внести вклад в процесс принятия решений по регулированию.
Этот сдвиг признает важную реальность. По мере того, как компьютерные методы становятся более сложными, уверенность в их предсказаниях зависит от уверенности в биологических доказательствах, подтверждающих их. Если лучший ИИ требует лучшей проверки, и лучшая проверка требует лучших человеческих данных, то лучший ИИ должен требовать лучших человеческих данных, лежащих в основе каждой модели.
Следующее десятилетие будет определяться качеством данных
Фармацевтическая промышленность пережила несколько технологических революций, от высокопроизводительного скрининга до последовательного анализа нового поколения. Каждый из них расширил объем доступных данных, но применение ИИ в этой области представляет собой что-то другое.
Его успех зависит не только от производства большего количества данных, но и от производства данных, которые более верно представляют человеческую биологию. По мере того, как основные модели становятся все более доступными, алгоритмические преимущества могут стать менее прочными. Доступ к дифференцированным, высококачественным человеческим биологическим данным может вместо этого появиться как одно из определяющих конкурентных преимуществ во всей фармацевтической экосистеме. Это особенно верно, если конечной целью отрасли является улучшение клинических показателей успеха, а не просто ускорение открытия.
Вход Anthropic в разработку препаратов отражает замечательный прогресс, которого достиг ИИ за последние несколько лет. Он также подчеркивает следующий вопрос, на который должна ответить отрасль. Если ИИ действительно имеет потенциал преобразовать медицину, какая биологическая основа будет лежать в основе этих моделей?
Будущее открытия препаратов с помощью ИИ, безусловно, будет зависеть от лучших алгоритмов. Но оно может зависеть еще больше от построения инфраструктуры человеческих биологических данных, способной научить эти алгоритмы тому, что представляет собой человеческая биология.












