Интервью
Доктор Серафим Батзоглу, главный офицер данных в Seer – Интервью

Серафим Батзоглу является главным офицером данных в Seer. До того, как присоединиться к Seer, Серафим служил главным офицером данных в Insitro, где он возглавлял машинное обучение и науку о данных в подходе к открытию лекарств. До Insitro он служил вице-президентом по прикладной и вычислительной биологии в Illumina, где он возглавлял исследования и разработку технологий ИИ и молекулярных анализов для того, чтобы сделать геномные данные более интерпретируемыми в области человеческого здоровья.
Что изначально привлекло вас к области геномики?
Я стал интересоваться областью вычислительной биологии в начале моего докторского исследования по информатике в MIT, когда я посетил курс на эту тему, преподаваемый Бонни Бергер, которая стала моим научным руководителем, и Дэвидом Гиффордом. Проект по картографированию человеческого генома набирал обороты во время моего докторского исследования. Эрик Ландер, который возглавлял Центр геномики в MIT, стал моим сонаучным руководителем и вовлек меня в этот проект. Стимулированный проектом по картографированию человеческого генома, я работал над сборкой всего генома и сравнительной геномикой человеческой и мышиной ДНК.
Затем я перешел в Стэнфордский университет в качестве преподавателя кафедры информатики, где я провел 15 лет, и был удостоен возможности руководить около 30 невероятно талантливыми аспирантами и многими постдокторантами и студентами. Сфокусировка моей команды была на применении алгоритмов, машинного обучения и программного обеспечения для анализа больших массивов геномных и биомолекулярных данных. Я покинул Стэнфорд в 2016 году, чтобы возглавить команду исследований и разработки технологий в Illumina. С тех пор я наслаждаюсь тем, что возглавляю команды исследований и разработки в промышленности. Я считаю, что командная работа, бизнес-аспект и более прямое влияние на общество являются характерными для промышленности по сравнению с академией. Я работал в инновационных компаниях на протяжении всей своей карьеры: DNAnexus, которую я основал в 2009 году, Illumina, Insitro и теперь Seer. Вычисления и машинное обучение являются важными на протяжении всего технологического цикла в биотехнологиях, от разработки технологий до сбора данных, биологической интерпретации данных и перевода их в человеческое здоровье.
За последние 20 лет секвенирование человеческого генома стало намного дешевле и быстрее. Это привело к драматическому росту рынка секвенирования генома и более широкому внедрению в промышленности жизни. Мы сейчас находимся на пороге того, чтобы иметь популяционную геномную, мультиомную и фенотипическую информацию достаточного объема, чтобы революционизировать здравоохранение, включая профилактику, диагностику, лечение и открытие лекарств. Мы можем все чаще открывать молекулярные основы заболеваний у отдельных людей посредством вычислительного анализа геномных данных, и пациенты имеют шанс получить лечение, которое является персонализированным и нацеленным, особенно в области онкологии и редких генетических заболеваний. Помимо очевидного использования в медицине, машинное обучение, в сочетании с геномной информацией, позволяет нам получить представление о других областях нашей жизни, таких как генеалогия и питание. В течение следующих нескольких лет мы увидим внедрение персонализированного, данных-ориентированного здравоохранения, сначала для отдельных групп людей, таких как пациенты с редкими заболеваниями, и все больше для широкой общественности.
До вашей текущей роли вы были главным офицером данных в Insitro, где вы возглавляли машинное обучение и науку о данных в подходе к открытию лекарств. Каковы были некоторые из ваших ключевых выводов из этого периода времени о том, как машинное обучение может быть использовано для ускорения открытия лекарств?
Традиционный парадигм открытия и разработки лекарств “проб и ошибок” страдает от неэффективностей и чрезвычайно длительных сроков. Для одного лекарства, чтобы оно попало на рынок, может потребоваться более 1 миллиарда долларов и более десяти лет. Включая машинное обучение в эти усилия, мы можем значительно сократить затраты и сроки на нескольких этапах. Один из этапов – выявление целей, где ген или набор генов, которые модулируют фенотип заболевания или возвращают клеточное состояние заболевания к более здоровому состоянию, могут быть выявлены посредством крупномасштабных генетических и химических вмешательств, а также фенотипических показателей, таких как визуализация и функциональная геномика. Другой этап – выявление и оптимизация соединений, где небольшая молекула или другая модальность может быть спроектирована с помощью машинного обучения, а также в vitro-скрининг, и, кроме того, желаемые свойства лекарства, такие как растворимость, проницаемость, специфичность и нетоксичность, могут быть оптимизированы. Самый трудный, а также самый важный аспект, возможно, является перевод на людей. Здесь выбор правильной модели – индуцированные плюрипотентные стволовые клетки, полученные линии против первичных клеток пациентов и тканевых образцов против животных моделей – для правильного заболевания представляет собой чрезвычайно важный набор компромиссов, который в конечном итоге отражается на способности полученных данных плюс машинного обучения перевести на пациентов.
Seer Bio является пионером в новых способах расшифровки секретов протеома для улучшения человеческого здоровья, для читателей, которые не знакомы с этим термином, что такое протеом?
Протеом – это изменяющийся набор белков, производимых или модифицированных организмом во времени и в ответ на окружающую среду, питание и состояние здоровья. Протеомика – это изучение протеома в данном типе клеток или тканевого образца. Геном человека или другого организма статичен: с важным исключением соматических мутаций, геном при рождении является геномом, который человек имеет на протяжении всей жизни, скопированным точно в каждой клетке его тела. Протеом динамичен и меняется в течение лет, дней и даже минут. Таким образом, протеомы чрезвычайно близки к фенотипу и, в конечном итоге, к состоянию здоровья, чем геномы, и, следовательно, более информативны для мониторинга здоровья и понимания заболеваний.
В Seer мы разработали новый способ доступа к протеому, который обеспечивает более глубокое понимание белков и протеоформ в сложных образцах, таких как плазма, которая является высокодоступным образцом, который, к сожалению, до сих пор представлял собой большую проблему для конвенциональной масс-спектрометрии протеомики.
Что такое платформа Proteograph Seer и как она предлагает новый взгляд на протеом?
Платформа Proteograph Seer использует библиотеку проприетарных инженерных наночастиц, работающих на простой, быстрой и автоматизированной рабочей схеме, что позволяет глубоко и масштабируемо изучать протеом.
Платформа Proteograph отличается в изучении плазмы и других сложных образцов, которые демонстрируют большой динамический диапазон – многие порядки величины различия в изобилии различных белков в образце – где конвенциональные методы масс-спектрометрии не могут обнаружить низкоабундантную часть протеома. Наночастицы Seer разработаны с настраиваемыми физико-химическими свойствами, которые собирают белки на протяжении всего динамического диапазона в беспристрастной манере. В типичных образцах плазмы наша технология позволяет обнаружить 5-8 раз больше белков, чем при обработке необработанной плазмы без использования Proteograph. В результате, от подготовки образца к инструментовке и анализу данных, наш набор продуктов Proteograph помогает ученым найти сигнатуры заболеваний протеома, которые в противном случае были бы не обнаружены. Мы говорим, что в Seer мы открываем новую дверь к протеому.
Кроме того, мы позволяем ученым легко проводить крупномасштабные протеогенные исследования. Протеогеника – это объединение геномных данных с протеомными данными для выявления и количественной оценки вариаций белков, связи геномных вариаций с уровнями изобилия белков, и, в конечном итоге, связи генома и протеома с фенотипом и заболеванием, и начала распутывания причинно-следственных и нисходящих генетических путей, связанных с заболеванием.
Можете ли вы обсудить некоторые из технологий машинного обучения, которые в настоящее время используются в Seer Bio?
Seer использует машинное обучение на всех этапах, от разработки технологий до анализа данных. Эти этапы включают: (1) разработку наших проприетарных наночастиц, где машинное обучение помогает нам определить, какие физико-химические свойства и комбинации наночастиц будут работать с конкретными продуктами и анализами; (2) обнаружение и количественная оценка пептидов, белков, вариаций и протеоформ из данных, полученных от масс-спектрометрических приборов; (3) последующие протеомные и протеогенные анализы в крупномасштабных когортах населения.
В прошлом году мы опубликовали статью в Advanced Materials, объединяющую методы протеомики, наноинжиниринг и машинное обучение для улучшения нашего понимания механизмов формирования белковой короны. Эта статья открыла нано-био-взаимодействия и информирует Seer о создании улучшенных будущих наночастиц и продуктов.
Помимо разработки наночастиц, мы разрабатываем новые алгоритмы для выявления вариаций пептидов и пост-трансляционных модификаций (ПТМ). Мы недавно разработали метод обнаружения количественных локусов белков (pQTL), который устойчив к вариациям белков, что является известным конфаундером для аффинной протеомики. Мы расширяем эту работу, чтобы напрямую выявить эти пептиды из сырых спектров, используя методы де-ново секвенирования на основе глубокого обучения, что позволяет искать без инфляции размера спектральных библиотек.
Наша команда также разрабатывает методы, которые позволяют ученым без глубоких знаний в машинном обучении оптимально настроить и использовать модели машинного обучения в своей исследовательской работе. Это достигается посредством фреймворка Seer ML, основанного на инструменте AutoML, который позволяет эффективно настраивать гиперпараметры посредством байесовской оптимизации.
Наконец, мы разрабатываем методы, которые позволяют уменьшить эффект партии и увеличить количественную точность масс-спектрометрического выхода, моделируя измеренные количественные значения, чтобы максимизировать ожидаемые метрики, такие как корреляция значений интенсивности между пептидами в группе белков.
Галлюцинации – это распространенная проблема с моделями языка, какие есть решения, чтобы предотвратить или смягчить это?
Модели языка – это генеративные методы, которые даны большой корпус и обучены генерировать подобный текст. Они захватывают основные статистические свойства текста, на котором они обучены, от простых локальных свойств, таких как частота определенных комбинаций слов (или токенов), до более высокого уровня свойств, которые имитируют понимание контекста и значения.
Однако модели языка не обучены быть правильными. Усиление обучения с человеческой обратной связью (RLHF) и другие методы помогают обучать их для желаемых свойств, включая правильность, но они не полностью успешны. Учитывая подсказку, модели языка будут генерировать текст, который наиболее близко соответствует статистическим свойствам обучающих данных. Часто этот текст также правильный. Например, если спросить “когда родился Александр Великий”, правильный ответ – 356 год до н.э., и модель языка, скорее всего, даст этот ответ, потому что в обучающих данных рождения Александра Великого часто появляется как это значение. Однако, если спросить “когда родилась императрица Реджинелла”, вымышленный персонаж, не присутствующий в обучающем корпусе, модель языка, скорее всего, галлюцинирует и создаст историю о ее рождении. Аналогично, когда задается вопрос, на который модель языка может не получить правильный ответ (либо потому, что правильный ответ не существует, либо по другим статистическим причинам), она, скорее всего, галлюцинирует и ответит так, как будто она знает. Это создает галлюцинации, которые являются очевидной проблемой для серьезных приложений, таких как “как можно лечить такое-то заболевание”.
Еще нет идеальных решений для галлюцинаций. Они являются неотъемлемой частью конструкции модели языка. Одним из частичных решений является правильное формулирование подсказки, такое как запрос к модели языка “подумать тщательно, шаг за шагом” и так далее. Это увеличивает вероятность того, что модель языка не составит истории. Более сложный подход, который разрабатывается, – это использование графов знаний. Графы знаний предоставляют структурированные данные: сущности в графе знаний связаны с другими сущностями в предопределенной, логической манере. Создание графа знаний для данной области является, конечно, сложной задачей, но ее можно выполнить с помощью комбинации автоматических и статистических методов и курирования. С встроенным графом знаний модели языка могут проверять сгенерированные ими утверждения против структурированного набора известных фактов и могут быть ограничены так, чтобы не генерировать утверждение, которое противоречит или не поддерживается графом знаний.
Из-за фундаментальной проблемы галлюцинаций, и, возможно, из-за их недостаточной способности рассуждения и суждения, модели языка в настоящее время мощны для извлечения, соединения и дистилляции информации, но не могут заменить человеческих экспертов в серьезных приложениях, таких как медицинская диагностика или юридические консультации. Тем не менее, они могут значительно повысить эффективность и способность человеческих экспертов в этих областях.
Можете ли вы поделиться своим видением будущего, где биология управляется данными, а не гипотезами?
Традиционный гипотезо-ориентированный подход, который включает в себя нахождение закономерностей, разработку гипотез, проведение экспериментов или исследований для их проверки, и затем уточнение теорий на основе данных, заменяется новым парадигмой, основанной на данных-ориентированном моделировании.
В этом возникающем парадигме исследователи начинают с гипотезо-свободного, крупномасштабного генерирования данных. Затем они обучают модель машинного обучения, такую как модель языка, с целью точной реконструкции скрытых данных, сильной регрессии или классификации в ряде последующих задач. Как только модель машинного обучения может точно предсказать данные и достигает достоверности, сравнимой с подобием между экспериментальными репликами, исследователи могут допросить модель, чтобы извлечь информацию о биологической системе и раскрыть основные биологические принципы.
Модели языка оказываются особенно хорошими в моделировании биомолекулярных данных и предназначены для того, чтобы стимулировать сдвиг от гипотезо-ориентированного к данным-ориентированному биологическому открытию. Этот сдвиг станет все более выраженным в течение следующих 10 лет и позволит точно моделировать биомолекулярные системы на уровне детализации, который выходит за пределы человеческих возможностей.
Каков потенциальный эффект на диагностику заболеваний и открытие лекарств?
Я считаю, что модели языка и генеративное ИИ приведут к значительным изменениям в промышленности жизни. Одна из областей, которая выиграет от моделей языка, – это клиническая диагностика, особенно для редких, трудно диагностируемых заболеваний и подтипов рака. Существует огромное количество всесторонней информации о пациентах, которую мы можем использовать – от геномных профилей, ответов на лечение, медицинских записей и семейной истории – для точной и своевременной диагностики. Если мы сможем найти способ скомпилировать все эти данные так, чтобы они были легко доступны и не были разрознены отдельными организациями здравоохранения, мы можем значительно улучшить диагностическую точность. Это не означает, что модели машинного обучения, включая модели языка, смогут автономно работать в диагностике. Из-за их технических ограничений в ближайшем будущем они не будут автономными, а будут мощными инструментами, которые помогут врачу предоставить великолепно информированные оценки и диагностику в долю времени, необходимого на данный момент, и правильно задокументировать и сообщить свою диагностику пациенту, а также всей сети поставщиков медицинских услуг, связанных с моделью машинного обучения.
Промышленность уже использует машинное обучение для открытия и разработки лекарств, подчеркивая его способность сократить затраты и сроки по сравнению с традиционным парадигмой. Модели языка еще больше добавляют к доступному инструментарию и предоставляют отличные рамки для моделирования крупномасштабных биомолекулярных данных, включая геномы, протеомы, функциональную геномику и эпигеномику, данные отдельных клеток и многое другое. В ближайшем будущем фундаментальные модели языка, безусловно, соединятся во всех этих модальностях данных и во всей когорте людей, чья геномная, протеомная и медицинская информация собирается. Такие модели языка помогут в генерации перспективных целей для лекарств, выявлении вероятных карманов активности белков, связанных с биологическими функциями и заболеваниями, или предложении путей и более сложных клеточных функций, которые можно модулировать определенным образом с помощью небольших молекул или других модальностей лекарств. Мы также можем использовать модели языка для выявления ответчиков и неответчиков на лекарства на основе генетической восприимчивости или для перепрофилирования лекарств в других показаниях заболеваний. Многие из существующих инновационных компаний, основанных на ИИ, по открытию лекарств, безусловно, уже начинают думать и развиваться в этом направлении, и мы должны ожидать увидеть образование дополнительных компаний, а также общественные усилия, направленные на развертывание моделей языка в человеческом здравоохранении и открытии лекарств.
Спасибо за подробное интервью, читатели, которые хотят узнать больше, должны посетить Seer.












