Здравоохранение
Ginkgo Datapoints представляет VCPI: смелый план по решению проблемы данных в открытии лекарств с помощью ИИ

В течение многих лет ИИ в открытии лекарств был ограничен одной, казалось бы, простой проблемой: данные не достаточно хороши. Горы секвенирования, пула пертурбационных исследований и смешанных экспериментов с клетками давали впечатление прогресса, не принося реальных прорывов. Вместо ясности область производила шум. Вместо воспроизводимости она производила дрейф. И вместо точных, фармакологически-специфических измерений, необходимых для обучения надежных виртуальных моделей клеток, она производила наборы данных, оптимизированные больше для масштаба, чем для научной целостности.
Это та среда, в которую Ginkgo Datapoints запускает Виртуальную клеточную фармакологию инициативу (VCPI) – проект, который не просто обещает больше данных, но стремится предоставить лучшие данные, предназначенные специально для моделей ИИ, пытающихся предсказать, как реальные молекулы, подобные лекарствам, нарушают реальные биологические системы. Официальное объявление компании подчеркивает, что VCPI сгенерирует более 12 миллиардов точек данных и профилирует 100 000 соединений, создавая первый стандартизированный набор данных фармакологии для виртуальной клеточной модели.
Почему “больше данных” потерпело неудачу
В блог-посте, представляющем VCPI, Ginkgo использует аналогию, которая идеально отражает ошибочное направление области. Представьте, что вы бросаете горсть таблеток в клетку с мышами, а затем пытаетесь выяснить, какая мышь съела что. Теперь масштабируйте это до миллиона мышей в одной巨альной клетке. Это основной недостаток пула одноклеточной фармакологии экспериментов. Они генерируют впечатляющие количества данных, но лежащая в основе конструкция предотвращает чистую атрибуцию между соединением и фенотипом.
Проблема не в технологии; это экспериментальная архитектура. Предположение, что более крупные наборы данных по своей сути учат лучшие модели, оказалось ложным. Блог прямо называет этот образ мышления “зависимостью от данных”, утверждая, что без хорошо структурированных, высокосигнальных входных данных даже самые передовые ИИ будут учиться неправильным закономерностям.
VCPI представляет собой резкий отход от этой логики. Вместо того, чтобы прославлять размер, он удваивает усилия по биологической отслеживаемости, экспериментальной строгости и контролируемой структуре, необходимой для того, чтобы ИИ мог действительно изучить фармакологию.
Как VCPI перестраивает трубопровод данных
Вместо того, чтобы полагаться на пула одноклеточных анализов, VCPI использует DRUG-seq, метод высокопроизводительного масс-спектрометрического анализа РНК, при котором каждое соединение обрабатывается в отдельной закодированной ячейке. Это позволяет Ginkgo измерять реакции, специфичные для лечения, с гораздо более чистым сигналом к шуму, чем предлагают пула конструкции. Согласно пресс-релизу, автоматизированная инфраструктура компании может запускать более 100 полных 384-хлуллных тарелок в неделю, генерируя миллионы высокоточных измерений РНК на промышленном масштабе.
Не менее важно введение V-Ref293, новой, стандартизированной справочной клеточной линии. Вместо того, чтобы каждая лаборатория запускала свою собственную мутированную, дрейфованную версию одной и той же клеточной линии, VCPI создает универсальную биологическую базовую линию – “органического двойника” к появляющемуся классу виртуальных клеток. Это устраняет один из давних источников нерепроизводимости в фармакогеномике и предоставляет стабильную истину, которая так необходима моделям ИИ.
В рамках этой инициативы Ginkgo открывает двери к сообществу-ориентированному набору данных с несколькими определяющими компонентами:
- Открытое участие для исследователей, фармацевтических команд и разработчиков ИИ
- Бесплатное высокопроизводительное профилирование РНК для представленных соединений
- Необязательный эмбарго или постоянный проприетарный доступ для участников
- Ежемесячные выпуски данных, формируемые голосованием сообщества
- Возможности для обмена моделями, определения приоритета соединений и раннего доступа к “супер-пользовательскому” статусу
Модель, построенная сообществом, а не сброс данных
Одним из наиболее необычных аспектов VCPI является решение о запуске до существования набора данных. Вместо загрузки готового ресурса Ginkgo просит научное сообщество помочь определить, какие соединения наиболее важны, и сотрудничать в реальном времени, пока набор данных растет.
Этот подход также снижает риск участия. Ранние биотехнологические компании могут представить соединения и получить реальные фармакологические данные без сжигания драгоценного бюджета на высокопроизводительное скрининговое тестирование. Команды ИИ могут обеспечить, чтобы набор данных отражал нарушения, которые им действительно нужны для обучения моделей. И академические лаборатории могут вносить свой вклад, сохраняя при этом возможность 90-дневного эксклюзивного окна.
Структура преобразует генерацию данных в участнический научный процесс – а не статический продукт.
Что это значит для будущего Bio-AI
Более широкие последствия VCPI выходят за рамки Ginkgo или любой отдельной инициативы виртуальной клетки. Чтобы виртуальные клеточные модели стали научно достоверными, они должны быть обучены на данных, которые воспроизводимы, специфичны для лечения и привязаны к стабильной биологической ссылке. Без этого фундамента ИИ будет продолжать галлюцинировать, неправильно предсказывать или переобучаться на артефакты.
Инициативы, такие как VCPI, сигнализируют о сдвиге в том, как область думает о данных самих по себе. Экспериментальная конструкция становится такой же важной, как архитектура модели. Воспроизводимость возвращается в качестве центрального требования, а не опционального идеала. И сообщество-ориентированные, открытые инфраструктурные проекты начинают обгонять закрытые проприетарные наборы данных в их способности ускорять инновации.
Если виртуальные клетки в конечном итоге станут надежными прогностическими инструментами – инструментами, которые помогают ранжировать соединения, флагировать токсичности или освещать пути до того, как человек коснется пипетки, – это будет потому, что проекты, такие как VCPI, создали структурированную, достоверную среду данных, которую они нуждались, чтобы расти.
Приоритизируя лучшие данные над просто большим количеством данных, Ginkgo переформулирует основы биологии, поддерживаемой ИИ. VCPI не просто реагирует на кризис данных в открытии лекарств; он создает сцену для новой эры, в которой биологические эксперименты и трубопроводы обучения ИИ эволюционируют вместе, открыто и с целью.












