Лідери думок

Проблема даних у серці відкриття ліків за допомогою штучного інтелекту

mm
Додайте Unite.AI до бажаних джерел у Google

Оскільки штучний інтелект швидко впроваджується у відкриття ліків, можливо, найважливіше питання не полягає в тому, наскільки потужним буде наступна модель, а в тому, які дані ці моделі фактично вивчають.

Недавнє розширення Anthropic у сфері розробки ліків є ознакою того, що штучний інтелект виходить за рамки загального призначення та переходить до прикладної науки. Це відображає реальний імпульс у галузі та зростаючу впевненість у тому, що штучний інтелект може суттєво змінити відкриття нових ліків. Однак якщо мета полягає в тому, щоб покращити клінічні показники успіху, а не просто прискорити відкриття, нам слід питати, чи біологічні дані, що лежать в основі цих систем, здатні вчити їх, що таке людська біологія насправді.

Тривалий час увага галузі була зосереджена на створенні все більш складних алгоритмів. Більші моделі, більше обчислень та кращі архітектури сприяли видатним досягненням у передбаченні структури білків, ідентифікації цілей, молекулярному дизайні та інших галузях біомедичних досліджень. Ці інновації заслуговують на увагу, яку вони отримали.

Що отримало значно менше уваги, це біологічна основа під ними.

Штучний інтелект винятково добре знаходить закономірності. Однак він не може розрізняти біологію, яка просто вимірюється, та біологію, яка справді передбачає, що відбувається у пацієнтах. Ліміти штучного інтелекту у відкритті ліків в кінцевому підсумку будуть визначені не лише інтелектом моделей, а й вірогідністю людських даних, використаних для навчання, валідації та оцінки моделей. Якщо ми хочемо, щоб штучний інтелект давав кращі ліки, а не просто швидші гіпотези, будівництво високоякісної інфраструктури людських біологічних даних може виявитися так само важливим, як і будівництво наступного покоління штучного інтелекту.

Штучний інтелект може вивчати тільки ту біологію, яку ми йому даємо

Кожна модель штучного інтелекту обмежена інформацією, яку вона вивчає. Розробка ліків представляє особливо складну задачу, оскільки біологія надзвичайно складна. Людська хвороба залежить від генетики, віку, статі, супутніх захворювань, імунних реакцій, впливу довкілля та тисяч взаємодіючих молекулярних шляхів, які залишаються тільки частково зрозумілими.

Історично багато експериментальних даних, використовуваних під час розробки ліків, походили з тваринних досліджень, безсмертних клітинних ліній, спрощених in vitro систем та комп’ютерних симуляцій. Ці інструменти суттєво просунули біомедичні науки та залишаються незамінними на багатьох стадіях досліджень. Однак десятиліття досвіду також продемонстрували, що вони не можуть повністю відтворити людську фізіологію.

Приблизно 90% кандидатів на ліки, які вступають у клінічні дослідження, в кінцевому підсумку не проходять, а відсутність ефективності та несподівані висновки про безпеку представляють собою основні фактори. Хоча багато факторів сприяють цим невдачам, одна повторювана тема полягає в тому, що доклінічні моделі часто не можуть передбачити, що відбувається у пацієнтах.

Якщо системи штучного інтелекту навчаються переважно на даних, згенерованих з моделей, які самі мають відомі трансляційні обмеження, не повинно бути дивним, якщо ці обмеження зберігаються. Штучний інтелект може визнавати закономірності надзвичайно добре, але він не може винайти біологічну правду, якої ніколи не було у його навчальних даних.

Більше даних не завжди означає кращі дані

Спільнота штучного інтелекту часто говорить про закони масштабування: спостереження, що більші набори даних часто покращують продуктивність моделі. У біології, однак, кількість і якість не є взаємозамінними. Міліони даних, зібраних з експериментальних систем, які погано відображають людську фізіологію, можуть пропонувати менше передбачувальної цінності, ніж менші набори даних, згенеровані безпосередньо з клінічно актуальної людської біології. Ця відмінність стає особливо важливою у відкритті ліків, де мета полягає не просто у передбаченні, а у передбаченні, яке перекладається у успішні результати лікування пацієнтів.

Високоякісні людські біологічні дані відрізняються від традиційних лабораторних наборів даних кількома важливими способами. Вони захоплюють біологічну функцію, а не статичні знімки. Вони зберігають відносини між тканинами, клітинною архітектурою, перфузією, метаболізмом та фармакологією. Вони включають історію пацієнта, клінічні характеристики, молекулярні вимірювання та функціональні реакції в рамках однієї біологічної системи. Найважливіше, що вони вимірюють біологію, яка фактично існує у людей.

Когда штучний інтелект стає все більш здатним витягувати тонкі закономірності з складних даних, якість цих закономірностей стає нерозривною від якості підлягаючої біології.

Наступна конкурентна перевага може бути людською інфраструктурою даних

За останні кілька років, величезні інвестиції були спрямовані на фундаментальні моделі, обчислювальну інфраструктуру та спеціалізовані архітектури штучного інтелекту. Надзвичайно мало уваги було приділено інфраструктурі, необхідній для систематичного створення високоякісних людських біологічних даних у масштабі.

Людські біологічні зразки є внутрішньо обмеженими та вимагають інтеграції з деякою формою інфраструктури донорства. Стандартизація залишається складною. Експериментальні протоколи повинні бути репродуктивними. Метадані повинні бути повними. Мультіомічні вимірювання, зображення, функціональні тести та клінічний контекст усі повинні бути інтегровані в набори даних, які є достатньо послідовними для обчислювального навчання.

Нічого з цього не нагадує традиційну інженерію програмного забезпечення. Замість цього це вимагає координованих біологічних операцій, здатних виробляти репродуктивні, регуляторно-готові набори даних протягом багатьох років. Як і хмарна інфраструктура стала необхідною для сучасної розробки програмного забезпечення, людська біологічна інфраструктура може стати фундаментальною для наступного покоління терапевтичних засобів, керованих штучним інтелектом. Організації, які інвестують в цю інфраструктуру сьогодні, можуть в кінцевому підсумку сформувати, чого будуть здатні навчатися майбутні моделі штучного інтелекту.

Регулятори рухаються в цьому напрямку

Важливо, що ця дискусія виходить за рамки академічного інтересу. Регулятори самі все частіше підкреслюють людські докази. FDA розширила свою підтримку нових підходів до методологій (NAMs), окресливши шляхи, за допомогою яких обчислювальні моделі, технології “орган на чипі”, просунуті in vitro системи та інші людські підходи можуть сприяти регуляторному прийняттю рішень.

Ця зміна визнає важливу реальність. Коли комп’ютерні методи стають все більш складними, довіра до їхніх передбачень залежить від довіри до біологічних доказів, які їх підтримують. Якщо кращий штучний інтелект вимагає кращої валідації, а краща валідзація вимагає кращих людських даних, то кращий штучний інтелект повинен вимагати кращих людських даних, які лежать в основі кожної моделі.

Наступне десятиліття буде визначено якістю даних

Фармацевтична промисловість пережила багатьох технологічних революцій, від високопродуктивного скринінгу до поколіньної секвенції. Кожна розширила обсяг доступних даних, але застосування штучного інтелекту в цій галузі представляє щось інше.

Його успіх залежить не тільки від виробництва більше даних, а від виробництва даних, які більш вірно представляють людську біологію. Коли фундаментальні моделі стають все більш доступними, алгоритмічні переваги самі по собі можуть стати менш тривалими. Доступ до диференційованих, високоякісних людських біологічних даних може замість цього виникнути як одна з визначальних конкурентних переваг у фармацевтичній екосистемі. Це особливо вірно, якщо кінцева мета галузі полягає в покращенні клінічних показників успіху, а не просто в прискоренні відкриття.

Вхід Anthropic у сферу розробки ліків відображає видатний прогрес, якого досягнув штучний інтелект за останні кілька років. Це також підкреслює наступне питання, на яке галузь повинна відповісти. Якщо штучний інтелект дійсно має потенціал трансформувати медицину, на якій біологічній основі будуть стояти ці моделі?

Майбутнє відкриття ліків за допомогою штучного інтелекту безумовно залежатиме від кращих алгоритмів. Однак воно може залежати навіть більше від будівництва людської інфраструктури даних, здатної вчити ці алгоритми, що таке людська біологія насправді.

Доктор Дженна ДіРіто є співзасновником і головним операційним директором Revalia Bio. Її робота зосереджена на створенні інфраструктури біологічних даних людини для підтримки розробки ліків з використанням штучного інтелекту, трансляційної науки та нормативної прийняття моделей, заснованих на людині, для досліджень.