Liderzy opinii
Problem danych w sercu odkryć leków z użyciem sztucznej inteligencji

Podczas gdy sztuczna inteligencja szybko staje się integralną częścią odkryć leków, być może najważniejszym pytaniem nie jest to, jak potężny będzie następny model, ale czego te modele naprawdę uczą się z danych.
Niedawne rozszerzenie Anthropic w kierunku rozwoju leków jest najnowszym sygnałem, że sztuczna inteligencja wykracza poza ogólny rozumowanie i wkracza w dziedzinę nauki stosowanej. Odzwierciedla to rzeczywisty postęp w tej dziedzinie i rosnące przekonanie, że sztuczna inteligencja może znacząco zmienić sposób, w jaki odkrywane są nowe leki. Jednak jeśli celem jest poprawa wskaźników powodzenia w badaniach klinicznych, a nie tylko przyspieszenie odkryć, powinniśmy zadawać sobie pytanie, czy biologiczne dane, na których opierają się te systemy, są w stanie nauczyć je, co tak naprawdę wygląda ludzka biologia.
Przez lata branża koncentrowała się na budowaniu coraz bardziej zaawansowanych algorytmów. Większe modele, więcej obliczeń i lepsze architektury przyniosły znaczące postępy w predykacji struktury białek, identyfikacji celów, projektowaniu molekularnym i innych obszarach badań biomedycznych. Te innowacje zasługują na uwagę, której zostały obdarzone.
Co otrzymało znacznie mniej uwagi, to biologiczna podstawa pod nimi.
Sztuczna inteligencja jest wyjątkowo dobra w znajdowaniu wzorców. Ale nie może odróżnić biologii, która jest po prostu mierzalna, od biologii, która jest naprawdę przewidywalna tego, co dzieje się u pacjentów. Górna granica dla odkryć leków z użyciem sztucznej inteligencji zostanie ostatecznie określona nie tylko przez inteligencję modeli, ale także przez wierność danych ludzkich używanych do trenowania, walidacji i benchmarkowania ich. Jeśli chcemy, aby sztuczna inteligencja dostarczała lepsze leki, a nie tylko szybsze hipotezy, budowanie wysokiej jakości infrastruktury danych biologicznych może okazać się równie ważne, jak budowanie następnej generacji sztucznej inteligencji.
Sztuczna inteligencja może się uczyć tylko od biologii, którą jej dajemy
Każdy model sztucznej inteligencji jest ograniczony przez informacje, które z niego pobiera. Rozwój leków stanowi szczególnie trudne wyzwanie, ponieważ biologia jest niezwykle złożona. Ludzkie choroby są wpływane przez genetykę, wiek, płeć, choroby współistniejące, odpowiedzi immunologiczne, narażenie na czynniki środowiskowe i tysiące wzajemnie powiązanych ścieżek molekularnych, które pozostają tylko częściowo zrozumiane.
Historycznie, większość danych eksperymentalnych używanych w rozwoju leków pochodziła z badań na zwierzętach, nieśmiertelnych linii komórkowych, uproszczonych systemów in vitro i symulacji komputerowych. Te narzędzia znacznie przyczyniły się do postępu nauk biomedycznych i pozostają niezastąpione na wielu etapach badań. Jednak dekady doświadczeń również wykazały, że nie mogą one w pełni odtworzyć ludzkiej fizjologii.
Około 90% kandydatów na leki wchodzących do badań klinicznych ostatecznie zawodzi, a brak skuteczności i nieoczekiwane wyniki bezpieczeństwa są głównymi przyczynami. Chociaż wiele czynników przyczynia się do tych niepowodzeń, jednym z powtarzających się tematów jest to, że modele przedkliniczne często mają trudności z przewidywaniem tego, co tak naprawdę dzieje się u pacjentów.
Jeśli systemy sztucznej inteligencji są trenowane głównie na danych wygenerowanych z modeli, które same mają znane ograniczenia translacyjne, nie powinno to być zaskakujące, jeśli te ograniczenia się utrzymują. Sztuczna inteligencja może rozpoznać wzorce w sposób godny uwagi, ale nie może wynaleźć biologicznej prawdy, której nigdy nie było w danych szkoleniowych.
Więcej danych niekoniecznie oznacza lepsze dane
Społeczność sztucznej inteligencji często mówi o prawach skalowania: obserwacji, że większe zestawy danych często poprawiają wydajność modelu. W biologii jednak ilość i jakość nie są wymiennymi pojęciami. Miliony punktów danych zebranych z systemów eksperymentalnych, które słabo odzwierciedlają ludzką fizjologię, mogą oferować mniejszą wartość przewidywalną niż mniejsze zestawy danych wygenerowane bezpośrednio z klinicznie istotnej biologii ludzkiej. Ta różnica staje się szczególnie ważna w rozwoju leków, gdzie celem jest nie tylko predykacja, ale predykacja, która przekłada się na udane wyniki u pacjentów.
Wysokiej jakości dane biologiczne ludzkie różnią się od tradycyjnych zestawów danych laboratoryjnych w kilku ważnych aspektach. Uchwycenia funkcji biologicznej, a nie statycznych migawek. Zachowują relacje między tkankami, architekturą komórkową, perfuzją, metabolizmem i farmakologią. Włączają historię pacjenta, cechy kliniczne, pomiary molekularne i odpowiedzi funkcjonalne w ramach tego samego systemu biologicznego. Co najważniejsze, mierzą biologię, która naprawdę istnieje u ludzi.
W miarę jak sztuczna inteligencja staje się coraz bardziej zdolna do wyodrębniania subtelnych wzorców z złożonych danych, jakość tych wzorców staje się nieodłączna od jakości podstawowej biologii.
Następna przewaga konkurencyjna może być infrastrukturą danych biologicznych
W ciągu ostatnich kilku lat, ogromne inwestycje zostały dokonane w modele podstawowe, infrastrukturę obliczeniową i specjalne architektury sztucznej inteligencji. Zdecydowanie mniej uwagi poświęcono infrastrukturze niezbędnej do systematycznego generowania wysokiej jakości danych biologicznych ludzkich w dużym stopniu.
Ludzkie próbki biologiczne są niezmiernie ograniczone i wymagają integracji z pewnego rodzaju infrastrukturą dawkowania. Standaryzacja pozostaje wyzwaniem. Protokoły eksperymentalne muszą być odtwarzalne. Metadane muszą być kompleksowe. Pomiary multiomikowe, obrazowanie, testy funkcjonalne i kontekst kliniczny wszystkie muszą być zintegrowane z zestawami danych, które są wystarczająco spójne dla obliczeniowego uczenia.
Żadna z tych rzeczy nie przypomina tradycyjnego inżynierii oprogramowania. Zamiast tego wymaga skoordynowanych operacji biologicznych, które mogą produkować odtwarzalne, gotowe do regulacji zestawy danych przez wiele lat. Podobnie jak infrastruktura chmura stała się niezbędna dla nowoczesnego rozwoju oprogramowania, infrastruktura biologiczna ludzka może stać się podstawą dla następnej generacji terapii napędzanych przez sztuczną inteligencję. Organizacje, które inwestują w tę infrastrukturę dzisiaj, mogą ostatecznie ukształtować to, czego będą mogły się nauczyć modele sztucznej inteligencji jutro.
Regulatorzy idą w tym kierunku
Co ważne, ta dyskusja wykracza poza akademicką ciekawość. Regulatorzy coraz bardziej podkreślają dowody dotyczące ludzi. FDA rozszerzyła swoje wsparcie dla Nowych Metodologii Podziału (NAM), określając ścieżki, którymi modele komputerowe, technologie chip-on-chip, zaawansowane systemy in vitro i inne podejścia dotyczące ludzi mogą przyczynić się do decyzji regulacyjnych.
Ten zwrot rozpoznaje ważną rzeczywistość. W miarę jak metody komputerowe stają się bardziej zaawansowane, zaufanie do ich predykacji zależy od zaufania do dowodów biologicznych, które je wspierają. Jeśli lepsza sztuczna inteligencja wymaga lepszej walidacji, a lepsza walidacja wymaga lepszych danych ludzkich, to lepsza sztuczna inteligencja musi wymagać lepszych danych ludzkich, które leżą u źródła każdego modelu.
Następną dekadę będzie definiowała jakość danych
Przemysł farmaceutyczny doświadczył wielu rewolucji technologicznych, od screeningów wysokiej wydajności do sekwencjonowania następnej generacji. Każda z nich rozszerzyła objętość dostępnych danych, ale zastosowanie sztucznej inteligencji w tej dziedzinie reprezentuje coś innego.
Jego powodzenie zależy nie tylko od produkcji większej ilości danych, ale od produkcji danych, które bardziej wiernie odzwierciedlają biologię ludzką. W miarę jak modele podstawowe stają się coraz bardziej dostępne, przewagi algorytmiczne same w sobie mogą stać się mniej trwałe. Dostęp do zróżnicowanych, wysokiej jakości danych biologicznych ludzkich może się okazać jedną z definiujących przewag konkurencyjnych w całym ekosystemie farmaceutycznym. Jest to szczególnie prawdziwe, jeśli ostatecznym celem branży jest poprawa wskaźników powodzenia w badaniach klinicznych, a nie tylko przyspieszenie odkryć.
Wejście Anthropic do rozwoju leków odzwierciedla znaczący postęp, jaki sztuczna inteligencja zrobiła w ciągu ostatnich kilku lat. Podkreśla również następne pytanie, które branża musi odpowiedzieć. Jeśli sztuczna inteligencja naprawdę ma potencjał, aby przekształcić medycynę, jaka biologiczna podstawa będzie podstawą tych modeli?
Przyszłość odkryć leków z użyciem sztucznej inteligencji z pewnością będzie zależała od lepszych algorytmów. Ale może zależeć jeszcze bardziej od budowania infrastruktury danych biologicznych ludzkich, która może nauczyć te algorytmy, co tak naprawdę wygląda biologia ludzka.












