Pemimpin pemikiran
Masalah Data di Jantung Penemuan Obat Berbasis AI

Ketika AI dengan cepat menjadi bagian dari penemuan obat, mungkin pertanyaan paling penting bukanlah seberapa kuat model berikutnya, tetapi apa data yang sebenarnya dipelajari oleh model-model tersebut.
Ekspansi Anthropic ke pengembangan obat adalah tanda terbaru bahwa kecerdasan buatan sedang melampaui alasan umum dan memasuki ilmu terapan. Ini mencerminkan momentum nyata di bidang ini dan kepercayaan yang tumbuh bahwa AI dapat secara signifikan mengubah cara ditemukannya obat-obatan baru. Namun, jika tujuannya adalah untuk meningkatkan tingkat keberhasilan klinis – bukan hanya mempercepat penemuan – kita harus bertanya apakah data biologis yang mendasari sistem-sistem ini mampu mengajarinya apa yang sebenarnya terjadi pada biologi manusia.
Selama bertahun-tahun, fokus industri telah berada pada membangun algoritma yang semakin canggih. Model yang lebih besar, lebih banyak komputasi, dan arsitektur yang lebih baik telah mendorong kemajuan luar biasa dalam prediksi struktur protein, identifikasi target, desain molekul, dan bidang penelitian biomedis lainnya. Inovasi-inovasi tersebut layak mendapatkan perhatian yang mereka terima.
Apa yang telah mendapatkan perhatian yang jauh lebih sedikit adalah fondasi biologis di bawahnya.
AI sangat baik dalam menemukan pola. Namun, ia tidak dapat membedakan antara biologi yang hanya dapat diukur dan biologi yang benar-benar dapat memprediksi apa yang terjadi pada pasien. Batas untuk penemuan obat berbasis AI pada akhirnya akan ditentukan tidak hanya oleh kecerdasan model, tetapi juga oleh kesetiaan data manusia yang digunakan untuk melatih, memvalidasi, dan membandingkan mereka. Jika kita ingin AI menghasilkan obat yang lebih baik bukan hanya hipotesis yang lebih cepat, membangun infrastruktur data biologis manusia yang berkualitas tinggi mungkin sama pentingnya dengan membangun generasi berikutnya dari AI itu sendiri.
AI Hanya Dapat Belajar Dari Biologi yang Kita Berikan
Setiap model AI dibatasi oleh informasi yang dipelajari. Pengembangan obat menyajikan tantangan yang sangat sulit karena biologi sangat kompleks. Penyakit manusia dipengaruhi oleh genetika, usia, jenis kelamin, komorbiditas, respon imun, paparan lingkungan, dan ribuan jalur molekuler yang berinteraksi yang masih belum sepenuhnya dipahami.
Secara historis, sebagian besar data eksperimental yang digunakan dalam pengembangan obat berasal dari studi hewan, garis sel yang diperbarui, sistem in vitro yang disederhanakan, dan simulasi komputasi. Alat-alat ini telah maju secara signifikan dalam sains biomedis dan tetap tidak tergantikan di banyak tahap penelitian. Namun, dekade pengalaman juga telah menunjukkan bahwa mereka tidak dapat sepenuhnya mereplikasi fisiologi manusia.
Kira-kira 90% kandidat obat yang memasuki uji klinis pada akhirnya gagal, dengan kekurangan efikasi dan temuan keamanan yang tidak terduga mewakili kontributor utama. Sementara banyak faktor yang berkontribusi pada kegagalan ini, satu tema yang berulang adalah bahwa model praklinis seringkali bergelut untuk memprediksi apa yang sebenarnya terjadi pada pasien.
Jika sistem AI dilatih terutama pada data yang dihasilkan dari model yang memiliki keterbatasan translasional yang diketahui, tidak boleh mengejutkan jika keterbatasan tersebut bertahan. AI dapat mengenali pola dengan luar biasa, tetapi tidak dapat menciptakan kebenaran biologis yang tidak pernah ada dalam data pelatihannya.
Lebih Banyak Data Tidak Selalu Berarti Data yang Lebih Baik
Komunitas AI sering berbicara tentang hukum skala: pengamatan bahwa dataset yang lebih besar sering meningkatkan kinerja model. Namun, dalam biologi, kuantitas dan kualitas tidak dapat dipertukarkan. Jutaan titik data yang dikumpulkan dari sistem eksperimental yang tidak mencerminkan fisiologi manusia dengan baik mungkin menawarkan nilai prediktif yang lebih rendah daripada dataset yang lebih kecil yang dihasilkan langsung dari biologi manusia yang relevan secara klinis. Perbedaan ini menjadi sangat penting dalam pengembangan obat, di mana tujuannya bukan hanya prediksi tetapi prediksi yang diterjemahkan ke dalam hasil pasien yang sukses.
Data biologis manusia yang berkualitas tinggi berbeda dari dataset laboratorium tradisional dalam beberapa cara penting. Ini menangkap fungsi biologis bukan hanya snapshot statis. Ini mempertahankan hubungan antara jaringan, arsitektur sel, perfusi, metabolisme, dan farmakologi. Ini menggabungkan riwayat pasien, karakteristik klinis, pengukuran molekuler, dan respon fungsional dalam sistem biologis yang sama. Yang paling penting, ini mengukur biologi yang sebenarnya ada pada manusia.
Ketika AI menjadi semakin mampu mengekstrak pola halus dari data kompleks, kualitas pola tersebut menjadi tak terpisahkan dari kualitas biologi yang mendasarinya.
Keunggulan Kompetitif Berikutnya Mungkin Infrastruktur Data Manusia
Selama beberapa tahun terakhir, investasi besar telah dilakukan pada model dasar, infrastruktur komputasi, dan arsitektur AI khusus. Perhatian yang jauh lebih sedikit telah diberikan pada infrastruktur yang diperlukan untuk secara sistematis menghasilkan data biologis manusia berkualitas tinggi dalam skala besar.
Spesimen biologis manusia secara inheren terbatas dan memerlukan integrasi dengan beberapa bentuk infrastruktur donasi. Standardisasi tetap menantang. Protokol eksperimental harus dapat direproduksi. Metadata harus menyeluruh. Pengukuran multiomik, pencitraan, asai fungsional, dan konteks klinis semua perlu diintegrasikan ke dalam dataset yang konsisten untuk pembelajaran komputasi.
Tidak ada yang menyerupai rekayasa perangkat lunak tradisional. Sebaliknya, ini memerlukan operasi biologis terkoordinasi yang mampu menghasilkan dataset yang dapat direproduksi, siap regulator, selama bertahun-tahun. Seperti infrastruktur cloud yang menjadi penting untuk pengembangan perangkat lunak modern, infrastruktur biologis manusia mungkin menjadi fondasi untuk generasi berikutnya dari terapi yang digerakkan oleh AI. Organisasi yang berinvestasi pada infrastruktur tersebut hari ini mungkin pada akhirnya membentuk apa yang dapat dipelajari oleh model AI di masa depan.
Regulator Sedang Bergerak ke Arah Ini
Penting untuk dicatat, diskusi ini meluas melampaui rasa ingin tahu akademis. Regulator sendiri semakin menekankan bukti yang relevan dengan manusia. FDA telah memperluas dukungan untuk Metodologi Pendekatan Baru (NAM), menguraikan jalur melalui mana model komputasi, teknologi chip-on, sistem in vitro canggih, dan pendekatan manusia yang relevan lainnya dapat berkontribusi pada pengambilan keputusan regulator.
Perubahan ini mengakui kenyataan penting. Ketika metode komputasi menjadi lebih canggih, kepercayaan pada prediksi mereka bergantung pada kepercayaan pada bukti biologis yang mendukungnya. Jika AI yang lebih baik memerlukan validasi yang lebih baik, dan validasi yang lebih baik memerlukan data manusia yang lebih baik, maka AI yang lebih baik harus memerlukan data manusia yang lebih baik yang terletak di sumber setiap model.
Decade Berikutnya Akan Didefinisikan oleh Kualitas Data
Industri farmasi telah mengalami revolusi teknologi dari skrining bertarget tinggi hingga sekuenasi generasi berikutnya. Setiap ekspansi volume data yang tersedia, tetapi penerapan AI dalam bidang ini mewakili sesuatu yang berbeda.
Keberhasilannya bergantung tidak hanya pada menghasilkan lebih banyak data, tetapi pada menghasilkan data yang lebih setia menggambarkan biologi manusia. Ketika model dasar menjadi semakin mudah diakses, keunggulan algoritmik saja mungkin menjadi kurang tahan lama. Akses ke data biologis manusia yang berkualitas tinggi dan berbeda mungkin muncul sebagai salah satu keunggulan kompetitif yang mendefinisikan di seluruh ekosistem farmasi. Ini terutama benar jika tujuan akhir industri adalah meningkatkan keberhasilan klinis daripada hanya mempercepat penemuan.
Masuknya Anthropic ke pengembangan obat mencerminkan kemajuan luar biasa yang telah dibuat oleh AI selama beberapa tahun terakhir. Ini juga menyoroti pertanyaan berikutnya yang harus dijawab industri. Jika AI benar-benar memiliki potensi untuk mengubah obat, apa fondasi biologis yang akan menjadi landasan model-model tersebut?
Masa depan penemuan obat berbasis AI akan sangat bergantung pada algoritma yang lebih baik. Namun, mungkin juga bergantung pada membangun infrastruktur data biologis manusia yang mampu mengajarinya apa yang sebenarnya terjadi pada biologi manusia.












