ผู้นำทางความคิด

ปัญหาข้อมูลที่อยู่ตรงกลางของการค้นพบยาที่ขับเคลื่อนด้วย AI

mm
เพิ่ม Unite.AI ลงในแหล่งข้อมูลที่คุณต้องการบน Google

เมื่อ AI ถูกฝังอยู่ในกระบวนการค้นพบยาที่เร็วขึ้น อาจเป็นคำถามที่สำคัญที่สุดที่ไม่ใช่ว่าโมเดลหน้าจะทรงพลังแค่ไหน แต่เป็นข้อมูลที่โมเดลเหล่านั้นเรียนรู้มาจากไหน

การขยายตัวของ Anthropic ล่าสุดเข้าสู่พื้นที่การพัฒนายา เป็นสัญญาณล่าสุดที่แสดงให้เห็นว่า AI กำลังขยายตัวออกไปนอกเหนือจากเหตุผลทั่วไปและเข้าสู่วิทยาศาสตร์ประยุกต์ สิ่งนี้สะท้อนถึงความก้าวหน้าในด้านนี้และความมั่นใจที่เพิ่มขึ้นในการใช้ AI ในการค้นพบยาที่ประสบความสำเร็จ แต่ถ้าเป้าหมายคือการปรับปรุงอัตราความสำเร็จทางคลินิก ไม่ใช่เพียงเพิ่มความเร็วในการค้นพบ เราควรตั้งคำถามว่าข้อมูลทางชีววิทยาที่เป็นพื้นฐานของระบบเหล่านี้สามารถสอนให้พวกมันเข้าใจชีววิทยาของมนุษย์ได้จริงหรือไม่

ในช่วงหลายปีที่ผ่านมา อุตสาหกรรมได้มุ่งเน้นไปที่การสร้างอัลกอริทึมที่ซับซ้อนมากขึ้น โมเดลที่ใหญ่ขึ้น การคำนวณที่ดีขึ้น และสถาปัตยกรรมที่ดีขึ้นได้ขับเคลื่อนความก้าวหน้าที่น่าประทับใจในด้านการคาดการณ์โครงสร้างโปรตีน การระบุเป้าหมาย การออกแบบโมเลกุล และพื้นที่วิจัยชีวการแพทย์อื่นๆ

สิ่งที่ได้รับความสนใจน้อยกว่าคือพื้นฐานทางชีววิทยาที่อยู่ภายใต้

AI มีความสามารถพิเศษในการค้นหารูปแบบ แต่ไม่สามารถแยกแยะระหว่างชีววิทยาที่สามารถวัดได้กับชีววิทยาที่สามารถคาดการณ์ได้จริงในสิ่งที่เกิดขึ้นในผู้ป่วย เพดานสำหรับการค้นพบยาที่ขับเคลื่อนด้วย AI จะถูกกำหนดไม่เพียงแต่ด้วยความฉลาดของโมเดล แต่ยังรวมถึงความถูกต้องของข้อมูลทางชีววิทยาของมนุษย์ที่ใช้ในการฝึกอบรม ตรวจสอบ และประเมินผล หากเราต้องการให้ AI ส่งมอบยาที่ดีกว่า ไม่ใช่แค่สมมติฐานที่เร็วขึ้น การสร้างโครงสร้างพื้นฐานข้อมูลทางชีววิทยาของมนุษย์ที่มีคุณภาพสูงอาจเป็นสิ่งสำคัญไม่แพ้กับการสร้างรุ่นต่อไปของ AI เอง

AI สามารถเรียนรู้ได้จากชีววิทยาที่เราให้ไว้เท่านั้น

ทุกๆ โมเดล AI ถูกจำกัดด้วยข้อมูลที่เรียนรู้มา การพัฒนายาเป็นเรื่องที่ท้าทายเป็นพิเศษเนื่องจากชีววิทยามีความซับซ้อนมาก มันถูกมีอิทธิพลจากพันธุกรรม อายุ เพศ โรคที่เกิดร่วมกัน การตอบสนองของระบบภูมิคุ้มกัน การสัมผัสกับสิ่งแวดล้อม และเส้นทางโมเลกุลที่มีปฏิสัมพันธ์หลายพันเส้นทางที่ยังไม่เข้าใจอย่างสมบูรณ์

ในอดีต ข้อมูลทดลองส่วนใหญ่ที่ใช้ในการพัฒนายาได้มาจากการศึกษาสัตว์ เซลล์ที่มีชีวิตนิรันดร์ ระบบในหลอดทดลองที่เรียบง่าย และการจำลองทางคอมพิวเตอร์ เครื่องมือเหล่านี้ได้ก้าวหน้าไปมากในด้านวิทยาศาสตร์ชีวการแพทย์ และยังคงเป็นสิ่งจำเป็นในหลายขั้นตอนของการวิจัย แต่ประสบการณ์หลายทศวรรษได้แสดงให้เห็นว่าพวกมันไม่สามารถจำลองสรีรวิทยาของมนุษย์ได้อย่างสมบูรณ์

ประมาณ 90% ของยาที่เข้าสู่การทดลองทางคลินิก ล้มเหลวในที่สุด โดยการขาดประสิทธิภาพและผลการตรวจพบความปลอดภัยที่ไม่คาดคิดเป็นปัจจัยที่สำคัญที่ทำให้เกิดความล้มเหลวเหล่านี้ แม้ว่าหลายปัจจัยจะส่งผลต่อความล้มเหลวเหล่านี้ แต่เรื่องที่เกิดขึ้นซ้ำๆ คือโมเดลก่อนคลินิกมักจะดิ้นรนในการคาดการณ์สิ่งที่เกิดขึ้นจริงในผู้ป่วย

หากระบบ AI ได้รับการฝึกอบรมหลักจากข้อมูลที่สร้างขึ้นจากโมเดลที่มีข้อจำกัดในการแปลผลแล้ว ไม่น่าประหลาดใจหากข้อจำกัดเหล่านั้นยังคงอยู่ AI สามารถรับรูปแบบได้อย่างน่าประทับใจ แต่ไม่สามารถคิดค้นความจริงทางชีววิทยาที่ไม่เคยปรากฏในข้อมูลการฝึกอบรม

ข้อมูลที่มากขึ้นไม่จำเป็นต้องดีกว่าข้อมูลที่มีคุณภาพ

ชุมชน AI มักจะพูดถึงกฎการขยาย: การสังเกตว่าชุดข้อมูลที่ใหญ่ขึ้นมักจะปรับปรุงประสิทธิภาพของโมเดล ในชีววิทยา คุณภาพและปริมาณไม่ใช่สิ่งเดียวกัน จุดข้อมูลหลายล้านจุดที่รวบรวมจากระบบทดลองที่สะท้อนสรีรวิทยาของมนุษย์ได้ไม่ดีนั้นอาจมีคุณค่าในการคาดการณ์น้อยกว่าชุดข้อมูลที่เล็กกว่าที่สร้างขึ้นโดยตรงจากชีววิทยาของมนุษย์ที่เกี่ยวข้องกับการรักษา

ข้อมูลทางชีววิทยาที่มีคุณภาพสูงจากมนุษย์แตกต่างจากชุดข้อมูลในห้องปฏิบัติการแบบดั้งเดิมในหลายด้าน มันจับภาพหน้าที่ทางชีววิทยา ไม่ใช่ภาพถ่ายนิ่ง มันรักษาความสัมพันธ์ระหว่างเนื้อเยื่อ โครงสร้างเซลล์ การไหลเวียนของเลือด การเผาผลาญ และเภสัชวิทยา มันรวมถึงประวัติผู้ป่วย ลักษณะทางคลินิก การวัดระดับโมเลกุล และการตอบสนองทางหน้าที่ภายในระบบชีววิทยาที่เดียวกัน สิ่งสำคัญที่สุดคือมันจับภาพชีววิทยาที่แท้จริงที่เกิดขึ้นในมนุษย์

เมื่อ AI มีความสามารถในการค้นหารูปแบบที่ซับซ้อนจากข้อมูลที่ซับซ้อน คุณภาพของรูปแบบเหล่านั้นจะแยกไม่ออกจากคุณภาพของชีววิทยาที่อยู่ภายใต้

ความได้เปรียบในการแข่งขันที่จะเกิดขึ้นอาจเป็นโครงสร้างพื้นฐานข้อมูลทางชีววิทยาของมนุษย์

ในช่วงหลายปีที่ผ่านมา มีการลงทุนจำนวนมากในการสร้างโมเดลพื้นฐาน โครงสร้างพื้นฐานการคำนวณ และสถาปัตยกรรม AI ที่เฉพาะเจาะจง แต่ความสนใจน้อยกว่าในการสร้างโครงสร้างพื้นฐานที่จำเป็นในการสร้างข้อมูลทางชีววิทยาที่มีคุณภาพสูงของมนุษย์

ตัวอย่างชีววิทยาของมนุษย์มีข้อจำกัดโดยธรรมชาติและต้องการการผสมผสานกับโครงสร้างพื้นฐานการบริจาค การมาตรฐานยังคงเป็นเรื่องที่ท้าทาย โพรโทคอลทดลองต้องสามารถทำซ้ำได้ ข้อมูลอธิบายต้องครอบคลุม การวัดหลายโอมิกส์ การถ่ายภาพ การทดสอบหน้าที่ และบริบททางคลินิกต้องถูกผสมผสานเข้ากับชุดข้อมูลที่มีความสอดคล้องกันสำหรับการเรียนรู้เชิงคำนวณ

ไม่มีสิ่งใดที่คล้ายกับการพัฒนาซอฟต์แวร์แบบดั้งเดิม มัน đòi hỏiการดำเนินงานทางชีววิทยาที่ประสานกันซึ่งสามารถสร้างชุดข้อมูลที่สามารถทำซ้ำได้และพร้อมสำหรับการกำกับดูแลในช่วงหลายปี เช่นเดียวกับโครงสร้างพื้นฐานคลาวด์ที่กลายเป็นสิ่งจำเป็นสำหรับการพัฒนาซอฟต์แวร์สมัยใหม่ โครงสร้างพื้นฐานข้อมูลทางชีววิทยาของมนุษย์อาจกลายเป็นพื้นฐานสำหรับการรักษาที่ขับเคลื่อนด้วย AI รุ่นต่อไป องค์กรที่ลงทุนในโครงสร้างพื้นฐานเหล่านี้อาจกำหนดสิ่งที่โมเดล AI ของพรุ่งนี้สามารถเรียนรู้ได้

ผู้กำกับดูแลกำลังเคลื่อนไปในทิศทางนี้

สิ่งสำคัญคือการอภิปรายนี้ขยายออกไปนอกเหนือจากความสนใจทางวิชาการ ผู้กำกับดูแลเองก็กำลังเน้นย้ำถึงหลักฐานที่เกี่ยวข้องกับมนุษย์มากขึ้น องค์การอาหารและยาสหรัฐฯ ได้ขยายการสนับสนุนสำหรับวิธีการใหม่ (NAMs) โดยอธิบายเส้นทางที่โมเดลการคำนวณ เทคโนโลยีอวัยวะบนชิป ระบบในหลอดทดลองที่ซับซ้อน และวิธีการที่เกี่ยวข้องกับมนุษย์อื่นๆ สามารถมีส่วนร่วมในการตัดสินใจด้านการกำกับดูแล

การเปลี่ยนแปลงนี้รับรู้ถึงความเป็นจริงที่สำคัญ เมื่อวิธีการคำนวณมีความซับซ้อนมากขึ้น ความเชื่อมั่นในผลการคาดการณ์ขึ้นอยู่กับความเชื่อมั่นในหลักฐานทางชีววิทยาที่รองรับพวกมัน หาก AI ที่ดีกว่าต้องการการตรวจสอบที่ดีกว่า และการตรวจสอบที่ดีกว่าต้องการข้อมูลทางชีววิทยาที่ดีกว่า AI ที่ดีกว่าจึงต้องอาศัยข้อมูลทางชีววิทยาที่ดีกว่าที่เป็นพื้นฐานของโมเดลแต่ละตัว

ทศวรรษหน้าจะถูกกำหนดโดยคุณภาพของข้อมูล

อุตสาหกรรมยาสามัญได้ประสบกับการปฏิวัติทางเทคโนโลยีหลายครั้ง ตั้งแต่การตรวจสอบความสามารถสูงไปจนถึงการลำดับยีนรุ่นต่อไป แต่ละครั้งได้ขยายปริมาณข้อมูลที่มีอยู่ แต่การนำ AI มาใช้ในด้านนี้แทนการแสดงถึงสิ่งที่แตกต่าง

ความสำเร็จของ AI ขึ้นอยู่ไม่เพียงแต่การผลิตข้อมูลมากขึ้น แต่ยังรวมถึงการผลิตข้อมูลที่สะท้อนชีววิทยาของมนุษย์ได้ดีกว่า เมื่อโมเดลพื้นฐานกลายเป็นมากกว่าความสามารถในการค้นหารูปแบบที่ซับซ้อน คุณภาพของรูปแบบเหล่านั้นจะแยกไม่ออกจากคุณภาพของชีววิทยาที่อยู่ภายใต้ หากเป้าหมายสูงสุดของอุตสาหกรรมคือการปรับปรุงอัตราความสำเร็จทางคลินิก แทนที่จะเพิ่มความเร็วในการค้นพบ การเข้าถึงข้อมูลทางชีววิทยาที่มีคุณภาพสูงและแตกต่างอาจกลายเป็นหนึ่งในความได้เปรียบในการแข่งขันที่สำคัญที่สุดในระบบนิเวศของยาสามัญ

การเข้าสู่พื้นที่พัฒนายาของ Anthropic สะท้อนถึงความก้าวหน้าที่น่าประทับใจของ AI ในช่วงหลายปีที่ผ่านมา แต่ก็เน้นย้ำถึงคำถามที่อุตสาหกรรมต้องตอบ หาก AI มีศักยภาพที่จะเปลี่ยนแปลงการแพทย์ พื้นฐานทางชีววิทยาที่โมเดลเหล่านั้นจะยืนอยู่บนพื้นฐานใด

อนาคตของการค้นพบยาที่ขับเคลื่อนด้วย AI จะขึ้นอยู่กับการพัฒนาอัลกอริทึมที่ดีกว่า แต่อาจขึ้นอยู่กับการสร้างโครงสร้างพื้นฐานข้อมูลทางชีววิทยาของมนุษย์ที่สามารถสอนให้โมเดลเหล่านั้นเข้าใจชีววิทยาของมนุษย์ได้จริง

ดร. เจนนา ดิ ริโต เป็น ผู้ร่วมก่อตั้ง และ ประธานฝ่ายปฏิบัติการ ของ Revalia Bio งานของเธอเน้นการสร้างโครงสร้างพื้นฐานข้อมูลชีววิทยาของมนุษย์เพื่อสนับสนุนการพัฒนายาโดยใช้ AI วิทยาศาสตร์เชิงการแปล และการยอมรับตามกฎระเบียบของโมเดลที่ใช้มนุษย์ในการวิจัย