사상 리더
AI 파워드 약물 발견의 핵심에 있는 데이터 문제

AI가 약물 발견에 빠르게 통합됨에 따라 가장 중요한 질문은 다음 모델이 얼마나 강력할 것인지가 아니라 실제로 어떤 데이터를 학습하는지에 관한 것입니다.
Anthropic의 최근 약물 개발 분야 진출은 인공 지능이 일반적인 추론을 넘어서 적용 과학으로 이동하고 있음을 나타내는 최신 신호입니다. 이는 분야에서 실제적인 진전과 AI가 새로운 약물을 발견하는 방법을 의미 있게 바꿀 수 있다는 믿음이 증가하고 있음을 반영합니다. 그러나 목표가 임상적 성공률을 개선하는 것이라면, 이러한 시스템의 기반이 되는 생물학적 데이터가 실제로 인간 생물학을 가르칠 수 있는지 여부를 물어야 합니다.
수년간 산업의 초점은 점점 더 복잡한 알고리즘을 구축하는 데 있었습니다. 더 큰 모델, 더 많은 컴퓨팅 파워, 더 나은 아키텍처는 단백질 구조 예측, 표적 식별, 분자 설계 및 기타 생물의학 연구 분야에서놀라운 발전을 이끌어 냈습니다. 이러한 혁신은 주목받을 만합니다.
그러나 그 아래에 있는 생물학적 기초는 상대적으로 적은 주목을 받았습니다.
AI는 패턴을 찾는 데 매우 뛰어납니다. 그러나 인간에서 실제로 발생하는 생물학과 단지 측정할 수 있는 생물학을 구별할 수 없습니다. AI 파워드 약물 발견의 한계는 궁극적으로 모델의 지능뿐만 아니라 모델을 훈련, 검증 및 벤치마크하는 데 사용되는 인간 데이터의 신뢰도에 의해 결정될 것입니다. 더 나은 약물을 제공하는 것이 아니라 단지 더 빠른 가설을 제공하는 것이 목표라면, 다음 세대의 AI를 구축하는 것만큼이나 중요한 것이 인간 생물학적 데이터 인프라를 구축하는 것입니다.
AI는 우리가 제공하는 생물학에서만 학습할 수 있습니다
모든 AI 모델은 학습하는 정보에 의해 제한됩니다. 약물 개발은 특히 어려운 도전을 제기합니다. 인간 질병은 유전적, 나이, 성별, 동시 질환, 면역 반응, 환경적 노출 및 부분적으로 이해되는 수천 개의 상호 작용하는 분자 경로에 의해 영향을 받습니다.
과거에 약물 개발을 통해 사용된 대부분의 실험 데이터는 동물 연구, 불멸한 세포 라인, 단순화된 체외 시스템 및 컴퓨터 시뮬레이션에서 유래했습니다. 이러한 도구는 생물의학을 크게 발전시켰으며 연구의 많은 단계에서 여전히 필수적입니다. 그러나 수십 년의 경험은 또한 이러한 도구가 인간 생리학을 완전히 복제할 수 없음을 보여주었습니다.
약 90%의 약물 후보가 임상 시험에 들어가지만 궁극적으로 실패합니다. 효능 결핍과 예상치 못한 안전성 발견이 주요 기여 요인입니다. 이러한 실패에 기여하는 많은 요인들이 있지만, 반복되는 주제 중 하나는 bahwa 전임상 모델이 실제로 인간에서 발생하는 것을 예측하는 데 어려움을 겪는다는 것입니다.
AI 시스템이 주로 알려진 번역적 제한을 가진 모델에서 생성된 데이터로 훈련된다면, 이러한 제한이 지속되는 것이 놀라운 일이 아닙니다. AI는 패턴을 매우 잘 인식할 수 있지만, 훈련 데이터에 존재하지 않는 생물학적 진리를 발명할 수 없습니다.
더 많은 데이터는 반드시 더 나은 데이터는 아닙니다
AI 커뮤니티는 종종 확장 법칙에 대해 말합니다. 더 큰 데이터셋이 모델 성능을 개선하는 관찰입니다. 그러나 생물학에서는 양과 질이 교환 가능하지 않습니다. 인간 생리학을 잘 반영하지 않는 실험 시스템에서 수집된 수백만 개의 데이터 포인트는 인간 생물학에서 직접 생성된 더 작은 데이터셋보다 예측 가치가 낮을 수 있습니다. 이 구별은 약물 개발에서 특히 중요합니다. 여기서 목표는 단순히 예측이 아니라 임상적 성공으로 이어지는 예측입니다.
고신뢰도 인간 생물학적 데이터는 전통적인 실험실 데이터셋과 여러 중요한 방면에서 다릅니다. 생물학적 기능을 캡처합니다. 조직, 세포 구조, 관류, 대사, 약리학 간의 관계를 보존합니다. 환자 역사, 임상적 특성, 분자 측정 및 동일한 생물학적 시스템 내의 기능적 반응을 포함합니다. 가장 중요한 것은 실제로 인간에서 존재하는 생물학을 측정합니다.
AI가 복잡한 데이터에서 미묘한 패턴을 추출하는 능력이 증가함에 따라, 이러한 패턴의 품질은 기본적인 생물학의 품질과 분리할 수 없습니다.
다음 경쟁 우위는 인간 데이터 인프라일 수 있습니다
과거 수년 동안 거대한 투자가 기초 모델, 컴퓨팅 인프라 및 특수한 AI 아키텍처에 투자되었습니다. 그러나 인간 생물학적 데이터를 체계적으로 생성하기 위한 인프라에 대한 관심은 상대적으로 적었습니다.
인간 생물학적 표본은 본질적으로 제한적이며 일부 기증 인프라와 통합되어야 합니다. 표준화는 여전히 도전적입니다. 실험 프로토콜은 재현 가능해야 합니다. 메타데이터는 포괄적이어야 합니다. 다중 오믹스 측정, 이미징, 기능적 분석 및 임상적 맥락이 모두 컴퓨팅 학습을 위한 일관된 데이터셋으로 통합되어야 합니다.
이것은 전통적인 소프트웨어 엔지니어링과 다릅니다. 대신, 재현 가능한, 규제기관이 준비된 데이터셋을 수년 동안 생성할 수 있는 조정된 생물학적 작동이 필요합니다. 클라우드 인프라가 현대 소프트웨어 개발에 필수적인 것처럼 인간 생물학적 인프라는 미래의 AI 기반 치료제에 필수적일 수 있습니다. 오늘날 이러한 인프라에 투자하는 조직은 궁극적으로 내일의 AI 모델이 무엇을 학습할 수 있는지 결정할 수 있습니다.
규제기관은 이러한 방향으로 이동하고 있습니다
중요한 것은, 이 논의는 학술적 호기심을 넘어서는 것입니다. 규제기관 자체가 인간 관련 증거를 강조하고 있습니다. FDA는 새로운 접근 방식 방법론(NAMs)에 대한 지원을 확대하고, 경로를 정의하고, 컴퓨팅 모델, 오간-온-칩 기술, 고급 체외 시스템 및 기타 인간 관련 접근 방식이 규제 결정에 기여할 수 있는 방식을 설명하고 있습니다.
이 시프트는 중요한 현실을 인정합니다. 컴퓨팅 방법이 더 복잡해짐에 따라, 예측에 대한 확신은 생물학적 증거에 대한 확신에 달려 있습니다. 더 나은 유효성은 더 나은 인간 데이터가 필요하며, 더 나은 인간 데이터는 각 모델의 근원에 있어야 합니다.
다음 10년은 데이터 품질로 정의될 것입니다
제약 산업은 여러 기술 혁신을 경험했습니다. 고처리량 스크리닝에서 다음 세대 시퀀싱까지. 각 기술은 사용 가능한 데이터의 양을 확대했지만, 이 분야에서 AI의 적용은 다릅니다.
그것의 성공은 더 많은 데이터를 생성하는 것뿐만 아니라 인간 생물학을 더 충실히 나타내는 데이터를 생성하는 것에 달려 있습니다. 기초 모델이 점점 더 접근 가능해짐에 따라, 알고리즘의 우위만으로는 더 이상 지속되지 않을 수 있습니다. 차별화된, 고품질의 인간 생물학적 데이터에 대한 접근이 제약 생태계 전반에서 주요 경쟁 우위로 나타날 수 있습니다. 이것은 궁극적으로 임상적 성공을 개선하는 것이 아니라 단지 발견을 가속화하는 것인 경우 특히 그렇습니다.
Anthropic의 약물 개발 분야 진출은 최근 수년 동안 AI가 이루어낸 놀라운 발전을 반영합니다. 또한 산업이 다음에 답해야 할 질문을 강조합니다. 만약 AI가 실제로 의학을 혁신할 수 있다면, 그 모델은 어떤 생물학적 기초 위에 서 있을까요?
AI 파워드 약물 발견의 미래는 분명히 더 나은 알고리즘에 달려 있을 것입니다. 그러나 그것은 인간 생물학적 데이터 인프라를 구축하는 것에 더 많이 달려 있을 수 있습니다. 이러한 인프라는 실제로 인간 생물학을 가르칠 수 있는 알고리즘을 제공할 것입니다.












