사상 리더

코드에서 치료까지: 다음 AI 혁명은 손과 눈이 필요하다

mm
Unite.AI를 Google의 선호 소스에 추가
A diverse female scientist in smart glasses works alongside a sophisticated dual-arm robotic lab system in a futuristic wet lab.

에이전트 시스템, XR 스마트 글래스, 로봇공학이 인간을 강화하는 방법 – 대체하는 것이 아니라

우리는 인공 지능에서 역설을 겪고 있다.

화면에서 AI는 초인적이다. 대규모 언어 모델은 몇 초 안에 기능적인 Python 코드를 작성한다. 생성 시스템은 몇 분 안에 현실적인 이미지와 비디오를 생성한다. 노벨상 수상 시스템인 AlphaFold는 거의 모든 알려진 단백질의 구조를 예측했다. 디지털 승리들은 쌓이고 있다.

그러나 생물의학 연구의 물리적 세계에서는 발견의 과정은まだ 수동적이다. 우리는 아직 과학이나 의학에서 AI가 가속화되는 것을 느끼지 않는다. 숫자는 문제의 심각성을 보여준다. 1,500명 이상의 과학자를 대상으로 한 랜드마크 네이처 설문조사에 따르면, 과학자 중 70% 이상이 다른 연구자의 실험을 재현하려고 시도했지만 실패했다. 더 문제는 과학자 중 절반이 자신의 연구를 재현하지 못했다는 것이다. 암 생물학에서 8년간의 재현성 프로젝트는 고영향력 발견의 40%만 재현할 수 있었으며 68%의 실험은 재현을 시도하기 위해 충분한 문서화가 없었다.

이것은 현대 과학의 더러운 비밀이다: 우리는 발견 문제가 아니라 지식 캡처 문제를 가지고 있다. 임계적인 실험 세부 정보는 연구자의 머릿속에 저장되어 있지 않다. 프로토콜은 변경된다. 암묵적인 지식은 훈련생이 졸업할 때 문을 나서면 사라진다. 출판된 문헌을 기반으로 훈련된 AI 시스템은 이러한 간격을 모두 상속한다.

기본적인 문제는 디지털 시뮬레이션에서 새로운 단백질을 설계할 수 있는 AI지만 실제로 시험管을 잡거나 가설을 검증할 수 없다는 것이다. 그것은 예측과 측정 사이의 루프를 닫을 수 없다. 그것은 경험豊富한 과학자의 손과 기술을 볼 수 없다.

이 “실행 간격”은 AI 혁명이 의학 혁명이 되지 못하는 가장 큰 병목 현상이다. 대부분의 로봇 공학 회사들은 아직 기계가 세탁물을 접거나 식기세척기를 채우는 것을 가르치고 있다. 그러나 의학 분야와 같은 진정으로 변革적인 능력에서는 뒤처지고 있다.

이를 해결하려면 우리는 채팅봇을 넘어서 AI 공동 연구자, 디지털 세계와 물리적 세계를 연결하는 에이전트 시스템을 개발해야 한다. 스탠퍼드에서 우리는 LabOS를 개발하고 있다. LabOS는 디지털-물리적 AI 프레임워크로 AI 에이전트, 확장 현실(XR) 스마트 글래스, 협력 로봇이 어떻게 결합하여 이 루프를 닫고 과학 실험을 인간과 기계 사이의 협력적인 대화로 변환하며 현재 손실되는 지식을 자동으로 캡처하는지 보여준다.

대きな 간격: AI가 “눈”과 “손”을 필요로 하는 이유

가장 가시적인 AI의 승리들은 환경이 완전히 디지털인 경우에 발생했다: 코드 저장소, 큐레이션된 데이터셋 또는 시뮬레이션 벤치마크(여기서 AI는 가상 비즈니스 또는 디지털 투자를 실행하는 경쟁을 한다).

습식 실험실은 다르다. 생물학, 일반적으로 과학적 발견은 매우 노이즈가 많은 과정이다. 기기들은漂移하고, 운용자는 즉흥적으로 행동하며 “프로토콜”은 종종 사람들의 머릿속에 있다. 깨끗한 결과와 실패한 실행 사이의 차이는 시험관의 각도, 섞기 패턴, 시약 대체 또는 10분 더 긴 부화일 수 있다. 이러한 맥락적 세부 사항은 종종 논문에 포함되지 않으며 AI 모델이 데이터셋을 넘어 일반화하기 위해 필요한 정확히 그런 세부 사항이다.

그것이为什么 실험실 등급 AI는 “눈”(맥락에서 발생하는 것을 인식하기 위해)과 “손”(표준화하고 안전하게 자동화하는 고변동성 단계를 위해) 및 “기억”(실제로 발생한 것을 기록하기 위해)가 필요한 이유이다. 이러한 기능이 없으면 모델은 추천할 수 있지만 검증된 물리적 실행을 신뢰할 수 없게 하거나 계획과 현실이 다를 때 실패를 설명할 수 없다.

채팅봇을 넘어서: 공동 조종사에서 공동 연구자까지

에이전트 AI라는 용어는 때때로 느슨하게 사용된다. 생물의학적 환경에서 이는 정확한 것을 의미해야 한다: 목표(예: CRISPR 유전자 편집 효율 최적화 및 오프 타겟 최소화)를 분해하여 작업 시퀀스를 실행하고 결과를 평가하며 제약과 감사 가능한 의사 결정 아래 계획을 적응시키는 시스템이다.

이것은 중요하다. 연구 워크플로는 단일 모델 호출이 아니다. 그것은 가설 공식화, 실험 설계, 데이터 처리, 통계적 테스트 및 해석을 포함하는 엔드 투 엔드 파이프라인이다. 최근 약물 발견에 대한 사고는 이러한 파이프라인을 확장하는 에이전트 시스템을 강조하기 시작했다(예: Unite.AI의 소분자 발견 에이전트에 대한 논의).

소프트웨어 공학에서 우리는 이미 초기 경험적 증거를 보아 왔다. AI 공동 조종사는 개발자의 처리량을 증가시킬 수 있다. 생물의학에서 유사한 기회는 코드를 작성하는 것이 아니라 프로토콜과 도구를 작성하고 검증하는 것이다. 데이터를 구조화하고 실행을 모니터링하고 예측과 측정 사이의 루프를 닫는 것이다. 실험실에서 인간 과학자와 연결하는 것이다.

LabOS: AI가 미래의 실험실 운영 체제에서 실행될 때

스탠퍼드에서 AI4Science를 위한我们的 작업에서, 우리는 다음과 같은 구조적 변화를 탐구하고 있다:

1. 디지털(건조) 실험실과 물리적(습식) 실험실을 연결하는 엔드 투 엔드 “실험실 운영 체제”를 설계한다.

전제는 간단하다: 실험실 노트북이 과학의 기억이라면 실험실 운영 체제는 실행 계층이어야 한다. 의도를 캡처하고 이를 동작으로 변환하고 결과를 관찰하고 모든 실행을 구조화된 지식으로 변환해야 한다.

[…이미지 설명…]

2. 디지털(건조) 실험실에서 자기 진화 계획 및 도구 구축

디지털(건조) 실험실에서 우리는 AI가 이미 잘하는 것을 할 수 있다: 검색, 종합 및 제안. 그러나 우리는 또한 자기 개선이 가능하도록 해야 한다. 새로운 과학을 “환상”으로 만들기보다는 피드백에서 더 나은 도구와 워크플로를 학습하는 것이다.

실제적인 디지털 실험실 루프는 네 가지 반복 단계로 구성될 수 있다:

  • 계획(가설 + 설계): 가설을 제안하고 실험 변수를 선택하고 혼잡 변수를 예상하고 측정 가능한 엔드 포인트를 지정한다.
  • 코딩(구현): 분석 스크립트, 시뮬레이션 파이프라인 및 기기 제어 템플릿을 생성하거나 적응한다.
  • 비평 에이전트(추론 + 평가): 가정을 스트레스 테스트하고 통계적 파워를 확인하고 제어를 제안하고 가능성 있는 실패 모드를 플래그한다.
  • 도구 생성(검색 + 개발): 워크플로우에 구성 요소가 缺하면(파서, QC 루틴, 대시보드 등) 구축하고 도구 집합에 추가한다.

3. 물리적(습식) 실험실에서 AI – XR 스마트 글래스와 로봇공학을 사용한 AI

물리적(습식) 실험실은 시스템이 신뢰를 얻거나 잃는 곳이다. 목표는 과학자를 대체하는 것이 아니라 마찰과 오류를 줄이고 관찰 가능성을 높이는 것이다.

우리는 물리적 실험실 루프를 다음과 같은 네 가지 보완 기능으로 본다:

  • 자동 기록 및 문서화: 동작, 타임스탬프, 기기 설정 및 편차를 자동으로 캡처하여 문서화가 사후 작업이 되지 않도록 한다.
  • 실행을 위한 지식 캡처: 실행을 구조화된 질의 가능한 아티팩트(프로토콜 버전, 매개변수 집합, QC 결과)로 변환하고 데이터 관리 원칙과 일치한다.
  • 실시간 비전-언어 가이드: 다중 모달 모델을 사용하여 장면을 해석하고(운용자가 무엇을 하는지, 어떤 시약을 가지고 있는지) 단계별 가이드와 안전 점검을 제공한다.
  • 코봇/로봇 통합: 반복적인 단계를 표준화하고 안전한 인수를 가능하게 하고 변동성을 줄인다.

이 아키텍처는 더广い 분야의 방향과 일치한다: “자율 주행” 또는 자동 실험실이 기계 학습과 자동화를 결합하여 다음 실험을 계획한다. LabOS는 인간 인터페이스 레이어를 더緊密하게 추가한다. 따라서 자율성이 투명성의 비용 없이 이루어지지 않는다.

실험실 등급 AI는 단순히 “데이터셋上的 AI”가 아니다

생물의학/과학적 초인텔리전스용 AI 시스템은 후견적 평가 또는 시험에서 인상적일 수 있다. 그러나 물리적 실험실에서 성과가 낮다. 이유는 단일 버그가 아니다. 모델의 가정과 실험실의 현실 사이의 불일치이다.

세 가지 간격이 반복적으로 나타난다:

  • 맥락 간격: 데이터셋은 일반적으로 운용자가 중요하다고 생각하는 맥락적 변수를 생략한다.
  • 동작 간격: 많은 AI 시스템은 무엇을 해야 하는지 추천할 수 있지만 검증된 물리적 단계로 추천을 신뢰할 수 있게 번역할 수 없다.
  • 피드백 간격: 실행에서 구조화된 고품질 피드백이 없으면 모델은 실패에서 무엇을 배울 수 없으며 과학자는 왜 모델이 실패했는지 감사할 수 없다.

이 간격을 닫는 것은 새로운 신경망 아키텍처를 발명하는 것보다 실험실을 기계에게 읽을 수 있게 하고 AI가 인간과 협업할 수 있도록 하는 도구, 인터페이스 및 데이터 계약을 구축하는 것이다.

신뢰에 의한 설계: 행동할 수 있는 AI를 위한 안전 및 거버넌스

발견 연구에서 에이전트 AI는 정확성에 대한 일반적인 우려를 제기하지 않는다. 행동할 수 있기 때문에 새로운 실패 모드를 도입한다. 실험실에서 행동은 낭비, 손상 또는 오도된 결론의 가능성을 의미한다. 특히 실험이 임상 가설로 이어질 때 더욱 그렇다.

유용한 마인드는 AI를 포함한 실험실 스택을 보증이 필요한 사회 기술적 시스템으로 간주하는 것이다. 몇 가지 기존 프레임워크가 도움이 되지만 실험실 현실로 번역되어야 한다:

  • 계속되는 위험 관리: NIST의 AI 위험 관리 프레임워크(AI RMF 1.0)는 AI 위험을 매핑, 측정 및 관리하기 위한 실제 어휘를 제공한다.
  • 의료 관련 AI를 위한 규제적 조정: FDA의 AI/ML 소프트웨어를 의료 기기로서(AI/ML SaMD) 작업, 관련 지침을 포함한 행동 계획은 AI가 환자 치료에 영향을 미칠 때 좋은 관행이 무엇인지에 대한 구체적인 관점을 제공한다.

유전자 편집 및 기타 고의도 영역을 위한 거버넌스는 이미 세계적인 대화이다. 인간 유전자 편집에 대한 적절한 감시 메커니즘 및 책임 있는 거버넌스에 대한 권장 사항이 논의되고 있다. LabOS와 같은 시스템은 준수를 더 쉽게 만들도록 설계되어야 한다.

체크리스트: 과학적 발견을 위한 안전한 AI 공동 연구자의 제어

우리의 견해에 따르면, 안전을 고려한 실험실 운영 체제는 다음 설계를 구현해야 한다:

  • 기본 제공: 모든 데이터셋, 프로토콜 버전 및 모델 출력은 입력 및 타임스탬프에 추적 가능해야 한다.
  • 구속된 자율성: 시스템에는 명시적인 권한(확인 없이 수행할 수 있는 작업)과 에스컬레이션 규칙(확인을 요청해야 하는 경우)이 있어야 한다.
  • 인간 오버라이드 및 우아한 퇴행: 센서 또는 데이터 스트림이 실패하거나 불확실성이 높을 때 시스템은 더 안전하고 더 단순한 모드로 돌아가야 한다.
  • 계속적인 검증: 실시간 예측은 물리적 실험실에서 검증되어야 하며 물리적 실험실 실행에는 QC 게이트가 있어야 한다.
  • 보안 및 이중 사용 인식: 실험실 인프라를篡改으로부터 보호한다.

모두를 위한 힘: AI 공동 연구자가 과학을 평준화할 수 있는가?

AI-XR “공동 연구자”의 가장 매력적인 약속 중 하나는 엘리트 기관을 위한 속도 증가가 아니라 모든 사람을 위한 접근성이다. 현재 소규모 실험실, 스타트업 및 원격/농촌/지역 클리닉을 제한하는 것을 고려해 보라:

  • 골드 표준 프로토콜 및 기기에 대한 전문가 지식에 대한 접근이 제한된다.
  • 교육, 실수, 재작업의 상대적인 비용이 높다.
  • 도구가 단편화되어 있다: 노트북, 스프레드시트, 기기 로그 및 분석 스크립트는 거의 깨끗하게 연결되지 않는다.

실험을 실행하는 contexto에서 실행을 안내하고 자동으로 발생한 것을 캡처하며 이전 실행을 기반으로 다음 최선의 단계를 제안할 수 있는 시스템은 고급 어세이를 더 재현 가능하게 만들 수 있다. 원칙적으로 분산된 임상 연구를 지원할 수도 있다. 프로토콜은 일관되게 실행되어야 하며 자원이 다를 수 있다.

타임라인: 모든 과학자와 임상의가 공동 연구자를 얻을 때

간단히 말하면, 우리는 일부 고가치, 고빈도 작업(예: 실험실에서 약물을 신뢰할 수 있게 생성하는 것)에 대해서는 더 가깝고 다른 작업(예: AI가 암 또는 알츠하이머병과 같은 큰 문제를 완전히 해결하는 것)에 대해서는 대부분의 데모보다 더 멀다. 현실적인 로드맵은 다음과 같다:

  1. 근거리(1년 이내): 행정 부담을 줄이는 워크플로우 공동 조종사: 프로토콜 초안, 문헌 종합, 분석 템플릿 및 자동화된 QC 보고서. 제한 요인은 통합이며 모델 기능이 아니다.
  2. 중기(1-2년): 실험실에서 공동 실행 시스템: XR 글래스 가이드, 자동 문서화 및 선택적 로봇공학을 위한 고변동성 단계. 신뢰는 감사 트레일과緊密한 인간-루프 설계에 달려 있다.
  3. 장기(3년 이상): 발견을 번역에 연결하는 도메인 간 공동 연구자: 실험실 데이터를 임상 엔드 포인트에 연결하고 안전 신호를 모니터링하고 시험을 설계하는 것을 도와주면서 규제 및 윤리적 기대에 따라 준수한다.

코드에서 치료까지: 1000배 과학적 발견으로 나아가기

LabOS는 간단한 질문에 대한 하나의 시도이다: 실험이 대화로 실행될 수 있다면? 의도, 실행 및 증거가 연결된다면? 이러한 시스템을 잘 구축하면 생물의학 및 많은 물리 과학 분야에서 번역 간격을 해결하는 데 도움이 될 수 있다. 그러나 잘못 구축하면 재현 불가능성을 증폭시키고 새로운 안전 위험을 생성할 수 있다.

다음 몇 년 동안 가장 중요한 작업은 기초적인 것이다: 표준화된 데이터 및 디바이스 인터페이스를 구축하여 운영 체제를 구축하고(예를 들어 iOS가 모든 유형의 앱을 실행하는 것처럼) AI 벤치마크를 구축하여 실행 및 불확실성을 포함하고(예: LabOS의 LabSuperVision 벤치마크) 실제 세계에 배포를 시작하여 혁신을 장려하면서 환자와 연구의 무결성을 보호한다.

연구자와 임상의에게 질문은 AI가 실험실에 들어갈 것인가가 아니다. 이미 들어왔다. 질문은 그것을 분리된 도구의 모음으로 통합할 것인가, 아니면 신뢰할 수 있고 감사 가능한 시스템으로 설계된 것인가이다. 생물의학의 현실을 위한 것이다.

제안된 읽기 및 출처

  • 재현성 설문조사(네이처, 2016): https://www.nature.com/articles/533452a
  • CRISPR-GPT 동료 검토 기사(네이처 생물의학 공학): https://www.nature.com/articles/s41551-025-01463-z
  • 스탠퍼드 의학 뉴스(2025): https://med.stanford.edu/news/all-news/2025/09/ai-crispr-gene-therapy.html
  • LabOS 사전 인쇄물(아르시브): https://arxiv.org/abs/2510.14861
  • LabOS 및 LabSuperVision 벤치마크 웹사이트: https://ai4lab.stanford.edu
  • NIST AI 위험 관리 프레임워크(AI RMF 1.0): https://nvlpubs.nist.gov/nistpubs/ai/NIST.AI.100-1.pdf
  • FDA 개요: AI/ML 소프트웨어를 의료 기기로서: https://www.fda.gov/medical-devices/software-medical-device-samd/artificial-intelligence-software-medical-device
  • FAIR 데이터 원칙(과학적 데이터, 2016): https://doi.org/10.1038/sdata.2016.18
  • Unite.AI: 소분자 약물 발견의 병목 현상을 깨어나다: https://www.unite.ai/how-ai-is-breaking-down-the-bottlenecks-in-small-molecule-drug-discovery/
  • Unite.AI: 로봇 수술의 새로운 시대: https://www.unite.ai/how-ai-is-ushering-in-a-new-era-of-robotic-surgery/

Le Cong, PhD, 는 스탠퍼드 대학교의 병리학 및 유전학 부교수이며, 그의 그룹은 디지털 연구실 추론을 물리적 연구실 실행에 연결하여 과학적 발견에서 인간을 강화하기 위한 AI-네이티브 유전체 공학 및 AI-XR-로봇 시스템을 개발합니다.