인터뷰

세라핌 바초글루 박사, 시어 최고 데이터 책임자 – 인터뷰 시리즈

mm
Unite.AI를 Google의 선호 소스에 추가

세라핌 바초글루 박사는 시어의 최고 데이터 책임자입니다. 시어에 합류하기 전에, 세라핌은 인시트로의 최고 데이터 책임자로 재직하며, 의약품 발견을 위한 기계 학습과 데이터 과학을 이끌었습니다. 인시트로 이전에는, 일루미나의 응용 및 계산 생물학 부문 부사장으로 재직하며, 인공지능 및 분자 어세이의 연구 및 기술 개발을 이끌었습니다.

게놈학 분야에 처음 관심을 가졌던 것은 무엇인가?

저는 컴퓨터 과학 박사 과정 중에 보니 버거가 가르친 계산 생물학 수업을 들으며 관심을 가졌습니다. 당시 인간 게놈 프로젝트가 진행 중이었고, 에릭 랜더가 미디어 게놈 센터를 이끌고 있었으며, 저를 프로젝트에 참여시켰습니다. 인간 게놈 프로젝트에 동기부여를 받은 저는 인간과 마우스 DNA의 전체 게놈 조립과 비교 게놈학에 대해 연구했습니다.

그런 다음 스탠퍼드 대학교에서 컴퓨터 과학부 교수로 15년 동안 재직하며, 30명의 매우 재능 있는 박사 과정 학생들과 많은 박사 후 연구원 및 학부 학생들을 지도했습니다. 저의 팀은 알고리즘, 기계 학습 및 소프트웨어 도구 개발을 통해 대규모 게놈 및 생물 분자 데이터를 분석하는 데 중점을 두었습니다. 2016년에 스탠퍼드 대학교를 떠나 일루미나에서 연구 및 기술 개발 팀을 이끌었습니다. 이후 저는 산업계에서 연구 개발 팀을 이끌면서 팀워크, 비즈니스 측면, 사회에 대한 직접적인 영향이 학계보다 산업계에서 더 크다는 것을 알게 되었습니다. 저는 DNAnexus, Illumina, Insitro 및 현재 시어를 포함한 다양한 혁신적인 회사에서 일했습니다. 계산 및 기계 학습은 바이오테크놀로지에서 기술 개발, 데이터 수집, 생물학적 데이터 해석 및 인간 건강으로의 번역에 걸쳐 전 기술 체인에서 필수적입니다.

過去 20년 동안, 인간 게놈의 서열 분석은 훨씬 더 저렴하고 빠르게 되었습니다. 이는 게놈 서열 분석 시장의 급격한 성장과 생명 과학 산업에서 더广泛한 채택으로 이어졌습니다. 우리는 이제 인구 게놈, 다중 오믹스 및 표현형 데이터를 충분한 크기로 Revolutionizing 건강 관리를 포함한 예방, 진단, 치료 및 의약품 발견을 의미 있게 혁신할 수 있는 시점에 있습니다. 우리는 게놈 데이터의 계산적 분석을 통해 개인의 질병의 분자적 기초를 점점 더 많이 발견할 수 있으며, 특히 암 및 희귀 유전 질환의 경우 개인에게 맞춤형 및 타겟팅된 치료를 받을 기회가 있습니다. 의학以外의 분야에서도 기계 학습과 게놈 정보를 결합하여 우리의 가계, 영양 등에 대한 통찰력을 얻을 수 있습니다. 향후 몇 년 동안 개인화된, 데이터 기반 의료가 처음에는 희귀 질환 환자와 같은 특정 인구 집단을 대상으로広が으며, 점차적으로 더广泛한 대중에게 확대될 것입니다.

현재 역할 이전에 인시트로의 최고 데이터 책임자로 재직하며, 의약품 발견을 위한 기계 학습과 데이터 과학을 이끌었습니다. 그 기간 동안 기계 학습을 통해 의약품 발견을 가속화하는 데 어떤 주요 관찰이 있었나요?

전통적인 의약품 발견 및 개발의 “시험 및 오류” 패러다임은 비효율성과 매우 긴 시간선으로 고통받고 있습니다. 한 약물이 시장에 나올 때까지 10억 달러 이상의 비용과 10년 이상의 시간이 걸릴 수 있습니다. 기계 학습을 이러한 노력에 통합함으로써 우리는 비용과 시간을 몇 단계에서 크게 줄일 수 있습니다. 하나의 단계는 목표 식별입니다. 여기서 질병 표현형 또는 더 건강한 세포 상태로의 재전환을 조절하는 유전자 또는 유전자 세트를 대규모 유전적 및 화학적 교란 및 표현형 리드아웃을 통해 식별할 수 있습니다. 또 다른 단계는 화합물 식별 및 최적화입니다. 여기서 기계 학습 기반의 실리코 예측 및 체외 스크리닝을 통해 소분자 또는 기타 모달리티를 설계할 수 있으며, 또한 약물의 원하는 속성인 용해도, 투과성, 특이성 및 비독성을 최적화할 수 있습니다. 가장 어려운 측면은 인간에게 번역하는 것입니다. 여기서 올바른 모델을 선택하는 것이 중요합니다. 즉, 유도된 다능성幹細胞 유래 세포 라인 대신 원발성 환자 세포 라인 또는 조직 샘플을 사용하는지, 또는 동물 모델을 사용하는지에 따라 질병에 대한 데이터 및 기계 학습의 번역 가능성이 반영됩니다.

시어 바이오는 프로테옴의 비밀을 해독하여 인간 건강을 개선하기 위한 새로운 방법을 개척하고 있습니다. 프로테옴이란 무엇입니까?

프로테옴은 유기체가 시간의 경과에 따라 및 환경, 영양 및 건강 상태에 따라 생성하거나 수정하는 단백질의 변경 가능한 집합입니다. 프로테오믹스는 주어진 세포 유형 또는 조직 샘플 내의 프로테옴을 연구하는 것입니다. 인간이나 다른 유기체의 게놈은 정적입니다. 출생 시의 게놈은 일생 동안 동일하게 복제되어 각 세포에 복사됩니다. 프로테옴은 동적이며 몇 년, 일,甚至 분 단위로 변경됩니다. 따라서 프로테옴은 표현형 및 궁극적으로 건강 상태에 더 가깝고, 게놈보다 건강을 모니터링하고 질병을 이해하는 데 더 정보가 풍부합니다.

시어에서는 복잡한 샘플인 혈장과 같은 단백질 및 프로테오폼에 대한 더 깊은 통찰력을 제공하는 새로운 프로테옴 접근 방식을 개발했습니다.

시어의 Proteograph 플랫폼은 무엇이며 프로테옴에 대한 새로운 관점을 제공하는 방법은 무엇입니까?

시어의 Proteograph 플랫폼은 라이브러리에서 제조된 나노 입자를 활용하여 단순하고 신속하며 자동화된 워크플로를 통해 프로테옴을 깊이 있고 확장 가능하게 조사할 수 있습니다.

Proteograph 플랫폼은 대규모 동적 범위를 갖는 플라즈마 및 기타 복잡한 샘플에서 탁월한 성능을 발휘합니다. 여기서 전통적인 질량 분석법은 프로테옴의 낮은丰度 부분을 감지할 수 없습니다. 시어의 나노 입자는 비편향된 방식으로 동적 범위에 걸쳐 단백질을 수집하기 위해 설계되었습니다. 일반적인 플라즈마 샘플에서 우리의 기술은 Proteograph를 사용하지 않고 처리된 플라즈마보다 5배에서 8배 더 많은 단백질을 감지할 수 있습니다. 결과적으로 샘플 준비에서 기기까지 데이터 분석에 이르기까지 Proteograph 제품군은 과학자들이 다른 방법으로는 감지할 수 없는 프로테옴 질병 신호를 찾는 데 도움이 됩니다. 우리는 시어에서 프로테옴의 새로운 관문이 열리고 있다고 말합니다.

또한 우리는 과학자들이 대규모 프로테오ژنomik 연구를 쉽게 수행할 수 있도록 허용합니다. 프로테오ژنomik은 게놈 데이터와 프로테옴 데이터를 결합하여 단백질 변이체를 식별하고 게놈 변이체를 단백질丰度 수준과 연결하며, 궁극적으로 게놈과 프로테옴을 표현형과 질병에 연결하고 질병과 관련된 유전적 경로를 해체하기 시작합니다.

현재 시어 바이오에서 사용되는 기계 학습 기술에 대해 논의해 주시겠습니까?

시어는 기술 개발부터 다운스트림 데이터 분석까지 모든 단계에서 기계 학습을 활용하고 있습니다. 이러한 단계에는 다음이 포함됩니다. (1) 우리의 고유한 나노 입자의 설계, जह서 기계 학습이 특정 제품 라인 및 어세이와 함께 작동할 수 있는 물리화학적 속성 및 나노 입자 조합을 결정하는 데 도움이 됩니다. (2) MS 기기에서 생성된 리드아웃 데이터에서 펩타이드, 단백질, 변이체 및 프로테오폼을 감지 및 양화하는 것. (3) 대규모 인구 집단에서 다운스트림 프로테오믹스 및 프로테오ژنomik스 분석.

작년, 우리는 프로테오믹스 방법, 나노 공학 및 기계 학습을 결합하여 단백질 코로ナ 형성 메커니즘을 개선하는 데 대한 논문을 발표했습니다. 이 논문은 나노-바이오 상호 작용을 발견했으며 시어에서 향후 나노 입자 및 제품 개발에 정보를 제공했습니다.

나노 입자 개발을 넘어서, 우리는 변이 펩타이드 및翻訳 후 修飾을 식별하기 위한 새로운 알고리즘을 개발했습니다. 우리는 프로테오폼을 식별하기 위한 방법을 개발했습니다. 우리는 또한 단백질 양화 특성(loci)을 감지하는 방법을 개발했습니다. 우리는 이 작업을 확장하여 深層 학습 기반의 디 ノ보 시퀀싱 방법을 사용하여 원시 스펙트럼에서 펩타이드를 직접 식별할 수 있도록 하고 있습니다.

우리의 팀은 또한 기계 학습 모델을 최적화하고 사용하기 위한 시어 ML 프레임워크를 개발하고 있습니다. 이는 베이즈 최적화를 통한 하이퍼파라미터 조정을 허용합니다.

마지막으로, 우리는 일괄 효과를 줄이고 질량 분석 리드아웃의 정량적 정확도를 높이는 방법을 개발하고 있습니다. 이는 측정된 정량 값을 모델링하여 강度 값의 상관 관계와 같은 기대 지표를 최대화하는 데 도움이 됩니다.

LLM에서 흔히 발생하는 문제인 환각(hallucination)에 대한 해결책은 무엇입니까?

LLM은 대규모 코퍼스에서 훈련된 생성 모델입니다. 훈련 데이터의 기본 통계적 속성을 캡처하고, 텍스트를 생성합니다. 그러나 LLM은 주로 정확성을 위해 훈련되지 않습니다. 강화 학습 및 인간 피드백과 같은 기술을 사용하여 원하는 속성을 훈련할 수 있지만, 완전히 성공적이지는 않습니다. LLM은 주어진 프롬프트에 가장 잘 맞는 텍스트를 생성합니다. 예를 들어, “알렉산더 대왕은 언제 태어났는가?”라는 질문에 대한 올바른答案은 기원전 356년입니다. 그러나 “레지넬라 황후는 언제 태어났는가?”라는 질문에 대한答案은 환각일 수 있습니다. 마찬가지로, LLM이 正解을 찾을 수 없는 질문이나 데이터에 대한回答을 생성할 때, 환각을 일으킬 수 있습니다.

환각을 완전히 해결하는 방법은 아직 없습니다. 이는 LLM의 설계에 내재된 문제입니다. 부분적인 해결책은 적절한 프롬프트를 사용하는 것입니다. 예를 들어, “주의해서, 단계적으로 생각해 보세요”라는 프롬프트를 사용하면 LLM이 환각을 일으킬 가능성이 줄어듭니다. 더 발전된 접근법은 지식 그래프를 사용하는 것입니다. 지식 그래프는 구조화된 데이터를 제공하며, LLM이 생성한 문장을 검증할 수 있습니다. 지식 그래프를 사용하면 LLM이 사실과 일치하지 않는 문장을 생성하지 않도록 제한할 수 있습니다.

환각의 근본적인 문제와, 논리적 추론 및 판단 능력의 부족으로 인해, LLM은 현재 정보를 검색, 연결 및 요약하는 데 강력하지만, 의료 진단 또는 법률 자문과 같은 심각한 응용 분야에서 인간 전문가를 대체할 수 없습니다. 그러나 LLM은 이러한 분야의 인간 전문가의 효율성과 능력을 크게 향상시킬 수 있습니다.

데이터가 가설보다 생물학을 주도하는 미래에 대한 비전을 공유해 주시겠습니까?

전통적인 가설 주도 접근 방식은 대규모 데이터 생성과 기계 학습 모델을 사용하여 데이터를 재구성하는 새로운 패러다임으로 대체되고 있습니다. 이 새로운 패러다임에서, 연구자들은 먼저 대규모 데이터를 생성하고, 기계 학습 모델을 훈련하여 데이터를 재구성합니다. 그런 다음, 모델이 데이터를 정확하게 예측할 수 있을 때, 연구자들은 모델을 해석하여 생물학적 시스템에 대한 통찰력을 얻을 수 있습니다.

LLM은 특히 바이오 분자 데이터를 모델링하는 데 매우 효과적입니다. 이러한 모델은 생물학적 시스템을 인간의 능력을 훨씬 뛰어넘는 세부도에서 모델링할 수 있을 것입니다. 이러한 전환은 향후 10년 동안 점점 더 두드러질 것입니다.

질병 진단 및 의약품 발견에 대한 잠재적인 영향은 무엇입니까?

저는 LLM과 생성적 인공지능이 생명 과학 산업에重大한 변화를 가져올 것이라고 믿습니다. 하나의 분야는 임상 진단입니다. 특히, 희귀하고 어려운 질병 및 암 아형의 경우, 기계 학습 모델은 정확하고 빠른 진단을 제공할 수 있습니다. 우리는 게놈 프로파일, 치료 반응, 의료 기록 및 가족력과 같은 환자 정보를 컴파일하여 진단 정확도를 크게 향상시킬 수 있습니다. 그러나 기계 학습 모델은 독립적으로 운영되지 않을 것입니다. 대신, 의사와 다른 의료 제공자에게 정보를 제공하여 진단과 치료를 지원할 것입니다.

의약품 발견과 개발에서도 기계 학습이 이미 사용되고 있습니다. LLM은 이러한 노력에 추가적인 도구를 제공합니다. 기계 학습 모델은 대규모 바이오 분자 데이터를 모델링하여 약물 표적을 식별하고, 단백질의 활성 부위와 생물학적 기능을 예측할 수 있습니다. 우리는 또한 기계 학습을 사용하여 약물 반응자와 비반응자를 식별하고, 다른 질병에 대한 약물 재사용을 탐색할 수 있습니다. 많은 혁신적인 AI 기반 의약품 발견 회사들은 이미 이러한 방향으로 생각하고 개발을 진행 중이며, 인간 건강과 의약품 발견을 위한 LLM의 배치 및 공공 노력에 대한 추가적인 회사와 노력의 형성을 기대할 수 있습니다.

자세한 인터뷰에 감사드립니다. 더 많은 정보를 원하는 독자는 시어를 방문하십시오.

앙투안은 유나이트.AI의 비전적인 리더이자 공동 설립자로서 AI와 로봇공학의 미래를 형성하고 촉진하는 데 대한 불변의 열정을 가지고 있습니다. 연속적인 기업가로서, 그는 AI가 사회에 전기와 같은 변화를 가져올 것이라고 믿으며, 종종 파괴적인 기술과 AGI의 잠재력에 대해 열광합니다.

作为 미래학자로서, 그는 이러한 혁신이 우리 세계를 어떻게 형성할지 탐구하는 데 헌신하고 있습니다. 또한, 그는 Securities.io의 설립자로서, 미래를 재정의하고 전체 부문을 재구성하는 최첨단 기술에 투자하는 플랫폼을 운영하고 있습니다.