파트너십

Elsevier, LG AI Research의 화학 비전 모델을 Reaxys에 통합

mm
Unite.AI를 Google의 선호 소스에 추가

Elsevier와 LG AI Research 발표했다 2026년 9월 15일, LG AI Research가 개발한 화학 전용 AI 비전 기술이 이제 Elsevier의 콘텐츠 추출 및 큐레이션 프로세스에 Reaxys, Elsevier의 발견 화학 솔루션에 사용되어 특허와 과학 문헌에서 이미지, 도면 및 반응 스키마로만 나타나는 물질들을 검색 가능하게 만든다.

양사는 특허 및 학술지 콘텐츠의 이미지에서 물질 정보를 이전보다 더 빠르고 정확하게, 그리고 더 큰 규모로 포착할 수 있게 되었다고 밝혔다. 이번 작업은 Elsevier의 콘텐츠 추출 및 과학적 큐레이션을 강화하여 Reaxys를 위한 물질, 반응, 생물활성, 생물학적 표적 및 물질 특성의 데이터를 향상시킨다.

이미지 기반 화학이 검색하기 어려운 이유

발표에 따르면, 화학자들이 의존하는 물질 및 반응 정보의 대부분은 검색 가능한 텍스트가 아닌 도표, 도면 및 반응 스키마를 통해 전달된다. 이러한 화학 정보가 검색되지 않으면, 연구자들은 해당 화합물이나 반응이 이미 기술되었는지 확인하기 위해 문서를 직접 검토해야 할 수 있다. 화학 도면은 결합, 원자, 입체화학 및 공간 관계를 통해 의미를 전달하므로, 결합을 오해하는 모델은 잘못된 화합물을 식별하고, 구조를 놓치는 모델은 화학자에게 불완전한 그림을 제공한다. 이러한 문제는 특히 신기술 검색, 경쟁 정보 파악, 합성 계획 분야와 복잡한 구조가 추출 및 색인하기 어려운 무기 및 유기금속 화학 분야에서 가장 심각하다.

MolMole 모델 및 보고된 벤치마크

이 기술은 분자 검출, 반응 다이어그램 파싱 및 광학 화학 구조 인식(OCSR)을 하나의 모델에 결합했으며, LG AI Research가 발표한 벤치마크 보고서에 따르면 전체 문서 페이지에서 화학을 추출하는 데 있어 대안을 능가한다. 2025년 5월 7일 LG AI Research 연구 블로그 게시물은 이 모델을 MolMole이라고 밝히며, 그룹의 Deep Document Understanding 프로그램 하에 개발되었고, 일반 문서의 텍스트, 그래프 및 표뿐만 아니라 화학 논문과 특허의 분자 구조식 및 반응식도 해석할 수 있는 AI를 구축하는 것을 목표로 한다.

블로그 게시물에 따르면, MolMole은 잘라낸 이미지가 아니라 전체 PDF 문서를 입력으로 받아 한 번에 문서에서 인식된 화학 데이터를 반환한다. 이 모델은 세 개의 모듈로 구성된다. ViDetect는 PDF 페이지 내의 분자 구조 영역을 감지하고 경계 상자로 표시한다. ViReact는 반응 다이어그램 내에서 반응물, 반응 조건 및 생성물의 위치를 식별하고 각 영역을 분류한다. ViMore는 인식된 구조를 SMILES, InChI 및 Mol 형식을 포함한 표준 화학 표현으로 변환하며, 잡음이 많은 스캔 기반 특허 페이지에 특화된 기술을 적용한다.

LG AI Research는 ViMore가 네 가지 표준 OCSR 벤치마크(CLEF, JPO, UOB, USPTO) 중 세 가지에서 최첨단 결과를 달성했으며, DECIMER Image Transformer, MolScribe 및 MolGrapher보다 우수하고, 특히 일본 특허 문서에서 추출한 저해상도 이미지로 구성된 도전적인 JPO 데이터셋에서 다른 모델보다 뛰어났다고 보고했다. LG 자체 벤치마크에서는 300개의 특허 페이지와 250개의 논문 페이지를 각각 평가하여 특성을 반영했으며, ViDetect와 ViMore를 결합한 파이프라인이 정밀도와 재현율 측면에서 Decimer Segmentation 및 Image Transformer, MolDetect 및 MolScribe보다 우수했으며, ViReact는 ReactionDataExtractor2.0 및 RxnScribe보다 뛰어났다고 밝혔다.

arXiv에 게시된 원본 논문은 2025년 4월 30일에 처음 제출되었으며 2025년 5월 8일에 수정되었다. 이 논문은 MolMole을 시각 기반 딥러닝 프레임워크로 설명하며, 분자 검출, 반응 다이어그램 파싱 및 OCSR을 하나의 파이프라인으로 통합하여 페이지 수준 문서에서 직접 화학 데이터를 추출한다. 표준 페이지 수준 벤치마크와 평가 지표가 부족함을 지적하며, 저자들은 분자 경계 상자, 반응 라벨 및 MOL 파일이 주석된 550페이지 테스트 세트와 새로운 평가 지표를 제시하고, MolMole이 기존 툴킷보다 벤치마크와 공개 데이터셋 모두에서 우수함을 보고한다.

Elsevier의 워크플로우 내에서 각 추출 파이프라인은 실시간 적용 전에 기존 Reaxys 벤치마크와 비교 검증되며, 전체 파이프라인은 널리 사용되기 전에 Elsevier의 데이터와 워크플로우 도구를 통해 테스트 기간을 거쳤다고 발표에서 밝혔다.

임원 발언 및 다음 단계

Elsevier의 라이프 사이언스 매니징 디렉터인 Mirit Eldor는 이번 파트너십을 통해 화학자들이 도표에서 화학 정보를 더 많이 추출해 Reaxys에 정제된 검색 가능한 증거로 옮김으로써 시간을 절약할 수 있게 되었다고 말했다. “도표에 묻힌 구조는 막다른 길이 아니라 증거가 되어야 한다”라고 그녀는 언급했다.

LG AI Research의 AI Biz Transformation Unit 책임자인 Hwayoung Edward Lee는 이 모델이 모든 결합과 공간 배치가 의미를 갖는 복잡한 시각 화학 표현을 해독하도록 설계되었으며, Elsevier와의 통합을 통해 원시 시각 데이터를 연구자를 위한 구조화된 지식으로 변환한다고 말했다.

양 기관은 반응 추출이 협업의 다음 단계이며, 이미지 기반 추출을 개별 물질을 넘어 확장해 Reaxys를 통해 제공되는 반응 증거를 확대한다는 입장을 밝혔다. 또한 함께 해결할 추가 고객 과제를 탐색하고 있으며, LG AI Research의 전문 AI 역량과 Elsevier의 화학 콘텐츠, 과학 전문성 및 큐레이션을 결합하고 있다. 이 작업은 Elsevier의 Responsible AI Principles 및 Privacy Principles를 따른다고 양사는 말했다.

아리아 블룸은 생명 과학 및 유전체 연구에서 인공지능이 어떻게 변화를 가져오는지를 탐구하는 인공지능 생성 저널리스트입니다. 그녀의 글은 정밀함과 생명 과학의 미래에 대한 깊은 호기심을 결합합니다.
합성 생물학에서 개인화된 의학까지, 아리아는 기계 학습이 인간 건강 혁신을 가속화하는 방법을 분석합니다.
아리아 블룸이 작성한 기사들은 인공지능에 의해 생성되어 Unite.AI의 편집 팀에 의해 정확성과 준수를 위해 검토됩니다.