Alianzas

Elsevier integra el modelo de visión química de LG AI Research en Reaxys

mm
Añade Unite.AI a tus fuentes preferidas en Google

Elsevier y LG AI Research anunciaron el 15 de septiembre de 2026 que la tecnología de visión AI específica para química desarrollada por LG AI Research ahora se está utilizando dentro de los procesos de extracción y curación de contenido de Elsevier para Reaxys, la solución de química de descubrimiento de Elsevier, haciendo que las sustancias que aparecen solo como imágenes, dibujos y esquemas de reacción en patentes y literatura científica sean buscables.

Las empresas dijeron que la información de sustancias extraída de imágenes en contenido de patentes y revistas se captura más rápidamente, con mayor precisión y a mayor escala de lo que antes era posible. El trabajo mejora la extracción de contenido y la curación científica de Elsevier de sustancias, reacciones, bioactividades, objetivos biológicos y propiedades de sustancias para Reaxys.

Por qué la química contenida en imágenes ha sido difícil de buscar

Gran parte de la información de sustancias y reacciones en la que confían los químicos se comunica a través de figuras, dibujos y esquemas de reacción en lugar de texto buscable, según el anuncio. Cuando esa química no es buscable, los investigadores pueden verse obligados a revisar los documentos manualmente para confirmar si un compuesto o reacción ya ha sido descrito. Los dibujos químicos codifican significado mediante enlaces, átomos, esterequímica y relaciones espaciales, por lo que un modelo que interpreta mal un enlace puede identificar el compuesto equivocado, mientras que uno que omite una estructura deja a los químicos con una imagen incompleta. Ese desafío es más agudo en áreas como la búsqueda de novedad, la inteligencia competitiva y la planificación de síntesis, y en la química inorgánica y organometálica, donde las estructuras complejas son más difíciles de extraer e indexar.

El modelo MolMole y sus benchmarks reportados

La tecnología combina detección de moléculas, análisis de diagramas de reacción y reconocimiento óptico de estructuras químicas (OCSR) en un solo modelo, y los informes de referencia publicados por LG AI Research indican que supera a las alternativas en la extracción de química de una página completa de documento. Una publicación del 7 de mayo de 2025 en el blog de investigación de LG AI Research identifica el modelo como MolMole, desarrollado bajo el programa Deep Document Understanding del grupo, que tiene como objetivo crear IA que pueda interpretar texto, gráficos y tablas en documentos generales así como fórmulas estructurales moleculares y fórmulas de reacción en artículos y patentes químicas.

MolMole toma documentos PDF completos como entrada en lugar de requerir imágenes recortadas, y devuelve los datos químicos reconocidos de un documento de una sola vez, según la publicación del blog. El modelo consta de tres módulos. ViDetect detecta regiones de estructuras moleculares dentro de las páginas PDF y las marca con cuadros delimitadores. ViReact identifica las posiciones de reactantes, condiciones de reacción y productos dentro de los diagramas de reacción y clasifica cada región. ViMore convierte las estructuras reconocidas en representaciones químicas estándar, incluidos los formatos SMILES, InChI y Mol, con técnicas especializadas para páginas de patentes escaneadas y ruidosas.

LG AI Research informa que ViMore logró resultados de vanguardia en tres de los cuatro benchmarks estándar de OCSR (CLEF, JPO, UOB y USPTO), superando a DECIMER Image Transformer, MolScribe y MolGrapher, y que sobresalió particularmente en JPO, un conjunto de datos desafiante y principalmente de baja resolución de imágenes extraídas de documentos de patentes japonesas. En el benchmark propio de LG, que evalúa 300 páginas de patentes y 250 páginas de artículos por separado para reflejar sus diferentes características, la canalización combinada ViDetect y ViMore superó a Decimer Segmentation y Image Transformer y a MolDetect y MolScribe en precisión y exhaustividad, y ViReact superó a ReactionDataExtractor2.0 y RxnScribe.

El artículo subyacente, publicado en arXiv, se presentó por primera vez el 30 de abril de 2025 y se revisó el 8 de mayo de 2025. Describe MolMole como un marco de aprendizaje profundo basado en visión que unifica la detección de moléculas, el análisis de diagramas de reacción y OCSR en una única canalización para extraer datos químicos directamente de documentos a nivel de página. Citando la falta de un benchmark estándar a nivel de página y una métrica de evaluación, los autores también presentan un conjunto de prueba de 550 páginas anotado con cajas delimitadoras de moléculas, etiquetas de reacción y archivos MOL, junto con una nueva métrica de evaluación, y reportan que MolMole supera a los kits de herramientas existentes tanto en su benchmark como en conjuntos de datos públicos.

Dentro del flujo de trabajo de Elsevier, cada canalización de extracción se valida contra los benchmarks existentes de Reaxys antes de entrar en producción, y la canalización completa pasó por un período de pruebas en los datos y herramientas de flujo de trabajo de Elsevier antes de su uso más amplio, según el anuncio.

Declaraciones ejecutivas y próximas etapas

Mirit Eldor, Directora General de Ciencias de la Vida en Elsevier, dijo que la asociación devuelve tiempo a los químicos al trasladar más química de las figuras a Reaxys como evidencia curada y buscable. “Una estructura enterrada en una figura debería ser evidencia y no un callejón sin salida”, afirmó.

Hwayoung Edward Lee, líder de la Unidad de Transformación de Negocios de IA en LG AI Research, dijo que el modelo fue diseñado para decodificar representaciones químicas visuales complejas en las que cada enlace y disposición espacial tiene significado, y que la integración con Elsevier convierte los datos visuales sin procesar en conocimiento estructurado para los investigadores.

Las organizaciones dijeron que la extracción de reacciones es la siguiente etapa de la colaboración, ampliando la extracción basada en imágenes más allá de sustancias individuales para ampliar la evidencia de reacciones disponible a través de Reaxys. También están explorando nuevos desafíos de los clientes para abordar juntos, combinando las capacidades especializadas de IA de LG AI Research con el contenido químico, la experiencia científica y la curación de Elsevier. El trabajo sigue los Principios de IA Responsable y los Principios de Privacidad de Elsevier, dijeron las empresas.

Aria Bloom es una periodista generada por IA que explora cómo la inteligencia artificial está transformando la biotecnología y la investigación genómica. Su escritura combina precisión con una profunda curiosidad sobre el futuro de las ciencias de la vida. Desde la biología sintética hasta la medicina personalizada, Aria analiza cómo el aprendizaje automático está acelerando la innovación en la salud humana. Los artículos escritos por Aria Bloom son generados por IA y revisados por el equipo editorial de Unite.AI para garantizar la precisión y el cumplimiento.