Parteneriate

Elsevier integrează modelul de viziune chimică al LG AI Research în Reaxys

mm
Adaugă Unite.AI la sursele tale preferate pe Google

Elsevier și LG AI Research au anunțat pe 15 septembrie 2026 că tehnologia AI de viziune specifică chimiei, dezvoltată de LG AI Research, este acum utilizată în procesele de extragere și curare a conținutului Elsevier pentru Reaxys, soluția de descoperire în chimie a Elsevier, făcând substanțele care apar doar ca imagini, desene și scheme de reacție în brevete și literatură științifică căutabile.

Companiile au declarat că informațiile despre substanțe din imagini din conținutul de brevete și reviste sunt capturate mai rapid, mai precis și la o scară mai mare decât era posibil anterior. Această lucrare îmbunătățește extragerea de conținut și curarea științifică a substanțelor, reacțiilor, bioactivităților, țintelor biologice și proprietăților substanțelor pentru Reaxys de către Elsevier.

De ce chimia bazată pe imagini a fost dificil de căutat

Conform anunțului, o mare parte a informațiilor despre substanțe și reacții pe care chimiștii se bazează este comunicată prin figuri, desene și scheme de reacție, mai degrabă decât prin text căutabil. Când acea chimie nu este căutabilă, cercetătorii pot fi nevoiți să verifice manual documentele pentru a confirma dacă un compus sau o reacție a fost deja descrisă. Desenele chimice codifică sensul prin legături, atomi, stereochimie și relații spațiale, astfel încât un model care interpretează greșit o legătură poate identifica compusul greșit, în timp ce unul care omite o structură lasă chimiștii cu o imagine incompletă. Această provocare este cel mai acut în domenii precum căutarea de noutăți, inteligența competitivă și planificarea sintezei, precum și în chimia inorganică și organometalică, unde structurile complexe sunt mai greu de extras și indexat.

Modelul MolMole și benchmark-urile sale raportate

Tehnologia combină detectarea moleculelor, parsarea diagramelor de reacție și recunoașterea optică a structurilor chimice (OCSR) într-un singur model, iar rapoartele de benchmark publicate de LG AI Research arată că depășește alternativele în extragerea chimiei dintr-o pagină completă de document. Un post din 7 mai 2025 pe blogul de cercetare al LG AI Research identifică modelul ca MolMole, dezvoltat în cadrul programului Deep Document Understanding al grupului, care își propune să construiască AI capabil să interpreteze texte, grafice și tabele în documente generale, precum și formule structurale moleculare și formule de reacție în lucrări și brevete chimice.

MolMole primește documente PDF complete ca intrare, în loc să solicite imagini decupate, și returnează datele chimice recunoscute dintr-un document simultan, conform postării de pe blog. Modelul este compus din trei module. ViDetect detectează regiunile cu structuri moleculare în paginile PDF și le marchează cu casete delimitatoare. ViReact identifică pozițiile reactanților, condițiilor de reacție și produselor în diagramele de reacție și clasifică fiecare regiune. ViMore convertește structurile recunoscute în reprezentări chimice standard, inclusiv formatele SMILES, InChI și Mol, utilizând tehnici specializate pentru paginile de brevete scanate și zgomotoase.

LG AI Research raportează că ViMore a obținut rezultate de ultimă generație pe trei din cele patru benchmark-uri standard OCSR (CLEF, JPO, UOB și USPTO), depășind DECIMER Image Transformer, MolScribe și MolGrapher, și că a depășit celelalte modele în special pe JPO, un set de date provocator, în principal cu rezoluție scăzută, de imagini extrase din brevete japoneze. În benchmark-ul propriu al LG, care evaluează separat 300 de pagini de brevete și 250 de pagini de lucrări pentru a reflecta caracteristicile diferite ale acestora, fluxul combinat ViDetect și ViMore a depășit Decimer Segmentation și Image Transformer și MolDetect și MolScribe în precizie și recall, iar ViReact a depășit ReactionDataExtractor2.0 și RxnScribe.

lucrarea de bază, postată pe arXiv, a fost trimisă inițial pe 30 aprilie 2025 și revizuită pe 8 mai 2025. Aceasta descrie MolMole ca un cadru de învățare profundă bazat pe viziune care unifică detectarea moleculelor, parsarea diagramelor de reacție și OCSR într-un singur flux pentru extragerea datelor chimice direct din documente la nivel de pagină. Menționând lipsa unui benchmark standard la nivel de pagină și a unei metrici de evaluare, autorii prezintă, de asemenea, un set de testare de 550 de pagini adnotat cu casete delimitatoare pentru molecule, etichete de reacție și fișiere MOL, împreună cu o nouă metrică de evaluare, și raportează că MolMole depășește seturile de instrumente existente atât pe benchmark-ul lor, cât și pe seturile de date publice.

În cadrul fluxului de lucru al Elsevier, fiecare pipeline de extragere este validat în raport cu benchmark-urile existente ale Reaxys înainte de a fi pus în producție, iar întregul pipeline a trecut printr-o perioadă de testare pe datele și instrumentele de workflow ale Elsevier înainte de utilizarea pe scară largă, conform anunțului.

Declarații executive și etape următoare

Mirit Eldor, Director General, Life Sciences la Elsevier, a declarat că parteneriatul oferă chimiștilor timp înapoi prin mutarea unei cantități mai mari de chimie din figuri în Reaxys ca dovezi curate și căutabile. “O structură îngropată într-o figură ar trebui să fie o dovadă, nu un capăt de drum,” a spus ea.

Hwayoung Edward Lee, lider al Unității AI Biz Transformation la LG AI Research, a declarat că modelul a fost conceput pentru a decoda reprezentări chimice vizuale complexe în care fiecare legătură și aranjament spațial are semnificație, și că integrarea cu Elsevier transformă datele vizuale brute în cunoștințe structurate pentru cercetători.

Organizațiile au declarat că extragerea reacţiilor este următoarea etapă a colaborării, extinzând extragerea bazată pe imagini dincolo de substanţele individuale pentru a lărgi dovezile de reacţie disponibile prin Reaxys. De asemenea, explorează alte provocări ale clienţilor pe care să le abordeze împreună, combinând capabilităţile AI specializate ale LG AI Research cu conţinutul chimic, expertiza ştiinţifică şi curarea Elsevier. Lucrarea urmează Principiile de AI Responsabil şi Principiile de Confidenţialitate ale Elsevier, au spus companiile.

Aria Bloom este un jurnalist generat de inteligență artificială care explorează modul în care inteligența artificială transformă biotehnologia și cercetarea genomică. Scrierile sale combină precizia cu o curiozitate profundă despre viitorul științelor vieții. De la biologia sintetică la medicina personalizată, Aria analizează modul în care învățarea automată accelerează inovația în sănătatea umană. Articolele scrise de Aria Bloom sunt generate de inteligență artificială și verificate de echipa editorială Unite.AI pentru acuratețe și conformitate.