Elsevier og LG gør gemt kemi søgbar i Reaxys
Den 15. september 2026 annoncerede Elsevier og LG AI Research et partnerskab, hvor LGs kemi-specifikke AI-visionsmodel bruges i Elseviers indholdsudtræk og kuratering til Reaxys. Nyheden i én sætning: kemi, der kun findes som billeder, tegninger og reaktionsskemaer i patenter og artikler, bliver søgbar i Reaxys. Begge kilder bekræfter dato, parter og integration. Ingen af dem beskriver modelarkitektur eller træningsdata.
Lad os være ærlige: det her rammer et hul i mange søgninger. Den lille ringstruktur i hjørnet af en patentfigur. En håndtegnet pil i et supplement. En reaktionsvej i en halvsløret PDF. Når det ikke er tekst, forsvinder det i traditionelle søgninger. Gøres sådanne elementer maskinlæselige i Reaxys, flytter det den første time af arbejdet. Mindre blind søgning, hurtigere overblik.

Hvorfor det betyder noget nu
For forskere og R&D-teams kan screening glide fra tekstsøgning + manuel figurkig til tekstsøgning + struktursøgning af billed-afledte data. Det bør afkorte prioritering, især i patentlandskaber, hvor nøgleinfo ofte bor i figurer. Originaldokumentet skal stadig åbnes for stereokemi, opløsningsmidler og betingelser. Men filteret før den menneskelige læsning kan blive skarpere.
IP- og patentteams kan skære ned på manuel figur-gennemgang og i stedet bruge tiden på validering og sporbarhed. Biblioteker og informationsspecialister flytter timer fra annotering til QA-lag og retningslinjer. Dataarkitekter får en ny strøm af maskinlæsbare strukturer, der skal mappes korrekt ind i felter, ontologier og deduplikering.
Hvad der præcis er integreret
Kilderne er samstemmende: LG AI Research’ kemi-vision bruges i Elseviers content extraction og curation til Reaxys. Ifølge PR Newswire fanges substansinformation fra billeder i patent- og tidsskriftsindhold “langt hurtigere, mere præcist og i langt større skala end før” – det er leverandørudtalelser. Unite.ai beskriver effekten mere nøgternt: billeder bliver til maskérbare, søgbare data. Funktionelt handler det om at finde og tolke kemiske strukturer og reaktionsskemaer fra visuelle kilder og gøre dem søgbare.
Teknik kort fortalt
“Kemi-specifik AI-vision” betyder typisk en pipeline, hvor modeller opdeler sider i figurer, læser labels med OCR, identificerer atomer, bindinger og stereokemi og konverterer til en maskinlæsbar repræsentation som SMILES eller Molfile. Reaktionsskemaer kræver tolkning af pile, reagenser, produkter og betingelser. Kilderne nøjes med at sige, at billeder og skemaer gøres søgbare i Reaxys. Der er ingen oplysninger om modeltype, træning eller fejlrater.


Ydelsespåstande uden benchmarks
PR Newswire fremhæver “langt hurtigere, mere præcist og i langt større skala”. Det er virksomhedernes egne ord, ikke understøttet af uafhængige tests i de kilder, der foreligger. Skal data påvirke beslutninger, bør man kræve metrikker per billedtype og datasæt (patenter vs. artikler) samt fejlklasser. Uden tallene er det svært at vide, hvornår automatisk udtræk skærer støj fra – og hvornår det tilføjer ny.
Konkrete ændringer i arbejdsprocesser
Forskning og udvikling: søg først bredt, men lad billed-afledte strukturer skære feltet til. Eksempel: en substituent, der kun fremgår i en figur, bliver pludselig søgbar og dukker op i en struktursøgning, hvor den før krævede side-for-side læsning.
Biblioteker og videnstyring: mindre rutineannotering, mere håndtering af undtagelser. Nye rutiner bør definere cutoffs for sikkerhedsscorer, stikprøver og korte vejledninger, så tydelige fejl kan flags og returneres til dataejeren. Feedback-sløjfer bliver centrale.
Data og integration
Dataarkitekturen skal kunne bære de nye datapunkter: strukturrepræsentationer, reaktionsobjekter, betingelser, kildepegefelter og versionsfelter for genkørsler. ETL og API’er må håndtere billed-afledte strukturer uden at blande dem med tekst-afledte. Deduplikering mellem “samme substans, ny kilde” og “ny substans” er sværere, end det lyder.
Det taler for tydelig provenance: hver struktur bør have kildehenvisning ned til side- eller figur-niveau, tidsstempel for udtræk og modelversion. Hvis confidence-scorer findes, bør de eksponeres i skemaet. Kilderne beskriver ikke, hvordan Elsevier gør dette i Reaxys.

Hvad man bør spørge Elsevier om
De her spørgsmål siger noget om modenhed:
- API eller kun UI: kan billed-afledte strukturer hentes via API med provenance og scorer
- Opdateringsfrekvens: batch-ETL i bølger eller nær-realtid
- Versionsstyring: hvordan mærkes modelversioner og genudtræk på samme dokument
- Fejllogning: kan brugere indsende rettelser, og hvordan indarbejdes de
- Sikkerhedsscorer: eksponeres de, og findes der anbefalede cutoffs pr. scenarie
- Deduplikering: hvordan undgås dobbelt-optælling fra tekst og billede
Risici og fejlsituationer
Kendte faldgruber i kemi-vision: falske positive strukturer fra tegnestøj eller overlappende bokse; manglende stereokemi; reaktionspile, der vendes; OCR-fejl i skannede, lavopløste figurer. Det kan ske, også for stærke systemer. Spørgsmålet er hvor tit – og hvordan det fanges.
Hvis man læner sig for tungt ind i automatisk udtræk, risikerer man spildt syntesearbejde eller skæve screeningslister. Læg derfor valideringslag ind: stikprøver, scorebaserede stopklodser og manuel godkendelse af lavt-sikre fund.

IP og regulatorisk brug
Kilderne siger ikke, om billed-afledte data er egnet som dokumentation i regulatoriske indsendelser eller som bevis i IP-sager. Det kræver sporbarhed ned til figur, tidsstempel og modelversion samt en valideringsbeskrivelse, der kan stå for skud. Indtil da bør data ses som pejlemærker i research – ikke som juridisk dokumentation.
Markedskontekst
AI-vision i kemi er ikke nyt. Både akademiske projekter og kommercielle aktører har længe forsøgt at gøre figurkemi maskinlæsbar. Forskellen her er skala og en eksplicit kobling til en stor, kurateret database som Reaxys. Det kan være et fremskridt i distribution, også selv om den underliggende pipeline ligner kendte tilgange.
Hvad kilderne bekræfter
Krydstjek: Datoen 15. september 2026, parterne, integrationen i content extraction og curation til Reaxys og at billeder, tegninger og reaktionsskemaer bliver søgbare. PR Newswire bruger stærkere sprog om ydeevne; Unite.ai bekræfter integrationen og den funktionelle effekt. Der er ingen uafhængige benchmarks i de tilgængelige kilder.
Mangler: arkitektur, træningsdata, fejlrater; leveringsform (API, batch), håndtering af confidence, deduplikering og egnethed til regulatorisk brug. Indtil hullerne lukkes, bør brugere planlægge valideringslag i egne workflows.
Tjekliste til teams der vil udnytte billed-til-data
- Efterspørg metrik: præcision/recall pr. dokument- og billedtype, inkl. stereokemi
- Kræv provenance: kilde-URL, figur-ID, side, timestamp og modelversion på hver struktur
- Definér QA: stikprøver, score-cutoffs, reprocessering af lavt-scorende hits
- Planlæg skemaer: felter til confidence, versionering og kilde-noter i jeres databaser
- Forbered ETL: håndtering af dobbeltfund (tekst vs. billede) og idempotente opdateringer
- Etabler feedback: en kanal til at melde fejl tilbage til dataejeren og få dem rettet
Boks Hvad er Reaxys
Reaxys er Elseviers kemidatabase med kurateret indhold om substanser, reaktioner, bioaktiviteter, biologiske targets og egenskaber. Den bruges bredt i forskning og udvikling til at finde kendte reaktioner, sammenligne egenskaber og screene kemiske rum. Når nye kilder til strukturer tilføjes – som billed-afledte – vokser rækkevidden, men krav til kvalitetssikring vokser med.
Det lyder tørt, men betyder færre skjulte hits bag PDF-figurer. Det er nyttigt tidligt i discovery-arbejdet, hvor man hurtigt vil skille halm fra nåle.
Boks Hvad rummer kemi-vision typisk
- Segmentering af figurer: at finde og isolere strukturtegninger og reaktionsskemaer
- Strukturgenkendelse: at fortolke atomer, bindinger og stereokemi til SMILES/Molfile
- Reaktionsparsing: at identificere reagenser/produkter, pile og betingelser
Det er en forklaringsramme, ikke en bekræftet beskrivelse af LGs model. Kilderne oplyser ikke de tekniske detaljer.
Bundlinjen
Nyheden er klar: Elsevier og LG AI Research kobler et kemi-visionssystem til Reaxys’ udtræk og kuratering, så figurbåret kemi bliver søgbar. Det kan gøre litteratursøgning og patent-screening både hurtigere og mere fyldig. Løfterne om hastighed, præcision og skala er leverandørudsagn uden åbne benchmarks. Spørgsmål om provenance, scorer, API-adgang og deduplikering står åbne i kilderne.
Det praktiske næste skridt er at forberede egne valideringslag og stille de hårde spørgsmål – og først derefter lade billed-til-data påvirke beslutninger.