Hälso- och sjukvård
AI-algoritm läser och förutspår patientdata från elektroniska journaler

Forskare vid Icahn School of Medicine at Mount Sinai har utvecklat en ny, automatiserad, AI-baserad algoritm som kan läsa och förutspå patientdata från elektroniska journaler (EHR).
Den nya metoden kallas Phe2vec och kan med stor noggrannhet identifiera patienter med vissa sjukdomar. Den visade sig vara lika noggrann som den mest populära traditionella metoden, som kräver mer manuellt arbete för att utföras.
Benjamin S. Glicksberg, PhD, är biträdande professor i genetik och genomics. Han är också medlem i Hasso Plattner Institute for Digital Health at Mount Sinai (HPIMS) och senior författare till studien.
“Det finns en explosionsartad ökning av mängden och typerna av data som lagras elektroniskt i en patients journal. Att reda ut denna komplexa väv av data kan vara mycket betungande, vilket bromsar framstegen inom klinisk forskning”, sa Glicksberg. “I denna studie skapade vi en ny metod för att utvinna data från elektroniska journaler med maskinlärning som är snabbare och mindre arbetskrävande än branschstandard. Vi hoppas att detta kommer att vara ett värdefullt verktyg som kommer att underlätta ytterligare och mindre förutfattade forskningar inom klinisk informatik.”
Studien, som publicerades i tidskriften Patterns, leddes av Jessica K. De Freitas, en doktorand i Dr. Glicksbergs lab.
Nuvarande branschstandard
Forskare förlitar sig för närvarande på etablerade datorprogram och algoritmer för att utvinna medicinska journaler för ny information. Ett system som kallas Phenotype Knowledgebase (PheKB) utvecklar och lagrar dessa algoritmer. Systemet är mycket effektivt för att korrekt identifiera en patients diagnos, men forskare måste gå igenom många medicinska journaler och leta efter data först. Denna data inkluderar saker som laboratorietester och recept.
Algoritmen programmeras sedan för att guida datorn att söka efter patienter som har sjukdomsspecifika data, som märks som en “fenotyp”. Detta möjliggör för systemet att skapa en lista över patienter, som sedan måste kontrolleras manuellt av forskarna. Om forskarna vill studera en ny sjukdom måste de starta processen om.
Den nya metoden
Med den nya metoden möjliggör forskarna för datorn att lära sig själv att identifiera sjukdomsfenotyper, vilket sparar forskarna tid och arbete. Phe2vec-metoden baserades på tidigare studier som teamet genomförde.
Riccardo Miotto, PhD, är en tidigare biträdande professor vid HPIMS och senior författare till studien.
“Tidigare har vi visat att oövervakad maskinlärning kan vara en mycket effektiv och effektiv strategi för att utvinna data från elektroniska journaler”, sa Miotto. “Fördelen med vår metod är att den lär sig representationer av sjukdomar från data i sig. Därför gör maskinen mycket av det arbete som experter normalt gör för att definiera kombinationen av dataelement från journaler som bäst beskriver en viss sjukdom.”
Datorn programmerades för att gå igenom miljontals elektroniska journaler och lära sig att identifiera samband mellan data och sjukdomar. Programmeringen byggde på “inbäddningsalgoritmer” som tidigare utvecklats av forskarna. Dessa användes för att studera ordnätverk i olika språk.
En av dessa algoritmer kallades word2vec och var särskilt effektiv. Datorn programmerades sedan för att identifiera diagnosen för cirka 2 miljoner patienter vars data lagrades i Mount Sinai Health System.
Forskarna jämförde sedan effektiviteten hos de nya och gamla systemen och fann att för nio av tio sjukdomar som testades var det nya Phe2vec-systemet lika effektivt eller något bättre än den nuvarande “guldstandarden” för fenotypning för att identifiera diagnos från EHR. Dessa sjukdomar kan inkludera demens, multipel skleros, sicklecellanemi och mer.
“Sammanfattningsvis är våra resultat uppmuntrande och tyder på att Phe2vec är en lovande teknik för storskalig fenotypning av sjukdomar i elektroniska journaler”, sa Dr. Glicksberg. “Med ytterligare testning och förfining hoppas vi att det kan användas för att automatisera många av de initiala stegen i klinisk informatikforskning, vilket tillåter forskare att fokusera sina ansträngningar på nedströmsanalyser som prediktiv modellering.”












