Tankeledere
Å gjøre mening av rotet: LLMs rolle i utstrukturerert datautvinning
Nylige fremskritt i maskinvare som Nvidia H100 GPU, har betydelig forbedret beregningskapasiteten. Med ni ganger hastigheten til Nvidia A100, disse GPU-ene utmerker seg i å håndtere dypt læring-arbeidsbelastninger. Dette fremskrittet har fremmet den kommersielle bruken av generativ AI i naturlig språkbehandling (NLP) og datavisualisering, og muliggjort automatisert og intelligent datautvinning. Bedrifter kan nå enkelt konvertere utstrukturerert data til verdifulle innsikter, og markerer et betydelig skritt fremover i teknologi-integrasjon.
Tradisjonelle metoder for datautvinning
Manuell datainntasting
Overraskende nok avhenger mange selskaper fortsatt av manuell datainntasting, til tross for tilgjengeligheten av mer avanserte teknologier. Denne metoden innebærer å taste inn informasjon direkte i målsystemet. Den er ofte enklere å implementere på grunn av lavere innledende kostnader. Likevel er manuell datainntasting ikke bare kjedelig og tidskrevende, men også svært utsatt for feil. I tillegg utgjør den en sikkerhetsrisiko når det gjelder å håndtere følsomme data, noe som gjør den til en mindre ønskelig løsning i en tid med automatisering og digital sikkerhet.
Optisk tegnkjenning (OCR)
OCR-teknologi, som konverterer bilder og håndskrevne innhold til maskinlesbar data, tilbyr en raskere og mer kostnadseffektiv løsning for datautvinning. Likevel kan kvaliteten være ustabilt. For eksempel kan tegn som “S” bli misforstått som “8” og omvendt.
OCR-ytelsen påvirkes betydelig av kompleksiteten og egenskapene til inndata; den fungerer godt med høyoppløselige skannede bilder uten problemer som orienteringsvinkler, vannmerker eller overskriving. Likevel møter den utfordringer med håndskrevne tekster, spesielt når visuelt innhold er intrikat eller vanskelig å prosessere. Tilpasninger kan være nødvendige for bedre resultater når det gjelder tekstlige inndata. Datautvinningsverktøyene på markedet med OCR som basis-teknologi legger ofte til lag og lag med etterbehandling for å forbedre nøyaktigheten av utvunnet data. Men disse løsningene kan ikke garantere 100 % nøyaktige resultater.
Tekst-mønster-matching
Tekst-mønster-matching er en metode for å identifisere og utvinne spesifikk informasjon fra tekst ved hjelp av forhåndsdefinerte regler eller mønster. Det er raskere og tilbyr en høyere avkastning enn andre metoder. Det er effektivt på alle nivåer av kompleksitet og oppnår 100 % nøyaktighet for filer med lignende layout.
Likevel kan dens stivhet i ord-for-ord-matcher begrense tilpasningen, og krever en 100 % eksakt match for vellykket utvinning. Utfordringer med synonymer kan føre til vanskeligheter i å identifisere ekvivalente termer, som å skille “vær” fra “klima”. I tillegg viser tekst-mønster-matching kontekstuell sensitivitet, og mangler bevissthet om multiple betydninger i forskjellige kontekster. Å finne en balanse mellom stivhet og tilpasning er en konstant utfordring i å bruke denne metoden effektivt.
Navngitt enhets-gjenkjenning (NER)
Navngitt enhets-gjenkjenning (NER), en NLP-teknikk, identifiserer og kategoriserer nøkkelinformasjon i tekst.
NER-utvinninger er begrenset til forhåndsdefinerte enheter som organisasjonsnavn, steder, personnavn og datoer. Med andre ord, NER-systemer mangler i øyeblikket evnen til å utvinne tilpassede enheter utenfor denne forhåndsdefinerte mengden, som kunne være spesifikke for en bestemt bransje eller brukstilfelle. For det andre, NERs fokus på nøkkelverdier assosiert med gjenkjente enheter, utvides ikke til datautvinning fra tabeller, og begrenser dermed dens anvendelighet til mer komplekse eller strukturerte datatyper.
Ettersom organisasjoner håndterer økende mengder utstrukturerert data, understreker disse utfordringene behovet for en omfattende og skalerbar tilnærming til utvinningsmetodologier.
Å låse opp utstrukturerert data med LLMs
Å bruke store språkmodeller (LLMs) for utstrukturerert datautvinning er en overbevisende løsning med distinkte fordeler som møter kritiske utfordringer.
Kontekst-bevisst datautvinning
LLMs besitter sterk kontekstuell forståelse, utviklet gjennom omfattende trening på store datamengder. Deres evne til å gå utenfor overflaten og forstå kontekstlige nyanser gjør dem verdifulle i å håndtere ulike informasjonsutvinningsoppgaver. For eksempel, når de er oppgitt å utvinne værverdier, fanger de den mentede informasjonen og tar med seg relaterte elementer som klimaverdier, og inkorporerer søyleord og semantikk på en måte som er overlegen tradisjonelle metoder. Denne avanserte nivået av forståelse etablerer LLMs som en dynamisk og tilpasningsdyktig valg i domenet for datautvinning.
Utnytting av parallellprosesseringskapasiteter
LLMs bruker parallellprosesseringskapasiteter, noe som gjør oppgavene raskere og mer effektive. I motsetning til sekvensielle modeller, optimaliserer LLMs ressursfordelingen, noe som resulterer i akselererte datautvinningsoppgaver. Dette forbedrer hastigheten og bidrar til utvinningsprosessens totale ytelse.
Tilpasning til ulike datatyper
Mens noen modeller som rekurrerende nevrale nettverk (RNNs) er begrenset til bestemte sekvenser, håndterer LLMs ikke-sekvensspesifikke data, og aksepterer ulike setningsstrukturer uten problemer. Denne fleksibiliteten omfatter ulike dataformer, som tabeller og bilder.
Forbedring av prosesseringspipeliner
Bruken av LLMs markerer en betydelig endring i automatiseringen av både forprosesserings- og etterprosesseringsfasene. LLMs reduserer behovet for manuell innsats ved å automatisere utvinningsprosesser nøyaktig, og strømlinjeformeer håndteringen av utstrukturerert data. Deres omfattende trening på ulike datamengder gjør dem i stand til å identifisere mønster og korrelasjoner som tradisjonelle metoder har gått glipp av.

Kilde: En pipeline for generativ AI
Denne figuren av en generativ AI-pipeline illustrerer anvendeligheten av modeller som BERT, GPT og OPT i datautvinning. Disse LLMs kan utføre ulike NLP-operasjoner, inkludert datautvinning. Vanligvis gir den generative AI-modellen en prompt som beskriver den ønskede dataen, og svaret inneholder den utvunne dataen. For eksempel kan en prompt som “Utvinn navnene på alle leverandørene fra denne kjøpsordren” kunne gi et svar som inneholder alle leverandørnavn som er til stede i den semi-strukturerte rapporten. Deretter kan den utvunne dataen parsere og laste inn i en database-tabell eller en flat fil, og på den måten integrere sømløst i organisatoriske arbeidsflyter.
Evolverende AI-rammeverk: RNNs til Transformers i moderne datautvinning
Generativ AI opererer innenfor en encoder-decoder-ramme som består av to samarbeidende nevrale nettverk. Encoderen prosesserer inndata, kondenserer essensielle funksjoner til en “kontekstvektor”. Denne vektoren brukes deretter av decoderen for generative oppgaver, som språkoversettelse. Denne arkitekturen, som utnytter nevrale nettverk som RNNs og Transformers, finner anvendelser i ulike domener, inkludert maskinoversettelse, bildegenerering, tale-syntese og data-entitetsutvinning. Disse nettverkene utmerker seg i å modellere komplekse relasjoner og avhengigheter innenfor datasekvenser.
Rekurrerende nevrale nettverk
Rekurrerende nevrale nettverk (RNNs) er utformet for å håndtere sekvensoppgaver som oversettelse og sammenfatting, og utmerker seg i visse kontekster. Likevel sliter de med nøyaktighet i oppgaver som involverer lang-rekke-avhengigheter.
RNNs utmerker seg i å utvinne nøkkel-verdi-par fra setninger, men møter vanskeligheter med tabell-lignende strukturer. Å håndtere dette krever omsorgsfull overveielse av sekvens og posisjonsplassering, og krever spesialiserte tilnærminger for å optimalisere datautvinning fra tabeller. Likevel var deres adopsjon begrenset på grunn av lav avkastning og underpar ytelser på de fleste tekstbehandlingsoppgaver, selv etter å ha blitt trent på store datamengder.
Lange korttids-hukommelsesnettverk
Lange korttids-hukommelsesnettverk (LSTMs) oppstår som en løsning som møter begrensningene til RNNs, spesielt gjennom en selektiv oppdatering og glemme-mekanisme. Like RNNs, utmerker LSTMs seg i å utvinne nøkkel-verdi-par fra setninger, men møter lignende utfordringer med tabell-lignende strukturer, og krever en strategisk overveielse av sekvens og posisjonselementer.
GPU-er ble først brukt til dyp læring i 2012 for å utvikle den berømte AlexNet CNN-modellen. Deretter ble noen RNNs også trent med GPU-er, men de ga ikke gode resultater. I dag, til tross for tilgjengeligheten av GPU-er, har disse modellene i stor grad falt ut av bruk og blitt erstattet av transformer-baserte LLMs.
Transformer – Oppmerksomhetsmekanisme
Introduksjonen av transformers, særlig presentert i den banebrytende “Oppmerksomhet er alt du trenger”-artikkelen (2017), revolusjonerte NLP ved å foreslå “transformer”-arkitekturen. Denne arkitekturen muliggjør parallell beregning og fanger dyktig lang-rekke-avhengigheter, og åpner opp nye muligheter for språkmodeller. LLMs som GPT, BERT og OPT har utnyttet transformer-teknologi. I hjertet av transformers ligger “oppmerksomhets”-mekanismen, en nøkkelbidragsyter til forbedret ytelse i sekvens-til-sekvens-data-behandling.
Den “oppmerksomhets”-mekanismen i transformers beregner en vektsum av verdier basert på kompatibiliteten mellom “spørsmål” (prompt) og “nøkkel” (modellens forståelse av hvert ord). Denne tilnærmingen tillater fokusert oppmerksomhet under sekvens-generering, og sikrer nøyaktig utvinning. To sentrale komponenter i oppmerksomhets-mekanismen er Selv-oppmerksomhet, som fanger viktigheten mellom ord i inndata-sekvensen, og Multi-hode-oppmerksomhet, som muliggjør ulike oppmerksomhetsmønster for bestemte relasjoner.
I konteksten av faktura-utvinning, gjenkjenner Selv-oppmerksomhet relevansen av en tidligere nevnt dato når det gjelder å utvinne betalingsbeløp, mens Multi-hode-oppmerksomhet fokuserer uavhengig på numeriske verdier (beløp) og tekstlige mønster (leverandørnavn). I motsetning til RNNs, forstår transformers ikke innledende rekkefølgen av ord. For å møte dette, bruker de posisjonskoding for å spore hver enkelt ordets plass i en sekvens. Denne teknikken brukes både på inndata- og utdata-embeddings, og hjelper med å identifisere nøkler og deres tilhørende verdier innenfor en dokument.
Kombinasjonen av oppmerksomhets-mekanismer og posisjonskoding er avgjørende for en stor språkmodells evne til å gjenkjenne en struktur som tabell-lignende, og å vurdere innhold, avstand og tekst-markører. Denne ferdigheten skiller dem fra andre utstrukturerert datautvinningsteknikker.
Nåværende trender og utvikling
AI-rommet utvikler seg med løftende trender og utvikling, og endrer måten vi utvinner informasjon fra utstrukturerert data. La oss dykke ned i de viktigste aspektene som former fremtiden for dette feltet.
Fremgang i store språkmodeller (LLMs)
Generativ AI er i en transformasjonsfase, med LLMs som tar sentralplass i håndtering av komplekse og ulike datamengder for utstrukturerert datautvinning. To bemerkelsesverdige strategier driver disse fremgangene:
- Multimodal læring: LLMs utvider sine evner ved å prosessere ulike typer data samtidig, inkludert tekst, bilder og lyd. Denne utviklingen forbedrer deres evne til å utvinne verdifull informasjon fra ulike kilder, og øker deres nytte i utstrukturerert datautvinning. Forskere utforsker effektive måter å bruke disse modellene på, med mål om å eliminere behovet for GPU-er og å muliggjøre drift av store modeller med begrensede ressurser.
- RAG-applikasjoner: Henting-utvidet-generering (RAG) er en fremvoksende trend som kombinerer store forhånds-trente språkmodeller med eksterne søke-mekanismer for å forbedre deres evner. Ved å få tilgang til en stor korpus av dokumenter under genereringsprosessen, transformerer RAG grunnleggende språkmodeller til dynamiske verktøy tilpasset både forretnings- og forbruker-applikasjoner.
Vurdering av LLM-ytelse
Utfordringen med å vurdere LLMs’ ytelse møtes med en strategisk tilnærming, som inkorporerer oppgave-spesifikke målinger og innovative evaluering-metodologier. Nøkkel-utviklinger i dette rommet inkluderer:
- Fine-tunned målinger: Tilpassede evaluering-målinger dukker opp for å vurdere kvaliteten på informasjonsutvinningsoppgaver. Presisjon, gjentakelse og F1-score målinger viser seg å være effektive, spesielt i oppgaver som entitets-utvinning.
- Menneskelig evaluering: Menneskelig vurdering forblir avgjørende, sammen med automatiserte målinger, for å sikre en omfattende vurdering av LLMs. Integrering av automatiserte målinger med menneskelig dømmekraft, hybrid-evaluering-metoder tilbyr en nyansert visning av kontekstuell korrekthet og relevans i utvunnet informasjon.
Bilde- og dokumentbehandling
Multimodale LLMs har fullstendig erstattet OCR. Brukere kan konvertere skannet tekst fra bilder og dokumenter til maskinlesbar tekst, og har mulighet til å identifisere og utvinne informasjon direkte fra visuelt innhold ved hjelp av visjon-baserte moduler.
Datautvinning fra lenker og nettsider
LLMs utvikler seg for å møte den økende etterspørselen etter datautvinning fra nettsider og nett-lenker. Disse modellene er stadig mer dyktige i å skrape data fra web-sider, og konvertere data fra web-sider til strukturerte formater. Denne trenden er uvurderlig for oppgaver som nyhetsaggregasjon, e-handelsdata-samling og konkurranse-intelligens, og forbedrer kontekstuell forståelse og utvinner relasjonell data fra weben.
Oppkomsten av små gigantene i generativ AI
Første halvdel av 2023 så en fokus på å utvikle enorme språkmodeller basert på “større er bedre”-antagelsen. Likevel viser nyere resultater at mindre modeller som TinyLlama og Dolly-v2-3B, med mindre enn 3 milliarder parametre, utmerker seg i oppgaver som resonnering og sammenfatting, og har dermed tatt tittelen “små gigantene”. Disse modellene bruker mindre beregningskraft og lagring, og gjør AI mer tilgjengelig for mindre selskaper uten behov for dyre GPU-er.
Konklusjon
Tidlige generative AI-modeller, inkludert generative adversarial nettverk (GANs) og variasjons-auto-encodere (VAEs), introduserte nye tilnærminger for å håndtere bilde-basert data. Likevel kom det virkelige gjennombruddet med transformer-baserte store språkmodeller. Disse modellene overgikk alle tidligere teknikker i utstrukturerert data-behandling på grunn av deres encoder-decoder-struktur, selv-oppmerksomhet og multi-hode-oppmerksomhet-mekanismer, og ga dem en dyp forståelse av språk og mulighet til å resonere på en måte som ligner menneskelig tankegang.
mens generativ AI tilbyr et løftende startpunkt for å utvinne tekst-data fra rapporter, er skalerbarheten av slike tilnærminger begrenset. De første steg inkluderer ofte OCR-behandling, som kan resultere i feil, og det er utfordringer i å utvinne tekst fra bilder i rapporter.
Derimot er utvinning av tekst inne i bildene i rapporter en annen utfordring. Å omfavne løsninger som multimodal data-behandling og token-grense-utvidelser i GPT-4, Claud3, Gemini tilbyr en løftende vei fremover. Likevel er det viktig å merke seg at disse modellene er tilgjengelige bare gjennom API-er. Mens bruk av API-er for datautvinning fra dokumenter er både effektivt og kostnadseffektivt, kommer det med sine egne begrensninger, som forsinkelse, begrenset kontroll og sikkerhetsrisiko.
En mer sikker og tilpassbar løsning ligger i å finjustere en intern LLM. Denne tilnærmingen eliminerer ikke bare data-privatets- og sikkerhets-problemer, men forbedrer også kontrollen over datautvinningsprosessen. Finjustering av en LLM for dokument-layouthåndtering og for å forstå betydningen av tekst basert på konteksten, tilbyr en robust metode for å utvinne nøkkel-verdi-par og linje-elementer. Ved å utnytte null-skudd- og få-skudd-læring, kan en finjustert modell tilpasse seg ulike dokument-layouter, og sikre effektiv og nøyaktig utstrukturerert datautvinning over ulike domener.












