Tankeledere

At gjøre fornuft ud af roden: LLM’ers rolle i udtrækning af ukontrolleret data

mm
Føj Unite.AI til dine foretrukne kilder på Google

Seneste fremgang i hardware, såsom Nvidia H100 GPU, har betydeligt forbedret beregningskapaciteterne. Med ni gange hurtigere end Nvidia A100, er disse GPU’er uovertrufne til at håndtere dybe læringstasks. Denne fremgang har fremmet den kommercielle brug af generativ AI i naturlig sprogbehandling (NLP) og computer vision, hvilket muliggør automatiseret og intelligent dataudtrækning. Virksomheder kan nu let omforme ukontrolleret data til værdifulde indsigt, hvilket markerer et betydeligt skridt fremad i teknologiintegration.

Traditionelle metoder til dataudtrækning 

Manuel dataindtastning 

Forbløffende nok afhænger mange virksomheder stadig af manuel dataindtastning, på trods af tilgængeligheden af mere avancerede teknologier. Denne metode indebærer manuel indtastning af informationer direkte i målsystemet. Det er ofte lettere at tilpasse på grund af de lavere initiale omkostninger. Dog er manuel dataindtastning ikke kun kedelig og tidskrævende, men også meget fejlbehæftet. Derudover udgør den en sikkerhedsrisiko, når der håndteres følsomme data, hvilket gør den til en mindre ønskværdig mulighed i en æra med automation og digital sikkerhed.

Optisk tegnkendelse (OCR)  

OCR-teknologi, der konverterer billeder og håndskrevne indhold til maskinlæsbart data, tilbyder en hurtigere og mere omkostningseffektiv løsning til dataudtrækning. Dog kan kvaliteten være utilstrækkelig. For eksempel kan tegn som “S” blive misfortolket som “8” og vice versa.

OCR’s præstation er betydeligt påvirket af kompleksiteten og egenskaberne hos inputdataen; den fungerer godt med højopløselige scanninger, fri for problemer som orienteringsvinkler, vandmærker eller overskrivning. Dog møder den udfordringer med håndskrevne tekster, især når visuelt indhold er intrikat eller svært at bearbejde. Tilpasninger kan være nødvendige for at forbedre resultaterne, når der håndteres tekstindhold. Dataudtrækningværktøjerne på markedet med OCR som grundlæggende teknologi lægger ofte lag på lag af efterbehandling for at forbedre nøjagtigheden af den udtrukne data. Dog kan disse løsninger ikke garantere 100% nøjagtige resultater.

Tekst mønstermatchning 

Tekst mønstermatchning er en metode til at identificere og udtrække specifik information fra tekst ved hjælp af foruddefinerede regler eller mønstre. Det er hurtigere og tilbyder en højere ROI end andre metoder. Det er effektivt på alle niveauer af kompleksitet og opnår 100% nøjagtighed for filer med lignende layouts.

Dog kan dens rigiditet i ord-for-ord-matches begrænse tilpasningen, hvilket kræver en 100% eksakt match for succesfuld udtrækning. Udfordringer med synonymer kan føre til vanskeligheder ved at identificere ækvivalente termer, som at skelne mellem “vejr” og “klima”. Desuden viser tekst mønstermatchning kontekstfølsomhed, mangler bevidsthed om multiple betydninger i forskellige kontekster. At finde den rette balance mellem rigiditet og tilpasning er en konstant udfordring ved at anvende denne metode effektivt.

Navngivet entitetsgenkendelse (NER)  

Navngivet entitetsgenkendelse (NER), en NLP-teknik, identificerer og kategoriserer nøgleinformation i tekst.

NER’s udtrækninger er begrænset til foruddefinerede enheder som organisationsnavne, lokaliteter, personnavne og datoer. Med andre ord mangler NER-systemer i øjeblikket den indbyggede evne til at udtrække brugerdefinerede enheder ud over denne foruddefinerede samling, som kunne være specifikke for en bestemt domæne eller brugsøjeblik. For det andet er NER’s fokus på nøgleværdier forbundet med genkendte enheder ikke udvidet til dataudtrækning fra tabeller, hvilket begrænser dets anvendelighed til mere komplekse eller strukturerede datatyper.

 Da organisationer har at gøre med en stigende mængde ukontrolleret data, fremhæver disse udfordringer behovet for en omfattende og skalerbar tilgang til udtrækningsteknikker.

At låse op ukontrolleret data med LLM’er 

At anvende store sprogmodeller (LLM’er) til ukontrolleret dataudtrækning er en overbevisende løsning med distinkte fordele, der løser kritiske udfordringer.

Kontekstbevidt dataudtrækning 

LLM’er besidder en stærk kontekstforståelse, udviklet gennem omfattende træning på store datasæt. Deres evne til at gå ud over overfladen og forstå kontekstens kompleksiteter gør dem værdifulde i håndtering af forskellige informationsudtrækningstasks. For eksempel, når de er opgaven at udtrække vejrværdier, fanger de den ønskede information og overvejer relaterede elementer som klimaværdier, og inkorporerer samtidig synonymer og semantik, hvilket gør dem til en dynamisk og tilpasningsdygtig valgmulighed i dataudtrækningens domæne.

At udnytte parallelt behandlingskapacitet 

LLM’er anvender parallelt behandling, hvilket gør opgaverne hurtigere og mere effektive. I modsætning til sekventielle modeller optimerer LLM’er resourcedistributionen, hvilket resulterer i accelereret dataudtrækning. Dette forbedrer hastigheden og bidrager til udtrækningens samlede præstation.

At tilpasse sig forskellige datatyper 

Mens nogle modeller som Recurrent Neural Networks (RNN’er) er begrænset til bestemte sekvenser, kan LLM’er håndtere ikke-sekvensspecifikke data, og omfavne forskellige sætningsstrukturer uden besvær. Denne fleksibilitet omfatter forskellige dataformer, såsom tabeller og billeder.

At forbedre behandlingspipeliner 

Anvendelsen af LLM’er markerer et betydeligt skift i automatisering af både forbehandling og efterbehandling. LLM’er reducerer behovet for manuel indsats ved at automatisere udtrækningerne nøjagtigt, og strømliner håndteringen af ukontrolleret data. Deres omfattende træning på diverse datasæt giver dem mulighed for at identificere mønstre og korrelationer, der overses af traditionelle metoder.

Dette billede af en generativ AI-pipeline illustrerer anvendeligheden af modeller som BERT, GPT og OPT i dataudtrækning. Disse LLM’er kan udføre forskellige NLP-operationer, herunder dataudtrækning. Typisk giver den generative AI-model en prompt, der beskriver den ønskede data, og den efterfølgende respons indeholder den udtrukne data. For eksempel kan en prompt som “Udtræk alle leverandørnavne fra denne købsordre” give en respons, der indeholder alle leverandørnavne, der er til stede i den semistrukturerede rapport. Herefter kan den udtrukne data parses og indlæses i en database eller en flad fil, hvilket muliggør en problemfri integration i virksomhedens arbejdsgange.

Udviklingen af AI-rammer: RNN’er til Transformers i moderne dataudtrækning 

Generativ AI fungerer inden for en encoder-decoder-ramme, der består af to samarbejdende neurale netværk. Encoderen behandler inputdata, og kondenserer essentielle funktioner i en “kontekstvektor”. Denne vektor anvendes herefter af decoderen til generative opgaver, såsom sprogoversættelse. Denne arkitektur, der anvender neurale netværk som RNN’er og Transformers, finder anvendelse i forskellige domæner, herunder maskinoversættelse, billedgenerering, tale-syntese og dataentitetsudtrækning. Disse netværk excellerer i at modellere komplekse relationer og afhængigheder inden for datasekvenser.

Recurrent Neural Networks 

Recurrent Neural Networks (RNN’er) er blevet designet til at tackle sekvensopgaver som oversættelse og sammenfatning, og excellerer i visse kontekster. Dog kæmper de med nøjagtighed i opgaver, der involverer lange afhængigheder.

 RNN’er excellerer i at udtrække nøgle-værdi-par fra sætninger, men møder vanskeligheder med tabel-lignende strukturer. At løse dette kræver omhyggelig overvejelse af sekvens og position, og kræver specialiserede tilgange til at optimere dataudtrækning fra tabeller.

Long Short-Term Memory Networks 

Long Short-Term Memory (LSTM) netværk opstår som en løsning, der løser RNN’ers begrænsninger, især gennem en selektiv opdatering og glemsel-mekanisme. Ligesom RNN’er excellerer LSTM’er i at udtrække nøgle-værdi-par fra sætninger. Dog møder de lignende udfordringer med tabel-lignende strukturer, og kræver en strategisk overvejelse af sekvens og position.

 GPU’er blev først anvendt til dyb læring i 2012 for at udvikle den berømte AlexNet CNN-model. Herefter blev nogle RNN’er også trænet ved hjælp af GPU’er, selvom de ikke gav gode resultater. I dag, på trods af tilgængeligheden af GPU’er, er disse modeller stort set gået af mode og er blevet erstattet af transformer-baserede LLM’er.

Transformer – Opmerksomheds-mekanisme 

Introduktionen af transformers, især fremhævet i den banebrydende “Attention is All You Need”-artikel (2017), revolutionerede NLP ved at foreslå ‘transformer’-arkitekturen. Denne arkitektur muliggør parallel beregning og fanger effektivt lange afhængigheder, og åbner nye muligheder for sprogmodeller. LLM’er som GPT, BERT og OPT har udnyttet transformer-teknologi. I hjertet af transformers ligger “opmerksomheds”-mekanismen, en nøglebidragsyter til forbedret præstation i sekvens-til-sekvens data-behandling.

“Opmerksomheds”-mekanismen i transformers beregner en vægtet sum af værdier baseret på kompatibiliteten mellem “spørgsmål” (prompt) og “nøgle” (modellens forståelse af hvert ord). Denne tilgang muliggør fokuseret opmærksomhed under sekvens-generering, og sikrer præcis udtrækning. To centrale komponenter inden for opmerksomheds-mekanismen er Selv-Opmerksomhed, der fanger vigtigheden mellem ord i input-sekvensen, og Multi-Head Opmerksomhed, der muliggør diverse opmerksomheds-mønstre for specifikke relationer.

I konteksten af faktura-udtrækning genkender Selv-Opmerksomhed relevansen af en tidligere nævnt dato, når der udtrækkes betalingsbeløb, mens Multi-Head Opmerksomhed fokuserer uafhængigt på numeriske værdier (beløb) og tekst-mønstre (leverandørnavne). I modsætning til RNN’er forstår transformers ikke inherent ordens rækkefølge. For at løse dette anvender de positionskodning for at spore hver ordets plads i en sekvens. Denne teknik anvendes til både input- og output-embedding, og hjælper med at identificere nøgler og deres tilhørende værdier inden for et dokument.

Kombinationen af opmerksomheds-mekanismer og positionskodning er afgørende for en stor sprogmodels evne til at genkende en struktur som tabel-lignende, og overveje dens indhold, afstand og tekst-markører. Denne færdighed adskiller dem fra andre ukontrolleret dataudtrækningsteknikker.

Aktuelle tendenser og udviklinger 

AI-området udvikler sig med lovende tendenser og udviklinger, der former, hvordan vi udtrækker information fra ukontrolleret data.

Fremgang i store sprogmodeller (LLM’er) 

Generativ AI oplever en transformerende fase, hvor LLM’er spiller en central rolle i håndtering af komplekse og diverse datasæt til ukontrolleret dataudtrækning. To bemærkelsesværdige strategier driver disse fremgang:

  1. Multimodal læring: LLM’er udvider deres kapaciteter ved at behandle forskellige typer data samtidig, herunder tekst, billeder og lyd. Denne udvikling forbedrer deres evne til at udtrække værdifuld information fra diverse kilder, og øger deres anvendelighed i ukontrolleret dataudtrækning. Forskere undersøger effektive måder at anvende disse modeller på, med målet om at eliminere behovet for GPU’er og muliggøre drift af store modeller med begrænsede ressourcer.
  1. RAG-anvendelser: Retrieval Augmented Generation (RAG) er en opkomende tendens, der kombinerer store forudtrænede sprogmodeller med eksterne søgemekanismer for at forbedre deres kapaciteter. Ved at få adgang til en omfattende samling af dokumenter under generationsprocessen, transformerer RAG grundlæggende sprogmodeller til dynamiske værktøjer tilpasset til både forretnings- og forbrugeranvendelser.

    Evaluering af LLM-præstation 

    Udfordringen ved at evaluere LLM’ers præstation mødes med en strategisk tilgang, der inkorporerer opgave-specifikke mål og innovative evalueringmetoder. Nøgleudviklinger i dette område omfatter:

    1. Finjusterede mål: Tilpassede evalueringmål opstår for at vurdere kvaliteten af informationsudtrækningstasks. Præcision, recall og F1-score mål viser sig at være effektive, især i opgaver som entitetsudtrækning.
    1. Menneskelig evaluering: Menneskelig vurdering forbliver afgørende sammen med automatiserede mål, og sikrer en komprehensiv evaluering af LLM’er. Integration af automatiserede mål med menneskelig vurdering giver en nuanceret syn på kontekstuel korrekthed og relevans i udtrukket information.

      Billede- og dokumentbehandling  

      Multimodale LLM’er har fuldstændigt erstattet OCR. Brugere kan konvertere scannet tekst fra billeder og dokumenter til maskinlæsbart tekst, og har mulighed for at identificere og udtrække information direkte fra visuelt indhold ved hjælp af vision-baserede moduler.

      Dataudtrækning fra links og websites 

      LLM’er udvikler sig for at møde den stigende efterspørgsel efter dataudtrækning fra websites og web-links. Disse modeller bliver mere og mere dygtige til web-scraping, og konverterer data fra web-sider til strukturerede formater. Denne tendens er uvurderlig for opgaver som nyhedsaggregering, e-handelsdataindsamling og konkurrentanalyse, og forbedrer kontekstuel forståelse og udtrækning af relationel data fra webben.

      Opkomsten af små kæmper i generativ AI 

      Første halvår 2023 så en fokus på udvikling af enorme sprogmodeller baseret på antagelsen “jo større, jo bedre”. Dog viser nyeste resultater, at mindre modeller som TinyLlama og Dolly-v2-3B, med færre end 3 milliarder parametre, excellerer i opgaver som resonnering og sammenfatning, og har fortjent titlen “små kæmper”. Disse modeller anvender mindre beregningskraft og lagring, og gør AI mere tilgængelig for mindre virksomheder uden behov for dyre GPU’er.

      Konklusion 

      Tidlige generative AI-modeller, herunder generative adversarial networks (GAN’er) og variational auto-encodere (VAE’er), introducerede nye tilgange til håndtering af billed-baseret data. Dog kom det virkelige gennembrud med transformer-baserede store sprogmodeller. Disse modeller overgik alle tidligere teknikker i ukontrolleret data-behandling takket være deres encoder-decoder-struktur, selv-opmerksomhed og multi-head opmerksomhed-mekanismer, og gav dem en dyb forståelse af sprog og mulighed for menneske-lignende resonnerings-evner.

       Selvom generativ AI tilbyder en lovende start til at udtrække tekst-baseret data fra rapporter, er skalerbarheden af sådanne tilgange begrænset. De første skridt indebærer ofte OCR-behandling, der kan resultere i fejl, og udfordringer består i at udtrække tekst fra billeder inden for rapporter.

       Hvorimod udtrækning af tekst inde i billeder i rapporter er en anden udfordring. At omfavne løsninger som multimodal data-behandling og token-grænse-udvidelser i GPT-4, Claud3, Gemini tilbyder en lovende vej frem. Dog er det vigtigt at bemærke, at disse modeller kun er tilgængelige via API’er. Selvom brug af API’er til dataudtrækning fra dokumenter er både effektivt og omkostningseffektivt, kommer det med sine egne begrænsninger, såsom latency, begrænset kontrol og sikkerhedsrisici.

       En mere sikker og tilpasset løsning ligger i at finjustere en intern LLM. Denne tilgang eliminerer ikke kun data-integritets- og sikkerhedsproblemer, men forbedrer også kontrollen over dataudtrækningens proces. At finjustere en LLM til dokument-layoudforståelse og til at forstå tekst-betydning baseret på kontekst tilbyder en robust metode til at udtrække nøgle-værdi-par og linje-elementer. Ved at udnytte zero-shot og few-shot læring kan en finjusteret model tilpasse sig forskellige dokument-layouts, og sikre effektiv og nøjagtig ukontrolleret dataudtrækning på tværs af forskellige domæner.

Jay Mishra, COO hos Astera, en førende leverandør af no-code data løsninger, er en erfaren data- og analytics-leder med 20+ års erfaring med at drive transformative strategier for at styrke organisationer gennem AI-drevne data løsninger.