Thought leaders

Orde scheppen in de chaos: de rol van LLM’s in ongestructureerde data-extractie

mm
Voeg Unite.AI toe aan je voorkeursbronnen op Google

Recentevooruitgang in hardware, zoals de Nvidia H100 GPU, heeft de computationele mogelijkheden aanzienlijk verbeterd. Metnegen keerde snelheid van de Nvidia A100, zijn deze GPU’s uitstekend in het verwerken van deep learning-workloads. Deze vooruitgang heeft het commerciële gebruik van generatieve AI in natuurlijke taalverwerking (NLP) en computerzicht mogelijk gemaakt, waardoor geautomatiseerde en intelligente data-extractie mogelijk is. Bedrijven kunnen nu gemakkelijk ongestructureerde data omzetten in waardevolle inzichten, wat een significante stap voorwaarts is in technologie-integratie. 

Traditionele methoden van data-extractie 

Handmatige gegevensinvoer 

Veel bedrijven vertrouwen nog steeds op handmatige gegevensinvoer, ondanks de beschikbaarheid van geavanceerdere technologieën. Deze methode houdt in dat informatie handmatig wordt ingevoerd in het doelsysteem. Het is vaak gemakkelijker om deze methode te gebruiken vanwege de lagere initiële kosten. Handmatige gegevensinvoer is echter niet alleen tijdrovend en saai, maar ook zeer gevoelig voor fouten. Bovendien vormt het een beveiligingsrisico bij het omgaan met gevoelige gegevens, waardoor het een minder wenselijke optie is in het tijdperk van automatisering en digitale beveiliging. 

Optical Character Recognition (OCR) 

OCR-technologie, die afbeeldingen en handschriften omzet in machine-leesbare gegevens, biedt een snellere en meer kostenefficiënte oplossing voor data-extractie. De kwaliteit kan echter onbetrouwbaar zijn. Bijvoorbeeld kunnen tekens zoals “S” verkeerd worden geïnterpreteerd als “8” en vice versa. 

De prestaties van OCR worden aanzienlijk beïnvloed door de complexiteit en kenmerken van de invoergegevens; het werkt goed met hoge-resolutie gescande afbeeldingen die vrij zijn van problemen zoals oriëntatiekantelingen, watermerken of overschrijving. Het werkt echter moeilijk met handschriften, vooral wanneer de visuals ingewikkeld of moeilijk te verwerken zijn. Aanpassingen kunnen nodig zijn voor betere resultaten bij het omgaan met tekstuele invoer. De data-extractie-tools op de markt met OCR als basis-technologie leggen vaak laag na laag post-processing toe om de nauwkeurigheid van de geëxtraheerde gegevens te verbeteren. Deze oplossingen kunnen echter geen 100% nauwkeurige resultaten garanderen. 

Tekstpatroonherkenning 

Tekstpatroonherkenning is een methode voor het identificeren en extraheren van specifieke informatie uit tekst met behulp van vooraf gedefinieerde regels of patronen. Het is sneller en biedt een hogere ROI dan andere methoden. Het is effectief op alle niveaus van complexiteit en bereikt 100% nauwkeurigheid voor bestanden met vergelijkbare lay-outs. 

Echter, de starheid in woord-voor-woord-overeenkomsten kan de aanpasbaarheid beperken, waardoor een 100% exacte overeenkomst nodig is voor een succesvolle extractie. Uitdagingen met synoniemen kunnen leiden tot moeilijkheden bij het identificeren van equivalente termen, zoals het onderscheiden van “weer” en “klimaat”. Bovendien vertoont Tekstpatroonherkenning contextuele gevoeligheid, zonder bewustzijn van meerdere betekenissen in verschillende contexten. Het vinden van het juiste evenwicht tussen starheid en aanpasbaarheid blijft een constante uitdaging bij het effectief gebruiken van deze methode. 

Named Entity Recognition (NER) 

Named Entity Recognition (NER), een NLP-techniek, identificeert en categoriseert belangrijke informatie in tekst. 

De extracties van NER zijn beperkt tot vooraf gedefinieerde entiteiten zoals organisatienamen, locaties, persoonsnamen en datums. Met andere woorden, NER-systemen missen momenteel de inherente mogelijkheid om aangepaste entiteiten te extraheren buiten deze vooraf gedefinieerde set, die specifiek kan zijn voor een bepaalde domein of gebruiksscenario. Ten tweede, de focus van NER op sleutelwaarden die zijn geassocieerd met herkende entiteiten, strekt zich niet uit tot data-extractie uit tabellen, waardoor de toepasbaarheid beperkt is tot meer complexe of gestructureerde gegevenstypen. 

 Aangezien organisaties te maken krijgen met een toenemende hoeveelheid ongestructureerde gegevens, benadrukken deze uitdagingen de noodzaak van een alomvattende en schaalbare benadering van extractiemethoden. 

Ongestructureerde gegevens ontgrendelen met LLM’s 

Het gebruik van grote taalmodellen (LLM’s) voor ongestructureerde data-extractie is een overtuigende oplossing met distincte voordelen die kritische uitdagingen aanpakken. 

Contextueel bewuste data-extractie 

LLM’s beschikken over een sterke contextuele begrip, verfijnd door uitgebreide training op grote datasets. Hun vermogen om voorbij de oppervlakte te gaan en contextuele nuances te begrijpen, maakt hen waardevol in het omgaan met diverse informatie-extractietaken. Bijvoorbeeld, wanneer ze worden belast met het extraheren van weergegevens, vangen ze de bedoelde informatie en overwegen ze gerelateerde elementen zoals klimaatwaarden, waardoor ze naadloos synoniemen en semantiek integreren. Dit geavanceerde niveau van begrip vestigt LLM’s als een dynamische en aanpasbare keuze in het domein van data-extractie. 

Het benutten van parallelle verwerking 

LLM’s gebruiken parallelle verwerking, waardoor taken sneller en efficiënter worden. In tegenstelling tot sequentiële modellen, optimaliseren LLM’s de verdeling van resources, waardoor de data-extractietaken worden versneld. Dit verbetert de snelheid en draagt bij aan de algehele prestatie van het extractieproces. 

Aanpassen aan uiteenlopende gegevenstypen 

Terwijl sommige modellen zoals Recurrent Neural Networks (RNN’s) beperkt zijn tot specifieke sequenties, kunnen LLM’s niet-sequentie-specifieke gegevens verwerken, waardoor ze gemakkelijk verschillende zinsstructuren aankunnen. Deze flexibiliteit omvat diverse gegevensvormen zoals tabellen en afbeeldingen. 

Verbeteren van verwerkingspijplijnen 

Het gebruik van LLM’s markeert een significante verschuiving in het automatiseren van zowel de voor- als de nasynchronisatie van het extractieproces. LLM’s verminderen de behoefte aan handmatige inspanning door het extractieproces nauwkeurig te automatiseren, waardoor het omgaan met ongestructureerde gegevens wordt gestroomlijnd. Hun uitgebreide training op diverse datasets stelt hen in staat om patronen en correlaties te identificeren die door traditionele methoden worden gemist. 

Deze afbeelding van een generatieve AI-pipeline illustreert de toepasbaarheid van modellen zoals BERT, GPT en OPT in data-extractie. Deze LLM’s kunnen diverse NLP-bewerkingen uitvoeren, waaronder data-extractie. Typisch biedt het generatieve AI-model een prompt dat de gewenste gegevens beschrijft, en het antwoord bevat de geëxtraheerde gegevens. Bijvoorbeeld, een prompt zoals “Extracteer de namen van alle leveranciers uit deze aankooporder” kan een antwoord opleveren met alle namen van leveranciers die in het semi-gestructureerde rapport aanwezig zijn. Vervolgens kunnen de geëxtraheerde gegevens worden geparsed en geladen in een database-tabel of een plat bestand, waardoor een naadloze integratie in organisatorische workflows mogelijk wordt. 

Evoluerende AI-kaders: RNN’s naar Transformatoren in moderne data-extractie 

Generatieve AI werkt binnen een encoder-decoder-kader met twee samenwerkende neurale netwerken. Het encoder-netwerk verwerkt invoergegevens, condenseert essentiële kenmerken in een “Context Vector” en het decoder-netwerk gebruikt deze vector voor generatieve taken, zoals taalvertaling. Deze architectuur, die neurale netwerken zoals RNN’s en Transformatoren omvat, vindt toepassingen in diverse domeinen, waaronder machinetaalvertaling, afbeeldingengeneratie, spraaksynthese en data-extractie. Deze netwerken excelleren in het modelleren van complexe relaties en afhankelijkheden binnen gegevenssequenties. 

Recurrent Neural Networks 

Recurrent Neural Networks (RNN’s) zijn ontworpen om sequentietaken zoals vertaling en samenvatting aan te pakken en excelleren in bepaalde contexten. Echter, ze worstelen met nauwkeurigheid in taken die lange-afstandafhankelijkheden betreffen. 

 RNN’s excelleren in het extraheren van sleutelwaardeparen uit zinnen, maar hebben moeite met tabel-achtige structuren. Het aanpakken hiervan vereist zorgvuldige overweging van sequentie en positionele plaatsing, waardoor speciale benaderingen nodig zijn om data-extractie uit tabellen te optimaliseren. Echter, hun adoptie was beperkt vanwege een laag ROI en ondermaatse prestaties op de meeste tekstverwerkings taken, zelfs na training op grote hoeveelheden gegevens. 

Long Short-Term Memory Networks 

Long Short-Term Memory (LSTM) netwerken zijn een oplossing die de beperkingen van RNN’s aanpakt, met name door een selectieve update- en vergetenmechanisme. Net als RNN’s excelleren LSTM’s in het extraheren van sleutelwaardeparen uit zinnen. Echter, ze hebben soortgelijke uitdagingen met tabel-achtige structuren, waardoor een strategische overweging van sequentie en positionele elementen nodig is. 

 GPU’s werden voor het eerst gebruikt voor deep learning in 2012 om het beroemde AlexNet CNN-model te ontwikkelen. Vervolgens werden enkele RNN’s ook getraind met GPU’s, maar ze leverden geen goede resultaten. Tegenwoordig zijn deze modellen grotendeels in onbruik geraakt en vervangen door transformatoren-gebaseerde LLM’s. 

Transformatoren – Aandachtmechanisme 

De introductie van transformatoren, met name in de baanbrekende paper “Attention is All You Need” (2017), heeft NLP gerevolutioneerd door de ‘transformatoren’-architectuur voor te stellen. Deze architectuur maakt parallelle berekeningen mogelijk en vangt lange-afstandafhankelijkheden adequaat, waardoor nieuwe mogelijkheden voor taalmodellen ontstaan. LLM’s zoals GPT, BERT en OPT hebben transformatoren-technologie aangenomen. Het “aandachtmechanisme” in transformatoren berekent een gewogen som van waarden op basis van de compatibiliteit tussen de ‘vraag’ (prompt) en de ‘sleutel’ (het model begrijpt elk woord). Deze aanpak stelt gericht aandacht toe tijdens sequentiegeneratie, waardoor nauwkeurige extractie wordt gegarandeerd. 

Het “aandachtmechanisme” in transformatoren berekent een gewogen som van waarden op basis van de compatibiliteit tussen de ‘vraag’ (prompt) en de ‘sleutel’ (het model begrijpt elk woord). Deze aanpak stelt gericht aandacht toe tijdens sequentiegeneratie, waardoor nauwkeurige extractie wordt gegarandeerd. Twee cruciale componenten binnen het aandachtmechanisme zijn Self-Attention, dat de relevantie tussen woorden in de invoersequentie vaststelt, en Multi-Head Attention, dat diverse aandachtpatronen voor specifieke relaties mogelijk maakt. 

In de context van factuur-extractie herkent Self-Attention de relevantie van een eerder genoemde datum bij het extraheren van betalingsbedragen, terwijl Multi-Head Attention onafhankelijk focust op numerieke waarden (bedragen) en tekstuele patronen (leveranciersnamen). In tegenstelling tot RNN’s begrijpen transformatoren niet inherent de volgorde van woorden. Om dit aan te pakken, gebruiken ze positionele codering om de positie van elk woord in een sequentie bij te houden. Deze techniek wordt toegepast op zowel invoer- als uitvoer-embeddings, waardoor het identificeren van sleutels en hun overeenkomstige waarden binnen een document wordt vergemakkelijkt. 

De combinatie van aandachtmecanismen en positionele codering is essentieel voor de mogelijkheid van een groot taalmodel om een structuur als tabulair te herkennen, rekening houdend met de inhoud, spaties en tekstmarkeringen. Deze vaardigheid onderscheidt hen van andere ongestructureerde data-extractie-technieken.

Huidige trends en ontwikkelingen 

De AI-ruimte ontwikkelt zich met veelbelovende trends en ontwikkelingen, waardoor de manier waarop we informatie uit ongestructureerde gegevens extraheren, wordt herschapen. Laten we dieper ingaan op de belangrijkste facetten die de toekomst van dit veld vormgeven. 

Vooruitgang in grote taalmodellen (LLM’s) 

Generatieve AI ondergaat een transformatieve fase, met LLM’s die centraal staan in het omgaan met complexe en diverse datasets voor ongestructureerde data-extractie. Twee opvallende strategieën drijven deze vooruitgang aan: 

  1. Multimodale leren: LLM’s breiden hun mogelijkheden uit door gelijktijdig verschillende typen gegevens te verwerken, waaronder tekst, afbeeldingen en audio. Deze ontwikkeling verbetert hun vermogen om waardevolle informatie te extraheren uit diverse bronnen, waardoor hun nut in ongestructureerde data-extractie toeneemt. Onderzoekers onderzoekenefficiënte manieren om deze modellen te gebruiken, met als doel de noodzaak voor GPU’s te elimineren en het gebruik van grote modellen met beperkte middelen mogelijk te maken.
  1. RAG-toepassingen: Retrieval Augmented Generation (RAG) is een opkomende trend die grote vooraf getrainde taalmodellen combineert met externe zoekmechanismen om hun mogelijkheden te verbeteren. Door toegang te hebben tot een uitgebreide verzameling documenten tijdens het generatieproces, transformeert RAG basis taalmodellen in dynamische tools die zowel voor bedrijven als voor consumenten toepassingen hebben.

Evaluatie van LLM-prestaties 

De uitdaging van het evalueren van LLM-prestaties wordt aangepakt met een strategische aanpak, waarbij taak-specifieke metrieken en innovatieve evaluatiemethoden worden gebruikt. Belangrijke ontwikkelingen in dit domein zijn: 

  1. Gefineerde metrieken: Aangepaste evaluatiemetrieken zijn in opkomst om de kwaliteit van informatie-extractietaken te beoordelen. Precisie, recall en F1-scoremetrieken bewijzen effectief te zijn, met name in taken zoals entiteitsextractie.
  1. Menselijke evaluatie: Menselijke beoordeling blijft essentieel naast geautomatiseerde metrieken, waardoor een alomvattende evaluatie van LLM’s mogelijk wordt. Het integreren van geautomatiseerde metrieken met menselijke beoordeling biedt een genuanceerd beeld van contextuele correctheid en relevantie in geëxtraheerde informatie.

Afbeelding- en documentverwerking 

Multimodale LLM’s hebben OCR volledig vervangen. Gebruikers kunnen gescande tekst uit afbeeldingen en documenten omzetten in machine-leesbare tekst, met de mogelijkheid om informatie rechtstreeks uit visuele inhoud te extraheren met behulp van visie-gebaseerde modules. 

Data-extractie uit links en websites 

LLM’s evolueren om te voldoen aan de toenemende vraag naar data-extractie uit websites en weblinks. Deze modellen zijn steeds beter in staat om webinhoud te schrapen en data van webpagina’s om te zetten in gestructureerde formaten. Deze trend is van onschatbare waarde voor taken zoals nieuwsaggregatie, e-commerce gegevensverzameling en concurrentie-intelligentie, waardoor contextuele begrip en relationele data-extractie uit het web worden verbeterd. 

De opkomst van kleine reuzen in generatieve AI 

Het eerste halfjaar van 2023 zag een focus op het ontwikkelen van enorme taalmodellen op basis van de “hoe groter, hoe beter”-aanname. Echter, recente resultaten laten zien dat kleinere modellen zoals TinyLlama en Dolly-v2-3B, met minder dan 3 miljard parameters, uitblinken in taken zoals redeneren en samenvatten, waardoor ze de titel “kleine reuzen” verdienen. Deze modellen gebruiken minder rekenkracht en opslag, waardoor AI toegankelijker wordt voor kleinere bedrijven zonder de noodzaak van dure GPU’s. 

Conclusie 

Vroege generatieve AI-modellen, waaronder generatieve adversarial networks (GAN’s) en variational auto-encoders (VAE’s), introduceerden nieuwe benaderingen voor het beheren van afbeeldingsgebaseerde gegevens. Echter, de echte doorbraak kwam met transformatoren-gebaseerde grote taalmodellen. Deze modellen overtroffen alle voorgaande technieken in ongestructureerde gegevensverwerking vanwege hun encoder-decoder-structuur, self-attention en multi-head attention-mechanismen, waardoor ze een diep begrip van taal en mensachtige redeneervaardigheden kregen. 

 Terwijl generatieve AI een veelbelovende start biedt voor het delven van tekstuele gegevens uit rapporten, is de schaalbaarheid van dergelijke benaderingen beperkt. De eerste stappen omvatten vaak OCR-verwerking, die tot fouten kan leiden, en er blijven uitdagingen bestaan bij het extraheren van tekst uit afbeeldingen in rapporten. 

 Het extraheren van tekst binnen afbeeldingen in rapporten is een andere uitdaging. Het omarmen van oplossingen zoals multimodale gegevensverwerking en tokenlimiet-uitbreidingen in GPT-4, Claud3, Gemini biedt een veelbelovende weg voorwaarts. Echter, het is belangrijk om te noteren dat deze modellen alleen toegankelijk zijn via API’s. Hoewel het gebruik van API’s voor data-extractie uit documenten effectief en kostenefficiënt is, komt het met zijn eigen set van beperkingen, zoals latentie, beperkte controle en beveiligingsrisico’s. 

 Een meer beveiligde en aanpasbare oplossing ligt in het fijn afstemmen van een in-house LLM. Deze aanpak mitigeert niet alleen gegevensprivacy- en beveiligingszorgen, maar verhoogt ook de controle over het data-extractieproces. Het fijn afstemmen van een LLM voor documentlay-outbegrip en voor het begrijpen van de betekenis van tekst op basis van de context biedt een robuuste methode voor het extraheren van sleutelwaardeparen en regelitems. Met behulp van zero-shot en few-shot learning kan een afgestemde model zich aanpassen aan diverse documentlay-outs, waardoor efficiënte en nauwkeurige ongestructureerde data-extractie over verschillende domeinen mogelijk wordt. 

Jay Mishra, COO bij Astera, een toonaangevende aanbieder van no-code dataservices, is een ervaren data- en analyticsleider met meer dan 20 jaar ervaring in het ontwikkelen van transformatieve strategieën om organisaties te empoweren door middel van AI-gedreven dataservices.