Myslitelé

Pořádání chaosu: Role LLM v extrakci nesourodých dat

mm
Přidejte Unite.AI mezi své preferované zdroje na Google

Recentní pokroky v hardwaru, jako je Nvidia H100 GPU, výrazně zvýšily výpočetní kapacity. S devítkrát vyšší rychlostí než Nvidia A100, tyto GPU vynikají v zpracování hlubokých učících se úloh. Tento pokrok podnítil komerční využití generativní umělé inteligence v zpracování přirozeného jazyka (NLP) a počítačovém vidění, umožňující automatickou a inteligentní extrakci dat. Společnosti mohou nyní snadno převést nesourodá data na cenné informace, což představuje významný skok vpřed v technologické integraci. 

Tradiční metody extrakce dat 

Ruční zadávání dat 

Překvapivě, mnoho společností stále spoléhá na ruční zadávání dat, navzdory dostupnosti pokročilejších technologií. Tato metoda zahrnuje přímé zadávání informací do cílového systému. Je často snazší ji přijmout kvůli nižším počátečním nákladům. Ruční zadávání dat je však nejen únavné a časově náročné, ale také vysoce náchylné k chybám. Kromě toho představuje bezpečnostní riziko při zpracování citlivých dat, což z něj činí méně žádoucí variantu v éře automatizace a digitální bezpečnosti. 

Optická rozpoznávání znaků (OCR)  

Technologie OCR, která převádí obrázky a ručně psaný obsah na strojově čitelná data, nabízí rychlejší a nákladově efektivnější řešení pro extrakci dat. Nicméně, kvalita může být nepředvídatelná. Například znaky jako “S” mohou být špatně interpretovány jako “8” a naopak.  

Výkon OCR je výrazně ovlivněn složitostí a charakteristikami vstupních dat; funguje dobře s vysokým rozlišením skenovaných obrázků bez problémů, jako jsou orientační úhly, vodítka nebo přepis. Nicméně, setkává se s výzvami při zpracování ručně psaného textu, zejména když jsou vizuály složitější nebo obtížněji zpracovatelné. Adaptace mohou být nezbytné pro zlepšení výsledků při zpracování textových vstupů. Nástroje pro extrakci dat na trhu s OCR jako základní technologií často přidávají vrstvy a vrstvy pooperačního zpracování, aby zlepšily přesnost extrahovaných dat. Tyto řešení však nemohou zaručit 100% přesné výsledky.  

Shoda textu 

Shoda textu je metoda pro identifikaci a extrakci specifických informací z textu pomocí předdefinovaných pravidel nebo vzorců. Je rychlejší a nabízí vyšší návratnost investic než jiné metody. Je účinná napříč všemi úrovněmi složitosti a dosahuje 100% přesnosti pro soubory se stejnou strukturou.  

Nicméně, jeho rigidita ve slovních shodách může omezit adaptabilitu, vyžadující 100% přesnou shodu pro úspěšnou extrakci. Výzvami při zpracování synonym mohou být obtíže při identifikaci ekvivalentních termínů, jako je rozlišení “počasí” od “klimatu”. Kromě toho Shoda textu vykazuje kontextovou citlivost, postrádající povědomí o více významových souvislostech v různých kontextech. Nacházení správné rovnováhy mezi rigiditou a adaptabilitou zůstává stálou výzvou při efektivní aplikaci této metody. 

Rozpoznávání jmenovaných entit (NER)  

Rozpoznávání jmenovaných entit (NER), technika NLP, identifikuje a kategorizuje klíčové informace v textu. 

Extrakce NER je omezena na předdefinované entity, jako jsou názvy organizací, umístění, osobní jména a data. Jinými slovy, systémy NER目前 postrádají inherentní schopnost extrahovat vlastní entity beyond předdefinované sady, které by mohly být specifické pro konkrétní doménu nebo použití. Za druhé, zaměření NER na klíčové hodnoty spojené s rozpoznanými entitami se nevztahuje na extrakci dat z tabulek, omezující tak jeho aplikovatelnost na složitější nebo strukturovanější typy dat. 

 Jak organizace čelí rostoucímu množství nesourodých dat, tyto výzvy zdůrazňují potřebu komplexního a škálovatelného přístupu k metodám extrakce. 

Odemknutí nesourodých dat pomocí LLM 

Využití velkých jazykových modelů (LLM) pro extrakci nesourodých dat je přesvědčivým řešením s výraznými výhodami, které řeší kritické výzvy. 

Kontextově vědomá extrakce dat 

LLM disponují silným kontextovým porozuměním, vycvičeným na rozsáhlých datech. Jejich schopnost jít za hranice povrchu a porozumět kontextovým nuancím je činí cennými při zpracování rozmanitých úkolů extrakce informací. Například, když jsou pověřeny extrakcí hodnot počasí, zachytí zamýšlené informace a zohledňují související prvky, jako jsou hodnoty klimatu, plynule začleňující synonyma a sémantiku. Tato pokročilá úroveň porozumění činí LLM dynamickou a adaptivní volbou v oblasti extrakce dat.  

Využití paralelního zpracování 

LLM využívají paralelní zpracování, což činí úkoly rychlejší a efektivnější. Na rozdíl od sekvenčních modelů, LLM optimalizují distribuci zdrojů, což vede k urychlení úkolů extrakce dat. To zvyšuje rychlost a přispívá k celkovému výkonu procesu extrakce.  

Adaptace na různé typy dat 

Zatímco některé modely, jako jsou Recurrent Neural Networks (RNNs), jsou omezeny na specifické sekvence, LLM zvládají nesekvenční specifické údaje, lehce zvládají různé struktury vět. Tato flexibilita zahrnuje různé formáty dat, jako jsou tabulky a obrázky. 

Vylepšení zpracování dat 

Využití LLM představuje významný posun v automatizaci obou fází předzpracování a poopracování. LLM snižují potřebu manuálního úsilí automatizací procesů extrakce přesně, zefektivňují zpracování nesourodých dat. Jejich rozsáhlé školení na rozmanitých datech umožňuje jim identifikovat vzory a korelace, které tradiční metody přehlédly. 

Tento obrázek potrubí generativní umělé inteligence ilustruje aplikovatelnost modelů, jako jsou BERT, GPT a OPT, v extrakci dat. Tyto LLM mohou provádět různé operace NLP, včetně extrakce dat. Obvykle poskytuje generativní model AI prompt, který popisuje požadovaná data, a následující odpověď obsahuje extrahovaná data. Například, prompt jako “Extrahujte jména všech dodavatelů z této objednávky” může vygenerovat odpověď obsahující všechny jména dodavatelů přítomných v polustrukturované zprávě. Následně lze extrahovaná data analyzovat a načíst do databázové tabulky nebo plochého souboru, usnadňující tak bezproblémovou integraci do firemních pracovních postupů. 

Evolvující rámce AI: RNNs na Transformery v moderní extrakci dat 

Generativní AI funguje v rámci encoder-decoder frameworku s dvěma spolupracujícími neuronovými sítěmi. Encoder zpracovává vstupní data, kondenzuje základní funkce do “kontextového vektoru”. Tento vektor je poté použit dekodelem pro generativní úkoly, jako je překlad jazyka. Tato architektura, využívající neuronové sítě, jako jsou RNNs a Transformery, nachází aplikace v různých doménách, včetně strojového překladu, generování obrázků, syntézy řeči a extrakce entit dat. Tyto sítě vynikají v modelování složitých vztahů a závislostí uvnitř datových sekvencí. 

Recurrent Neural Networks 

Recurrent Neural Networks (RNNs) byly navrženy pro řešení úkolů sekvencí, jako je překlad a shrnutí, vynikají v určitých kontextech. Nicméně, bojují s přesností v úkolech, které zahrnují dlouhodobé závislosti.  

 RNNs vynikají v extrahování párů klíč-hodnota ze vět, ale čelí obtížím s tabulkovými strukturami. Řešení tohoto problému vyžaduje pečlivé zvažování sekvence a pozicionálního umístění, vyžadující specializované přístupy k optimalizaci extrakce dat z tabulek. Nicméně, jejich přijetí bylo omezeno kvůli nízké návratnosti investic a podprůměrnému výkonu na většině úkolů zpracování textu, i po školení na velkých objemech dat. 

Long Short-Term Memory Networks 

Long Short-Term Memory (LSTMs) sítě se objevují jako řešení, které řeší omezení RNNs, zejména prostřednictvím selektivního aktualizování a zapomínání mechanismu. Jako RNNs, LSTMs vynikají v extrahování párů klíč-hodnota ze vět. Nicméně, čelí podobným výzvám s tabulkovými strukturami, vyžadujícím strategické zvažování sekvence a pozicionálních prvků.  

 GPU byly poprvé použity pro hluboké učení v 2012 pro vývoj slavného modelu AlexNet CNN. Následně byly některé RNNs také vycvičeny pomocí GPU, ale nevykazovaly dobré výsledky. Dnes, navzdory dostupnosti GPU, tyto modely byly téměř vyřazeny a nahrazeny transformačními LLMs. 

Transformer – Pozornostní mechanismus 

Zavedení transformátorů, zejména ve znamenitém článku “Pozornost je vše, co potřebujete” (2017), revolucionalizovalo NLP navrhnoucím architekturu “transformátor”. Tato architektura umožňuje paralelní výpočty a dokonale zachycuje dlouhodobé závislosti, odemykající nové možnosti pro jazykové modely. LLM, jako GPT, BERT a OPT, využily transformátorovou technologii. V srdci transformátorů leží “pozornostní” mechanismus, klíčový přispěvatel k vylepšenému výkonu v sekvenční zpracování dat. 

Pozornostní mechanismus v transformátorech počítá vážený součet hodnot na základě kompatibility mezi “dotazem” (promptem) a “klíčem” (modelovým porozuměním každého slova). Tento přístup umožňuje soustředěnou pozornost během generace sekvencí, zajišťující přesnou extrakci. Dvě zásadní složky v pozornostním mechanismu jsou Self-Attention, zachycující důležitost mezi slovy ve vstupní sekvenci, a Multi-Head Attention, umožňující různé pozornostní vzorce pro specifické vztahy.  

V kontextu extrakce faktur, Self-Attention rozpoznává relevanci dříve zmíněného data při extrahování platebních částek, zatímco Multi-Head Attention se zaměřuje nezávisle na numerických hodnotách (částkách) a textových vzorcích (jménech dodavatelů). Na rozdíl od RNNs, transformátory samy o sobě nerozumí pořadí slov. Aby se tomu zabránilo, používají pozicionální kódování, aby sledovaly pozici každého slova v sekvenci. Tato technika se aplikuje na vstupní a výstupní vložené prvky, usnadňující identifikaci klíčů a jejich odpovídajících hodnot uvnitř dokumentu.  

Kombinace pozornostních mechanismů a pozicionálního kódování je zásadní pro schopnost velkého jazykového modelu rozpoznat strukturu jako tabulkovou, zohledňující její obsah, rozložení a textové značky. Tato schopnost ho odlišuje od ostatních technik extrakce nesourodých dat.

Aktuální trendy a vývoj 

Prostor AI se vyvíjí s perspektivními trendy a vývojem, měnícími způsob, jakým extrahujeme informace z nesourodých dat. Pojďme se ponořit do klíčových aspektů, které budou formovat budoucnost tohoto oboru. 

Pokroky v velkých jazykových modelech (LLM) 

Generativní AI prochází transformační fází, s LLM na předním místě při zpracování složitých a rozmanitých dat pro extrakci nesourodých dat. Dvě pozoruhodné strategie pohánějí tyto pokroky: 

  1. Multimodální učení: LLM se rozšiřují o své schopnosti současným zpracováním různých typů dat, včetně textu, obrázků a zvuku. Tento vývoj zvyšuje jejich schopnost extrahovat cenné informace z rozmanitých zdrojů, zvyšuje tak jejich využití v extrakci nesourodých dat. Výzkumníci prozkoumávají efektivní způsoby, jak tyto modely využít, snažící se eliminovat potřebu GPU a umožnit provoz velkých modelů s omezenými zdroji.
  1. Aplikace RAG: Retrieval Augmented Generation (RAG) je vznikající trend, který kombinuje velké předškolní jazykové modely s externími vyhledávacími mechanismy, aby vylepšil jejich schopnosti. Přístupem k rozsáhlé sbírce dokumentů během generování, RAG transformuje základní jazykové modely na dynamické nástroje přizpůsobené pro obchodní i spotřebitelské aplikace.

Hodnocení výkonu LLM 

Výzva hodnocení výkonu LLM je řešena strategickým přístupem, zahrnujícím úkol-specifické metriky a inovativní metodologie hodnocení. Klíčový vývoj v tomto prostoru zahrnuje: 

  1. Jemně vyladěné metriky: Vznikají metriky speciálně navržené pro hodnocení kvality úkolů extrakce informací. Přesnost, recall a F1-skóre metriky se ukazují jako efektivní, zejména v úkolech, jako je extrakce entit.
  1. Lidské hodnocení: Lidská evaluace zůstává zásadní vedle automatizovaných metrik, zajišťujících komplexní hodnocení LLM. Integrace automatizovaných metrik s lidským úsudkem, hybridní evaluační metody nabízejí nuancované pohledy na kontextuální správnost a relevanci extrahovaných informací.

Zpracování obrázků a dokumentů  

Multimodální LLM zcela nahradily OCR. Uživatelé mohou převést naskenovaný text z obrázků a dokumentů na strojově čitelný text, s možností identifikovat a extrahovat informace přímo z vizuálního obsahu pomocí modulů založených na vidění. 

Extrakce dat z odkazů a webových stránek 

LLM se vyvíjí, aby splňovaly rostoucí poptávku po extrakci dat z webových stránek a odkazů. Tyto modely jsou stále více schopné webového skenování, převádějící data z webových stránek do strukturovaných formátů. Tento trend je neocenitelný pro úkoly, jako je agregace zpráv, sběr e-commerce dat a konkurenční inteligence, zvyšující kontextuální porozumění a extrahující relační data z webu. 

Vzestup malých gigantů v generativní AI 

První polovina roku 2023 se soustředila na vývoj velkých jazykových modelů založených na předpokladu “čím větší, tím lepší”. Nicméně, nedávné výsledky ukazují, že menší modely, jako je TinyLlama a Dolly-v2-3B, s méně než 3 miliardami parametrů, vynikají v úkolech, jako je odůvodňování a shrnutí, zasloužily si titul “malí giganti”. Tyto modely využívají méně výpočetní síly a úložiště, činí tak AI přístupnější menším společnostem bez potřeby drahých GPU. 

Závěr 

Rané modely generativní AI, včetně generativních adversativních sítí (GANs) a variabilních autoencoderů (VAEs), představily nové přístupy pro zpracování obrazových dat. Nicméně, skutečný průlom přišel s transformačními velkými jazykovými modely. Tyto modely překonaly všechny předchozí techniky v zpracování nesourodých dat díky své encoder-decoder struktuře, self-attention a multi-head attention mechanismům, poskytujícím jim hluboké porozumění jazyka a umožňujícím jim lidsky podobné odůvodňovací schopnosti. 

 Zatímco generativní AI nabízí slibný začátek při těžbě textových dat z zpráv, škálovatelnost takových přístupů je omezená. První kroky často zahrnují zpracování OCR, které může vést k chybám, a přetrvávají výzvy při extrahování textu z obrázků uvnitř zpráv.  

 Extrakce textu uvnitř obrázků v zprávách je další výzvou. Přijetí řešení, jako je multimodální zpracování dat a rozšíření limitu tokenů v GPT-4, Claud3, Gemini, nabízí slibnou cestu vpřed. Nicméně, je důležité poznamenat, že tyto modely jsou dostupné pouze prostřednictvím API. Zatímco použití API pro extrakci dat z dokumentů je efektivní a nákladově efektivní, přichází s vlastními omezeními, jako je latence, omezená kontrola a bezpečnostní rizika.  

 Více zabezpečené a přizpůsobitelné řešení spočívá v jemném vyladění interního LLM. Tento přístup nejenže zmírňuje obavy o ochranu dat a bezpečnost, ale také zvyšuje kontrolu nad procesem extrakce dat. Jemné vyladění LLM pro porozumění rozložení dokumentu a pro pochopení významu textu na základě jeho kontextu nabízí robustní metodu pro extrakci párů klíč-hodnota a položek. Využíváním nulového a málo-shot učení, vyladěný model může přizpůsobit se různým rozložení dokumentů, zajišťujíc tak efektivní a přesnou extrakci nesourodých dat napříč různými doménami. 

Jay Mishra, COO ve společnosti Astera, líder poskytovatele bezkódových řešení pro data, je zkušený líder v oblasti dat a analýz s více než 20 lety zkušeností s řízením transformačních strategií pro organizace prostřednictvím řešení založených na umělé inteligenci.