Liderzy opinii

Rozwiązywanie problemu: rola LLM w ekstrakcji danych niestrukturalizowanych

mm
Dodaj Unite.AI do preferowanych źródeł w Google

Niedawne postępy w dziedzinie sprzętu, takie jak procesor graficzny Nvidia H100, znacznie zwiększyły możliwości obliczeniowe. Dzięki dziewięciokrotnie większej szybkości niż procesor Nvidia A100, te procesory graficzne doskonale radzą sobie z obciążeniami głębokiego uczenia. Ten postęp zaowocował komercyjnym wykorzystaniem sztucznej inteligencji generatywnej w przetwarzaniu języka naturalnego (NLP) i rozpoznawaniu obrazów, umożliwiając automatyczne i inteligentne ekstrakcje danych. Przedsiębiorstwa mogą teraz łatwo przekształcić dane niestrukturalizowane w cenne informacje, co stanowi znaczny krok naprzód w integracji technologii. 

Tradycyjne metody ekstrakcji danych 

Wprowadzanie danych ręcznie 

Zaskakująco, wiele firm nadal polega na wprowadzaniu danych ręcznie, pomimo dostępności bardziej zaawansowanych technologii. Metoda ta polega na ręcznym wprowadzaniu informacji bezpośrednio do systemu docelowego. Często jest łatwiejsza do przyjęcia ze względu na niższe koszty początkowe. Jednak wprowadzanie danych ręcznie nie tylko jest nudne i czasochłonne, ale także bardzo podatne na błędy. Ponadto stanowi zagrożenie bezpieczeństwa podczas pracy z danymi wrażliwymi, co czyni ją mniej pożądaną opcją w erze automatyzacji i bezpieczeństwa cyfrowego. 

Rozpoznawanie znaków optycznych (OCR)  

Technologia OCR, która przekształca obrazy i treści odręczne w dane czytelne maszynowo, oferuje szybsze i bardziej opłacalne rozwiązanie dla ekstrakcji danych. Jednak jakość może być niepewna. Na przykład znaki takie jak “S” mogą być mylone z “8” i odwrotnie.  

Wydajność OCR jest znacznie uzależniona od złożoności i cech danych wejściowych; działa dobrze z wysokiej jakości zeskanowanymi obrazami, wolnymi od problemów, takich jak nachylenie orientacji, znaki wodne lub nadpisywanie. Jednak napotyka trudności z tekstem odręcznym, szczególnie gdy wizualizacje są skomplikowane lub trudne do przetworzenia. Mogą być konieczne adaptacje w celu poprawy wyników podczas pracy z danymi tekstowymi. Narzędzia do ekstrakcji danych na rynku, oparte na technologii OCR, często nakładają warstwy i warstwy przetwarzania pośredniego, aby poprawić dokładność wyodrębnionych danych. Jednak te rozwiązania nie mogą gwarantować 100% dokładnych wyników.  

Dopasowanie wzorca tekstu 

Dopasowanie wzorca tekstu jest metodą identyfikacji i ekstrakcji określonych informacji z tekstu przy użyciu predefiniowanych reguł lub wzorców. Jest szybsze i oferuje wyższy zwrot z inwestycji niż inne metody. Skuteczne jest we wszystkich poziomach złożoności i osiąga 100% dokładności dla plików o podobnej strukturze.  

Jednak jego sztywność w dopasowaniach słowo po słowie może ograniczać adaptacyjność, wymagając 100% dokładnego dopasowania do udanej ekstrakcji. Trudności ze synonimami mogą prowadzić do trudności w identyfikowaniu równoważnych terminów, takich jak różnicowanie “pogody” od “klimatu”. Dodatkowo, dopasowanie wzorca tekstu wykazuje wrażliwość kontekstową, brakując świadomości wielu znaczeń w różnych kontekstach. Utrzymanie odpowiedniej równowagi między sztywnością a adaptacyjnością pozostaje stałym wyzwaniem w efektywnym stosowaniu tej metody. 

Rozpoznawanie nazwanych encji (NER)  

Rozpoznawanie nazwanych encji (NER), technika NLP, identyfikuje i klasyfikuje kluczowe informacje w tekście. 

Ekstrakcje NER są ograniczone do predefiniowanych encji, takich jak nazwy organizacji, lokalizacje, nazwy osobowe i daty. Innymi słowy, systemy NER obecnie nie posiadają wewnętrznej zdolności do ekstrakcji niestandardowych encji poza tym predefiniowanym zestawem, który może być specyficzny dla określonej dziedziny lub przypadku użycia. Po drugie, skupienie NER na kluczowych wartościach związanych z rozpoznanymi encjami nie rozciąga się na ekstrakcję danych z tabel, ograniczając ich przydatność w przypadku bardziej złożonych lub ustrukturalizowanych typów danych. 

 Ponieważ organizacje mają do czynienia z coraz większymi ilościami danych niestrukturalizowanych, te wyzwania podkreślają potrzebę kompleksowego i skalowalnego podejścia do metod ekstrakcji. 

Odblokowanie danych niestrukturalizowanych za pomocą LLM 

Wykorzystanie dużych modeli językowych (LLM) do ekstrakcji danych niestrukturalizowanych jest kuszącym rozwiązaniem z wyraźnymi zaletami, które rozwiązują krytyczne wyzwania. 

Ekstrakcja danych z uwzględnieniem kontekstu 

LLM posiadają silne zrozumienie kontekstu, wykształcone dzięki obszernemu szkoleniu na dużych zbiorach danych. Ich zdolność do wykraczania poza powierzchnię i zrozumienia złożoności kontekstu sprawia, że są cenne w radzeniu sobie z różnymi zadaniami ekstrakcji informacji. Na przykład, gdy są zobowiązane do ekstrakcji wartości pogody, przechwytują zamierzone informacje i rozważają powiązane elementy, takie jak wartości klimatu, bezproblemowo włączając synonimy i semantykę. Ten zaawansowany poziom zrozumienia ustanawia LLM jako dynamiczny i adaptacyjny wybór w dziedzinie ekstrakcji danych.  

Wykorzystanie możliwości przetwarzania równoległego 

LLM wykorzystują przetwarzanie równoległe, co sprawia, że zadania są szybsze i bardziej efektywne. W przeciwieństwie do modeli sekwencyjnych, LLM optymalizują dystrybucję zasobów, co prowadzi do przyspieszenia zadań ekstrakcji danych. To zwiększa szybkość i przyczynia się do ogólnej wydajności procesu ekstrakcji.  

Adaptacja do różnych typów danych 

Podczas gdy niektóre modele, takie jak sieci neuronowe rekurencyjne (RNN), są ograniczone do określonych sekwencji, LLM radzą sobie z danymi niezwiązanymi z sekwencjami, bezproblemowo dostosowując się do różnych struktur zdaniowych. Ta elastyczność obejmuje różne formy danych, takie jak tabele i obrazy. 

Poprawa potoków przetwarzania 

Użycie LLM oznacza znaczny zwrot w automatyzacji zarówno etapów wstępnych, jak i końcowych. LLM redukują potrzebę ręcznego wysiłku, automatyzując procesy ekstrakcji z dokładnością, usprawniając obsługę danych niestrukturalizowanych. Ich obszerne szkolenie na różnych zbiorach danych pozwala im identyfikować wzorce i korelacje, które są pomijane przez tradycyjne metody. 

Ten rysunek potoku sztucznej inteligencji generatywnej ilustruje zastosowanie modeli takich jak BERT, GPT i OPT w ekstrakcji danych. Te LLM mogą wykonywać różne operacje NLP, w tym ekstrakcję danych. Zazwyczaj model sztucznej inteligencji generatywnej zapewnia promptryzujący opis pożądanych danych, a następująca odpowiedź zawiera wyodrębnione dane. Na przykład, promptyzacja “Wyodrębnij nazwy wszystkich dostawców z tego zamówienia zakupu” może spowodować odpowiedź zawierającą wszystkie nazwy dostawców obecne w półstrukturalnym raporcie. Następnie wyodrębnione dane mogą być sparsowane i załadowane do tabeli bazy danych lub pliku płaskiego, ułatwiając bezproblemową integrację z workflow organizacyjnymi. 

Ewolucja ram sztucznej inteligencji: RNN do transformerów w nowoczesnej ekstrakcji danych 

Sztuczna inteligencja generatywna działa w ramach struktury encoder-decoder, zawierającej dwie współpracujące sieci neuronowe. Encoder przetwarza dane wejściowe, kondensując istotne cechy w “wektor kontekstowy”. Ten wektor jest następnie wykorzystywany przez decoder do zadań generatywnych, takich jak tłumaczenie języka. Ta architektura, wykorzystująca sieci neuronowe, takie jak RNN i transformery, znajduje zastosowanie w różnych dziedzinach, w tym w tłumaczeniu maszynowym, generowaniu obrazów, syntezie mowy i ekstrakcji encji danych. Te sieci doskonale radzą sobie z modelowaniem skomplikowanych relacji i zależności w sekwencjach danych. 

Sieci neuronowe rekurencyjne 

Sieci neuronowe rekurencyjne (RNN) zostały zaprojektowane do radzenia sobie z zadaniami sekwencyjnymi, takimi jak tłumaczenie i streszczenie, doskonale radząc sobie w pewnych kontekstach. Jednak mają trudności z dokładnością w zadaniach, w których występują dalekosiężne zależności.  

 RNN radzą sobie doskonale z wyodrębnianiem par klucz-wartość z zdań, jednak napotykają trudności z strukturami tabelarycznymi. Rozwiązanie tego wymaga starannej uwagi na sekwencję i rozmieszczenie pozycyjne, wymagając specjalnych podejść do optymalizacji ekstrakcji danych z tabel. Jednak ich przyjęcie było ograniczone ze względu na niski zwrot z inwestycji i słabą wydajność w większości zadań przetwarzania tekstu, nawet po przeszkoleniu na dużych ilościach danych. 

Sieci neuronowe z pamięcią krótkotrwałą 

Sieci neuronowe z pamięcią krótkotrwałą (LSTM) pojawiają się jako rozwiązanie, które rozwiązuje ograniczenia RNN, szczególnie poprzez mechanizm selektywnego aktualizowania i zapominania. Podobnie jak RNN, LSTM radzą sobie doskonale z wyodrębnianiem par klucz-wartość z zdań. Jednak napotykają podobne wyzwania ze strukturami tabelarycznymi, wymagając strategicznego rozważenia sekwencji i elementów pozycyjnych.  

 Procesory graficzne były po raz pierwszy wykorzystywane w głębokim uczeniu w 2012 roku, aby opracować słynny model AlexNet CNN. Następnie niektóre RNN również były szkolone przy użyciu procesorów graficznych, chociaż nie dawały dobrych wyników. Dziś, pomimo dostępności procesorów graficznych, te modele zostały w dużej mierze wycofane i zastąpione przez transformery oparte na LLM. 

Transformator – mechanizm uwagi 

Wprowadzenie transformerów, szczególnie w przełomowym artykule “Attention is All You Need” (2017), rewolucjonizowało NLP, proponując architekturę “transformer”. Ta architektura umożliwia obliczenia równoległe i doskonale ujmuje dalekosiężne zależności, odblokowując nowe możliwości dla modeli językowych. LLM, takie jak GPT, BERT i OPT, wykorzystują technologię transformerów. W sercu transformerów leży mechanizm “uwagi”, kluczowy wkład w poprawę wydajności w przetwarzaniu sekwencji. 

Mechanizm “uwagi” w transformerach oblicza ważoną sumę wartości na podstawie zgodności między “zapytaniem” (promptyzacją) a “kluczem” (zrozumieniem modelu każdego słowa). To podejście pozwala na skupioną uwagę podczas generowania sekwencji, zapewniając precyzyjną ekstrakcję. Dwa kluczowe komponenty w mechanizmie uwagi to Self-Attention, ujmujący znaczenie między słowami w sekwencji wejściowej, i Multi-Head Attention, umożliwiający różne wzorce uwagi dla określonych relacji.  

W kontekście ekstrakcji faktur, Self-Attention rozpoznaje znaczenie wcześniej wymienionej daty podczas ekstrakcji kwot płatności, podczas gdy Multi-Head Attention skupia się niezależnie na wartościach numerycznych (kwotach) i wzorcach tekstowych (nazwach dostawców). W przeciwieństwie do RNN, transformery nie rozumieją naturalnie kolejności słów. Aby rozwiązać ten problem, wykorzystują kodowanie pozycyjne, aby śledzić miejsce każdego słowa w sekwencji. Ta technika jest stosowana zarówno do danych wejściowych, jak i wyjściowych, ułatwiając identyfikację kluczy i ich odpowiadających wartości w dokumencie.  

Kombinacja mechanizmów uwagi i kodowania pozycyjnego jest niezbędna dla zdolności dużych modeli językowych do rozpoznania struktury jako tabelarycznej, biorąc pod uwagę jej zawartość, przestrzeń i znaki tekstowe. Ta umiejętność wyróżnia je spośród innych technik ekstrakcji danych niestrukturalizowanych.

Aktualne trendy i rozwój 

Przestrzeń sztucznej inteligencji rozwija się z obietniczymi trendami i rozwojem, zmieniając sposób, w jaki wyodrębniamy informacje z danych niestrukturalizowanych. Zanurzmy się w kluczowych aspektach kształtujących przyszłość tej dziedziny. 

Postępy w dużych modelach językowych (LLM) 

Sztuczna inteligencja generatywna przechodzi przez transformacyjną fazę, z LLM na czele w radzeniu sobie z złożonymi i zróżnicowanymi zbiorami danych do ekstrakcji danych niestrukturalizowanych. Dwie godne uwagi strategie napędzają te postępy: 

  1. Uczenie wielomodalne: LLM rozszerzają swoje możliwości, przetwarzając jednocześnie różne typy danych, w tym tekst, obrazy i dźwięk. Ten rozwój zwiększa ich zdolność do wyodrębniania cennych informacji z różnych źródeł, zwiększając ich przydatność w ekstrakcji danych niestrukturalizowanych. Badacze badają efektywne sposoby wykorzystania tych modeli, dążąc do wyeliminowania potrzeby procesorów graficznych i umożliwienia działania dużych modeli z ograniczonymi zasobami.
  1. Aplikacje RAG: Wzmocniona generacja za pomocą odzyskiwania (RAG) to nowy trend, który łączy duże przeszkolone modele językowe z zewnętrznymi mechanizmami wyszukiwania, aby poprawić ich możliwości. Poprzez dostęp do ogromnej kolekcji dokumentów podczas generowania, RAG przekształca podstawowe modele językowe w dynamiczne narzędzia dostosowane zarówno do zastosowań biznesowych, jak i konsumenckich.

Ocena wydajności LLM 

Wyzwanie oceny wydajności LLM jest podejmowane z pomocą strategicznego podejścia, łączącego metryki specyficzne dla zadań i innowacyjne metody oceny. Kluczowe rozwoje w tej dziedzinie obejmują: 

  1. Dopasowane metryki: Pojawiają się metryki oceny dopasowane do zadań ekstrakcji informacji. Precyzja, recall i wynik F1 są skuteczne, szczególnie w zadaniach takich jak ekstrakcja encji.
  1. Ocena ludzka: Ocena ludzka pozostaje kluczowa obok metryk automatycznych, zapewniając kompleksową ocenę LLM. Integracja metryk automatycznych z osądami ludzkimi, metody oceny hybrydowej oferują nuansowany widok poprawności kontekstowej i istotności wyodrębnionych informacji.

Przetwarzanie obrazów i dokumentów  

Wielomodalne LLM całkowicie zastąpiły OCR. Użytkownicy mogą przekształcić zeskanowany tekst z obrazów i dokumentów w tekst czytelny maszynowo, z możliwością identyfikacji i ekstrakcji informacji bezpośrednio z treści wizualnej przy użyciu modułów opartych na widzeniu. 

Ekstrakcja danych z linków i stron internetowych 

LLM ewoluują, aby sprostać rosnącemu popytowi na ekstrakcję danych ze stron internetowych i linków. Te modele są coraz bardziej zdolne do wykorzystania technik wydobywania danych z sieci, konwertując dane ze stron internetowych w strukturyzowane formaty. Ten trend jest niezwykle cenny dla zadań takich jak agregacja wiadomości, gromadzenie danych handlowych i wywiad konkurencyjny, zwiększając zrozumienie kontekstowe i wyodrębnianie danych relacyjnych z sieci. 

Wzrost małych gigantów w sztucznej inteligencji generatywnej 

Pierwsza połowa 2023 roku była skupiona na rozwijaniu ogromnych modeli językowych opartych na założeniu “im większy, tym lepszy”. Jednak ostatnie wyniki pokazują, że mniejsze modele, takie jak TinyLlama i Dolly-v2-3B, z mniej niż 3 miliardami parametrów, wyróżniają się w zadaniach takich jak rozumowanie i streszczenie, zdobywając tytuł “małych gigantów”. Te modele wykorzystują mniej mocy obliczeniowej i miejsca na dysku, czyniąc sztuczną inteligencję bardziej dostępną dla mniejszych firm bez potrzeby drogich procesorów graficznych. 

Podsumowanie 

Wczesne modele sztucznej inteligencji generatywnej, w tym sieci generatywne przeciwstawne (GAN) i auto-encode VAE, wprowadziły nowe podejścia do zarządzania danymi opartymi na obrazach. Jednak prawdziwy przełom nastąpił z modelem językowym opartym na transformerach. Te modele przewyższyły wszystkie poprzednie techniki w przetwarzaniu danych niestrukturalizowanych dzięki swojej strukturze encoder-decoder, uwadze własnej i uwadze wielogłowej, dając im głębokie zrozumienie języka i umożliwiając zdolności rozumowania podobne do ludzkich. 

 Podczas gdy sztuczna inteligencja generatywna oferuje obiecujący start w wydobywaniu danych tekstowych z raportów, skalowalność takich podejść jest ograniczona. Początkowe kroki często obejmują przetwarzanie OCR, które może prowadzić do błędów, a wyzwania utrzymują się w ekstrakcji tekstu z obrazów w raportach.  

 Wydobywanie tekstu wewnątrz obrazów w raportach jest kolejnym wyzwaniem. Przyjęcie rozwiązań, takich jak przetwarzanie danych wielomodalnych i rozszerzenia limitu tokenów w GPT-4, Claud3, Gemini, oferuje obiecującą ścieżkę do przodu. Jednak ważne jest, aby zauważyć, że te modele są dostępne wyłącznie za pośrednictwem interfejsów API. Podczas gdy korzystanie z interfejsów API do ekstrakcji danych z dokumentów jest zarówno skuteczne, jak i efektywne pod względem kosztów, wiąże się to z własnymi ograniczeniami, takimi jak opóźnienia, ograniczona kontrola i ryzyka bezpieczeństwa.  

 Bardziej bezpieczne i dostosowalne rozwiązanie leży w dostrajaniu modelu LLM wewnętrznie. To podejście nie tylko łagodzi problemy związane z prywatnością danych i bezpieczeństwem, ale także zwiększa kontrolę nad procesem ekstrakcji danych. Dostrajanie LLM do zrozumienia układu dokumentu i pojmowania znaczenia tekstu w zależności od kontekstu oferuje solidną metodę wyodrębniania par klucz-wartość i pozycji liniowych. Wykorzystując uczenie zero-shot i few-shot, dostrajany model może dostosować się do różnych układów dokumentów, zapewniając wydajną i dokładną ekstrakcję danych niestrukturalizowanych we wszystkich dziedzinach. 

Jay Mishra, COO w Astera, wiodącym dostawcy rozwiązań bezkodeowych do danych, jest doświadczonym liderem w dziedzinie danych i analiz, z ponad 20-letnim doświadczeniem w tworzeniu transformacyjnych strategii, które umożliwiają organizacjom korzystanie z rozwiązań opartych na danych z wykorzystaniem sztucznej inteligencji.