Лідери думок

Розуміння хаосу: роль великих мовних моделей у видобутку неструктурованих даних

mm
Додайте Unite.AI до бажаних джерел у Google

Нещодавні дослідження в галузі апаратного забезпечення, наприклад, розробка графічних процесорів Nvidia H100, суттєво покращили обчислювальні можливості. Завдяки дев’ятикратній швидкості графічних процесорів Nvidia A100, ці графічні процесори досконало справляються з завданнями глибокого навчання. Це спричинило широке використання генеративного штучного інтелекту в обробці природної мови (NLP) та комп’ютерному зорі, що дозволяє автоматизувати видобуток даних. Тепер компанії можуть легко перетворювати неструктуровані дані на цінну інформацію, що означає суттєвий крок вперед у технологічній інтеграції. 

Традиційні методи видобутку даних 

Ввід даних вручну 

Дивно, але багато компаній усе ще використовують ввід даних вручну, незважаючи на наявність більш просунутих технологій. Цей метод полягає у введенні інформації безпосередньо в цільову систему. Це часто легше впровадити через нижчі початкові витрати. Однак, ввід даних вручну не тільки монотонний і часоємний, але також високий ризик помилок. Крім того, це становить ризик для безпеки при роботі з конфіденційними даними, що робить його менш бажаним варіантом у віці автоматизації та цифрової безпеки. 

Оптичне розпізнавання символів (OCR)  

Технологія OCR, яка перетворює зображення та рукописний контент у дані, які можна прочитати машині, пропонує швидше та більш економічне рішення для видобутку даних. Однак, якість може бути ненадійною. Наприклад, символи типу “S” можуть бути сплутані з “8” і навпаки.  

Виконання OCR суттєво залежить від складності та характеристик вхідних даних; воно працює добре з високоякісними сканованими зображеннями, вільними від проблем типу зміщення орієнтації, водяних знаків або надписів. Однак, воно зустрічає труднощі з рукописним текстом, особливо коли візуальні елементи складні або важко оброблюються. Можуть бути необхідні адаптації для покращення результатів при роботі з текстовими вхідними даними. Інструменти видобутку даних на ринку, які використовують OCR як базову технологію, часто додають шари після обробки для покращення точності видобутих даних. Однак, ці рішення не можуть гарантувати 100% точних результатів.  

Видобуток даних на основі текстових шаблонів 

Видобуток даних на основі текстових шаблонів – це метод ідентифікації та видобутку конкретної інформації з тексту за допомогою попередньо визначених правил або шаблонів. Це швидший метод, який пропонує вищу віддачу від інвестицій порівняно з іншими методами. Він ефективний на всіх рівнях складності та досягає 100% точності для файлів з подібними макетами.  

Однак, його жорсткість у словесних збігах може обмежувати адаптивність, вимагаючи 100% точного збігу для успішного видобутку. Труднощі з синонімами можуть привести до труднощів у визначенні еквівалентних термінів, як-от розрізнення “погоди” та “клімату”. Крім того, видобуток даних на основі текстових шаблонів виявляє контекстну чутливість, не маючи знання про 여러 значення в різних контекстах. Знаходження балансу між жорсткістю та адаптивністю залишається постійним викликом при ефективному використанні цього методу. 

Визначення названих сутностей (NER)  

Визначення названих сутностей (NER) – це техніка обробки природної мови, яка ідентифікує та категоризує ключову інформацію в тексті. 

Видобуток даних NER обмежений попередньо визначеними сутностями, такими як назви організацій, місця, особисті імена та дати. Інакше кажучи, системи NER зараз не мають вбудованої здатності видобувати користувацькі сутності за межами цього попередньо визначеного набору, який міг би бути специфічним для певної галузі або випадку використання. Другою проблемою є те, що фокус NER на ключових значеннях, пов’язаних з визнаними сутностями, не поширюється на видобуток даних з таблиць, обмежуючи його застосування для більш складних або структурованих типів даних. 

 Оскільки організації мають справу з все більшим обсягом неструктурованих даних, ці виклики підкреслюють необхідність комплексного та масштабованого підходу до методів видобутку. 

Розблокування неструктурованих даних за допомогою великих мовних моделей 

Використання великих мовних моделей (LLM) для видобутку неструктурованих даних – це привабливе рішення з особливими перевагами, які адресують критичні виклики. 

Контекстно-залежний видобуток даних 

LLM володіють сильним контекстним розумінням, розвиненим через обширне навчання на великих наборах даних. Їхня здатність виходити за межі поверхні та розуміти контекстні нюанси робить їх цінними у xửлянні різноманітних завдань видобутку інформації. Наприклад, коли їм доручено видобути значення погоди, вони захоплюють потрібну інформацію та розглядають пов’язані елементи, такі як значення клімату, безшовно інтегруючи синоніми та семантику. Цей розширений рівень розуміння встановлює LLM як динамічний та адаптивний вибір у сфері видобутку даних.  

Використання паралельних обчислювальних можливостей 

LLM використовують паралельні обчислення, роблячи завдання швидшими та більш ефективними. На відміну від послідовних моделей, LLM оптимізують розподіл ресурсів, що призводить до прискорення завдань видобутку даних. Це підвищує швидкість та сприяє загальній продуктивності процесу видобутку. 

Адаптація до різних типів даних 

Хоча деякі моделі, такі як рекурентні нейронні мережі (RNN), обмежені конкретними послідовностями, LLM можуть обробляти дані, не залежні від послідовності, легко справляючись з різними структурами речень. 

Покращення обробних потоків 

Використання LLM позначає суттєвий зсув у автоматизації як попередньої, так і після обробки. LLM зменшують потребу в ручному зусиллі, автоматизуючи процеси видобутку точно, оптимізуючи обробку неструктурованих даних. Їхнє обширне навчання на різноманітних наборах даних дозволяє їм визначати закономірності та кореляції, які традиційні методи не можуть. 

Цей малюнок пайплайну генеративного штучного інтелекту демонструє застосування моделей типу BERT, GPT та OPT у видобутку даних. Ці LLM можуть виконувати різні операції обробки природної мови, включаючи видобуток даних. Зазвичай, генеративна модель штучного інтелекту надає запит, що описує бажані дані, а відповідь містить видобуті дані. Наприклад, запит типу “Видобути імена всіх постачальників з цього замовлення на покупку” може привести до відповіді, яка містить імена всіх постачальників, присутніх у напівструктурованому звіті. Надалі видобуті дані можна розібрати та завантажити до таблиці бази даних або плоского файлу, забезпечуючи безшовну інтеграцію до робочих процесів організації. 

Еволюція штучного інтелекту: від RNN до трансформерів у сучасному видобутку даних 

Генеративний штучний інтелект діє в рамках енкодер-декодерної архітектури, що складається з двох співпрацюючих нейронних мереж. Енкодер обробляє вхідні дані, конденсуючи суттєві особливості у “контекстний вектор”. Цей вектор потім використовується декодером для генерації завдань, таких як переклад мови. Ця архітектура, що використовує нейронні мережі типу RNN та трансформерів, знаходить застосування в різних галузях, включаючи машинний переклад, генерацію зображень, синтез мовлення та видобуток сутностей даних. Ці мережі добре моделюють складні відносини та залежності в даних послідовностях. 

Рекурентні нейронні мережі 

Рекурентні нейронні мережі (RNN) були розроблені для виконання завдань послідовностей, таких як переклад та підсумовування, і добре працюють у певних контекстах. Однак, вони мають труднощі з точністю завдань, які включають довгострокові залежності.  

 RNN добре видобувають пари ключ-значення з речень, однак, вони мають труднощі з таблицями. Вирішення цього питання вимагає ретельного розгляду послідовності та позиційного розміщення, що вимагає спеціальних підходів для оптимізації видобутку даних з таблиць. Однак, їхнє впровадження було обмежене через низьку віддачу від інвестицій та низьку продуктивність на більшості завдань обробки тексту, навіть після навчання на великих обсягах даних. 

Нейронні мережі з довгостроковою пам’яттю 

Нейронні мережі з довгостроковою пам’яттю (LSTM) виникають як рішення, яке вирішує обмеження RNN, зокрема через механізм вибіркової оновлення та забування. Як і RNN, LSTM добре видобувають пари ключ-значення з речень. Однак, вони мають подібні труднощі з таблицями, що вимагає стратегічного розгляду послідовності та позиційних елементів.  

 Графічні процесори вперше були використані для глибокого навчання у 2012 році для розробки відомої моделі AlexNet CNN. Надалі деякі RNN також були треновані за допомогою графічних процесорів, хоча вони не дали добрих результатів. Сьогодні, незважаючи на наявність графічних процесорів, ці моделі в основному вийшли з використання та були замінені трансформерними LLM. 

Трансформер – Механізм уваги 

Введення трансформерів, особливо в революційній статті “Увага – це все, що потрібно” (2017), революціонізувало обробку природної мови, пропонуючи архітектуру “трансформера”. Ця архітектура дозволяє паралельні обчислення та майстерно захоплює довгострокові залежності, відкриваючи нові можливості для мовних моделей. LLM типу GPT, BERT та OPT використовують технологію трансформерів. У серці трансформерів лежить механізм “уваги”, ключовий внесок у покращення продуктивності при обробці послідовностей даних. 

Механізм “уваги” у трансформерах обчислює зважену суму значень на основі сумісності між “запитом” (промптом питання) та “ключем” (розумінням моделі кожного слова). Цій підхід дозволяє зосереджувати увагу під час генерації послідовностей, забезпечуючи точний видобуток. Два ключові компоненти всередині механізму уваги – це Самоувага, яка захоплює важливість між словами у вхідній послідовності, та Багатократна увага, яка дозволяє різноманітні шаблони уваги для конкретних відносин.  

У контексті видобутку даних з рахунків Самоувага розпізнає значення попередньо згаданої дати при видобутку сум платежів, тоді як Багатократна увага незалежно фокусується на числових значеннях (сумах) та текстових шаблонах (іменах постачальників). На відміну від RNN, трансформери не мають вбудованого розуміння порядку слів. Для вирішення цього вони використовують позиційне кодування для відстеження місця кожного слова в послідовності. Ця техніка застосовується як до вхідних, так і до вихідних вкладень, допомагаючи ідентифікувати ключі та їхні відповідні значення всередині документа.  

Комбінація механізмів уваги та позиційного кодування є важливою для здатності великої мовної моделі розпізнавати структуру як табличну, враховуючи її вміст, пробіли та текстові маркери. Ця уміння відрізняють її від інших методів видобутку неструктурованих даних.

Поточні тенденції та розробки 

Простір штучного інтелекту розвивається з перспективними тенденціями та розробками, змінюючи спосіб видобутку інформації з неструктурованих даних. Давайте глибше розглянемо ключові аспекти, які формують майбутнє цієї галузі. 

Розробки у сфері великих мовних моделей (LLM) 

Генеративний штучний інтелект переживає трансформаційний етап, з великими мовними моделями (LLM) на передньому плані у обробці складних та різноманітних наборів даних для видобутку неструктурованих даних. Дві помітні стратегії сприяють цим розробкам: 

  1. Багатомодальне навчання: LLM розширюють свої можливості, обробляючи одночасно різні типи даних, включаючи текст, зображення та аудіо. Це покращення підвищує їхню здатність видобувати цінну інформацію з різних джерел, збільшуючи їхню корисність у видобутку неструктурованих даних. Дослідники досліджують ефективні способи використання цих моделей, спрямовані на ліквідацію потреби у графічних процесорах та забезпечення роботи великих моделей з обмеженими ресурсами.
  1. Застосування RAG: Пошукова доповнена генерація (RAG) – це новий напрямок, який поєднує великі попередньо треновані мовні моделі з зовнішніми механізмами пошуку для покращення їхніх можливостей. Доступ до великої кількості документів під час процесу генерації перетворює базові мовні моделі на динамічні інструменти, придатні як для бізнесу, так і для споживчих застосунків.

Оцінка продуктивності LLM 

Виклик оцінки продуктивності LLM вирішується стратегічним підходом, який включає метрики, специфічні для завдань, та інноваційні методи оцінювання. Ключові розробки в цій сфері включають: 

  1. Метрики, налаштовані під завдання: Еmerge метрики оцінювання, розроблені для оцінки якості завдань видобутку інформації. Точність, повнота та показник F1 метрик доводять свою ефективність, особливо у завданнях типу видобутку сутностей.
  1. Оцінка людиною: Оцінка людиною залишається ключовою поряд з автоматичними метриками, забезпечуючи всебічну оцінку LLM. Інтегруючи автоматичні метрики з людською оцінкою, гібридні методи оцінювання пропонують нюансований погляд на контекстну правильність та актуальність видобутої інформації.

Обробка зображень та документів  

Багатомодальні LLM повністю замінили OCR. Користувачі можуть перетворювати сканований текст з зображень та документів у текст, який можна прочитати машині, з можливістю видобувати інформацію безпосередньо з візуального вмісту за допомогою модулів, заснованих на баченні. 

Видобуток даних з посилань та веб-сайтів 

LLM еволюціонують, щоб задовольнити зростаючий попит на видобуток даних з веб-сайтів та веб-посилань. Ці моделі все частіше застосовуються для веб-скрейпінгу, перетворюючи дані з веб-сторінок у структуровані формати. Ця тенденція невід’ємна для завдань типу агрегації новин, збору даних електронної комерції та конкурентної розвідки, підвищуючи контекстне розуміння та видобуток відносної інформації з вебу. 

Підйом малих гігантів у генеративному штучному інтелекті 

Перша половина 2023 року була зосереджена на розробці великих мовних моделей на основі припущення “чим більша, тим краще”. Однак, останні результати показують, що менші моделі, такі як TinyLlama та Dolly-v2-3B, з менш ніж 3 мільярдами параметрів, добре справляються з завданнями типу розуміння та підсумовування, заслуживши їм звання “малих гігантів”. Ці моделі використовують менше обчислювальної потужності та пам’яті, роблячи штучний інтелект більш доступним для менших компаній без потреби у дорогих графічних процесорах. 

Висновок 

Ранні моделі генеративного штучного інтелекту, включаючи генеративні адверсарні мережі (GAN) та варіаційні автоенкодери (VAE), запропонували нові підходи до обробки даних на основі зображень. Однак, справжній прорив стався з трансформерними великими мовними моделями. Ці моделі перевершили всі попередні методи у обробці неструктурованих даних завдяки своїй енкодер-декодерній структурі, самоувазі та багатократній увазі, надавши їм глибоке розуміння мови та можливість людського рівня розуміння. 

 Хоча генеративний штучний інтелект пропонує перспективний початок видобутку текстових даних з звітів, масштабованість таких підходів обмежена. Перші кроки часто включають обробку OCR, яка може призвести до помилок, і залишаються труднощі у видобутку тексту з зображень у звітах.  

 Видобуток тексту всередині зображень у звітах – це ще одна проблема. Прийняття рішень, таких як багатомодальна обробка даних та розширення обмежень токенів у GPT-4, Claud3, Gemini, пропонує перспективний шлях вперед. Однак, важливо зазначити, що ці моделі доступні лише через API. Хоча використання API для видобутку даних з документів є ефективним та економічним, воно має свої обмеження, такі як затримка, обмежений контроль та ризики безпеки.  

 Більш безпечне та налаштовуване рішення полягає у доналаштуванні внутрішньої LLM. Цей підхід не тільки мінімізує ризики безпеки даних, але й підвищує контроль над процесом видобутку даних. Доналаштування LLM для розуміння макету документів та для розуміння значення тексту на основі його контексту пропонує надійний метод видобутку пар ключ-значення та рядкових елементів. Використовуючи нульове та малообразне навчання, доналаштована модель може адаптуватися до різних макетів документів, забезпечуючи ефективний та точний видобуток неструктурованих даних у різних галузях. 

Джей Мішра, COO в Astera, провідному постачальнику рішень з даних без коду, є досвідченим лідером даних і аналітики з більш ніж 20-річним досвідом розробки трансформаційних стратегій для надання організації можливостей через рішення з даних, що працюють за допомогою штучного інтелекту.