Лідери думок

Чому Генеративно-Підтримуване Відновлення Даних Є Наступним Рубіжем Аналітики Даних

mm
Додайте Unite.AI до бажаних джерел у Google

Три з чотирьох людей кажуть, що їхні організації використовують штучний інтелект. Однак більшість цієї діяльності все ще зосереджена на неструктурованих даних: підсумовуванні зустрічей, складанні електронних листів або автоматизації підтримки клієнтів.

Але іронічно, що більша частина даних, які фактично керують бізнес-рішеннями – фінансовими звітами, таблицями складу та показниками ефективності – залишається майже не зачепленою штучним інтелектом.

Причина полягає не в браку амбіцій, а в браку довіри. Коли модель “галлюцинує” речення, це часто можна виправити; коли вона “галлюцинує” число, це катастрофічно. Фінансовий директор не може підписати відповідь, яку він не може перевірити.

Сьогодні структуровані дані живуть у десятках систем, кожна з яких має свої власні правила та відносини. Отримання штучного інтелекту для правильного розуміння цієї складності – це складніше завдання, ніж будь-який чат-бот.

Бізнеси та їхні команди – включаючи неквалифікованих користувачів – повинні мати можливість взаємодіяти зі своїми даними простим способом, щоб зменшити затори та отримувати швидкі та точні висновки. Без необхідності вивчати SQL.

Деякі рішення з’являються – давайте розглянемо деякі відомі приклади, з їхніми перевагами та недоліками.

Штучний Інтелект і Структуровані Дані – Міст Занадто Далеко

За останні два роки з’явилися кілька спроб поєднати висновки штучного інтелекту та структуровані дані.

Багато з них походять від технологічних гігантів з значними ресурсами та даними. Snowflake, наприклад, ввела Cortex Analyst з Cortex Analyst, який намагається дозволити користувачам ставити природні мовні запитання до сховища даних Snowflake.

Для підвищення точності Cortex має спосіб надання семантичних метаданих – але модель сильно обмежена. По-перше, її потрібно створити вручну, і навіть так, вона може працювати лише з максимально 10 таблицями, чого недостатньо навіть для середньої компанії. Вище, і довіра розбивається, оскільки точність знижується.

Історія повторюється з спробами Databricks, який прийняв підхід “текст до SQL” з AI/BI Genie. Це рішення можна ефективно розгорнути лише на малих доменах, втрачаючи точність при збільшенні наборів даних.

Microsoft Power BI Copilot приймає поверхневий генеративний підхід, вбудовуючи штучний інтелект безпосередньо в панелі управління, щоб описувати візуальні дані, пропонувати заходи та складати звіти. Це підвищує дослідження, але не змінює, як аналітика розуміє або верифікує. Кожна відповідь все ще залежить від судження моделі, і коли це судження виходить з ладу, немає аудиторської траси чи детермінової логіки, на яку можна спертися.

Колективно, ці системи вказують у правильному напрямку: розгортання штучного інтелекту на структурованих підприємствах даних. Але вони також мають критичний недолік. Вони залежать від моделі штучного інтелекту для генерації SQL з природної мови, і коли цей SQL неправильний, що відбувається часто, бізнес-користувач застряє. Виконавчий директор, який не може читати SQL, не має способу діагностувати або виправити результат. Розмова зупиняється.

Інший спосіб підходу до цієї проблеми – попередньо індексувати ймовірні питання-відповіді. GARAGe Ada, серед інших, слідує цьому методу. Це працює добре у вузьких доменах, де питання передбачувані, але продуктивність знижується, коли складність даних зростає. Як тільки таблиці та схеми множаться, попереднє індексування швидко стає не керованим.

Інший Шлях: Генеративно-Підтримуване Відновлення

Генеративно-Підтримуване Відновлення (GAR) перевернуло поточний підхід RAG (Retrieval-Augmented Generation джерела актуальної інформації та включення її в LLM для підвищення точності).

Натомість ніж просити LLM написати SQL, GAR використовує генеративний штучний інтелект для розуміння намірів запиту користувача, а потім створює кроки розуміння для генерації відповіді.

У GAR запити взаємодіють безпосередньо з базою знань. Вони компілюються, а не генеруються, тому相同не питання завжди дає相同ну відповідь. Ланцюжок розуміння в GAR – це постійна, переглядна артефакт, а не тимчасовий чат, тому весь ланцюжок розуміння можна відтворити.

Це означає, що результати експоненціально точніше, ніж у генералізованих генеративних двигунах.

У своєму ядрі GAR робить три речі:

  1. Автоматично будує семантичний шар. GAR використовує штучний інтелект для відкриття відносин та бізнес-визначень між системами, уніфікуючи дані в одну модель
  2. Перекладає бізнес-намір у високорівневу аналітичну мову. Ця мова захоплює запит на рівні бізнес-концепції (“доходи за відвідування за постачальником для другого кварталу”) і компілюється безпосередньо в SQL.
  3. Реєструє кожен крок розуміння для аудитабельності. Походження кожної відповіді можна відстежити.

Чому Це Має Значення

Обмежуючи розуміння власною внутрішньою моделлю знань бізнесу, GAR може ліквідувати “галлюцинації” та надавати відповіді, які є доведено правильними.

Визначення, метрики та шаблони запитів накопичуються з часом, роблячи майбутні відповіді ще більш персоналізованими для свого конкретного користувача.

Елемент довіри є критично важливим для бізнес-користувачів, які залежать від своїх структурованих даних для прийняття інформованих бізнес-рішень. Як більше організацій впроваджують розширені рішення штучного інтелекту, вони будуть вимагати рамок, які приведуть ризик “галлюцинацій” та помилок до майже нуля.

Це відбувається, коли запитування безпосередньо з’єднується з вашими даними, коли штучний інтелект може працювати з великими наборами даних без порушення, і коли відповіді надаються з послідовністю та доведенням.

Роб Джардіна є співзасновником і генеральним директором компанії Claritype, яка розробляє системи штучного інтелекту, що забезпечують пояснюваність і аудитованість підприємств даних аналітики. Раніше він працював інженером компанії Palantir Technologies.