Лидеры мнений

Почему Генеративно-Усиленное Извлечение Данных Является Новым Рубежом Аналитики Данных

mm
Добавьте Unite.AI в избранные источники в Google

Три из четырех человек говорят, что их организации используют ИИ. Однако большинство этой деятельности все еще сосредоточено на неструктурированном контенте: суммировании встреч, составлении электронных писем или автоматизации поддержки клиентов.

Но иронично, что так много данных, которые фактически определяют бизнес-решения – финансовые отчеты, таблицы складов и KPI – остаются в значительной степени не затронутыми ИИ.

Причина не в отсутствии амбиций, а в отсутствии доверия. Когда модель “галлюцинирует” предложение, это часто можно исправить; когда она “галлюцинирует” число, это катастрофично. Финансовый директор не может утвердить ответ, который он не может проверить.

Сегодня структурированные данные живут в десятках систем, каждая со своими правилами и отношениями. Получение ИИ для правильного рассуждения через эту сложность – более сложная задача, чем любой чат-бот.

Бизнес и их команды – включая непрофессиональных пользователей – должны быть в состоянии взаимодействовать со своими данными простым способом, чтобы уменьшить узкие места и получить быстрые, точные идеи. Без необходимости изучать SQL.

Некоторые решения появляются – давайте рассмотрим некоторые заметные примеры, с их преимуществами и недостатками.

ИИ и структурированные данные – мост слишком далеко

За последние два года несколько усилий предпринимались, чтобы соединить идеи ИИ и структурированные данные.

Многие из них исходят от технологических гигантов с значительными ресурсами и данными. Snowflake, например, представил Cortex Analyst, который пытается позволить пользователям задавать естественно-языковые вопросы к хранилищу данных Snowflake.

Чтобы улучшить точность, Cortex имеет способ предоставить семантические метаданные – но модель сильно ограничена. Во-первых, она должна быть построена вручную, и даже тогда она может работать только с максимумом 10 таблиц, что явно недостаточно даже для средней компании. Больше, и доверие разрывается, поскольку точность снижается.

История повторяется с попытками Databricks, который использовал подход “текст в SQL” с AI/BI Genie. Это решение может быть эффективно развернуто только на небольших доменах, теряя точность с увеличением наборов данных.

Microsoft Power BI Copilot использует поверхностный генеративный подход, встраивая ИИ直接 в панели управления, чтобы описать визуальные элементы, предложить меры и составить отчеты. Он улучшает исследование, но не меняет, как аналитика рассуждают или проверяются. Каждый ответ все еще зависит от суждения модели, и когда это суждение терпит неудачу, нет аудиторской трассы или детерминированной логики, на которую можно было бы опираться.

Коллективно, эти системы указывают в правильном направлении: развертывание ИИ на структурированных корпоративных данных. Но они также имеют критический недостаток. Они полагаются на модель ИИ для генерации SQL из естественно-языковых запросов, и когда этот SQL неверен, что происходит часто, бизнес-пользователь застревает. Руководитель, который не может прочитать SQL, не имеет способа диагностировать или исправить результат. Разговор заканчивается.

Другой способ подойти к этой проблеме – предварительно проиндексировать вероятные пары вопрос-ответ. GARAGe Ada, среди других, следует этому методу. Он работает хорошо в узких доменах, где вопросы предсказуемы, но производительность снижается, когда растет сложность данных. Как только таблицы и схемы умножаются, предварительное индексирование быстро становится неуправляемым.

Другой Путь: Генеративно-Усиленное Извлечение

Генеративно-Усиленное Извлечение (GAR) переворачивает текущий подход RAG (Retrieval-Augmented Generation источников актуальной информации и включает ее в LLM для повышения точности).

Вместо того, чтобы просить LLM написать SQL, GAR использует генеративный ИИ, чтобы понять намерение запроса пользователя, и затем создает шаги рассуждения, чтобы сгенерировать ответ.

В GAR запросы взаимодействуют напрямую с базой знаний. Они компилируются, а не генерируются, один и тот же вопрос всегда дает один и тот же ответ. Цепочка рассуждения в GAR – это постоянный, проверяемый артефакт, а не временный чат, поэтому всю цепочку рассуждения можно воспроизвести.

Это означает, что результаты экспоненциально более точны, чем у генерализированных генеративных двигателей.

В своей основе GAR делает три вещи:

  1. Автоматически строит семантический слой. GAR использует ИИ, чтобы открыть отношения и бизнес-определения через системы, объединяя данные в единую модель
  2. Переводит бизнес-намерение в высокоуровневый аналитический язык. Этот язык захватывает запрос на уровне бизнес-контцепции (“выручка за посещение по поставщику за Q2”) и компилируется напрямую в SQL.
  3. Регистрирует каждый шаг рассуждения для аудиторской трассы. Происхождение каждого ответа можно отслеживать.

Почему Это Важно

Ограничивая рассуждение собственной внутренней моделью знаний бизнеса, GAR может устранить “галлюцинации” и доставить ответы, которые доказательно верны.

Определения, метрики и шаблоны запросов накапливаются со временем, что делает будущие ответы еще более адаптированными для конкретного пользователя.

Элемент доверия имеет решающее значение для бизнес-пользователей, которые полагаются на свои структурированные данные, чтобы принимать обоснованные бизнес-решения. Когда все больше и больше организаций реализуют передовые решения ИИ, они будут требовать рамок, которые снижают риск “галлюцинаций” и ошибок до почти нуля.

Это происходит, когда запросы напрямую соединяются с вашими данными, когда ИИ может работать с большими наборами данных без сбоев, и когда ответы предоставляются с последовательностью и доказательностью.

Роб Джардина является сооснователем и генеральным директором Claritype, компании, разрабатывающей системы искусственного интеллекта, которые обеспечивают объяснимость и аудитability корпоративной аналитики данных. Ранее он работал в качестве инженера, развернутого в Palantir Technologies.