사상 리더

생성적 증강 검색이 데이터 분석의 차세대 전략이다

mm
Unite.AI를 Google의 선호 소스에 추가

4명 중 3명은 자신의 조직에서 AI를 사용한다고 말합니다. 그러나 대부분의 활동은 여전히 비정형 콘텐츠에 중점을 두고 있습니다. 회의 요약, 이메일 초안 작성, 또는 고객 지원 자동화와 같은 작업에 중점을 두고 있습니다.

하지만 아이러니하게도, 실제로 비즈니스 의사 결정에 영향을 미치는 데이터 – 재무 보고서, 창고 테이블, KPI와 같은 데이터는 대부분 AI의 영향을 받지 못하고 있습니다.

이유는雄心부족이 아니라 신뢰의 부족입니다. 모델이 문장을 상상할 때, 그것은 종종 고칠 수 있지만, 모델이 숫자를 상상할 때, 그것은 재앙적입니다. CFO는 검증할 수 없는 답변에 서명할 수 없습니다.

오늘날, 구조화된 데이터는 수십 개의 시스템에 걸쳐 있으며, 각 시스템에는 자신의 규칙과 관계가 있습니다. AI가 이러한 복잡성에 걸쳐 올바르게 추론하도록 하는 것은 어떤 챗봇보다 더 어려운 도전입니다.

비즈니스와 팀 – 비기술적 사용자를 포함하여 – 데이터와 간단하게 상호 작용하여 병목 현상을 줄이고 빠른 정확한 통찰력을 얻을 수 있어야 합니다. SQL을 배우지 않아도 됩니다.

일부 솔루션이 등장하고 있습니다. 몇 가지 주요 예를 살펴보겠습니다.

AI와 구조화된 데이터 – 너무 먼 다리

過去 2년 동안, AI 통찰력과 구조화된 데이터를 연결하려는 여러 시도가 나타났습니다.

많은 시도가 기술 거물에서 나왔으며, 상당한 자원과 데이터를 가지고 있습니다. Snowflake는 Cortex Analyst를 도입하여, 사용자가 Snowflake 데이터 웨어하우스에 대한 자연어 질문을 할 수 있도록 했습니다.

정확성을 개선하기 위해 Cortex는 의미 메타 데이터를 제공하는 방법을 가지고 있지만, 모델은 크게 제한적입니다. 먼저, 수동으로 구축되어야 하며, 최대 10개의 테이블에서만 작동할 수 있습니다. 이는 중간 규모의 회사에 대해서도 충분하지 않습니다. 더 높은 수준에서는 신뢰가 깨지며, 정확성이 떨어집니다.

이 이야기는 Databricks의 시도와도 반복됩니다. Databricks는 AI/BI Genie를 통해 텍스트-SQL 접근 방식을 취했습니다. 이 솔루션은 작은 도메인에서만 효과적으로 배포할 수 있으며, 데이터셋이 증가함에 따라 정확성이 떨어집니다.

Microsoft Power BI Copilot 는 표면 수준의 생성적 접근 방식을 취하여, 대시보드 내에 AI를 직접 내장하여 시각화에 대한 설명, 측정값 제안, 보고서 초안을 제공합니다. 이것은 탐색을 강화하지만, 분석이 어떻게 추론되고 검증되는지에 대한 변경은 없습니다. 각 응답은 모델의 판단에 의존하며, 모델의 판단이 실패하면, 오디트 트레일이나 결정론적 논리가 뒤따르지 않습니다.

이 시스템들은 올바른 방향을 가리키고 있습니다. 구조화된 엔터프라이즈 데이터에 AI를 배포하는 것입니다. 그러나, 모두 중요한 결함을 공유합니다. 자연어에서 SQL을 생성하기 위해 AI 모델에 의존하기 때문입니다. SQL이 잘못된 경우, 비즈니스 사용자는 막히게 됩니다. SQL을 읽을 수 없는 이사는 결과를 진단하거나 수정할 방법이 없습니다. 대화가 중단됩니다.

다른 접근 방식은 가능한 질문-답변 쌍을 미리 인덱싱하는 것입니다. Ada의 GARAGe를 포함한 일부 솔루션은 이 방법을 따릅니다. 이것은 예상 가능한 질문이 있는 狭い 도메인에서 잘 작동합니다. 그러나 데이터 복잡성이 증가함에 따라 성능이 떨어집니다. 테이블과 스키마가 증가하면, 인덱싱은 관리할 수 없게 됩니다.

다른 길: 생성적 증강 검색

생성적 증강 검색 (GAR)은 현재의 RAG 접근 방식을 뒤집습니다 (검색 증강 생성은 관련 정보를 검색하여 LLM에 통합하여 정확성을 높입니다).

GAR은 사용자의 질의 의도를 이해하기 위해 생성적 AI를 사용한 다음, 답변을 생성하기 위한 추론 단계를 만듭니다.

GAR에서, 질의는 지식 베이스와 직접 상호 작용합니다. 컴파일되며, 생성되지 않습니다. 동일한 질문은 항상 동일한 답변을 생성합니다. GAR의 추론 체인은 일시적인 채팅이 아닌, 영구적이고 검토 가능한 아티팩트입니다. 따라서 전체 추론 체인을 재현할 수 있습니다.

그 결과, 결과는 일반화된 genAI 엔진보다 훨씬 더 정확합니다.

GAR의 핵심은 세 가지 일을 합니다:

  1. 의미적 계층을 자동으로 구축합니다. GAR는 시스템 전체의 관계와 비즈니스 정의를 발견하기 위해 AI를 사용하여, 데이터를 단일 모델로 통합합니다
  2. 비즈니스 의도를 높은 수준의 분석 언어로 번역합니다. 이 언어는 비즈니스 개념 수준 (“제공자에 따른 2분기 매출”)에서 질의를 포착하고 SQL로 직접 컴파일합니다.
  3. 모든 추론 단계를 감사 가능하게 로깅합니다. 각 응답의 출처는 추적할 수 있습니다.

왜 이것이 중요할까

GAR는 비즈니스의 내부 지식 모델에 추론을 제한함으로써, 상상과 오류를 제거하고, 검증 가능한 답변을 제공할 수 있습니다.

정의, 메트릭, 질의 패턴은 시간이 지남에 따라 누적되며, 미래의 답변은 사용자에게 더 맞춤화됩니다.

신뢰는 비즈니스 사용자에게 중요합니다. 구조화된 데이터를 사용하여 정보에 기반한 비즈니스 결정을 내리기 때문입니다. 더 많은 조직이 고급 AI 솔루션을 구현할수록, 그들은 상상과 오류의 위험을 거의 0으로 낮추는 프레임워크를 요구할 것입니다.

그것은 데이터에 직접 연결된 질의, 대량 데이터 세트에서 작동하는 AI, 일관성과 검증 가능성을 제공하는 답변으로 일어납니다.

로브 지아르디나(Rob Giardina)는 클래리티(Claritype)의 공동 창립자이자 CEO로, 기업 데이터 분석에 설명 가능성과 감사 가능성을 제공하는 AI 시스템을 개발하는 회사입니다. 그는 이전에 팔란티어 테크놀로지(Palantir Technologies)에서 전방 배치 엔지니어로 근무했습니다.