ロブ・ジャーディナは、Claritypeの共同創設者兼CEOです。Claritypeは、エンタープライズのデータ分析に説明可能性と監査可能性をもたらすAIシステムを開発している会社です。彼は以前、Palantir TechnologiesでForward Deployed Engineerとして勤務していました。
4人に3人が自分の組織がAIを使用していると述べています。しかし、その活動のほとんどはまだ構造化されていないコンテンツの中心にあります。会議のまとめ、メールの草案作成、またはカスタマー・サポートの自動化などです。しかし、皮肉にも、実際のビジネス上の決定を下すために使用されるデータの多くは、財務報告書、倉庫テーブル、KPIなど、まだAIの影響を受けていないままであります。その理由は、野心の欠如ではなく、信頼の欠如です。モデルが文を妄想することはよくありますが、数字を妄想することは災難です。CFOは検証できない答えに署名することはできません。今日、構造化されたデータは数十のシステムにわたって存在し、それぞれ独自のルールと関係性を持っています。AIがその複雑さを正しく推論することは、チャットボットよりも難しい課題です。ビジネスとそのチーム、非技術的なユーザーを含む、はデータと簡単にやり取りする必要があります。ボトルネックを減らし、迅速で正確な洞察を得るために、SQLを学ぶ必要はありません。いくつかの解決策が登場しています。いくつかの著名な例を見てみましょう。それらの利点と欠点も見てみましょう。AIと構造化データ – 遠すぎる橋過去2年間で、AIの洞察と構造化データを橋渡しするためのいくつかの取り組みが登場しています。多くは、多大なリソースとデータを持つテクノロジー大手から来ています。Snowflakeは、Cortex Analystを導入しました。これは、Snowflakeのデータ・ウェアハウスに対して自然言語の質問をユーザーが行えるようにします。精度を向上させるために、Cortexはセマンティック・メタ・データを提供する方法を持っています。しかし、このモデルは大幅に制限されています。まず、手動で構築する必要があり、さらに、10個を超えるテーブルでは動作しません。中規模の会社では十分ではありません。精度が低下するため、信頼性が損なわれます。同じ話は、AI/BI Genieを使用したDatabricksの試みにも当てはまります。この解決策は、小規模なドメインでのみ有効に展開でき、データセットが増加するにつれて精度が低下します。Microsoft Power BI Copilot は、ダッシュボード内にAIを直接埋め込み、視覚的な説明、測定の提案、報告書の草案作成を行います。探索を強化しますが、分析の推論や検証方法には変化しません。各回答はまだモデルの判断に依存しており、その判断が失敗した場合、監査証跡や決定論的ロジックに頼ることはできません。これらのシステムは、全体として正しい方向を向いています。企業の構造化されたデータにAIを展開しています。しかし、重要な欠点を共有しています。AIモデルが自然言語からSQLを生成することに依存しており、そのSQLが間違っている場合、ビジネス・ユーザーは立ち往生します。SQLを読むことができない幹部は、結果を診断または修正する方法がありません。会話はそこで終わります。別のアプローチは、予想される質問と回答のペアを事前にインデックス化することです。AdaのGARAGeを含むいくつかのシステムがこの方法を使用しています。予測可能な質問を持つ狭いドメインでは機能しますが、データの複雑さが増すとパフォーマンスが低下します。テーブルやスキーマが増えると、事前にインデックス化はすぐに管理不能になります。別の道:ジェネレーティブ・オーグメンテッド・リトリーバルジェネレーティブ・オーグメンテッド・リトリーバル(GAR)は、現在のRAGアプローチを逆転させます(Retrieval-Augmented Generationは関連情報を取得し、LLMに統合して精度を向上させます)。GARは、LLMにSQLを書かせるのではなく、ジェネレーティブAIを使用してユーザーのクエリの意図を理解し、答えを生成するための推論ステップを作成します。GARでは、クエリは直接ノウledgeベースとやり取りします。コンパイルされるのではなく、生成されるのです。同じ質問は常に同じ答えを生成します。GARの推論チェーンは、一時的な会話ではなく、恒久的なレビュー可能なアーティファクトです。したがって、推論の全チェーンを再現することができます。その結果、結果は一般的なgenAIエンジンよりも指数関数的に正確になります。GARの核となる部分では、3つのことが行われます: セマンティック・レイヤーを自動的に構築します。GARは、AIを使用してシステム全体の関係性やビジネス定義を発見し、データを単一のモデルに統一します ビジネス上の意図を高レベルの分析言語に翻訳します。この言語は、ビジネス概念レベル(「Q2のプロバイダーごとの売上高」など)でクエリを捉え、直接SQLにコンパイルします。 推論の各ステップを監査可能な形でログします。各回答の起源は追跡可能です。 これが重要な理由ビジネスの内部ノウレッジ・モデルに推論を制限することで、GARは妄想やエラーを排除し、確かに正しい答えを提供できます。定義、メトリクス、クエリ・パターンは時間の経過とともに蓄積し、将来の回答はさらにカスタマイズされます。信頼性は、構造化されたデータに基づいて情報に基づいたビジネス上の決定を下すビジネス・ユーザーにとって非常に重要です。さらに多くの組織が高度なAIソリューションを実装するにつれて、妄想やエラーのリスクをほぼゼロに抑えるフレームワークを要求するようになるでしょう。それは、クエリが直接データに接続され、AIが大規模なデータセットで動作することなく、答えが一貫性と検証可能性で提供される場合に起こります。