AIモデルとプラットフォーム
クモがKumoRFM-2を発表、従来の企業向けマシンラーニングを置き換える基礎モデル

クモは、KumoRFM-2を発表しました。これは、構造化された企業データに特化した次世代の基礎モデルで、データウェアハウスから予測を生成する際の組織のアプローチを根本的に変えるものです。従来のマシンラーニングパイプラインが機能エンジニアリングとカスタムモデル開発に数ヶ月を要するのに対し、KumoRFM-2は、自然言語を使用して、トレーニングや専門知識を必要とせずに、瞬時に予測を生成できるようにします。
その核となる部分では、モデルは、従来のマシンラーニングパイプラインを単一の事前トレーニング済みシステムに置き換えます。
静的なパイプラインからリアルタイム予測システムへ
企業予測分析は、従来、遅く、リソースを大量に消費するものでした。各新しいユースケース(顧客流失予測、不正検出、需要予測など)には、通常、データクリーンアップ、機能エンジニアリング、モデルトレーニング、チューニングを含む個別のパイプラインが必要です。
代わりに、KumoRFM-2は、ユーザーが予測したいものを定義するだけで済みます。モデルはリクエストを解釈し、基礎となるデータベースから必要なコンテキストを構築し、単一のパスで予測を生成します。これは、関係グラフ変換器アーキテクチャと呼ばれる宣言型インターフェイスを組み合わせた結果です。
結果として、モデルは「モデルを構築する」ことから「質問する」ことに重点を置くように変わり、予測AIを使用するための障壁を大幅に低減します。
関係データがなぜ難しかったのか
ほとんどの既存のAIシステムは、構造化された企業データを扱うのに苦労しています。なぜなら、データを不正に扱うからです。
従来のモデル、多くの表形式AIシステム、さらには大規模な言語モデルも、データを単一の表形式に平坦化することに頼っています。しかし、実際の企業データは、顧客、取引、製品、在庫などの相互に接続されたシステムとして存在します。
この構造を平坦化すると、予測に最も貴重な信号を含む関係が失われます。また、チームは手動でこれらの信号を機能エンジニアリングを通じて再作成する必要がありますが、これは時間がかかり、エラーを生み出しやすいプロセスです。
KumoRFM-2は、関係データベースを直接操作することでこの問題を完全に回避し、テーブル、タイムスタンプ、エンティティ間の接続を維持します。
KumoRFM-2のアーキテクチャ
KumoRFM-2の背後にある主な革新は、階層的な関係グラフ変換器アーキテクチャです。これは、データを同時に複数のレベルで処理します。
最初のレベルでは、モデルは、行と列の注目度の組み合わせを使用して個々のテーブルを分析します。これにより、モデルはテーブル内の特徴の関係を理解し、無関係またはノイズの多いデータを早期に除外できます。重要な点は、予測対象がこの段階で導入されることです。つまり、モデルは最初からタスクに条件付けられます。
2番目のレベルでは、モデルはテーブル間のグラフベースの推論を実行します。外部キー関係を使用して、顧客プロファイルと購入履歴、または行動パターンをリンクし、テーブル間で失われる可能性のある信号を特定します。
3番目のレベルでは、モデルはサンプル間の注目度を組み込み、複数の例から同時に学習できるようにします。これにより、完全なトレーニングデータセットを必要とせずに、比較的小規模なコンテキスト例から一般化できるようになります。
この段階的な設計は重要です。データポイントを同時に処理することによる計算爆発を避けると同時に、ノイズをフィルタリングすることで精度も向上します。
トレーニングの代わりにコンテキスト学習
KumoRFM-2の特徴的な機能は、従来のトレーニングではなくコンテキスト学習に頼ることです。
タスクごとにモデルをトレーニングするのではなく、KumoRFM-2は、合成データと実世界の関係データの混合で事前トレーニングされます。ユーザーが予測リクエストを提出すると、システムは自動的にコンテキスト例のセットを生成します。これは、データベースの小さなサブグラフと既知の結果のペアです。
これらの例は、モデルがパターンを推測し、重みを更新せずに予測を生成できるように、ガイダンスとして機能します。実践では、これは次のことを意味します:
- タスクごとのトレーニングは不要
- 機能エンジニアリングは不要
- モデルチューニングは不要
通常、教師あり学習に必要なデータの0.2%しか使用しなくても、モデルは最先端のパフォーマンスを達成できます。
リアルワールドベンチマークでのパフォーマンス
KumoRFM-2は、ECサイト、ヘルスケア、ソーシャルプラットフォーム、企業システムなどの業界を網羅する41の予測タスクで評価されています。
モデルは、従来の教師ありマシンラーニングアプローチ、エンジニアリングされたアンサンブル、関係深層学習システムを一貫して上回ります。企業ベンチマークでは、広く使用されているソリューションを大幅に上回り、ファインチューニングによってさらに改善されます。
生の精度だけでなく、モデルは強力なロバスト性も示しています:
- 関係リンクの多くが欠落していてもパフォーマンスを維持
- ノイズまたは不完全なデータで最小限の劣化
- 歴史データが限られているコールドスタートシナリオで良好なパフォーマンス
この堅牢性は、データ品質がしばしば一貫性がない企業環境では特に重要です。
スケーラビリティの向上:500億行まで
KumoRFM-2は、現代のデータインフラストラクチャのスケールで動作するように設計されています。
システムは、データベースネイティブの実行と、高スループットのデータアクセスが可能なカスタムグラフエンジンの組み合わせにより、500億行を超えるデータセットを処理できます。代わりに、MLシステムにデータを移動するのではなく、計算はデータが存在する場所、SQLデータベースまたはクラウドデータウェアハウスに直接プッシュされます。
このアプローチにより、待機時間が短縮され、デプロイが簡素化され、組織は既存のワークフローに予測機能を直接統合できるようになります。
自然言語をインターフェイスとして
別の特徴的な機能は、モデルの自然言語インターフェイスです。
ユーザーは、次のような質問を投げかけることができます:
- 30日以内に流失する可能性のある顧客は誰か?
- どのリードが最も変換される可能性があるか?
- どの製品が需要の増加をみせるか?
システムは、これらのクエリを構造化された予測ロジックに翻訳し、基礎となるデータで実行し、予測と説明の両方を返します。
これにより、予測分析がさらにアクセスしやすくなり、AIエージェントとの統合も可能になり、予測は自動化された意思決定ワークフローの一部として埋め込むことができます。
エージェント駆動型企業インテリジェンスへの道
KumoRFM-2は、エージェントを念頭に置いて設計されています。
その予測機能は、AIエージェントがより大きなワークフローの一部として呼び出すことができるモジュラー「スキル」として公開できます。これにより、予測モデリングは、検索、推論、実行と組み合わせることができる構成可能なビルディングブロックとなります。
この文脈では、モデルは、分析者にとってのツールではなく、次世代の企業オートメーションの基礎レイヤーです。
データサイエンスの役割の再定義
KumoRFM-2は、組織がデータサイエンスに取り組む方法をより広い意味で変える信号を送ります。
代わりに、チームは、瞬時に新しい問題に適応する単一の汎用システムに頼ることができます。これにより、機能エンジニアリングとモデルチューニングの専門知識の必要性が減り、実験とイテレーションのスピードが上がります。
多くの組織にとって、これは、集中型のデータサイエンス機能から、予測インサイトを複数の部門でアクセス可能な、より分散型のモデルへの移行を意味する可能性があります。
新しい基礎モデル
基礎モデルは、すでに言語やビジョンの分野を変革していますが、構造化された企業データは、最後のフロンティアの1つとして残っていました。
KumoRFM-2は、構造化データ用の専門化された基礎モデルの初期の例を表しています。関係推論、コンテキスト学習、自然言語インタラクションを組み合わせることで、予測AIの新しいパラダイムを導入します。
広く採用されれば、このアプローチは、企業がデータとやり取りする方法を再定義する可能性があり、予測分析を、複雑で遅れたプロセスから、リアルタイムの組織全体の機能に変えることができます。












