アニタ・カーコフスカは、強力な機械学習の背景を持つAIの専門家で、GenAIとLLM教育に特化しています。フルブライト奨学生だった彼女は、Vellumの成長と教育を率いており、企業がAI製品を構築して拡大するのを支援しています。她はLLM評価を実施し、AIのベストプラクティスについて広く執筆し、ビジネスリーダーが効果的なAIの導入を推進できるようにしています。
最近の調査データから、1,250以上の開発チームが明らかにした驚くべき現実が浮かび上がっています:55.2%のチームが今年、より複雑なエージェントワークフローを構築することを計画していますが、現在、AIアプリケーションを本稼働環境にデプロイしたチームは25.1%しかありません。この、野心と実装のギャップは、業界が直面している重要な課題を浮き彫りにしています:どのようにして、効果的に、より自律的なAIシステムを構築し、評価し、拡張することができるのでしょうか。エージェントの抽象的な定義について議論するのではなく、実装上の課題と、開発チームが現在直面している能力スペクトルに焦点を当てましょう。自律性フレームワークの理解自律走行車が定義された能力レベルを通過するのと同様に、AIシステムも開発のトラジェクトリーをたどり、各レベルは前の能力を基盤としています。この6レベルのフレームワーク(L0-L5)は、開発者に、AIの実装を評価し、計画するための実用的レンズを提供します。 L0:ルールベースワークフロー(フォロワー)- 真の知能を持たない、事前に定義されたルールによる伝統的な自動化 L1:基本的なレスポンダー(エクスキューター)- 入力に反応するが、記憶や反復的推論が欠如するリアクティブシステム L2:ツールの使用(アクター)- 外部ツールを呼び出し、結果を統合することを積極的に決定するシステム L3:観察、計画、行動(オペレーター)- 自己評価機能を持つマルチステップワークフロー L4:完全に自律的な(エクスプローラー)- 状態を維持し、独立してアクションをトリガーする持続的なシステム L5:完全に創造的な(発明家)- 未知の問題を解決するための新しいツールやアプローチを生み出すシステム 現在の実装の現実:多くのチームが現在いる場所実装の現実は、理論的なフレームワークと本稼働システムの間にある明確な対比を浮き彫りにしています。私たちの調査データによると、多くのチームはまだ実装の成熟度の初期段階にあります: 25%は戦略の開発に留まっている 21%はコンセプトの証明を構築中 1%はベータ環境でテスト中 1%は本稼働環境に到達 この分布は、概念から実装への移行の実用的課題を浮き彫りにしており、低い自律性レベルでも同様です。自律性レベル別の技術的課題L0-L1:基盤の構築現在の本稼働AIシステムのほとんどはこれらのレベルで動作しており、51.4%のチームがカスタマーサービスチャットボットの開発に取り組み、59.7%のチームがドキュメントパーシングに焦点を当てています。この段階での主な実装上の課題は、理論的な限界ではなく、統合の複雑さと信頼性です。L2:現在のフロンティアここで最先端の開発が進行中であり、59.7%のチームがベクトルデータベースを使用してAIシステムを事実情報に基づいて構築しています。開発アプローチは幅広く: 2%は内部ツールで構築 9%は第三者によるAI開発プラットフォームを利用 9%はプロンプトエンジニアリングのみに頼る L2開発の実験的性質は、進化するベストプラクティスと技術的考慮を反映しています。チームは重大な実装上の障害に直面しています。57.4%のチームがホールシネーション管理をトップの懸念事項として挙げており、次にユースケースの優先順位付け(42.5%)と技術的専門知識のギャップ(38%)が続きます。L3-L5:実装の障害モデル能力の重大な進歩にもかかわらず、基本的な限界が高い自律性レベルへの進歩を妨げています。現在のモデルは重要な制約を示しています:訓練データに過剰に適合するのではなく、真の推論を示すことができないのです。これは、53.5%のチームがファインチューニング(32.5%)ではなくプロンプトエンジニアリングに頼っている理由です。技術スタックの考慮技術的実装スタックは現在の能力と限界を反映しています: マルチモーダル統合:テキスト(93.8%)、ファイル(62.1%)、画像(49.8%)、オーディオ(27.7%) モデルプロバイダー:OpenAI(63.3%)、Microsoft /Azure(33.8%)、Anthropic(32.3%)...