ソートリーダー

AIの隠れたコスト: “ブラックボックス”モデルが信頼、予算、そして環境を蝕んでいる

mm
Unite.AI を Google の優先ソースに追加

AI業界はモデル設計に問題を抱えています。企業はコスト、パフォーマンス、信頼性の面でその影響を感じ始めています。

AIは話すことはできても、聞くことはできるでしょうか? 

リスニングは単に単語を処理するだけではなく、信号を解釈し、ニュアンスを理解してリアルタイムに意思決定することです。しかし、多くの「音声」モデルはトークンを書き起こすために作られており、会話に潜む微妙な意味を認識することはできません。その結果、重要な情報が欠落しています。 

音声のような環境では、コンテキスト、タイミング、継続的な入力が重要です。AIシステムがデモから実際の運用へと移行するにつれて、システム構築方法に根深い課題が浮き彫りになり、企業はコスト、パフォーマンス、信頼性の面でそのギャップの影響を感じ始めています。 

現在のAIにおける支配的なアプローチは、より大きく汎用的なモデルを優先することです。しかし、これらのモデルを大規模に展開すると、その限界は無視できなくなります。継続的に実行するコストが高く、解釈や信頼が難しく、適用されるタスクに対して非効率的であることが多いです。一見驚異的な単発デモでさえ、企業規模で展開すると、システムは同時に応答性、効率性、理解可能性を求められ、崩壊してしまいます。

このダイナミクスはトレードオフを生み出します。理論上はモデルができることの選択肢が増える一方で、効率性、透明性、最終的には使いやすさが犠牲になります。大規模モデルを運用するコストは上昇し、エネルギー消費は(正当な理由で)注目を浴び、システム自体の解釈も難しくなっています。取り返しのつかない段階に至る前に、自問すべきです:これが本当に持続可能なAIシステム構築の方法なのでしょうか?

汎用AIモデルが本質的に非効率的である理由

業界が汎用AIへと推し進めることで、新たな非効率性が生まれました。複雑さに関係なく、すべての問題やタスクに同じ重量級モデルを使用することです。単一のシステムで何でも処理できるという魅力的な考えですが、実際には鈍い道具に過ぎません。

すべてのタスクが大規模モデルを必要とするわけではありません。実際、ほとんどのタスクは必要としません。組織がモノリシックなシステムに依存すると、すべてのやり取りでその複雑さに伴うコストを支払うことになります。単純な意思決定でさえ、複雑なものと同じ計算負荷で処理され、規模が拡大すると経済性が急速に崩れます。

これは特に音声のようなリアルタイム環境で顕著です。システムは継続的なデータストリームを処理する必要があります。大規模な汎用モデルをすべてのやり取りのすべての瞬間に適用することは、費用がかかりすぎる上に不要です。これらのモデルが広く展開されるほど、非効率性は蓄積します。結果として、どちらの側面も最悪の状態、すなわちどこでも実行するには高すぎ、実際に機能するには限定的すぎるシステムが生まれます。 

この現象の明確な例はコンタクトセンターに見られます。多くの組織はすべての顧客対応にAIを適用したいと考えていますが、大規模モデルを継続的に稼働させるコストが現実的でありません。McKinseyがGlobal Survey on AIで指摘しているように、組織はコストと運用の複雑さからAIユースケースを広範にスケールさせるのに苦戦し続けています(参考までに、大規模エンタープライズのコンタクトセンターは1日あたり5,000〜15,000件の顧客電話を処理し、年間で数百万、場合によっては数十億件のやり取りになります)。このボリュームを管理するために、彼らは通話の一部だけを分析するか、事後レビューに頼っています。その下流の影響は測定可能です:39%の組織が詐欺関連の問い合わせに起因する通話増加を報告し、34%が処理時間の延長を報告、29%が従業員の生産性低下を報告しています¹。結果として、過剰にパワフルでありながら活用しきれていないシステム、すなわち運用コストは高いが、完全なカバレッジやリアルタイムの洞察を提供できない状態に陥っています。

ここで過度の汎用化が負債となります。すべてを行うように設計されたシステムは、各タスクを非効率的に処理しがちです。その結果、規模での計算資源が無駄になり、よりシンプルで的を絞ったアプローチが効果的な場面でも高価なモデルを走らせることになります。組織がAIをより広範に適用しようとするほど、この非効率性は急速に蓄積し、継続的かつリアルタイムな利用を正当化するのが困難になります。 

ブラックボックス問題:AIが自ら説明できないとき

モデルがより複雑になるにつれ、解釈も困難になっています。多くの場合、AIシステムは主に正確な出力を提供しますが、意思決定のプロセスや残りのエラーの原因についてはほとんど情報を提供しません。その曖昧さは、モデルの結果に基づいて行動する担当者の作業を遅延させ、当初得られたスピード向上の利点を失わせます。

これは特に不正検知などのリアルタイムでの意思決定が求められる領域で顕著です。システムが通話を高リスクとフラグ付けしたが、なぜかを説明できない場合、速度が最も重要になる瞬間に躊躇が生じます。チームは完全に理解できないシステムを信頼するか、リアルタイムで二度手間になるかの選択を迫られ、どちらもリスクを伴います。AIが業務フローに深く組み込まれるにつれ、リアルタイムでモデル出力を理解し対応できる能力は必須要件となり、単なる付加価値ではなくなります。

ここで大規模汎用モデルの限界がより顕在化します。その複雑さゆえに調査・デバッグ・適応が困難となり、結果として組織は単にコストが上がるだけでなく、意思決定プロセスと合致しないシステムに直面することになります。

この問題が崩れる場所:実世界におけるリアルタイムAI

これらの課題(コスト、非効率、透明性の欠如)は、限定的なユースケースでは管理可能です。しかし、AIが単に出力を生成するだけでなく、リアルタイムで意思決定を形作るシステムにおいては、無視できないほど深刻になります。

音声は好例です。バッチ処理やオフライン分析とは異なり、音声インタラクションは継続的で時間に敏感です。システムは後で一時停止・再処理・エスカレーションできず、瞬時に動作しなければなりません。たとえば、皮肉で言われた「Oh good, another AI」を肯定的に解釈してしまうと、顧客の保持・喪失の差になる可能性があり、人間が介入できる前に数秒で対処しなければなりません。つまり、会話全体を通してモデルを継続的に稼働させつつ、人間が即座に行動できる出力を生成し続ける必要があります。

ここで現在のパラダイムが崩れ始めます。大規模汎用モデルはその規模での運用コストが高く、出力もリアルタイムの意思決定を支えるには不透明すぎます。その結果、企業は妥協を余儀なくされます。たとえば、やり取りの一部だけを分析する、意思決定を事後に遅らせる、あるいは速度と正確性が重要な場面で不完全な人間判断に頼る、といった形です。

言い換えれば、今日のモデルの限界は理論的なものではなく、AIが最大の価値を提供すべき環境で最も顕著に現れます。

別の進むべき道:より賢く – 大きくなく – AI

現在のAIアプローチがスケールで定義されているなら、次のフェーズは効率性で定義されるでしょう。

すべてのタスクを単一モデルに回すのではなく、ワークフローを段階に分割し、日常的な意思決定には軽量モデルを、複雑なケースには重い処理を割り当てることが可能です。

この微妙なアーキテクチャのシフトは経済性を変えます。システムがタスクごとに必要な処理量を動的に判断できれば、不要に大規模モデルを走らせるオーバーヘッドを回避できます。これにより、AIを選択的ではなく継続的に適用することが実用的になり、さらに透明性の向上も期待できます。なぜなら、意思決定を単一の不透明なモデルからではなく、システム内の特定シグナルやコンポーネントに結び付けられるようになるからです。

企業にとって、これが広範な採用を可能にする要因です。コストや複雑さに阻まれることなく、リアルタイムでより多くのデータを分析できるようになることで、これまで手が届かなかったユースケースが解放されます。

業界はモデルを拡大することで大きな進歩を遂げましたが、すべてのケースに同一サイズは当てはまりません。AIが運用システムに深く組み込まれるにつれ、問われるのは「モデルが何をできるか」から「モデルをどう設計すべきか」へと変わります。AIの未来は最大規模のモデルで決まるのではなく、インテリジェンスを効率的かつ透明に、スケールで提供できるシステムで決まるでしょう。

マイク・パパスは、ボイスインテリジェンススタートアップModulateのCEO兼共同創設者であり、同社の商業セグメントを牽引し、AIボイスアナリティクスのベストプラクティスについて顧客にアドバイスし、国内外の規制およびコンプライアンス委員会に参加しています。