ソートリーダー
AIは実務にまだ準備できていない:なぜモデルは複雑なタスクで失敗するのか

AIバブルの投資家は、ホワイトカラーの専門家に最も難しい課題を引き渡すよう懇願し、データをもう少しだけ提供すれば午後の時間が取り戻せると労働者に約束します。複雑な分析や判断、何年もかけて構築されたワークフローがモデルに吸収され、人間はより良いことに専念できるとされています。これは現在の米国企業で支配的な物語であり、罠です。
能力神話:なぜモデルは複雑なタスクで失敗するのか
カリフォルニア大学バークレー校の新しい研究では、ヘルスケアから金融、法律まで55の産業にわたる実務タスクに対して、主要なAIエージェントをテストしました。全体的なパフォーマンスは25%未満でした。その後、研究者は各分野で最も難しいタスク—シニア専門家とジュニア専門家を分けるような仕事—を抽出しましたが、すべてのモデルが失敗しました。スコアは低いだけでなく、ゼロでした。
そのような結果が出れば物語は自ずと変わるはずですが、実際には変わっていません。産業全体で、AI投資家は現在のAIモデルが実際よりも進んでいると専門家に信じさせようと必死です。しかし最も興味深い問いは、AIが今日の仕事の最も難しい部分をこなせるかどうかではありません。私たちも、AIを販売する側もすでにその答えを知っているからです。
そこで、別の問いが生まれます。このデータ交換に賛同した若手専門家の判断は、彼ら自身の推論が十分に形成される前にどうなるのでしょうか?
ミネソタの調査結果:AIがスキルを中間へ平坦化させる方法
ミネソタ大学ロースクールの新しい実証的研究が、法学をテストケースとして実際の答えを示しています。研究者は約100人の上級法学生に、実務的なタスクのシーケンス—原資料から法を合成し、閉鎖式質問で吸収した知識をテストし、その法を事例に適用し、最後に自分の作業を修正する—を実施させました。一部の学生は最初と最後のステップだけでAIにアクセスでき、もう一方は最後までAIを使用できませんでした。
AIを使って最初の草稿を作成した学生は、より強い成果をより速く生み出しましたが、これは特に驚くべきことではありません。注目すべきはその後の展開です。研究者は、初期段階でAIを使用すると、ツールが取り上げられたときに理解のギャップが現れると予想していました。しかしそれは起きませんでした。AIで法を合成した学生は、冷却テストでもAIを使わなかった学生よりも法の理解が深く、独立した推論は低下しませんでした。むしろ保持され、場合によっては向上しました。
転機は最終段階で訪れました。すべての学生がAIを使って作業を修正できるようになったとき、弱いメモで始めた学生はAIを活用して実際に改善しました。一方、強いメモで始めた学生は逆に質が低下しました。能力のあるツールだけが与えられ、使い方に関する構造がないまま放置されると、スキルは蓄積されず中間へと平坦化していくのです。
この二つの研究が示す厳しい真実は、AIはプロの判断の代替手段ではなく、バークレーの数値がこの議論を永遠に終わらせるべきだということです。しかし、AIは接触しただけで推論を腐食させるような破壊的な力でもありません。その影響は、プロセスのどの段階でAIが登場するかに完全に依存します。
置換よりシーケンス:判断を核に保つ
この考え方は法務以外にも当てはまります。すべての知識職が現在、同様の実験を行っています——医師がモデルに鑑別診断の草稿を書かせるかどうか、アナリストがモデルに最初の分析を作成させるかどうか、アソシエイトが自ら考える前にモデルに論点の構造化を任せるかどうか。ミネソタの結果は、すべてのAI形態に対して一律の「はい」や「いいえ」では答えられないことを示唆しています。重要なのはシーケンスです。AIは単純作業や摩擦を生む作業の前段階に位置すべきであり、判断そのものには適さないのです。クライアントが実際に支払うタスクの中心部にはAIは置かれるべきではなく、現時点ではたとえ試みてもそこに到達できません。
それでもなお、逆の主張を続ける企業は、データが存在しないと示すAIのバージョンを販売しています。研究が描く線上に製品と顧客関係を構築した企業だけが、5年後も専門家から信頼され続けるでしょう。その他の企業は、非常に高価な誤解を説明する時間に追われることになるのです。












