ソートリーダー
AIはすでにあなたの医師よりも賢い。恐ろしいのはそこではない。

私はAIにこの問題を解決してほしかった。
何年もの間、複雑な患者の病歴、検査結果、症状、投薬、サプリメント、そして過去の治療歴をすべて取りまとめ、首尾一貫した臨床計画に変換しようとしてきました。複雑な症例では、重要な点と次にすべきことを判断できるようになるまでに、3時間もの調査が必要になることもありました。
そして生成AIが登場した。
私の最初の考えは明白だった:ついに。
膨大な情報を処理し、私がこれまでに記憶できる以上の速さで医療知識を呼び起こし、数秒で症例全体の関係性を見つけ出す技術が目の前にあった。大規模言語モデルの周りにインターフェースを設け、いくつかの安全策を構築すれば完了するだろうと考えた。
それは素晴らしいことだっただろう。
しかし、約1年と100万ドルが経過し、ソフトウェアエンジニアが10人の臨床チームと共に作業しているにもかかわらず、私たちはまだ構築段階にあった。
理由は、AIが十分に賢くなかったからではない。
知性自体は簡単な部分だった。
私は他の人とは違うAIを手に入れていた
最初の手がかりは、臨床ソフトウェアの構築に取り掛かる前に得られた。隣に座っている人と同じAIツールを使っても、劇的に優れた結果が得られることに気付いたのだ。
なぜか?単に質問して答えを受け取るだけではなかったからだ。私はAIと議論し、前提に挑戦し、見落としていた文脈を提供し、誤りを訂正し、枠組みを変え、再度突き進んだのだ。
技術的には同じツールを使用していたが、機能面ではそうではなかった。
広告を書いているときは興味深い生産性の問題だが、対象が患者になると全く別の問題になる。
私は7万人以上の医療従事者と仕事をしてきた。臨床的に優秀でも、AIシステムから有用な情報を引き出すのが下手な人もいる。
それらは別々のスキルだ。
しかし、医療界の答えは、臨床医が単に「プロンプトエンジニアリング」を学べばよいというもののようだ。
それが真剣な解決策だとは思わない。
臨床AIシステムが信頼できるようになる前に、医師が高度なプロンプトエンジニアになる必要があるなら、臨床AIの構築はまだ完了していないということになる。
研究はすでに不快な事実を示している
2024年に実施されたランダム化臨床試験で、50人の医師に難しい診断症例が与えられた。GPT-4を使用した医師は76%の得点を得たのに対し、従来のリソースを使用した医師は74%で、統計的に有意な差はなかった。
その後、研究者はGPT-4単独でテストした。従来のリソースを使用した医師よりも16ポイント上回った。
2026年にパキスタンで実施された試験では、AIリテラシー研修を受けた後、GPT-4oにアクセスできる医師は診断推論で71.4%の得点を得たのに対し、従来のリソースを使用した医師は42.6%だった。しかし、GPT-4o単独では82.9%の得点だった。
2026年の英国再現実験でも同様の差が見られた。医師はAI支援で改善したものの、単独で動作するLLMよりも21ポイント以上低い得点にとどまった。
不快な部分をはっきり言わなければならない。特定の認知タスクにおいて、AIはすでに個々の医師よりも優れている。
どの医師もすべての医学論文を読んだり、関連性が出た瞬間にすべての稀な疾患や相互作用、禁忌を記憶したりすることはできない。AIは膨大な情報を疲れたり時間切れになったりすることなく処理できる。
チャットボットを臨床医の前に置くだけで問題が解決したと考えるのは誤りだ。
空のプロンプトボックスが問題だ
医師が150項目のマーカーを含む検査報告書をアップロードし、LLMに分析を依頼すると想像してみてください。
回答は美しく整理された形で返ってくる。しかし唯一の問題は、システムが150項目すべてを確実に抽出できなかったことだ。
汎用のLLMは決定論的な臨床文書パーサーではない。表や密度の高い医療報告書は依然として特に難しい。恐ろしいのは、最終的な回答が「50項目を見落としました」と告げない可能性があることだ。
単に回答するだけかもしれない。
そして、見落とされた項目のひとつが緊急の医療評価を必要とすると想像してみてください。
それは私が受け入れられる制限ではなかった。システムの臨床推論部分を開始する前に、検査報告書を正確かつ再現性をもって処理できる別の抽出技術を開発せざるを得なかった。
その経験は、AI安全性に対する私の考え方を変えた。
何かを知らないと告げるAIシステムは不便だ。
何が欠けているか分からないAIシステムは危険です。
なぜAIを超えて構築しなければならなかったのか
臨床業務には、汎用的な生成AIが自然に提供できないもの、すなわち再現性が必要です。
私たちは、入力と出力を制御できることが必要でした。信頼できるデータ抽出、構造化された知識、決定論的ロジック、保護策、そして患者の履歴全体にわたる関係性を評価できるシステムです。
臨床的推論は単なるif‑then文の集合ではありません。時にはシグナルは複数の指標間の関係です。時には、個別には目立たない5つの所見が、合わせて見ると重要になります。
エンジニアはソフトウェアが実行できるほど明示的なルールが必要です。臨床医は「はい、ただし…」と言い続けます。
人間の生物学は例外、修飾子、文脈、競合する説明で満ちています。システムを構築する際、あるグループは手話で、別のグループはクリンゴン語でコミュニケーションしているように感じました。
答えは「AI」でも「非AI」でもありませんでした。各要素が正確にどこに属すべきかを見極めることでした。
AIはチャートを読むことができる。人間は部屋の雰囲気を読むことができる。
適切に使用すれば、AIは臨床医の記憶を拡張し、研究を加速させ、稀な可能性を提示し、膨大な情報からパターンを認識できます。
それは医師を置き換えるというより、バイオニックな医師を構築することに近いです。
しかし、患者は臨床的な症例ではありません。
医師は答えが出る前にためらいを聞き取り、話の変化に気づきます。ある患者は症状を常に最小化し、別の患者はすべての感覚を最大強度で報告します。「私は大丈夫です」という言葉が明らかに大丈夫でないことを医師は知っています。
その情報はチャートに存在しないこともあります。
医療における人間の相互作用は、機械が知的作業を終えた後に付加する快適な層ではなく、別の臨床データの源です。
AIはチャートを読み取れます。人間は部屋の雰囲気を読み取れます。
最高の臨床システムは両方を必要とします。
AIが医師に取って代わるかどうかを問うのはやめましょう
私たちは間違った質問をしています。
将来は必ずしも最も賢いチャットボットや最先端の基盤モデルを持つ企業が支配するわけではありません。重要なイノベーションはモデルそのものではなく、情報の取得と検証、提供される知識、システムが推論できる範囲、決定論的制御が介入する場所、そして人間がループに残るべき場所に関わっています。
生の知能は豊富になりつつあります。
その知能を適用する信頼できるシステムの構築ははるかに難しいです。
そして、すべての臨床医がアマチュアAI開発者になるよう要求してこの問題を解決すべきではありません。複雑さは技術内部にあり、医師のプロンプト内部にあってはなりません。
将来の医師がAIの記憶力に勝つことはありません。その競争はすでに無意味になりつつあります。
むしろ、機械の記憶力、処理能力、パターン認識を提供しつつ、臨床医の文脈、判断、懐疑心、人間的なつながりを保持するシステムを構築すべきです。
私たちはそれをバイオニック・プラクティショナーと呼んでいます。
患者は最終的にもっとシンプルな呼び方をするのではないかと予想しています。
自分の医師。












