ソートリーダー
コードから治療へ:次のAI革命には手と目が必要

エージェントシステム、XRスマートグラス、ロボティクスが人間を強化する——置き換えるのではなく
私たちは、人工知能のパラドックスを経験しています。
画面上では、AIは超人的です。大量の言語モデルは数秒でPythonコードを書きます。生成システムは数分で写真のようにリアルな画像とビデオを生成します。ノーベル賞を受賞したAlphaFoldのようなシステムは、既知のほぼすべてのタンパク質の構造を予測しました。デジタルでの勝利は積み重ねられます。
しかし、生物医学研究の物理的な世界では、発見のプロセスはまだ手作業で行われています。AIが科学や医学を加速していることを感じることはできません。少なくともまだそうです。数字は問題の深さを明らかにしています。1,500人以上の科学者を対象としたランドマーク的なNatureの調査によると、70%以上の科学者が他の研究者の実験を再現しようとして失敗しています。さらに心配なのは、半分以上の科学者が自分の研究を再現できなかったことです。がん生物学では、8年間の再現性プロジェクトで、40%の高影響力の研究結果が再現可能で、68%の実験では再現を試みるのに十分な文書化がされていませんでした。
これは現代の科学の汚い秘密です。私たちには知識の取得問題があります。実験の重要な詳細は研究者の頭の中にあり、論文の中にはありません。プロトコルは変化し、暗黙の知識はトレーニーの卒業とともに外に出ていきます。公開された文献に基づいて訓練されたAIシステムは、これらのギャップをすべて継承します。
根本的な問題は、AIが新しいタンパク質をデジタルシミュレーションで設計できるのに対し、実験をテストするためのパイプを持ち上げることができないことです。予測と測定の間のループを閉じるために、人間の科学者と実験室で接続することができないのです。
この「実行ギャップ」は、AI革命が医療革命になることを妨げる最大のボトルネックです。ほとんどのロボティクス企業はまだ洗濯物を折ったり食器を片付けたりする機械を教えているのに対し、医学などの分野でのこれらの進歩の真正な変革的な能力に後れを取っています。
これを解決するために、私たちはチャットボットを超えて、AIコサイエンティスト、エージェントシステムに向かって進む必要があります。デジタルと物理の世界を橋渡しし、計画とコーディングを超えて、実世界の実行に向かって進みます。スタンフォードでは、LabOSを開発しています。これは、デジタル物理AIフレームワークであり、AIエージェント、拡張現実(XR)スマートグラス、協力ロボティクスがどのように統合してループを閉じ、科学実験を人間と機械の共同対話に変え、現在失われている知識を自動的に取得する方法を示しています。
大きな隔たり:AIに「目」と「手」が必要な理由
最も目立つAIの勝利の多くは、環境が完全にデジタルである場所で発生しました。コードリポジトリ、キュレーションデータセット、シミュレートベンチマーク(AIが仮想ビジネスを実行したり、デジタル投資を行ったりする場所)。
ウェットラボは異なります。生物学、そして一般的に科学的発見は、非常にノイズの多いプロセスです。機器は変化し、オペレーターは即興で作業し、「プロトコル」は często 人間の頭の中にあります。クリーンな結果と失敗した実行の違いは、パイプの角度、ボルテックスパターン、試薬の置換、またはインキュベーションが10分長く実行されたことによって決まることがあります。これらのコンテキストの詳細は、論文に記載されることはまれであり、AIモデルがデータセットを超えて一般化するために必要なものです。
これは、ラボグレードAIが「目」(コンテキストで何が起こっているかを認識する)、「手」(高分散ステップを標準化して安全に自動化する)、「記憶」(何が実際に起こったかを記録する)を必要とする理由です。これらの機能がなければ、モデルは推奨事項を提供できますが、実行を信頼性高く実行したり、計画から現実が逸脱したときに失敗を説明したりすることはできません。
チャットボットを超えて:コパイロットからコサイエンティストへ
「エージェントAI」という用語は、時々緩く使われます。生物医学的環境では、正確な意味で使う必要があります。目標(たとえば、「CRISPR遺伝子編集の効率を最適化し、オフターゲットを最小限に抑える」)を分解して、タスクのシーケンスを実行し、結果を評価し、制約の下でオーディブルな意思決定で計画を適応させることができるシステムです。
これは重要です。研究ワークフローは、単一のモデル呼び出しではありません。仮説の構成、実験設計、データ処理、統計的テスト、解釈を含むエンドツーエンドのパイプラインです。最近の薬剤発見における考え方は、個々のステップを加速するのではなく、これらのパイプラインを拡張するエージェントシステムを強調し始めています(たとえば、Unite.AIの小分子発見におけるエージェントの議論)。
ソフトウェアエンジニアリングでは、AIコパイロットが開発者の生産性を高めることができる初期の経験的証拠を既に見ています。生物医学では、機会はコードを書くことではなく、プロトコルを書き、データを構造化し、実行を監視し、予測と測定の間のループを閉じ、実験室の科学者と接続することです。
LabOS:AIが未来のラボのオペレーティングシステムで実行される場合
スタンフォードでのAI4Scienceの研究では、CRISPR-GPTのような遺伝子編集コパイロットとAI-XR共同実行システムのようなLabOSを開発しています。これは、生物医学および材料科学のラボで科学者を支援するAIエージェント、拡張現実(XR)スマートグラス、協力ロボティクスがどのように統合して、科学実験を人間と機械の共同対話に変え、現在失われている知識を自動的に取得する方法を示しています。
1. デジタル(ドライ)ラボと物理(ウェット)ラボを結合するエンドツーエンドの「ラボオペレーティングシステム」の設計
前提はシンプルです。ラボノートブックが科学の記憶である場合、ラボOSは実行レイヤーであり、意図をキャプチャし、行動に翻訳し、結果を観察し、毎回の実行を構造化された知識に変えるべきです。

図。LabOSがデジタルラボループ(計画、コーディング、批評、ツール作成)と人間AIウェットラボループ(自動ドキュメンテーション、知識キャプチャ、XRガイダンス、ロボティクス統合)を結びつける概念的なビュー。
2. デジタルラボでのAI:自己進化型計画とツールビルディング
デジタル(ドライ)ラボでは、AIにすでに得意なことを行わせることができます。検索、統合、提案ですが、自己改良も行わせることができます。新しい科学を「妄想」するのではなく、フィードバックからより良いツールとワークフローを学ぶことです。
実用的デジタルラボループは、4つの反復ステージで構成できます。
- 計画(仮説+設計):仮説を提案し、実験変数を選択し、混在変数を予測し、測定可能なエンドポイントを指定します。
- コーディング(実装):分析スクリプト、シミュレーションパイプライン、インストルメントコントロールテンプレートを生成または適応します。
- 批評エージェント(推論+評価):仮説をストレステストし、統計的パワーをチェックし、コントロールを提案し、予想される失敗モードをフラグします。
- ツール作成(検索+開発):ワークフローがコンポーネント(パーサー、QCルーチン、ダッシュボード)を欠く場合、作成し、ツールキットに追加します。
3. 物理ラボでのAI:XRグラスとロボティクスを使用したAI
物理(ウェット)ラボは、システムが信頼を獲得するか、失うかの場所です。目標は科学者を置き換えるのではなく、摩擦とエラーを減らし、観察可能性を高めることです。
私たちは物理ラボループを、4つの補完的な機能で見ています。
- 自動記録とドキュメンテーション:アクション、タイムスタンプ、インストルメント設定、偏差を自動的にキャプチャします。ドキュメンテーションはあとまわしではありません。
- 再現可能な実行のための知識キャプチャ:実行を構造化された、クエリ可能なアーティファクト(プロトコルバージョン、パラメータセット、QCアウトカム)に変え、データステワードシップの原則(FAIR)に沿ったものにします。
- XRスマートグラスを使用したリアルタイムビジョン言語ガイダンス:多モーダルモデルを使用してシーン(オペレーターが何をしているか、どの試薬を持っているか)を解釈し、ステップバイステップのガイダンスとセーフティチェックを提供します。AR/XRは、実験ガイダンス(LabOS、スタンフォード、プリンストン、NVIDIA との共同)などの物理ワークフローで既に価値を証明しています。
- コボット/ロボティクス統合による自動化:繰り返しのステップを標準化し、安全なハンドオフを可能にし、変動性を減らします。シミュレーションからリアルワークフロー(NVIDIA Isaacなど)やエッジでのリアルタイムAI処理(LabOSのスマートグラスライブストリーミングや人間AIの相互作用)などのプラットフォームは、重要な有効層です。
このアーキテクチャは、分野のより広い方向性と一致しています。「セルフドライビング」または自律ラボが、自動化と機械学習を組み合わせて次の実験を計画します。LabOSが追加するのは、透明性を犠牲にしない人間インターフェイス層です。
ラボグレードAIは「データセット上のAI」ではない理由
生物医学/科学的スーパーアイのためのAIシステムは、後ろ向きの評価や試験で印象的なものですが、物理ラボでは実行時に失敗します。理由は、単一のバグではなく、モデルとラボの現実の間のミスマッチです。
3つのギャップが繰り返し現れます。
- コンテキストギャップ:データセットは通常、オペレーターが重要であると考えているコンテキスト変数を省略します(温度の逸脱、試薬のロット番号、微妙なプロトコルの逸脱)。
- アクションギャップ:多くのAIシステムは何をすべきかを推奨できますが、推奨事項を信頼性の高い物理的なステップに翻訳することはできません。
- フィードバックギャップ:実行からの構造化された、高品質のフィードバックがなければ、モデルはどこで失敗するかを学ぶことはできません。科学者は、AIモデル/エージェントがデジタル世界に戻ったときに、 почему 結論が伝播する理由を監査することはできません。
これらのギャップを解決するには、新しいニューラルネットワークアーキテクチャを発明することよりも、機械がラボを読み書きできるようにするためのインストルメンテーション、インターフェイス、データ契約を構築することが重要です。
デザインによる信頼:AIが行動できる場合の安全性とガバナンス
発見の研究におけるエージェントAIは、精度に関する既存の懸念以外に、新しい失敗モードを引き起こします。実験室では、行動は廃棄、危害、または誤解を招く結論の可能性を意味します。
有用な心構えは、AIを備えたラボスタックを、保証が必要な社会技術システムとして扱うことです。いくつかの既存のフレームワークが役立ちますが、ラボの現実に翻訳する必要があります。
- リスクマネジメントとしての継続的な実践:NISTのAIリスクマネジメントフレームワーク(AI RMF 1.0)は、AIリスクをマッピング、測定、管理するための実用的ボキャブラリーを提供します。
- 医療に近接するAIのための規制への準拠:FDAのAI/MLソフトウェアとしての医療機器(SaMD)ワーク、アクションプランおよび関連ガイドラインは、AIが医療を影響する場合の「良い実践」の具体的な見方を提供します。
遺伝子編集などの高影響力ドメインでは、ガバナンスはすでに世界的な議論です。人類ゲノム編集のための監視メカニズムの必要性を強調する、アメリカ遺伝子・細胞療法学会(ASGCT)などの推奨事項が議論されています。LabOSのようなシステムは、コンプライアンスを容易にし、困難にしないように設計する必要があります。
チェックリスト:科学的発見のための安全なAIコサイエンティストのためのコントロール
私たちの見解では、安全性に配慮したラボOSは、少なくとも次のデザインを実装する必要があります。
- デフォルトのプロバンス:すべてのデータセット、プロトコルバージョン、モデル出力は、入力とタイムスタンプに追跡可能である必要があります。
- バウンドされた自律性:システムには、確認なしで実行できるもの(何を実行できるか)と、確認が必要なもの(いつ確認を求めるか)の明確な許可とエスカレーションルールが必要です。
- 人間によるオーバーライドと優雅な劣化:センサーまたはデータストリームが故障した場合、または不確実性が高い場合、システムはより安全で単純なモードに戻る必要があります。
- 継続的な検証:シミュレーション予測は物理ラボの検証とペアにする必要があります。物理ラボの実行には、AIモデル/エージェントがデジタル世界に戻ったときに結論が伝播する前に、QCゲートを含める必要があります。
- セキュリティと二重使用の認識:ラボインフラストラクチャを改ざんから保護します。
人間をどこにでもエンパワーする:AIコサイエンティストがプレーヤーフィールドを平等にすることができるか
AI-XR「コサイエンティスト」の最も魅力的な約束の1つは、エリート機関のためのスピードだけではなく、誰でもアクセスできることです。現在、どのようなものが小規模ラボ、スタートアップ、リモート/農村/地域クリニックを制限していますか。
- 専門のエキスパートへのアクセスが限られている:ゴールドスタンダードプロトコルとインストルメント。
- トレーニング、ミス、再作業の相対的なコストが高い。
- 断片化されたツール:ノートブック、スプレッドシート、インストルメントログ、分析スクリプトは、きれいに接続されません。
コンテキストで実行をガイドする(XRグラスを介して)、自動的に何が起こったかをキャプチャし、先の実行に基づいて次のベストステップを提案するシステムは、高度なアッセイをサイト間で再現可能にすることができます。原則として、プロトコルが一貫して実行される必要がある分散型臨床研究もサポートできます。
タイムライン:いつ科学者や臨床医がコサイエンティストを得ることができるか
簡単に言えば、私たちは何よりも近いと思っているものよりも近く、デモでは示唆されているよりも遠いものです。現実的なロードマップは次のとおりです。
- 近期(1年以内):ワークフローコパイロットが管理負荷を軽減します。プロトコル作成、文献統合、分析テンプレート、自動QCレポート。制限要因は統合であり、モデル能力ではありません。
- 中期(1〜2年):ラボでの共同実行システム。XRグラスガイダンス、自動ドキュメンテーション、高分散ステップのロボティクス。信頼性は監査証跡と人間がループ内にいる設計に依存します。
- 長期(3年以上):発見と翻訳を接続するドメイン間コリサーチャー。ラボデータを臨床エンドポイントに接続し、安全性シグナルを監視し、試験を設計するのに役立ちます。規制および倫理的期待に従っています。
コードから治療へ:1000倍の科学的発見への道
LabOSは、実験が会話として実行される方法、意図、実行、証拠がエンドツーエンドで接続される方法についての質問に答えるための1つの試みです。私たちがこれらのシステムをうまく構築すれば、生物医学や多くの物理科学分野で遅れを招く翻訳ギャップに役立ちます。如果私たちがそれらをうまく構築しなければ、再現性の低さを増幅させ、新しい安全性のリスクを生み出すでしょう。
次の数年間で最も重要な作業は基盤となるものです。オペレーティングシステム(iOSがすべてのタイプのアプリを実行するように)のような標準化されたデータおよびデバイスインターフェイスを構築すること、LabOSのLabSuperVisionベンチマークのような実行と不確実性を含むAIベンチマークを構築すること、そして現実世界への展開を開始して、革新を促進し、患者と研究の完全性を保護することです。
研究者や臨床医にとって、質問は、AIがラボに入ってくるかどうかではありません。すでに入ってきています。質問は、AIをまとまりのないツールのコレクションとして統合するか、信頼性の高いオーディブルなシステムとして設計されたものとして統合するか、ということです。
推奨の読み物とソース
- 再現性調査(ネイチャー、2016年):https://www.nature.com/articles/533452a
- CRISPR-GPTの査読済み論文(ネイチャー生物医学工学):https://www.nature.com/articles/s41551-025-01463-z
- スタンフォードメディシンのCRISPR-GPTに関するニュース(2025年):https://med.stanford.edu/news/all-news/2025/09/ai-crispr-gene-therapy.html
- LabOSのプレプリント(arXiv):https://arxiv.org/abs/2510.14861
- LabOSとLabSuperVisionベンチマークのウェブサイト:https://ai4lab.stanford.edu
- NIST AIリスクマネジメントフレームワーク(AI RMF 1.0):https://nvlpubs.nist.gov/nistpubs/ai/NIST.AI.100-1.pdf
- FDAのAI/MLソフトウェアとしての医療機器の概要:https://www.fda.gov/medical-devices/software-medical-device-samd/artificial-intelligence-software-medical-device
- FAIRデータ原則(サイエンティフィックデータ、2016年):https://doi.org/10.1038/sdata.2016.18
- Unite.AIの小分子薬剤発見のボトルネック:https://www.unite.ai/how-ai-is-breaking-down-the-bottlenecks-in-small-molecule-drug-discovery/
- Unite.AIのAIとロボット外科:https://www.unite.ai/how-ai-is-ushering-in-a-new-era-of-robotic-surgery/












