AIモデルとプラットフォーム

OpenEvidence、ダーウィンプレビュー付き医療AIモデルファミリーを発表

mm
Unite.AI を Google の優先ソースに追加

OpenEvidenceは2026年9月3日に新しい医療AI検索モデルファミリーをリリースし、3つのプロダクションモデルを認証済みの臨床医に無料で提供し、最も高度なモデルと位置付ける第4モデルを研究者向けに応募制で開放しました。

3つのプロダクションモデルは医学史上の人物にちなんで名付けられています。Oslerは「約5秒で回答」を実現する同社最速モデルで、以前OpenEvidenceが提供していた回答エンジンの後継となり、プラットフォームのデフォルトになります。Sackettはエビデンスの重み付けが重要な質問に対し、約30秒で回答する深層検索モデルとして位置付けられています。SnowはOpenEvidenceのDeep Consult機能の後継で、約5分で回答を生成する最も深いプロダクションモデルであり、医療文献をフルに調査した上でレポートを作成します。

これらのモデルはopenevidence.comおよび同社のiOS・Androidアプリ上の全ユーザーに順次展開され、臨床医はインターフェース内のモデルセレクタから選択できます。OpenEvidenceは、ファミリー内のすべてのモデルが同一の臨床精度基準を満たすとし、違いは「考える時間」と「検索の深さ」にあると説明しています。

名前の由来は、講義室からベッドサイドへ医学教育を移行させたウィリアム・オスラー、エビデンスに基づく医療の父と称されるデイビッド・サケット、1854年のブロードストリートコレラ流行を単一の水ポンプに結び付け、近代疫学の創始に貢献したジョン・スノーです。

研究プレビューでのダーウィン

第4モデルであるダーウィンは研究プレビュー段階にあり、一般公開はされていません。発表において、OpenEvidenceはダーウィンを「世界で最も高度な医療AIモデル」と位置付け、同社が「完全に独立した医療AIベンチマーク」のトップスコアを達成した初のAIモデルであると述べています。また、MedXpertQAで72.8%、HealthBench Professionalで82.7%、NOHARMで87.2%という最先端のスコアを示し、次点モデルとしてClaude Fable 5とGemini 3.7を挙げています。

利用は応募制です。OpenEvidenceはその理由を二重用途リスク:ウイルス学、免疫学、ヒト遺伝学の最前線で推論できるモデルは、悪用された場合に生物兵器関連研究や主流の科学的監視外での胚系編集など、厳格に規制される領域の作業を加速させる可能性がある、と説明しています。現在のアクセス対象は、Rare Disordersの全国組織などの機関パートナー(ダーウィンに最も難しい症例を提供)、研究協力者、そして臨床医療におけるAIの精度と安全性をベンチマークする学術機関の認定AI研究者です。同社は、これらパートナーと共に安全策が検証され次第、ダーウィンの機能がOsler、Sackett、Snowへと展開されると述べています。

ベンチマーク手法

関連技術記事にて、OpenEvidenceは評価設定の詳細を公開しました。MedQAについては、ベンチマークの1,273問・4択テスト分割を医師が再注釈し、情報欠損・曖昧性・ラベルエラーを除外した後、2026年8月に3名のOpenEvidence医師が誤答を再レビューしました。その結果、最終評価セットは660問となり、ダーウィンはエラーなく全問に正解しました。同社は注釈データと全4ベンチマークに対するダーウィンの完全回答を公開しています。

MedXpertQAでは、マルチモーダルサブセットを除外した全2,450問のテキスト分割で評価しました。HealthBench Professionalでは、マルチターンケースを除外した公開テストセットから525件中410件を使用し、Anthropicが公開したLLM-as-a-judge構成(Claude Opus 4.8、最大32,000トークンの思考予算)で採点しました。NOHARMは実際の診療ケースにおける有害な推奨の頻度と重症度を測るベンチマークで、30件のオープンサブセットに対し公式のオープンソースパッケージで採点しました。

ベースラインは、適応的思考を持つclaude-fable-5、デフォルト推論努力のgpt-5.6-sol、デフォルト推論努力のgemini-3.7-flashを各プロバイダーのAPIデフォルト設定(ツールやカスタムシステムプロンプトなし)で実行しました。HealthBench Professionalのスコアは各モデルにつき最低5回の独立試行で平均化し、他のデータセットは単一試行で採点し、平均スコアを報告しています。

記事によれば、ダーウィンのMedXpertQAスコアは最強ベースラインを7.7ポイント上回り、HealthBench Professionalスコアは次点モデルを12.1ポイント上回り、NOHARMの重症度加重F1は0.872で、最も近いベースラインの0.740を上回っています。同社は、NOHARMにおけるダーウィンの非加重精度がいくつかのベースラインより低いことを認めており、これはルーブリックに存在しないすべての推奨を偽陽性としてカウントする指標であり、ダーウィンは医師に対し関連オプションをすべて提示するよう調整されていると説明しています。重症度加重精度は0.9と報告されています。

利用可能性と今後の展開

Osler、Sackett、Snowは認証済みの臨床医全員に対し、無制限・無償で利用可能です。ダーウィンは同社サイトでの応募プロセスを通じて研究者に提供されます。

OpenEvidenceは、今後もモデルファミリーの改善・拡張・アクセス拡大を継続すると述べており、腫瘍学、放射線科、臨床遺伝学といった専門診療向けモデルの開発も計画しています。

アリア・ブルームは、人工知能が生物技術とゲノム研究をどのように変革しているかを探るAI生成ジャーナリストです。彼女の文章は、精度とライフサイエンスの将来に対する深い好奇心を融合させています。
合成生物学から個別化医療まで、アリアは機械学習が人間の健康イノベーションをどのように加速させているかを分析しています。
アリア・ブルームが執筆した記事は、AIによって生成され、Unite.AIの編集チームによって精度とコンプライアンスのためにレビューされています。