Andersonの視点
『ハウス』TVショーを使用してAIの診断能力を開発する

にとって特に困難な課題ですが、人気のある言語モデルであるChatGPTとGeminiは、人気のある医療ドラマ『ハウス』の診断ケースでトレーニングされたときに、約束のあるパフォーマンスを示しています。
希少疾患の診断は、AI(および人間) ほぼ半数のヘル スサイエンスの学生 、 は 的に 『ハウ定期 は一般ス』や『グレイズ・アナトミー』、『スクラブス』などの医療ドラマを視聴しています。ただし、この種の資料は、危険な誤情報の拡散のリスクがあるため、多くのフィルタリングと枠組みが必要です。ただし、医療条件を特集するドラマの研究の水準 的に高 く(ただし、制作間で 精度 は異なります)。 驚くこ とでは ないです が、 医師はしばしば オリジン 、 アドバイス 、および/ 書き テレビ医療ドラマ。こうした場合、広範な医療ドメインの知識は、医療上の問題を正確に伝えるだけでなく、新しい興味深いストーリーラインのアイデアを出すためにも有利です。 最近の「黄金時代」のテ ビで レ ズンの放最も研究されている医療ショーの一つは、 (別名 ハウス )です。ここで、リードキャラクターの奇抜さと、サポートキャストの大きな変動は、面白かったですが、「週の病気」に次ぐものでした。 ハウスMD 実際、8シー たが、 送で177エピソードが放映された は、熱心に176の診断ケーススタディを提供しました。ショーは2012年に終了しまし 20 られませ トは得 15年までに、 ハウス 特別な が標準的なセミナーの内容よりも優れた結果をもたらし、学生のクレジッ

ハウスとAI
『ハウス』や他の多様なTVショーの使用は、医学生にとって学習のための有効な補助ツールであることが、複数の研究で証明されています。しかし、機械学習の文脈では、これまであまり試みられていません。 ペンシルバニア州立大学からの新しい論文は、この方向に初めてのステップを踏み出し、176の使用可能な の症例研究を特集したデータセットを開発し、OpenAIとGoogleの人気LLMで評価しました。 ハウス この課題の難しさ(生物科学で最も困難な分野の一つ)にもかかわらず、研究者は、ChatGPTとGeminiの最新バージョンが古いバージョンよりも改善されたことを発見しました。これは、モデル開発の進化の傾向が将来、診断プロセスに効果的に取り組む可能性が高いことを示しています。 論文には以下のように記載されています: ‘結果は、16.48%から38.64%の精度の範囲で著しい変動を示し、新しいモデル世代は2.3倍の改善を示しています。すべてのモデルは希少疾患の診断で重大な課題に直面していますが、アーキテクチャ間の改善は、将来の開発の約束のある方向性を示しています。
‘ 将来の努力を評価するためのパフォーマンスベースラインを確立することに加えて、著者は、新しいデータセット(公開されている)が、既存の医療データセット内にある物語プロセスの欠如を解決し、標準的な医療データセットとは対照的に、簡単に利用できることを指摘しています。 新しい研究は、
‘
‘私たちの教育的に検証されたベンチマークは、物語的な医療推論のためのベースラインのパフォーマンスメトリックを確立し、AI支援診断研究の進歩のための公開評価フレームワークを提供します。 というタイトルで、ペンシテートの4人の研究者によって行われました。 House M.Dを使用した希少疾患の診断における大規模言語モデルの評価
データ
データセットを構築するために、著者は、長期にわたって確立された のファンサイト ハウス から利用可能な資料を使用しました。物語コンテンツは、WebページのHTMLソースから構造データを抽出できる人気のある ハウスウィキ を使用して抽出および濃縮されました。 ビューティフルスープフレームワーク 基本的な物語がこの方法で収集された後、4つのLLMが、出力を標準化された症例形式に変換するために使用されました。使用されたモデルは、 GPT-4o mini 、GPT-5 Mini 、 Gemini 2.5 Flash 、および Gemini 2.5 Pro でした。最後に、適切な臨床的詳細と、医療推論の現在の状態との整合性を確保するために、品質フィルタリングが適用されました。 著者は、 著者は、この種のデータソースの有用性は、医療ドラマの開発において芸術的なライセンスが優先される可能性があるため、注意を払う必要があることを認めています:
‘孤児病 ‘(希少疾患)が標準的な医療データベースで表現されていないことを観察しています。特定の場合、ショーでのカバレッジは、存在する総カバレッジの異常な割合を表す可能性があります。 ‘私たちのデータセットは、劇的な誇張や複雑な症例への焦点などのフィクションコンテンツの限界を反映していますが、これらの特性は、モデルをテストするための課題的なエッジケースを提供することで評価に利益をもたらす可能性があります。 ‘
‘ハウスM.D.の医療専門家による教育的検証は、抽出されたシナリオがAIの評価に適した臨床的に有意な情報を含むことを保証します。 ‘ プロジェクトで生成されたデータセットの例。
テスト
物語診断タスクでのモデルの精度を評価するために、著者は、プロンプト生成、モデル推論、スコアリングを組み合わせたシンプルなパイプラインを設計しました。 上記の4つのLLMがテストされました。各モデルは、 温度 を0( 決定論的 ではなく「創造的な」出力を保証する)に設定され、最大 トークン 長は1,500で、複雑な診断推論を収容するための余地が与えられました。システムのプロンプトをさらに枠組み化するために、追加のシステムプロンプトは使用されませんでした。 プロンプト自体は、医療ドラマで新しい患者/病気が紹介され、医師が他の医師のために(実質的には、しかし、視聴者のために)概要をまとめる、標準的な構造化された医療症例プレゼンテーション形式に従っていました。 各プロンプトには、人口統計的詳細、症状のタイムライン、関連する医療歴、および初期の診断所見を含む臨床的物語が提示されました。モデルは、 推論 でその結論を裏付ける単一のプライマリ診断を特定するように指示されました。 各モデルは、反復的な改良なしに、単一のパスで診断応答を生成しました。応答は、176症例すべてで一貫した条件下で収集されました。 Gemini 2.5


は、正しく分類された症例の割合として計算されました。 研究者が使用した「ふわふわした」マッチングワークフロー。 著者は、曖昧なマッチングでは、異なる用語を使用するが意味的に同等の診断が見逃される可能性があることを指摘していますが、アプローチを、プロジェクトの制約を満たすことができる最も再現可能なものとして提示しています。
結果
診断の精度は、Gemini 2.5 Proが38.64%で最高、GPT-5

2.5

Miniが16.48%と、モデル間で広く変動しました。モデルはすべて希少疾患の診断で苦労しましたが。 4つのモデルで診断の精度の結果。 著者はまた、ショーのシーズン間でパフォーマンスが変動したことにも注目しています。
Proの38.64%へのパフォーマンスの向上は、臨床的に適用可能なAI支援ツールへの着実な進歩を示唆しています。 研究者は、精度のレベルがまだ謙虚であることを認めていますが、ベンチマークは、訓練された医師にさえ挑戦を与える、高度に複雑な症例にのみ焦点を当てており、約40%の難しい症例で診断を正確に特定する能力は、将来の改善のための基盤を提供する、真正の推論能力を示しています。
『ハウス』の様々なシーズンでの精度の変動、明確な曲線や明確な理由はありません。 論文には以下のように記載されています: ‘シーズン1は56.52%の精度で最高でしたが、シーズン5は20.83%で最低でした。この変動は、シリーズ全体を通じて診断の複雑さが変化することを示唆しており、後半のシーズンはより挑戦的な希少疾患症例を特集する可能性があります。 ‘ モデルは、髄膜炎、心筋梗塞、肺塞栓などの一般的な状態で認められる症状を持つ一般的な状態を診断するときに、より信頼性が高かったが、神経嚢虫症やErdheim-Chester病などの希少疾患や、全身性エリテマトーデスや肉芽腫症などの複雑な自己免疫疾患では一貫して苦労しました。また、臨床的兆候に露出歴を関連付ける必要がある毒物症例でもパフォーマンスが低下しました。 ‘しかし、シーズン8(52.38%)での相対的に強いパフォーマンスは、時間の経過のみが精度の違いを完全に説明するわけではないことを示唆しており、症例ごとの診断の複雑さが主な要因のようです。 ‘ 著者は、モデルの精度の変動は、アーキテクチャとトレーニング戦略の違いを示唆しており、GPT-5 MiniとGemini 2.5 Proのより強いパフォーマンスは、新しいLLM世代が改善された推論能力から利益を得ていることを示していますが、それらの結果は依然として複雑な診断タスクを処理する際の明確な限界を示しています。 結果は、物語ベースの希少疾患診断のためのベースラインメトリックを提供し、現在の言語モデルが有用な医療推論能力を示し始めていることを強く示唆しています。 結果は、GPT-4o Miniの16.48%からGemini 2.5
結論
TVショーの物語を現実世界の医療データセットに転用するには、明らかな危険性があります。たとえば、 の場合、ソース資料に高いレベルの医療専門家の貢献や監督がある場合でもです。 ハウス 『ハウス』の1エピソードは、実際には、インターネットで一般の人や断片的で非線形に提示される医療エントリーシリーズのための要約マシンとして機能します。 医師が『ハウス』の1エピソードの脚本を書くことが頻繁に起こったように、研究者はコンテンツの「承認」として使用できますが、これは、芸術的な考慮がエピソードでの病気の提示に影響を与えた可能性があることを無視しています。 これにより、データは、多くの他の潜在的に有用なトレーニングデータソースと同様の状態になります。高価で資格のある人間の管理が必要です。 * この非常に短い論文は、通常のテンプレートに従っていないため、カバレッジを適応させるようにしました。 2025年11月17日初版













