Andersonの視点

『ハウス』TVショーを使用してAIの診断能力を開発する

mm
Unite.AI を Google の優先ソースに追加
A screen capture from the NBC TV show 'House, S04E02., 'The Right Stuff'

希少疾患の診断は、AI(および人間)にとって特に困難な課題ですが、人気のある言語モデルであるChatGPTとGeminiは、人気のある医療ドラマ『ハウス』の診断ケースでトレーニングされたときに、約束のあるパフォーマンスを示しています。

 

ほぼ半数のヘルスサイエンスの学生は、定期的に『ハウス』や『グレイズ・アナトミー』、『スクラブス』などの医療ドラマを視聴しています。ただし、この種の資料は、危険な誤情報の拡散のリスクがあるため、多くのフィルタリングと枠組みが必要です。ただし、医療条件を特集するドラマの研究の水準は一般的に高く(ただし、制作間で精度は異なります)。

驚くことではないですが、医師はしばしばオリジンアドバイス、および/書きテレビ医療ドラマ。こうした場合、広範な医療ドメインの知識は、医療上の問題を正確に伝えるだけでなく、新しい興味深いストーリーラインのアイデアを出すためにも有利です。

最近の「黄金時代」のテレビで最も研究されている医療ショーの一つは、ハウス(別名ハウスMD)です。ここで、リードキャラクターの奇抜さと、サポートキャストの大きな変動は、面白かったですが、「週の病気」に次ぐものでした。

実際、8シーズンの放送で177エピソードが放映されたハウスは、熱心に176の診断ケーススタディを提供しました。ショーは2012年に終了しましたが、2015年までに、特別なDr.ハウスセミナーが標準的なセミナーの内容よりも優れた結果をもたらし、学生のクレジットは得られませんでした。

2015年の研究から、医学生が『ハウス』TVショーから情報を活用した診断セミナーに参加したい理由の多様性。ソース[https://journals.plos.org/plosone/article/file?id=10.1371/journal.pone.0193972&type=printable]

2015年の研究から、医学生が『ハウス』TVショーから情報を活用した診断セミナーに参加したい理由の多様性。セミナーは意図的に厳しい時間に予定され、学習クレジットは得られませんでしたが、イニシアチブは大成功でした。 ソース

ハウスとAI

『ハウス』や他の多様なTVショーの使用は、医学生にとって学習のための有効な補助ツールであることが、複数の研究で証明されています。しかし、機械学習の文脈では、これまであまり試みられていません。

ペンシルバニア州立大学からの新しい論文は、この方向に初めてのステップを踏み出し、176の使用可能なハウスの症例研究を特集したデータセットを開発し、OpenAIとGoogleの人気LLMで評価しました。

この課題の難しさ(生物科学で最も困難な分野の一つ)にもかかわらず、研究者は、ChatGPTとGeminiの最新バージョンが古いバージョンよりも改善されたことを発見しました。これは、モデル開発の進化の傾向が将来、診断プロセスに効果的に取り組む可能性が高いことを示しています。

論文には以下のように記載されています:

‘結果は、16.48%から38.64%の精度の範囲で著しい変動を示し、新しいモデル世代は2.3倍の改善を示しています。すべてのモデルは希少疾患の診断で重大な課題に直面していますが、アーキテクチャ間の改善は、将来の開発の約束のある方向性を示しています。 ‘

‘私たちの教育的に検証されたベンチマークは、物語的な医療推論のためのベースラインのパフォーマンスメトリックを確立し、AI支援診断研究の進歩のための公開評価フレームワークを提供します。 ‘

将来の努力を評価するためのパフォーマンスベースラインを確立することに加えて、著者は、新しいデータセット(公開されている)が、既存の医療データセット内にある物語プロセスの欠如を解決し、標準的な医療データセットとは対照的に、簡単に利用できることを指摘しています。

新しい研究は、House M.Dを使用した希少疾患の診断における大規模言語モデルの評価というタイトルで、ペンシテートの4人の研究者によって行われました。

データ

データセットを構築するために、著者は、長期にわたって確立されたハウスのファンサイトハウスウィキから利用可能な資料を使用しました。物語コンテンツは、WebページのHTMLソースから構造データを抽出できる人気のあるビューティフルスープフレームワークを使用して抽出および濃縮されました。

基本的な物語がこの方法で収集された後、4つのLLMが、出力を標準化された症例形式に変換するために使用されました。使用されたモデルは、GPT-4o miniGPT-5 MiniGemini 2.5 Flash、およびGemini 2.5 Proでした。最後に、適切な臨床的詳細と、医療推論の現在の状態との整合性を確保するために、品質フィルタリングが適用されました。

著者は、‘孤児病‘(希少疾患)が標準的な医療データベースで表現されていないことを観察しています。特定の場合、ショーでのカバレッジは、存在する総カバレッジの異常な割合を表す可能性があります。

著者は、この種のデータソースの有用性は、医療ドラマの開発において芸術的なライセンスが優先される可能性があるため、注意を払う必要があることを認めています:

‘私たちのデータセットは、劇的な誇張や複雑な症例への焦点などのフィクションコンテンツの限界を反映していますが、これらの特性は、モデルをテストするための課題的なエッジケースを提供することで評価に利益をもたらす可能性があります。 ‘

‘ハウスM.D.の医療専門家による教育的検証は、抽出されたシナリオがAIの評価に適した臨床的に有意な情報を含むことを保証します。 ‘

プロジェクトで生成されたデータセットの例。ソース[https://www.kaggle.com/datasets/arshgupta23/housemd-data-for-rare-disease-accuracy-using-llms?resource=download]

プロジェクトで生成されたデータセットの例。 ソース

テスト

物語診断タスクでのモデルの精度を評価するために、著者は、プロンプト生成、モデル推論、スコアリングを組み合わせたシンプルなパイプラインを設計しました。

上記の4つのLLMがテストされました。各モデルは、温度を0(決定論的ではなく「創造的な」出力を保証する)に設定され、最大トークン長は1,500で、複雑な診断推論を収容するための余地が与えられました。システムのプロンプトをさらに枠組み化するために、追加のシステムプロンプトは使用されませんでした。

プロンプト自体は、医療ドラマで新しい患者/病気が紹介され、医師が他の医師のために(実質的には、しかし、視聴者のために)概要をまとめる、標準的な構造化された医療症例プレゼンテーション形式に従っていました。

各プロンプトには、人口統計的詳細、症状のタイムライン、関連する医療歴、および初期の診断所見を含む臨床的物語が提示されました。モデルは、推論でその結論を裏付ける単一のプライマリ診断を特定するように指示されました。

各モデルは、反復的な改良なしに、単一のパスで診断応答を生成しました。応答は、176症例すべてで一貫した条件下で収集されました。

Gemini 2.5 Proのテストに使用された、物語的臨床プロンプトとその対応するグランドトゥルース診断のイラスト例。ソース[https://arxiv.org/pdf/2511.10912]

Gemini 2.5 Proのテストに使用された、物語的臨床プロンプトとその対応するグランドトゥルース診断のイラスト例。 ソース


機械学習のライターであり、ヒューマンイメージシンセシスのドメインスペシャリスト。Metaphysic.aiの研究コンテンツ責任者を務めていたが、DNEGのBrahma.aiへの統合により解散した。
Portfolio site: martinanderson.ai
Contact:martin@martinanderson.ai