Góc nhìn Anderson

Sử dụng chương trình truyền hình ‘House’ để phát triển khả năng chẩn đoán của AI

mm
Thêm Unite.AI vào các nguồn ưu tiên của bạn trên Google
A screen capture from the NBC TV show 'House, S04E02., 'The Right Stuff'

Mặc dù chẩn đoán bệnh hiếm gặp là một thách thức đặc biệt khó khăn đối với AI (và cũng đối với con người), các mô hình ngôn ngữ phổ biến như ChatGPT và Gemini đã thể hiện hiệu suất hứa hẹn khi được đào tạo trên các trường hợp chẩn đoán từ bộ phim truyền hình y khoa nổi tiếng ‘House’.

 

Gần một nửa số sinh viên khoa học sức khỏe thường xem các bộ phim truyền hình y khoa như House, Grey’s AnatomyScrubs. Mặc dù loại vật liệu này chỉ có thể được sử dụng cho mục đích giáo dục với rất nhiều lọc và khung, do rủi ro lan truyền thông tin sai lệch nguy hiểm, tiêu chuẩn nghiên cứu cho các bộ phim truyền hình về các tình trạng y khoa có xu hướng khá cao (mặc dù độ chính xác thay đổi qua các sản phẩm).

Không ngạc nhiên, các bác sĩ thường là nguồn gốc, tư vấn và/hoặc viết các bộ phim truyền hình y khoa. Trong những trường hợp như vậy, kiến thức chuyên môn y tế rộng lớn là có lợi không chỉ để thể hiện chính xác các vấn đề y tế, mà còn để tạo ra các ý tưởng cho các cốt truyện mới và thú vị.

Một trong những bộ phim truyền hình y khoa được nghiên cứu kỹ lưỡng nhất trong ‘thời đại vàng’ gần đây của truyền hình là House (còn được gọi là House MD), trong đó những đặc điểm của nhân vật chính và sự thay đổi lớn trong dàn diễn viên phụ, mặc dù thú vị, nhưng lại đứng sau ‘bệnh của tuần’.

Trên thực tế, trong số 177 tập được phát sóng trong suốt 8 mùa, House đã cung cấp 176 nghiên cứu trường hợp chẩn đoán tận tâm. Mặc dù bộ phim kết thúc vào năm 2012, nhưng đến năm 2015, nó đã được sử dụng như một công cụ giảng dạy, với một buổi hội thảo đặc biệt Dr. House mang lại kết quả tốt hơn so với các buổi hội thảo tiêu chuẩn, mặc dù việc tham gia không mang lại điểm tín chỉ cho sinh viên:

Từ một nghiên cứu năm 2015, các lý do đa dạng mà sinh viên y muốn tham gia một buổi hội thảo chẩn đoán tận dụng thông tin từ chương trình truyền hình 'House'. Nguồn [  https://journals.plos.org/plosone/article/file?id=10.1371/journal.pone.0193972&type=printable ]

Từ một nghiên cứu năm 2015, các lý do đa dạng mà sinh viên y muốn tham gia một buổi hội thảo chẩn đoán tận dụng thông tin từ chương trình truyền hình ‘House’. Các buổi hội thảo được lên lịch vào một thời điểm thách thức có chủ ý, và không cấp tín chỉ học tập; mặc dù những yếu tố này, sáng kiến này đã rất thành công. Nguồn

Nhà và AI

Mặc dù việc sử dụng House và các bộ phim truyền hình đa dạng khác đã được chứng minh trong nhiều nghiên cứu là một công cụ hỗ trợ học tập hiệu quả, cho sinh viên y, nhưng cho đến nay, rất ít phương pháp này đã được thử nghiệm trong bối cảnh học máy.

Bây giờ, một bài báo mới từ Đại học bang Pennsylvania đã thực hiện một bước đầu tiên trong hướng này, bằng cách phát triển một tập dữ liệu bao gồm tất cả 176 nghiên cứu trường hợp chẩn đoán House có thể sử dụng được, được định dạng thành một cấu trúc chẩn đoán dựa trên câu chuyện, sau đó được đánh giá trên các mô hình ngôn ngữ lớn phổ biến từ OpenAI và Google.

Mặc dù đây là một thách thức khó khăn (đặc trưng bởi một trong những lĩnh vực khó khăn nhất trong khoa học sinh học), các nhà nghiên cứu đã phát hiện ra rằng các phiên bản mới hơn của ChatGPT và Gemini đã thể hiện sự cải thiện so với các phiên bản cũ hơn, cho thấy rằng xu hướng tiến hóa của sự phát triển mô hình có thể sẽ phát huy hiệu quả trong các quá trình chẩn đoán theo thời gian.

Bài báo cho biết:

‘Kết quả cho thấy sự thay đổi đáng kể về hiệu suất, từ 16,48% đến 38,64% độ chính xác, với các thế hệ mô hình mới hơn thể hiện sự cải thiện 2,3 lần. Mặc dù tất cả các mô hình đều phải đối mặt với những thách thức đáng kể về chẩn đoán bệnh hiếm gặp, nhưng sự cải thiện được quan sát thấy trên các kiến trúc cho thấy những hướng đi hứa hẹn cho sự phát triển trong tương lai.

‘Chúng tôi đã thiết lập một tiêu chuẩn giáo dục đã được xác thực, thiết lập các chỉ số hiệu suất cơ bản cho lý luận y khoa dựa trên câu chuyện và cung cấp một khuôn khổ đánh giá công khai cho nghiên cứu chẩn đoán hỗ trợ AI.’

Ngoài việc thiết lập các chỉ số hiệu suất cơ bản để đánh giá các nỗ lực trong tương lai, các tác giả lưu ý rằng tập dữ liệu mới – mà họ đang làm công khai – giải quyết sự thiếu hụt quá trình kể chuyện trong các tập dữ liệu y tế hiện có, và dễ dàng tiếp cận, trái ngược với văn hóa bị kiểm soát của các tập dữ liệu y tế tiêu chuẩn.

Công việc mới này có tiêu đề Đánh giá các mô hình ngôn ngữ lớn về chẩn đoán bệnh hiếm gặp: Một nghiên cứu trường hợp sử dụng House M.D, và đến từ bốn nhà nghiên cứu tại Penn State*.

Dữ liệu

Để tạo ra tập dữ liệu của họ, các tác giả đã sử dụng tài liệu công khai từ trang web fandom lâu đời House Wiki. Nội dung câu chuyện được trích xuất và cô đặc bằng khuôn khổ Beautiful Soup phổ biến, có thể trích xuất dữ liệu cấu trúc từ mã nguồn HTML của các trang web.

Sau khi các câu chuyện cơ bản được thu thập theo cách này, bốn mô hình ngôn ngữ lớn đã được sử dụng để chuyển đổi đầu ra thành định dạng trường hợp tiêu chuẩn. Các mô hình được sử dụng là GPT-4o mini; GPT-5 Mini; Gemini 2.5 Flash; và Gemini 2.5 Pro. Cuối cùng, bộ lọc chất lượng đã được áp dụng để đảm bảo rằng tập dữ liệu có đủ chi tiết lâm sàng và phù hợp với tình trạng hiện tại của nghệ thuật trong lý luận y khoa.

Các tác giả quan sát thấy rằng ‘bệnh mồ côi’ (tức là bệnh hiếm gặp) bị thiếu đại diện trong các cơ sở dữ liệu y tế tiêu chuẩn; trong một số trường hợp, sự bao phủ của chúng trong chương trình House có thể đại diện cho một tỷ lệ bất thường của tổng số lượng hiện có.

Các tác giả thừa nhận rằng tính hữu dụng của một nguồn dữ liệu như thế này phải được điều chỉnh với sự thận trọng liên quan đến giấy phép nghệ thuật có thể được ưu tiên hóa trong quá trình phát triển các bộ phim truyền hình y khoa:

‘Mặc dù tập dữ liệu của chúng tôi phản ánh những hạn chế của nội dung hư cấu, bao gồm sự phóng đại kịch tính và tập trung vào các trường hợp phức tạp, nhưng những đặc điểm này có thể mang lại lợi ích cho việc đánh giá bằng cách cung cấp các trường hợp biên giới thách thức kiểm tra độ bền của mô hình.

‘Việc xác thực giáo dục của House M.D. bởi các chuyên gia y tế cung cấp sự tin tưởng rằng các kịch bản được trích xuất chứa thông tin lâm sàng có ý nghĩa về mặt lâm sàng phù hợp cho đánh giá AI.’

Các ví dụ từ tập dữ liệu được tạo cho dự án. Nguồn [   https://www.kaggle.com/datasets/arshgupta23/housemd-data-for-rare-disease-accuracy-using-llms?resource=download    ]

Các ví dụ từ tập dữ liệu được tạo cho dự án.  Nguồn

Thử nghiệm

Để đánh giá độ chính xác của mô hình trên các nhiệm vụ chẩn đoán dựa trên câu chuyện, các tác giả đã thiết kế một đường ống đơn giản kết hợp việc tạo lời nhắc, suy luận mô hình và đánh giá.

Bốn mô hình ngôn ngữ lớn đã được thử nghiệm, với mỗi mô hình được cấu hình với nhiệt độ được đặt thành không (đảm bảo đeterministic chứ không phải ‘sáng tạo’ đầu ra), và với độ dài token tối đa là 1.500 – một sự cho phép được thiết kế để chứa đựng lý luận chẩn đoán phức tạp. Không có lời nhắc hệ thống bổ sung nào được sử dụng để khung các truy vấn thêm.

Các lời nhắc chính nó tuân theo một định dạng trình bày trường hợp y khoa tiêu chuẩn – loại mà người xem sẽ quen thuộc nhất với các bộ phim truyền hình y khoa khi một bệnh nhân/một bệnh mới được giới thiệu, và một bác sĩ tóm tắt một cái nhìn tổng quan cho lợi ích của các bác sĩ khác có mặt (hiệu quả, tuy nhiên, cho lợi ích của người xem).

Mỗi lời nhắc trình bày một câu chuyện lâm sàng bao gồm chi tiết nhân khẩu học; một dòng thời gian của các triệu chứng; lịch sử y khoa liên quan; và các phát hiện chẩn đoán sớm. Mô hình được chỉ đạo để xác định một chẩn đoán chính và để biện minh cho kết luận của nó với lý luận.

Mỗi mô hình tạo ra phản hồi chẩn đoán của nó trong một lần đi, mà không cần tinh chỉnh lặp lại; và phản hồi được thu thập trong điều kiện nhất quán trên tất cả 176 trường hợp:

Một ví dụ minh họa, hiển thị một lời nhắc lâm sàng dựa trên câu chuyện và chẩn đoán thực sự tương ứng, như được sử dụng để thử nghiệm Gemini 2.5 Pro. Nguồn [  https://arxiv.org/pdf/2511.10912  ]

Một ví dụ minh họa hiển thị một lời nhắc lâm sàng dựa trên câu chuyện và chẩn đoán thực sự tương ứng, như được sử dụng để thử nghiệm Gemini 2.5 Pro. Nguồn

Đối với các chỉ số, các dự đoán được đánh giá bằng một thủ tục khớp chuỗi ‘mờ’ được thiết kế để tính đến sự mơ hồ trong thuật ngữ y khoa. Phương pháp sử dụng thư viện SequenceMatcher của Python, với ngưỡng tương tự là 0,8, bắt đầu với việc khớp chuỗi con chính xác và quay lại so sánh theo từng token khi cần. Độ chính xác được tính toán là tỷ lệ trường hợp được phân loại chính xác trong những điều kiện này:

Quy trình khớp 'mờ' được sử dụng bởi các nhà nghiên cứu.

Quy trình khớp ‘mờ’ được sử dụng bởi các nhà nghiên cứu.

Các tác giả lưu ý rằng việc khớp ‘mờ’ có thể có nghĩa là các chẩn đoán đồng nghĩa về mặt ngữ nghĩa sử dụng các thuật ngữ khác nhau có thể bị bỏ lỡ, nhưng họ trình bày phương pháp của mình là phương pháp có khả năng tái tạo nhất có thể đáp ứng tất cả các ràng buộc của dự án.

Kết quả

Độ chính xác chẩn đoán thay đổi rộng rãi trên các mô hình, với Gemini 2.5 Pro hoạt động tốt nhất ở mức 38,64%, tiếp theo là GPT-5 Mini ở mức 36,93%, Gemini 2.5 Flash ở mức 32,95% và GPT-4o Mini ở mức 16,48%. Mặc dù những khác biệt này, tất cả các mô hình đều gặp khó khăn với nhu cầu của lý luận chẩn đoán cho các bệnh hiếm gặp:

Kết quả về độ chính xác chẩn đoán trên bốn mô hình được thử nghiệm.

Kết quả về độ chính xác chẩn đoán trên bốn mô hình được thử nghiệm.

Các tác giả cũng lưu ý rằng hiệu suất thay đổi trên các mùa của chương trình:

Độ chính xác thay đổi trên các mùa đa dạng của House, nhưng không có đường cong hoặc lý do rõ ràng.

Độ chính xác thay đổi trên các mùa đa dạng của House, nhưng không có đường cong hoặc lý do rõ ràng.

Bài báo cho biết:

‘Mùa 1 đạt được độ chính xác cao nhất ở mức 56,52%, trong khi Mùa 5 cho thấy thấp nhất ở mức 20,83%. Sự thay đổi này cho thấy rằng độ phức tạp chẩn đoán thay đổi trong suốt loạt phim, với các mùa sau có thể có các trường hợp bệnh hiếm gặp thách thức hơn.

‘Tuy nhiên, hiệu suất mạnh mẽ trong Mùa 8 (52,38%) cho thấy rằng sự tiến bộ theo thời gian không giải thích đầy đủ sự khác biệt về độ chính xác; dường như độ phức tạp chẩn đoán theo từng trường hợp là yếu tố chính.’

Các mô hình hoạt động đáng tin cậy hơn khi chẩn đoán các tình trạng phổ biến với các triệu chứng dễ nhận biết, chẳng hạn như viêm màng não, nhồi máu cơ tim và thuyên tắc phổi – nhưng nhất quán gặp khó khăn với các bệnh hiếm gặp như bệnh neurocysticercosis và bệnh Erdheim-Chester, cũng như các rối loạn tự miễn phức tạp như lupus ban đỏ hệ thống và sarcoidosis. Hiệu suất cũng giảm trong các trường hợp độc tính đòi hỏi liên kết lịch sử phơi nhiễm với các dấu hiệu lâm sàng.

Các tác giả đề xuất rằng sự thay đổi về độ chính xác giữa các mô hình cho thấy sự khác biệt có ý nghĩa về kiến trúc và chiến lược đào tạo, với hiệu suất mạnh mẽ hơn của GPT-5 Mini và Gemini 2.5 Pro cho thấy rằng các thế hệ mới hơn của mô hình ngôn ngữ lớn có lợi từ các khả năng lý luận được cải thiện – mặc dù kết quả của họ vẫn cho thấy những hạn chế rõ ràng trong việc xử lý các nhiệm vụ chẩn đoán phức tạp.

Kết quả, họ cho rằng, cung cấp các chỉ số cơ bản cho chẩn đoán bệnh hiếm gặp dựa trên câu chuyện, cho thấy mạnh mẽ rằng các mô hình ngôn ngữ hiện tại đang bắt đầu thể hiện các khả năng lý luận y khoa hữu ích.

Sự nhảy vọt về hiệu suất từ GPT-4o Mini ở mức 16,48% đến Gemini 2.5 Pro ở mức 38,64%, bài báo kết luận, cho thấy sự tiến bộ ổn định hướng tới các công cụ hỗ trợ AI có thể áp dụng lâm sàng.

Mặc dù các nhà nghiên cứu thừa nhận rằng mức độ chính xác vẫn còn khiêm tốn, điểm chuẩn tập trung độc quyền vào các trường hợp phức tạp thách thức ngay cả các bác sĩ được đào tạo, và khả năng xác định chẩn đoán chính xác trong gần 40% trong số các ví dụ khó khăn này cho thấy khả năng lý luận thực sự, tạo nền tảng cho các cải tiến trong tương lai thông qua tinh chỉnh có mục tiêu, tích hợp kiến thức y khoa có cấu trúc hoặc chiến lược lý luận hỗn hợp.

Kết luận

Có một số nguy cơ rõ ràng khi tái sử dụng các câu chuyện từ chương trình truyền hình thành các tập dữ liệu y tế thực tế – ngay cả trong các trường hợp, như với House, nơi vật liệu nguồn có mức độ đóng góp y khoa đủ điều kiện và/hoặc giám sát cao.

Điều thú vị cần lưu ý là một tập phim truyền hình House hiệu quả hoạt động như một máy tóm tắt cho một loạt các mục y khoa có thể không dễ dàng tiếp cận trên internet cho người bình thường, hoặc cho các nguồn dữ liệu trình bày thông tin theo cách phân mảnh và phi tuyến tính hơn.

Có một bác sĩ thực sự viết kịch bản cho một tập, như thường xảy ra với House, có thể được các nhà nghiên cứu sử dụng như một hình thức ‘xác nhận’ về nội dung; nhưng điều này bỏ qua thực tế rằng các yếu tố nghệ thuật có thể đã ảnh hưởng đến việc trình bày bệnh trong tập.

Điều này để lại dữ liệu trong tình trạng của nhiều nguồn dữ liệu hữu ích khác cho đào tạo: cần một lớp giám sát mới của con người đủ điều kiện và tốn kém.

 

* Xin lưu ý rằng bài báo này rất ngắn và không theo mẫu thông thường, và tôi đã điều chỉnh phạm vi để phù hợp với điều này.

Được xuất bản lần đầu vào thứ Hai, ngày 17 tháng 11 năm 2025

Nhà văn về học máy, chuyên gia lĩnh vực tổng hợp hình ảnh con người. Cựu trưởng nhóm nội dung nghiên cứu tại Metaphysic.ai, cho đến khi nó được併 nhập vào Brahma.ai của DNEG.
Portfolio site: martinanderson.ai
Contact: [email protected]