Góc nhìn Anderson
Bộ dữ liệu COVIDx phổ biến bị các nhà nghiên cứu Vương quốc Anh chỉ trích

Một tập đoàn nghiên cứu từ Vương quốc Anh đã chỉ trích mức độ tự tin khoa học được đặt vào các bộ dữ liệu mã nguồn mở được sử dụng cho phân tích dựa trên tầm nhìn máy tính của X-quang ngực của bệnh nhân COVID-19, tập trung vào bộ dữ liệu mã nguồn mở phổ biến COVIDx.
Các nhà nghiên cứu, sau khi thử nghiệm COVIDx trong các mô hình đào tạo AI, cho rằng nó ‘không đại diện cho vấn đề lâm sàng thực sự’, rằng kết quả thu được bằng cách sử dụng nó ‘được thổi phồng’, và rằng các mô hình ‘không tổng quát hóa tốt’ với dữ liệu thế giới thực.
Các tác giả cũng lưu ý sự không nhất quán của dữ liệu được đóng góp tạo thành COVIDx, nơi các hình ảnh ban đầu đến từ nhiều độ phân giải khác nhau được định dạng tự động bởi công việc học sâu vào các kích thước nhất quán cần thiết cho đào tạo, và quan sát thấy rằng quá trình này có thể giới thiệu các hiện象 lừa đảo liên quan đến thuật toán thay đổi kích thước hình ảnh, chứ không phải khía cạnh lâm sàng của dữ liệu.
Bài báo có tên Những cái bẫy khi sử dụng dữ liệu mở để phát triển các giải pháp học sâu cho việc phát hiện COVID-19 trong X-quang ngực, và là một sự hợp tác giữa Trung tâm Hình ảnh và Mô phỏng Y sinh (CISTIB) tại Đại học Leeds, cùng với các nhà nghiên cứu từ năm tổ chức khác trong cùng thành phố, bao gồm cả Bệnh viện Dạy khoa Leeds NHS Trust.
Nghiên cứu chi tiết, trong số các thực hành tiêu cực khác, ‘sử dụng nhãn sai’ trong bộ dữ liệu COVIDx, cũng như ‘nguy cơ cao về偏见 và tương quan’. Các thí nghiệm của các nhà nghiên cứu khi đưa bộ dữ liệu qua ba mô hình học sâu khả thi đã khiến họ kết luận rằng ‘hiệu suất đặc biệt được báo cáo rộng rãi trên toàn miền vấn đề là bị thổi phồng, rằng kết quả hiệu suất mô hình bị đại diện sai, và rằng các mô hình không tổng quát hóa tốt với dữ liệu lâm sàng thực tế.’
Năm Bộ dữ liệu Khác nhau trong Một
Báo cáo* lưu ý rằng hầu hết các phương pháp dựa trên AI hiện tại trong lĩnh vực này phụ thuộc vào một ‘hỗn hợp’ dữ liệu từ các kho mã nguồn mở khác nhau, quan sát thấy rằng năm bộ dữ liệu có đặc điểm khác biệt đã được kết hợp vào bộ dữ liệu COVIDx mặc dù (theo quan điểm của các nhà nghiên cứu) không có sự tương đương về chất lượng và loại dữ liệu.
Bộ dữ liệu COVIDx được phát hành vào tháng 5 năm 2020 như một nỗ lực hợp tác do Bộ phận Thiết kế Hệ thống tại Đại học Waterloo ở Canada dẫn đầu, với dữ liệu có sẵn như một phần của Sáng kiến Mở COVID-Net.
Năm bộ sưu tập tạo nên COVIDx là: Bộ sưu tập Dữ liệu Hình ảnh COVID-19 (một bộ sưu tập mã nguồn mở từ các nhà nghiên cứu Montreal); Bộ dữ liệu X-quang ngực COVID-19 đề xuất; Bộ dữ liệu X-quang ngực COVID-19 Actualmed đề xuất; Cơ sở dữ liệu X-quang COVID-19 Cơ sở dữ liệu; và thử thách phát hiện viêm phổi RSNA, một trong những bộ dữ liệu trước COVID được sử dụng cho cuộc khủng hoảng đại dịch.
(RICORD – xem dưới đây – đã được thêm vào COVIDx, nhưng vì nó được bao gồm sau các mô hình được quan tâm trong nghiên cứu, nên nó đã bị loại khỏi dữ liệu thử nghiệm, và trong mọi trường hợp, nó sẽ có xu hướng làm cho COVIDx đa dạng hơn, điều này là khiếu nại trung tâm của các tác giả của nghiên cứu.)
Các nhà nghiên cứu cho rằng COVIDx là ‘lớn nhất và được sử dụng rộng rãi nhất’ bộ dữ liệu của loại này trong cộng đồng khoa học liên quan đến nghiên cứu COVID, và rằng dữ liệu nhập vào COVIDx từ các bộ dữ liệu bên ngoài không phù hợp với lược đồ ba phần của bộ dữ liệu COVIDx (tức là, ‘bình thường’, ‘viêm phổi’ và ‘COVID-19’).
Đủ gần..?
Khi kiểm tra nguồn gốc và tính phù hợp của các bộ dữ liệu đóng góp cho COVIDx tại thời điểm nghiên cứu, các nhà nghiên cứu đã tìm thấy ‘sử dụng sai’ dữ liệu RSNA, nơi dữ liệu của một loại đã được các nhà nghiên cứu cho là đã được đưa vào một loại khác:
‘Bộ dữ liệu RSNA, sử dụng dữ liệu X-quang ngực công khai từ NIH Chestx-ray8 [**], được thiết kế cho một nhiệm vụ phân割 và như vậy chứa ba lớp hình ảnh, ‘Lung Opacity’, ‘Không có Lung Opacity / Không bình thường’, và ‘Bình thường’, với các hộp giới hạn có sẵn cho các trường hợp ‘Lung Opacity’.
‘Trong việc biên dịch vào COVIDx, tất cả X-quang từ lớp ‘Lung Opacity’ đều được bao gồm trong lớp viêm phổi.’
Hiệu quả, bài báo cho rằng, phương pháp COVIDx mở rộng định nghĩa của ‘viêm phổi’ để bao gồm ‘tất cả các mờ đục phổi giống như viêm phổi’. Do đó, giá trị so sánh của các loại dữ liệu tương tự có thể bị đe dọa. Các nhà nghiên cứu cho biết:
‘ […] lớp viêm phổi trong bộ dữ liệu COVIDx chứa X-quang với một loạt các bệnh lý khác, bao gồm cả tràn dịch màng phổi, xâm nhập, hợp nhất, phổi già và khối u. Hợp nhất là một đặc điểm X-quang của viêm phổi có thể, không phải là chẩn đoán lâm sàng. Sử dụng hợp nhất như một thay thế cho viêm phổi mà không ghi lại điều này có thể gây hiểu lầm.’

Bệnh lý thay thế (ngoài COVID-19) liên quan đến COVIDx. Nguồn: https://arxiv.org/ftp/arxiv/papers/2109/2109.08020.pdf
Báo cáo cho thấy chỉ 6,13% trong số 4.305 trường hợp viêm phổi lấy từ RSNA được dán nhãn chính xác, đại diện cho chỉ 265 trường hợp viêm phổi thực sự.
Nhiều trường hợp không phải viêm phổi được bao gồm trong COVIDx đại diện cho các bệnh lý đồng mắc – các biến chứng của các bệnh khác, hoặc các vấn đề y tế thứ cấp trong các tình trạng không nhất thiết liên quan đến viêm phổi.
Không phải ‘Bình thường’
Báo cáo cũng cho rằng ảnh hưởng của bộ dữ liệu thách thức RSNA trong COVIDx đã làm sai lệch sự ổn định thực nghiệm của dữ liệu. Các nhà nghiên cứu quan sát thấy rằng COVIDx ưu tiên lớp ‘bình thường’ của dữ liệu RSNA, hiệu quả loại bỏ tất cả các lớp ‘không có mờ đục phổi / không bình thường’ trong bộ dữ liệu rộng hơn. Bài báo nói:
‘Mặc dù điều này phù hợp với những gì được mong đợi trong nhãn ‘bình thường’, nhưng việc mở rộng lớp viêm phổi và chỉ sử dụng X-quang ‘bình thường’, thay vì các trường hợp không phải viêm phổi, làm cho nhiệm vụ phân loại trở nên đơn giản hơn.’
‘Kết quả cuối cùng của điều này là một bộ dữ liệu phản ánh một nhiệm vụ được loại bỏ khỏi vấn đề lâm sàng thực sự.’
Ứng suất tiềm năng từ các Tiêu chuẩn Dữ liệu Không tương thích
Bài báo nhận ra một số loại ứng suất khác trong COVIDx, lưu ý rằng một số dữ liệu đóng góp trộn hình ảnh X-quang ngực nhi đồng với X-quang của bệnh nhân người lớn, và quan sát thấy rằng dữ liệu này là nguồn ‘đáng kể’ duy nhất của hình ảnh nhi đồng trong COVIDx.
Cũng, hình ảnh từ bộ dữ liệu RSNA có độ phân giải 1024×1024, trong khi một bộ dữ liệu đóng góp khác chỉ cung cấp hình ảnh với độ phân giải 299×299. Vì các mô hình học máy sẽ tự động thay đổi kích thước hình ảnh để phù hợp với không gian đào tạo có sẵn (không gian tiềm ẩn), điều này có nghĩa là hình ảnh 299×299 sẽ được nâng cấp trong một công việc đào tạo (có thể dẫn đến các hiện象 liên quan đến thuật toán thay đổi kích thước chứ không phải bệnh lý), và các hình ảnh lớn hơn sẽ bị giảm kích thước. Điều này làm giảm tiêu chuẩn dữ liệu đồng nhất cần thiết cho phân tích tầm nhìn máy tính dựa trên AI.
Thêm vào đó, dữ liệu ActMed được đưa vào COVIDx chứa ‘dấu hiệu hình đĩa’ trong X-quang ngực COVID-19, một tính năng lặp lại không nhất quán với bộ dữ liệu rộng hơn, và sẽ cần được xử lý như một ‘dấu hiệu lặp lại’.
Đây là loại vấn đề thường được giải quyết bằng cách làm sạch hoặc loại bỏ dữ liệu, vì sự lặp lại của các dấu hiệu đủ để đăng ký như một ‘tính năng’ trong đào tạo, nhưng không đủ thường xuyên để tổng quát hóa hữu ích trong kế hoạch rộng lớn hơn của bộ dữ liệu. Nếu không có cơ chế để loại bỏ ảnh hưởng của các dấu hiệu nhân tạo, chúng có thể được coi là hiện tượng bệnh lý bởi phương pháp của hệ thống học máy.
Đào tạo và Kiểm tra
Các nhà nghiên cứu đã kiểm tra COVIDx chống lại hai bộ dữ liệu so sánh trên ba mô hình. Hai bộ dữ liệu bổ sung là RICORD, chứa 1096 X-quang ngực COVID-19 trên 361 bệnh nhân, lấy từ bốn quốc gia; và CheXpert, một bộ dữ liệu công khai
Ba mô hình được sử dụng là COVID-Net, CoroNet và DarkCovidNet. Tất cả ba mô hình đều sử dụng Mạng nơ-ron tích chập (CNN), mặc dù CoroNet bao gồm một quá trình phân loại hình ảnh hai giai đoạn, với các bộ tự mã hóa truyền đầu ra đến một bộ phân loại CNN.
Kiểm tra cho thấy sự ‘giảm mạnh’ trong hiệu suất của tất cả các mô hình trên các bộ dữ liệu không phải COVIDx so với độ chính xác 86% khi sử dụng dữ liệu COVIDx. Tuy nhiên, nếu dữ liệu bị dán nhãn sai hoặc nhóm sai, những kết quả này hiệu quả là kết quả sai. Các nhà nghiên cứu lưu ý rằng độ chính xác giảm đáng kể trên các bộ dữ liệu bên ngoài so sánh, mà bài báo đề xuất là dữ liệu thực tế và được phân loại chính xác hơn.
Thêm vào đó, bài báo quan sát:
‘Một đánh giá lâm sàng của 500 bản đồ độ sáng grad-CAM được tạo ra bởi dự đoán trên dữ liệu thử nghiệm COVIDx cho thấy xu hướng về các tính năng không liên quan đến lâm sàng. Điều này thường bao gồm việc tập trung vào cấu trúc xương và mô mềm thay vì sự mờ đục lan tỏa hai bên của các lĩnh vực phổi điển hình của nhiễm COVID-19.’

Đây là một X-quang của một trường hợp COVID-19 được xác nhận, được chỉ định một xác suất dự đoán là 0,938 từ COVIDx được đào tạo trên DarkCovidNet.
Kết luận
Các nhà nghiên cứu chỉ trích sự thiếu dữ liệu nhân khẩu học hoặc lâm sàng liên quan đến hình ảnh X-quang trong COVIDx, lập luận rằng nếu không có những thông tin này, thì không thể tính đến ‘các yếu tố tương quan’ như tuổi.
Họ cũng quan sát thấy rằng các vấn đề được tìm thấy trong bộ dữ liệu COVIDx có thể được áp dụng cho các bộ dữ liệu khác được thu thập theo cách tương tự (tức là bằng cách trộn các cơ sở dữ liệu hình ảnh X-quang trước COVID với dữ liệu hình ảnh X-quang COVID gần đây mà không có kiến trúc dữ liệu đầy đủ, bù đắp phương sai và phạm vi rõ ràng của hạn chế của cách tiếp cận này).
Khi tóm tắt những điểm yếu của COVIDx, các nhà nghiên cứu nhấn mạnh việc bao gồm ‘không cân đối’ các X-quang nhi đồng ‘rõ ràng’, cũng như nhận thức của họ về việc sử dụng nhãn sai và nguy cơ cao về ứng suất và tương quan trong COVIDx, cho rằng ‘hiệu suất đặc biệt [của COVIDx] được báo cáo rộng rãi trên toàn miền vấn đề là bị thổi phồng, rằng kết quả hiệu suất mô hình bị đại diện sai, và rằng các mô hình không tổng quát hóa tốt với dữ liệu lâm sàng thực tế.’
Báo cáo kết luận:
‘Sự thiếu hụt dữ liệu bệnh viện kết hợp với việc đánh giá mô hình không đầy đủ trên toàn miền vấn đề đã cho phép việc sử dụng dữ liệu mã nguồn mở để đánh lừa cộng đồng nghiên cứu. Việc tiếp tục xuất bản các chỉ số hiệu suất mô hình bị thổi phồng có nguy cơ làm tổn hại đến sự tin cậy của nghiên cứu AI trong chẩn đoán y tế, đặc biệt là khi bệnh tật là của công chúng. Chất lượng nghiên cứu trong lĩnh vực này phải được cải thiện để ngăn chặn điều này, điều này phải bắt đầu từ dữ liệu.’
*Mặc dù các nhà nghiên cứu của nghiên cứu cho rằng họ đã làm cho dữ liệu, tệp và mã của bài báo mới có sẵn trực tuyến, nhưng việc truy cập đòi hỏi đăng nhập, và tại thời điểm viết, không có quyền truy cập công cộng vào các tệp.
** ChestX-ray8: Cơ sở dữ liệu X-quang ngực quy mô bệnh viện và các điểm chuẩn về phân loại và định vị yếu đuối của các bệnh về ngực phổ biến – https://arxiv.org/pdf/1705.02315.pdf












