Y tế

Từ Dự đoán đến Hành động có Trách nhiệm: Thiết kế Sự không chắc chắn trong Femtech AI

mm
Thêm Unite.AI vào các nguồn ưu tiên của bạn trên Google

Trong lĩnh vực sức khỏe phụ nữ, độ chính xác là cần thiết, nhưng nó chỉ là lớp đầu tiên của sự an toàn sản phẩm. Điều quan trọng là hệ thống phải biết khi nào một dự đoán đủ mạnh để hành động và được thiết kế để nói khi nó không đủ.

Mở hầu hết các ứng dụng theo dõi chu kỳ hoặc khả năng sinh sản, và bạn sẽ thấy một kết quả sạch: ngày rụng trứng vào ngày 15, nhãn khả năng sinh sản cao, điểm tự tin 78%. Con số này trông có vẻ chính xác. Nhưng sinh học bên dưới nó thì không.

Ngày kinh nguyệt là điều mà người dùng quan sát được. Ngày rụng trứng là một sự kiện tiềm ẩn mà không có thiết bị tiêu dùng nào đo trực tiếp. Nó được suy luận từ các yếu tố trung gian. Nhiệt độ da phản ánh không chỉ progesterone mà còn giấc ngủ, rượu, bệnh tật, điều kiện môi trường và vị trí của cảm biến vào đêm đó. Một mục nhập triệu chứng kết hợp sinh lý với nhận thức, ký ức và quyết định của người dùng khi ghi lại. Khi tất cả những điều đó được giải quyết thành “Ngày 15, 78%”, đã có nhiều loại không chắc chắn khác nhau được nén vào một câu có vẻ tự tin.

Trong các sản phẩm tôi đã làm việc trong lĩnh vực sức khỏe phụ nữ, vấn đề khó khăn không phải là độ chính xác. Mẫu mà tôi luôn quay lại là tính toàn vẹn của quyết định. Độ chính xác cho bạn biết mô hình dự đoán tốt như thế nào. Nhưng nó không nói gì về việc sản phẩm có biết khi nào dự đoán đủ mạnh để hành động hay không. Trong một lĩnh vực mà cùng một đầu ra có thể thông tin cho việc lập kế hoạch thông thường hoặc quyết định tránh thai, khoảng cách đó là nơi mà sự tin tưởng được giành hoặc mất.

Vì vậy, lập luận của tôi là Femtech AI không cần dự đoán tốt hơn. Nó cần thiết kế sự không chắc chắn tốt hơn. Và thiết kế sự không chắc chắn không phải là một điều khoản được gắn thêm trước khi ra mắt; nó là một kiến trúc. Tôi cấu trúc nó thành sáu lớp mang tín hiệu từ đầu vào thô đến hành động mà hệ thống có thể chứng minh và kiểm toán. Tôi áp dụng một phiên bản sáu lớp của Phương pháp Sản phẩm Quyết định-hành động được Điều chỉnh, được thiết kế để quản lý cách các tín hiệu sức khỏe không chắc chắn được chuyển đổi thành hành động được phép và có trách nhiệm. Phương pháp bao gồm việc đủ điều kiện dữ liệu, hiệu chỉnh suy luận, ánh xạ hậu quả, chính sách kiểm soát, thực hiện quy trình và vòng lặp trách nhiệm. Con đường quản lý của nó bắt đầu từ dữ liệu sức khỏe, dẫn đến kiến trúc quyết định và kết thúc ở hành động có trách nhiệm.

1. Xác định Dữ liệu Trước khi Tin tưởng

Lớp đầu tiên quyết định những gì hệ thống thực sự biết. Các sản phẩm Femtech thu thập từ các nguồn rất khác nhau. Nó có thể bao gồm những thứ mà người dùng quan sát trực tiếp, chẳng hạn như ngày kinh nguyệt hoặc báo cáo chủ quan như đau hoặc tâm trạng, cũng như các tính năng đeo được như nhiệt độ da và biến thiên nhịp tim, và các biến mà mô hình tạo ra chính nó. Việc coi các tín hiệu này là đầu vào có thể hoán đổi cho nhau là tội lỗi ban đầu.

Mỗi tín hiệu cần có nguồn gốc mà hệ thống có thể đọc: nơi nó đến từ, khi nào, tần suất lấy mẫu, những gì làm cho nó bị ảnh hưởng và cách nó liên quan đến sự kiện bạn đang dự đoán. Ngày rụng trứng là sự kiện. Nhiệt độ, dịch cổ tử cung, LH và ngày chu kỳ là bằng chứng về sự kiện đó, mỗi loại có độ trễ và lỗi riêng.

Dữ liệu bị thiếu xứng đáng được chú ý đặc biệt vì trong theo dõi sức khỏe, nó hiếm khi là ngẫu nhiên. Người dùng ghi lại nhiều hơn khi họ lo lắng và ngừng khi họ cảm thấy ổn, vì vậy một khoảng trống có thể mang nhiều thông tin như một mục nhập. Trong một phân tích thực tế của hơn 600.000 chu kỳ rụng trứng, ngày rụng trứng không thể được phát hiện trong 665.603 trong 1,4 triệu chu kỳ đầu tiên được xem xét. Ba phần tư trong số đó có đọc nhiệt độ hợp lệ trên ít hơn một nửa số ngày trong chu kỳ. Sự đủ điều kiện của dữ liệu là một yếu tố hạn chế lớn trong những gì thuật toán có thể suy luận. Một sản phẩm đưa ra nhãn khả năng sinh sản sạch trong tình huống đó không phải là tự tin. Nó đang tạo ra sự chính xác mà nó không có.

2. Hiệu chỉnh Suy luận với Bằng chứng

Một điểm số tự tin duy nhất không thể đại diện cho những gì thực sự đang diễn ra, vì các hệ thống này phải đối mặt với nhiều nguồn không chắc chắn khác nhau cùng một lúc. Những điều này bao gồm sự biến thiên sinh học trong quá trình chính nó, chất lượng đo lường, sự thiếu hụt từ tự theo dõi, sự không chắc chắn của mô hình từ dữ liệu đào tạo mỏng và sự thay đổi phân phối khi người dùng hiện tại không giống với dân số mà mô hình được xác thực.

Trong cùng một phân tích, chỉ 13% chu kỳ là chính xác 28 ngày, và giai đoạn nang buồng trứng trung bình chạy 16,9 ngày trên một phạm vi đủ rộng để làm cho bất kỳ giả định “ngày 14” nào trở nên ввод dẫn. Nghiên cứu Sức khỏe Phụ nữ Apple đã tìm thấy rằng độ dài chu kỳ và biến thiên trong người liên quan đến tuổi tác, chủng tộc tự báo cáo và chỉ số khối cơ thể. Tùy chỉnh, do đó, không có nghĩa là thay thế một giá trị trung bình dân số bằng một điểm cá nhân. Nó có nghĩa là tạo ra một phân phối mà thu hẹp khi bằng chứng tích lũy.

Hãy xem xét hai dự đoán dựa trên AI đều đọc “75%”. Một dựa trên một năm lịch sử và đo lường dày đặc, và sự không chắc chắn của nó chủ yếu là sinh học thực sự. Người kia dựa trên hai chu kỳ, năm lần đo nhiệt độ, xét nghiệm LH dương tính gần đây, một số mục nhập triệu chứng và một tuần giấc ngủ kém. Ở đây, sự không chắc chắn chủ yếu là do thiếu dữ liệu. Cùng một số, nhưng sản phẩm không nên được phép phản ứng với chúng theo cùng một cách. Đây cũng là lý do tại sao hiệu chỉnh phải được kiểm tra trong các phân nhóm – hiệu suất tổng hợp có thể che giấu một mô hình quá tự tin, đặc biệt là đối với chu kỳ không đều hoặc người dùng tiền mãn kinh. Văn học lâm sàng-AI hiện nay tách phân biệt, hiệu chỉnh và tiện ích quyết định chính xác vì lý do này. Một mô hình có thể xếp hạng người dùng tốt và vẫn tạo ra xác suất không chính xác cho các quyết định thực sự.

3. Ánh xạ Hậu quả của Việc Sai lầm

Lớp thứ ba đặt câu hỏi về việc xảy ra gì khi hệ thống sai lầm và gắn phản hồi được phép với chi phí đó. Một bản tóm tắt chu kỳ, một ước tính cửa sổ khả năng sinh sản, một nhãn khả năng sinh sản thấp được đọc như hướng dẫn tránh thai và một giải thích triệu chứng quyết định liệu ai đó có tìm kiếm sự chăm sóc hay không không phải là cùng một sản phẩm, ngay cả khi mô hình đằng sau chúng là giống nhau.

Tôi phân loại đầu ra thành bốn cấp theo hậu quả: thông tin, hành vi, sinh sản và lâm sàng. Mỗi cấp có ngưỡng bằng chứng riêng, ngôn ngữ được phép và đường dẫn leo thang. Một xác suất 70% có thể đủ cho việc đoán ngày bắt đầu kinh nguyệt và không gần đủ để trấn an ai đó đang cố gắng tránh thai.

Đây là nơi thiết kế gặp quy định. Việc liệu phần mềm có vượt qua lãnh thổ thiết bị y tế hay không phụ thuộc vào việc sử dụng dự định và vai trò đầu ra của nó trong quyết định sức khỏe. Hướng dẫn hiện tại của FDA về Phần mềm Hỗ trợ Quyết định Lâm sàng, được cập nhật vào tháng 1 năm 2026, rõ ràng rằng các chức năng dự định cho bệnh nhân và người chăm sóc có thể đáp ứng định nghĩa của một thiết bị. Vị trí quy định không phải là một đánh giá pháp lý ở cuối. Nó được mã hóa trong các ngưỡng của bạn, ngôn ngữ của bạn và logic leo thang của bạn từ ngày đầu tiên.

4. Chuyển Sự không chắc chắn thành Chính sách Kiểm soát

Một “kết quả có thể không chính xác” đặt toàn bộ vấn đề giải thích trở lại người dùng. Một chính sách kiểm soát làm điều ngược lại. Đối với một trạng thái bằng chứng nhất định, nó quyết định liệu hệ thống sẽ hiển thị một quan sát, cung cấp một phạm vi có giới hạn, yêu cầu một phép đo khác, trỏ đến một bác sĩ lâm sàng hoặc từ chối trả lời. Sự từ chối là một khả năng của sản phẩm, không phải là một thất bại. “Chúng tôi không chắc chắn” nên là một trạng thái được thiết kế với bước tiếp theo, không phải là màn hình lỗi.

Cụ thể, thay vì “Ngày rụng trứng: Ngày 15, Tự tin 78%”, phản hồi được quản lý đọc gần như thế này: ngày rụng trứng có khả năng cao nhất trong một cửa sổ bốn ngày; sự tự tin bị hạn chế bởi dữ liệu nhiệt độ thưa thớt và giấc ngủ bị gián đoạn; một số lần đọc thêm sẽ làm sắc nét ước tính, và một xét nghiệm LH có thể thêm bằng chứng tiềm năng và thu hẹp cửa sổ có khả năng. Người dùng nhận được một ước tính, lý do tại sao nó không chắc chắn và hành động đơn lẻ sẽ thay đổi nó.

5. Hỗ trợ Hành động mà Đầu ra Ngụ ý

Ngay cả một ứng dụng tiêu dùng cũng tạo ra một quy trình làm việc: ghi lại một lần đọc khác, lặp lại một xét nghiệm, tiếp tục quan sát, xuất dữ liệu, gọi một bác sĩ lâm sàng. Hệ thống nên biết hành động mà mỗi phản hồi trỏ đến và liệu nó có thể hỗ trợ hành động đó một cách an toàn hay không.

Ranh giới giữa hướng dẫn sản phẩm và tư vấn y tế sống ở đây, và nó không phải là một dòng cố định. Nội dung giáo dục giải thích ý nghĩa chung của một tín hiệu nằm an toàn ở phía hướng dẫn. Sản phẩm di chuyển vào lãnh thổ rủi ro cao hơn khi nó giải thích dữ liệu của một người như một bệnh, chỉ đạo điều trị hoặc cung cấp sự an ủi mang trọng lượng lâm sàng thực sự. Ranh giới đó phải được giữ ở mọi tương tác, không chỉ trong điều khoản dịch vụ.

6. Đóng Vòng lặp Trách nhiệm

Lớp cuối cùng phán quyết toàn bộ hệ thống, không chỉ mô hình. Các chỉ số mô hình tiêu chuẩn vẫn quan trọng và tập trung vào phân biệt, hiệu chỉnh, hiệu suất phân nhóm, xác thực bên ngoài và xác thực theo thời gian. Nhưng các chỉ số cấp sản phẩm cũng quan trọng không kém. Chúng tôi nên hỏi bao nhiêu lần hệ thống có đủ đầu vào để hành động, bao nhiêu lần nó từ chối. Ngoài ra, một chỉ số mà tôi sẽ nhấn mạnh là tỷ lệ an ủi sai, nghĩa là bao nhiêu lần nó nói với ai đó mọi thứ đều ổn trên bằng chứng không thể hỗ trợ tuyên bố đó.

Mỗi phản hồi có hậu quả nên được tái tạo sau khi thực tế. Các cơ quan quản lý, tổ chức tiêu chuẩn và các tổ chức quản lý sức khỏe toàn cầu ngày càng áp dụng quan điểm chu kỳ sống này. Nguyên tắc thực hành tốt Máy học của IMDRF coi AI y tế đáng tin cậy là trách nhiệm chu kỳ sống toàn diện bao gồm thiết kế, triển khai và giám sát, vang vọng hướng dẫn của WHO về AI cho sức khỏe.

Kiến trúc trông như thế nào trong Thực tiễn

Hãy nói rằng một sản phẩm có ba tháng ngày kinh nguyệt, sáu đêm nhiệt độ, một xét nghiệm LH dương tính, một số mục nhập triệu chứng và một tuần giấc ngủ kém. Xác suất rụng trứng cao nhất của mô hình rơi vào ngày 15. Một ứng dụng ước tính điểm tạo ra “Ngày rụng trứng: Ngày 15, Tự tin 78%”.

Kiến trúc tạo ra điều gì đó khác. Nó đánh dấu dữ liệu nhiệt độ là thưa thớt và bị gián đoạn giấc ngủ. Nó tạo ra một phân phối trên nhiều ngày ứng viên thay vì một ngày. Nó áp dụng một ngưỡng nhẹ cho nhận thức chu kỳ nhưng một ngưỡng nghiêm ngặt hơn nếu đầu ra chạm vào việc tránh thai. Nó cung cấp một phạm vi cộng với phép đo tiếp theo hữu ích. Và nó lưu trữ toàn bộ trạng thái bằng chứng để quyết định có thể được tái tạo sau này. Cùng một mô hình cơ bản và một sản phẩm rất khác.

Quyền hành động

Các hệ thống Femtech chỉ đang trở nên phong phú dữ liệu hơn, với các ứng dụng, thiết bị đeo, xét nghiệm tại nhà, hồ sơ y tế và các lớp đối thoại xếp chồng lên nhau. Dữ liệu nhiều hơn có thể làm sắc nét suy luận, nhưng nó cũng mở rộng bề mặt cho sự chính xác sai. Các đội ngũ kiếm được sự tin tưởng sẽ không phải là những đội ngũ có điểm số tự tin sạch nhất. Họ sẽ là những đội ngũ có sản phẩm biết những gì họ không biết và được xây dựng để nói như vậy.

Độ chính xác mô tả chất lượng của một dự đoán. Tính toàn vẹn quyết định quyết định liệu sản phẩm có kiếm được quyền hành động trên nó hay không.

Mariia Kulikovskaia là một chuyên gia chiến lược sản phẩm về dữ liệu sản phẩm liên quan đến sức khỏe, làm việc trên các sản phẩm công nghệ được hỗ trợ bởi AI, môi trường sức khỏe và sản phẩm phân tích tuân thủ chăm sóc sức khỏe. Công việc của cô bao gồm chiến lược sản phẩm kinh doanh đối với hệ thống giám sát sức khỏe môi trường và sản phẩm phân tích tuân thủ chăm sóc sức khỏe.