Mô hình và nền tảng AI
OpenEvidence ra mắt họ mô hình AI y tế với bản xem trước Darwin

OpenEvidence đã công bố một họ mới các mô hình tìm kiếm AI y tế vào ngày 3 tháng 9 năm 2026, cung cấp ba mô hình sản xuất miễn phí cho các bác sĩ đã được xác minh và mở ra một mô hình thứ tư, mà công ty mô tả là tiên tiến nhất, cho các nhà nghiên cứu chỉ qua quy trình đăng ký.
Ba mô hình sản xuất này được đặt tên theo các nhân vật trong lịch sử y học. Osler, mà công ty mô tả là mô hình nhanh nhất với khoảng năm giây cho mỗi câu trả lời, là người kế thừa mô hình trước đây đã cung cấp câu trả lời cho OpenEvidence và trở thành mặc định của nền tảng. Sackett được định vị là mô hình tìm kiếm sâu hơn, mất khoảng 30 giây cho mỗi câu trả lời đối với các câu hỏi phụ thuộc vào mức độ quan trọng của bằng chứng. Snow, người kế thừa tính năng Deep Consult của OpenEvidence, là mô hình sản xuất sâu nhất với khoảng năm phút cho mỗi câu trả lời, thực hiện một cuộc điều tra toàn bộ tài liệu y khoa trước khi tạo báo cáo.
Các mô hình đang được triển khai cho tất cả người dùng OpenEvidence trên openevidence.com và các ứng dụng iOS và Android của công ty, cho phép các bác sĩ lựa chọn chúng qua bộ chọn mô hình trong giao diện. OpenEvidence cho biết mọi mô hình trong họ đều tuân thủ cùng một tiêu chuẩn về độ chính xác lâm sàng, với sự khác biệt giữa chúng là thời gian suy nghĩ và độ sâu của quá trình tìm kiếm.
Các tên gọi lấy cảm hứng từ William Osler, người đã đưa việc giảng dạy y học từ giảng đường tới giường bệnh; David Sackett, được nhớ đến như người cha của y học dựa trên bằng chứng; và John Snow, người đã truy vết dịch bệnh tả năm 1854 trên phố Broad Street đến một bể nước duy nhất và góp phần thành lập dịch tễ học hiện đại.
Darwin trong Bản Xem Trước Nghiên Cứu
Mô hình thứ tư, Darwin, đang trong giai đoạn bản xem trước nghiên cứu và không được phát hành rộng rãi. Trong thông báo, OpenEvidence mô tả Darwin là mô hình AI y tế tiên tiến nhất trên thế giới và cho biết đây là mô hình AI đầu tiên đạt điểm hoàn hảo trên MedQA, mà công ty gọi là chuẩn độc lập hàng đầu cho AI y tế. Công ty cũng báo cáo Darwin đạt mức độ tiên tiến trên MedXpertQA ở mức 72,8%, HealthBench Professional ở mức 82,7% và NOHARM ở mức 87,2%, vượt qua các mô hình kế tiếp tốt nhất, mà họ đặt tên là Claude Fable 5 và Gemini 3.7.
Quyền truy cập chỉ qua đăng ký. OpenEvidence cho biết lý do của mình liên quan đến rủi ro sử dụng kép: một mô hình có thể suy luận ở ranh giới của virology, immunology và di truyền học người, nếu rơi vào tay kẻ xấu, có thể thúc đẩy các công việc được quản lý chặt chẽ, như nghiên cứu liên quan đến vũ khí sinh học và chỉnh sửa dòng giống ngoài sự giám sát khoa học chính thống. Hiện tại, quyền truy cập bao gồm các đối tác tổ chức như National Organization for Rare Disorders, cung cấp cho Darwin những trường hợp khó nhất, các cộng tác viên nghiên cứu, và các nhà nghiên cứu AI được công nhận tại các viện học thuật, đánh giá độ chính xác và an toàn của AI trong y học lâm sàng. Công ty cho biết khả năng của Darwin sẽ được chuyển sang Osler, Sackett và Snow khi các biện pháp bảo vệ được xác nhận với các đối tác này.
Phương pháp Đánh giá
Trong bài đăng kỹ thuật đi kèm, OpenEvidence chi tiết quy trình đánh giá. Đối với MedQA, công ty bắt đầu từ việc các bác sĩ tái chú thích lại 1.273 câu hỏi với bốn lựa chọn của bộ kiểm tra chuẩn và áp dụng tiêu chí loại trừ cho thông tin thiếu, mơ hồ và lỗi nhãn, sau đó thực hiện một lượt xem xét thứ hai vào tháng 8 năm 2026 bởi ba bác sĩ OpenEvidence bao phủ mọi câu hỏi mà bất kỳ mô hình nào được đánh giá trả lời sai. Điều này tạo ra bộ đánh giá cuối cùng gồm 660 câu hỏi, mà Darwin trả lời mà không có lỗi. Công ty đang công bố các chú thích của mình và các phản hồi đầy đủ của Darwin cho cả bốn chuẩn đánh giá.
Trên MedXpertQA, Darwin được đánh giá trên toàn bộ bộ 2.450 câu hỏi dạng Text, loại trừ phần phụ đa phương thức. Đối với HealthBench Professional, công ty sử dụng bộ kiểm tra công khai với các trường hợp đa lượt được loại bỏ, còn lại 410 trong số 525 nhiệm vụ, và chấm điểm các phản hồi bằng cấu hình LLM-as-a-judge do Anthropic công bố, sử dụng Claude Opus 4.8 với ngân sách suy luận tối đa 32.000 token. NOHARM, một chuẩn đánh giá tần suất và mức độ nghiêm trọng của các khuyến nghị gây hại trong các trường hợp tư vấn thực tế, được chấm điểm bằng gói mã nguồn mở chính thức trên tập con mở gồm 30 trường hợp.
Các mô hình nền tảng được chạy dưới dạng claude-fable-5 với suy luận thích ứng, gpt-5.6-sol với mức nỗ lực suy luận mặc định, và gemini-3.7-flash với mức nỗ lực suy luận mặc định, sử dụng các mặc định API của mỗi nhà cung cấp mà không có công cụ hay lời nhắc hệ thống tùy chỉnh. Điểm số HealthBench Professional được tính trung bình trên ít nhất năm lần thử độc lập cho mỗi mô hình, trong khi các bộ dữ liệu khác được chấm điểm qua một lần duy nhất, với các điểm trung bình được báo cáo xuyên suốt.
Theo bài đăng, điểm MedXpertQA của Darwin cao hơn 7,7 điểm so với nền tảng mạnh nhất, điểm HealthBench Professional cao hơn 12,1 điểm so với mô hình kế tiếp tốt nhất, và F1 có trọng số mức độ nghiêm trọng của NOHARM đạt 0,872 so với 0,740 của nền tảng gần nhất. Công ty thừa nhận độ chính xác không trọng số của Darwin trên NOHARM thấp hơn một số nền tảng, giải thích rằng chỉ số này tính mọi khuyến nghị không có trong tiêu chuẩn là dương tính giả và Darwin được điều chỉnh để cung cấp cho các bác sĩ toàn bộ các tùy chọn liên quan. Họ báo cáo độ chính xác có trọng số mức độ nghiêm trọng của Darwin là 0,9.
Khả dụng và Các Bước Tiếp Theo
Osler, Sackett và Snow có sẵn với việc sử dụng không giới hạn cho tất cả các bác sĩ đã được xác minh mà không mất phí. Darwin có sẵn cho các nhà nghiên cứu thông qua quy trình đăng ký trên trang web của công ty.
OpenEvidence cho biết sẽ tiếp tục cải thiện, mở rộng và tăng cường quyền truy cập vào họ mô hình theo thời gian, bao gồm các mô hình được xây dựng cho các chuyên ngành bắt đầu từ ung bướu, chẩn đoán hình ảnh và di truyền lâm sàng.












