โมเดลและแพลตฟอร์ม AI

OpenEvidence เปิดตัวตระกูลโมเดล AI ทางการแพทย์พร้อมการแสดงตัวอย่าง Darwin

mm
เพิ่ม Unite.AI ลงในแหล่งข้อมูลที่คุณต้องการบน Google

OpenEvidence ได้เปิดตัวตระกูลโมเดล AI การค้นหาทางการแพทย์ใหม่เมื่อวันที่ 3 กันยายน 2026 โดยทำให้โมเดลการผลิตสามรุ่นพร้อมใช้งานฟรีสำหรับผู้เชี่ยวชาญที่ได้รับการยืนยันและเปิดตัวรุ่นที่สี่ซึ่งบริษัทอธิบายว่าเป็นรุ่นที่ก้าวหน้าที่สุด ให้กับนักวิจัยโดยต้องสมัครเท่านั้น

โมเดลการผลิตทั้งสามรุ่นได้รับการตั้งชื่อตามบุคคลสำคัญในประวัติศาสตร์การแพทย์ Osler ซึ่งบริษัทอธิบายว่าเป็นโมเดลที่เร็วที่สุดโดยใช้เวลาประมาณห้าวินาทีต่อคำตอบ เป็นรุ่นสืบต่อจากโมเดลที่เคยให้คำตอบของ OpenEvidence และกลายเป็นค่าเริ่มต้นของแพลตฟอร์ม Sackett ถูกวางตำแหน่งเป็นโมเดลการค้นหาเชิงลึกที่ใช้เวลาประมาณ 30 วินาทีต่อคำตอบสำหรับคำถามที่ขึ้นกับน้ำหนักของหลักฐาน Snow ซึ่งเป็นรุ่นสืบต่อจากฟีเจอร์ OpenEvidence Deep Consult เป็นโมเดลการผลิตที่ลึกที่สุดโดยใช้เวลาประมาณห้านาทีต่อคำตอบ เพื่อทำการสืบค้นวรรณกรรมทางการแพทย์อย่างเต็มรูปแบบก่อนสร้างรายงาน

โมเดลเหล่านี้กำลังเปิดให้ผู้ใช้ OpenEvidence ทั้งหมดบน openevidence.com รวมถึงแอป iOS และ Android ของบริษัท โดยผู้เชี่ยวชาญสามารถเลือกใช้โมเดลต่าง ๆ ผ่านตัวเลือกโมเดลในอินเทอร์เฟซ OpenEvidence กล่าวว่าโมเดลทุกตัวในตระกูลนี้ได้รับการยึดมาตรฐานความแม่นยำทางคลินิกเดียวกัน ความแตกต่างระหว่างโมเดลอยู่ที่ระยะเวลาที่โมเดลคิดและความลึกของการค้นหา

ชื่อของโมเดลมาจาก William Osler ผู้ที่ย้ายการสอนการแพทย์จากห้องบรรยายไปสู่เตียงผู้ป่วย David Sackett ผู้ที่ได้รับการยกย่องว่าเป็นบิดาของการแพทย์ตามหลักฐาน และ John Snow ผู้ที่สืบค้นการระบาดของอหิวาตกโรคบนถนนบรอดสตรีทในปี 1854 ไปยังปั๊มน้ำหนึ่งเครื่องและช่วยก่อตั้งระบาดวิทยาสมัยใหม่

Darwin ในการแสดงตัวอย่างเพื่อการวิจัย

โมเดลที่สี่ Darwin อยู่ในขั้นตอนการแสดงตัวอย่างเพื่อการวิจัยและไม่ได้เปิดให้ใช้ทั่วไป ใน ประกาศ OpenEvidence อธิบายว่า Darwin เป็นโมเดล AI ทางการแพทย์ที่ก้าวหน้าที่สุดในโลกและเป็นโมเดล AI ตัวแรกที่ได้คะแนนเต็มใน MedQA ซึ่งบริษัทเรียกว่ามาตรฐานอิสระเต็มรูปแบบสำหรับ AI ทางการแพทย์ บริษัทยังระบุว่า Darwin มีผลการทำงานระดับศิลปะบน MedXpertQA ที่ 72.8 เปอร์เซ็นต์, HealthBench Professional ที่ 82.7 เปอร์เซ็นต์, และ NOHARM ที่ 87.2 เปอร์เซ็นต์ ซึ่งเหนือกว่ารุ่นที่ดีที่สุดต่อไปที่บริษัทระบุว่าเป็น Claude Fable 5 และ Gemini 3.7

การเข้าถึงต้องสมัครเท่านั้น OpenEvidence กล่าวว่าเหตุผลของการจำกัดการเข้าถึงเกี่ยวกับ ความเสี่ยงการใช้สองด้าน: โมเดลที่สามารถให้เหตุผลในขอบเขตของไวรัสวิทยา, ภูมิคุ้มกันวิทยา, และพันธุศาสตร์มนุษย์ หากตกอยู่ในมือผิดอาจเร่งความเร็วของงานที่ถูกควบคุมอย่างเข้มงวด เช่น การวิจัยที่เกี่ยวข้องกับอาวุธชีวภาพและการแก้ไขจีโนมของสายพันธุ์นอกการตรวจสอบของวิทยาศาสตร์หลัก การเข้าถึงในปัจจุบันครอบคลุมพันธมิตรสถาบันเช่น National Organization for Rare Disorders ซึ่งนำกรณีที่ยากที่สุดของ Darwin มาให้, ผู้ร่วมวิจัย, และนักวิจัย AI ที่ได้รับการรับรองจากสถาบันการศึกษาเพื่อประเมินความแม่นยำและความปลอดภัยของ AI ในการแพทย์คลินิก บริษัทระบุว่าความสามารถของ Darwin จะถ่ายทอดไปยัง Osler, Sackett, และ Snow เมื่อมาตรการความปลอดภัยได้รับการตรวจสอบกับพันธมิตรเหล่านี้

ระเบียบวิธีการประเมินผล

ใน โพสต์เทคนิคที่เกี่ยวข้อง OpenEvidence ให้รายละเอียดการตั้งค่าการประเมิน สำหรับ MedQA บริษัทเริ่มจากการทำเครื่องหมายใหม่โดยแพทย์ของเกณฑ์การทดสอบ 1,273 คำถามแบบสี่ตัวเลือกและใช้เกณฑ์การคัดออกสำหรับข้อมูลที่ขาดหาย, ความคลุมเครือ, และข้อผิดพลาดของป้ายกำกับ ตามด้วยการตรวจทบทวนครั้งที่สองในเดือนสิงหาคม 2026 โดยแพทย์ OpenEvidence สามคนที่ตรวจสอบทุกคำถามที่โมเดลใด ๆ ตอบผิด ผลลัพธ์คือชุดการประเมินสุดท้ายที่มี 660 คำถาม ซึ่ง Darwin ตอบได้โดยไม่มีข้อผิดพลาด บริษัทกำลังเผยแพร่การทำเครื่องหมายและคำตอบเต็มของ Darwin สำหรับเกณฑ์สี่ชุด

สำหรับ MedXpertQA Darwin ถูกประเมินบนชุดข้อความ 2,450 คำถามเต็มรูปแบบ โดยยกเว้นส่วนย่อยหลายโหมด สำหรับ HealthBench Professional บริษัทใช้ชุดทดสอบที่เปิดให้สาธารณะโดยยกเว้นกรณีหลายรอบ ทำให้เหลือ 410 จาก 525 งาน และให้คะแนนการตอบโดยใช้การกำหนดค่า LLM-as-a-judge ที่เผยโดย Anthropic โดยใช้ Claude Opus 4.8 พร้อมงบประมาณการคิดสูงสุด 32,000 โทเคน NOHARM ซึ่งเป็นเกณฑ์ที่วัดความถี่และความรุนแรงของคำแนะนำที่เป็นอันตรายในกรณีการให้คำปรึกษาจริง ถูกให้คะแนนด้วยแพคเกจโอเพ่นซอร์สอย่างเป็นทางการบนชุดย่อยเปิด 30 กรณี

Baseline ถูกรันเป็น claude-fable-5 ด้วยการคิดแบบปรับตัว, gpt-5.6-sol ที่ใช้ความพยายามในการให้เหตุผลค่าเริ่มต้น, และ gemini-3.7-flash ที่ใช้ความพยายามในการให้เหตุผลค่าเริ่มต้น โดยใช้ค่าเริ่มต้นของ API ของแต่ละผู้ให้บริการโดยไม่มีเครื่องมือหรือพรอมต์ระบบที่กำหนดเอง คะแนนของ HealthBench Professional ถูกเฉลี่ยจากอย่างน้อยห้าการทดลองอิสระต่อโมเดล ในขณะที่ชุดข้อมูลอื่น ๆ ได้คะแนนจากการรอบเดียว โดยรายงานค่าเฉลี่ยตลอดการทดสอบ

ตามโพสต์ คะแนน MedXpertQA ของ Darwin สูงกว่าฐานที่แข็งแกร่งที่สุด 7.7 คะแนน, คะแนน HealthBench Professional สูงกว่ารุ่นต่อไปที่ดีที่สุด 12.1 คะแนน, และค่า F1 ที่ถ่วงน้ำหนักความรุนแรงของ NOHARM อยู่ที่ 0.872 เทียบกับ 0.740 ของฐานที่ใกล้เคียงที่สุด บริษัทยอมรับว่าความแม่นยำที่ไม่ได้ถ่วงน้ำหนักของ Darwin บน NOHARM ต่ำกว่าบางฐาน เนื่องจากเมตริกนี้นับทุกคำแนะนำที่ไม่มีในรูบริกเป็นผลบวกเท็จและ Darwin ถูกปรับให้ให้แพทย์ได้รับชุดตัวเลือกที่เกี่ยวข้องทั้งหมด บริษัทรายงานว่าความแม่นยำที่ถ่วงน้ำหนักความรุนแรงของ Darwin อยู่ที่ 0.9

การใช้งานและขั้นตอนต่อไป

Osler, Sackett, และ Snow พร้อมใช้งานโดยไม่มีขีดจำกัดสำหรับผู้เชี่ยวชาญที่ได้รับการยืนยันทั้งหมดโดยไม่มีค่าใช้จ่าย Darwin พร้อมให้บริการนักวิจัยผ่านกระบวนการสมัครบนเว็บไซต์ของบริษัท

OpenEvidence กล่าวว่า บริษัทจะยังคงพัฒนา, ขยาย, และเพิ่มการเข้าถึงตระกูลโมเดลต่อไปตามเวลา รวมถึงโมเดลที่สร้างขึ้นสำหรับการปฏิบัติเฉพาะทางโดยเริ่มจากด้านมะเร็ง, รังสีวิทยา, และพันธุศาสตร์คลินิก

อารียา บลูม เป็นนักข่าวที่สร้างโดย AI ที่สำรวจว่าปัญญาประดิษฐ์กำลังเปลี่ยนแปลงเทคโนโลยีชีวภาพและวิจัยจีโนมอย่างไร การเขียนของเธอผสมผสานความแม่นยำเข้ากับความอยากรู้อยากเห็นอย่างลึกซึ้งเกี่ยวกับอนาคตของวิทยาศาสตร์ชีวิต จากชีววิทยาสังเคราะห์ถึงการรักษาแบบบุคคล อารียา วิเคราะห์ว่าเครื่องมือการเรียนรู้ของเครื่องจักรกำลังเร่งนวัตกรรมสุขภาพของมนุษย์อย่างไร บทความที่เขียนโดยอารียา บลูมสร้างโดย AI และได้รับการตรวจสอบโดยทีมบรรณาธิการของ Unite.AI สำหรับความถูกต้องและความสอดคล้อง