Yapay zeka modelleri ve platformları

OpenEvidence, Darwin Önizlemesi ile Medikal AI Model Ailesini Başlattı

mm
Unite.AI sitesini Google'daki tercih ettiğiniz kaynaklara ekleyin

OpenEvidence, 3 Eylül 2026 tarihinde yeni bir medikal AI arama modeli ailesi yayınladı ve üç üretim modelini doğrulanmış klinisyenlere ücretsiz olarak sunarken, dördüncüsünü, en gelişmiş modeli olduğunu belirttiği modeli, yalnızca başvuru yoluyla araştırmacılara açtı.

Üç üretim modeli, tıbbın tarihindeki figürlerin adını taşıyor. Şirketin en hızlı modeli olarak yaklaşık beş saniye süren yanıtlarıyla tanımladığı Osler, daha önce OpenEvidence yanıtlarını güçlendiren modelin halefi ve platformun varsayılanı haline geliyor. Sackett, kanıt ağırlığına dayalı sorular için yaklaşık 30 saniye süren daha derin bir arama modeli olarak konumlandırılıyor. OpenEvidence Deep Consult özelliğinin halefi Snow ise, yanıt başına yaklaşık beş dakika süren en derin üretim modeli; medikal literatürü tam anlamıyla araştırıp bir rapor üretmeden önce inceleme yapıyor.

Modeller, openevidence.com üzerindeki tüm OpenEvidence kullanıcılarına ve şirketin iOS ve Android uygulamalarına dağıtılıyor; klinisyenler arayüzdeki model seçici aracılığıyla aralarında seçim yapabiliyor. OpenEvidence, ailedeki her modelin aynı klinik doğruluk standardına sahip olduğunu ve aralarındaki farkın modelin ne kadar düşündüğü ve ne kadar derin arama yaptığı olduğunu belirtti.

İsimlerin ilham kaynağı, tıbbi eğitimi derslikten hastanın yanına taşıyan William Osler; kanıta dayalı tıbbın babası olarak hatırlanan David Sackett; ve 1854 Broad Street kolera salgınını tek bir su pompasına bağlayarak modern epidemiyolojinin temellerini atan John Snow’dur.

Araştırma Önizlemesinde Darwin

Dördüncü model olan Darwin, araştırma önizlemesinde bulunuyor ve genel olarak yayımlanmıyor. duyuru, OpenEvidence, Darwin’i dünyanın en gelişmiş medikal AI modeli olarak tanımlıyor ve şirketin medikal AI’nin önde gelen tamamen bağımsız ölçütü olarak adlandırdığı MedQA’da mükemmel puan elde eden ilk AI modeli olduğunu belirtiyor. Şirket ayrıca Darwin’in MedXpertQA’da %72,8, HealthBench Professional’da %82,7 ve NOHARM’da %87,2 ile en iyi performansa sahip olduğunu, bir sonraki en iyi modeller olarak Claude Fable 5 ve Gemini 3.7’yi geride bıraktığını rapor ediyor.

Erişim yalnızca başvuru yoluyla sağlanıyor. OpenEvidence, mantığının dual-use risk: viroloji, immünoloji ve insan genetiği alanının sınırında akıl yürütebilen bir modelin, yanlış ellere geçtiğinde biyolojik silah araştırmaları ve ana akım bilimsel denetim dışındaki germline düzenleme gibi sıkı düzenlemeye tabi çalışmaları hızlandırabileceğini belirtti. Şu anki erişim, Darwin’e en zor vakalarını getiren Ulusal Nadir Hastalıklar Örgütü gibi kurumsal ortakları, araştırma işbirlikçilerini ve akademik kurumlarda AI araştırmacısı olarak akreditasyonlu olan, klinik tıpta AI’nın doğruluğunu ve güvenliğini ölçen araştırmacıları kapsıyor. Şirket, Darwin’in yeteneklerinin, bu ortaklarla doğrulanan güvenlik önlemleriyle Osler, Sackett ve Snow’a da aktarılacağını söyledi.

Kıyaslama Metodolojisi

Bir yan teknik gönderide, OpenEvidence, değerlendirme kurulumunu ayrıntılı olarak açıkladı. MedQA için şirket, ölçütün 1.273 soruluk dört seçenekli test bölümü üzerindeki doktor yeniden anotasyonlarından başladı ve eksik bilgi, belirsizlik ve etiket hataları için dışlama kriterleri uyguladı; ardından Ağustos 2026’da üç OpenEvidence doktorunun, hatalı yanıt veren her soruyu kapsayan ikinci bir inceleme geçirdi. Bu, Darwin’in hatasız yanıtladığı 660 soruluk nihai değerlendirme setini oluşturdu. Şirket, anotasyonlarını ve Darwin’in dört ölçüt için tam yanıtlarını yayımlıyor.

MedXpertQA’da Darwin, çok modlu alt küme hariç tutularak tam 2.450 soruluk Metin bölümü üzerinde değerlendirildi. HealthBench Professional için şirket, çoklu tur vakaları dışarıda bırakılarak halka açık test setini kullandı; bu, 525 görevden 410 tanesini bıraktı ve yanıtları Anthropic tarafından yayımlanan LLM‑as‑a‑judge yapılandırmasıyla, Claude Opus 4.8 ve 32.000 token maksimum düşünme bütçesiyle puanladı. NOHARM, gerçek danışma vakalarında zararlı önerilerin sıklığını ve şiddetini puanlayan bir ölçüt, 30 vakalı açık alt küme üzerinde resmi açık kaynak paketle puanlandı.

Temel modeller, her sağlayıcının API varsayılanlarıyla, araçsız ve özelleştirilmiş sistem istemleri olmadan, claude-fable-5 adaptif düşünme, gpt-5.6-sol varsayılan akıl çabası ve gemini-3.7-flash varsayılan akıl çabası olarak çalıştırıldı. HealthBench Professional puanları, her model için en az beş bağımsız deneme üzerinden ortalama alındı; diğer veri setleri ise tek geçişle puanlandı ve ortalama puanlar tüm süreçte rapor edildi.

Gönderiye göre, Darwin’in MedXpertQA puanı, en güçlü temel modelin 7,7 puan üzerinde; HealthBench Professional puanı ise bir sonraki en iyi modelin 12,1 puan üzerinde. NOHARM şiddet‑ağırlıklı F1 skoru, en yakın temel modelin 0,740’ına karşı 0,872 olarak kaydedildi. Şirket, Darwin’in NOHARM üzerindeki ağırlıksız kesinliğinin birkaç temel modelden daha düşük olduğunu kabul etti; bu ölçütün, rubrikte bulunmayan her öneriyi yanlış pozitif olarak saydığını ve Darwin’in doktorlara ilgili tüm seçenekleri sunmak için ayarlandığını açıkladı. Darwin’in şiddet‑ağırlıklı kesinliği 0,9 olarak rapor edildi.

Kullanılabilirlik ve Sonraki Adımlar

Osler, Sackett ve Snow, doğrulanmış tüm klinisyenlere sınırsız kullanım hakkı ile ücretsiz olarak sunulmaktadır. Darwin ise şirket sitesindeki başvuru süreci aracılığıyla araştırmacılara açıktır.

OpenEvidence, model ailesini zaman içinde geliştirmeye, genişletmeye ve erişimi artırmaya devam edeceğini, onkoloji, radyoloji ve klinik genetik gibi uzmanlık pratiği için modeller de dahil olmak üzere yeni modeller inşa edeceğini belirtti.

Aria Bloom yapay zeka tarafından oluşturulan bir gazeteci olup, yapay zeka ve biyoteknoloji ve genomik araştırmaların nasıl dönüştüğünü keşfediyor. Yazıları, gelecekteki yaşam bilimlerinin derin bir merakıyla birleşen bir kesinlik sunuyor.
Sentetik biyoloji ve kişiselleştirilmiş tıptan başlayarak, Aria, makine öğreniminin insan sağlığı inovasyonunu nasıl hızlandırdığını analiz ediyor.
Aria Bloom tarafından yazılan makaleler, doğruluk ve uyumluluk için Unite.AI editör ekibi tarafından gözden geçirilen AI tarafından oluşturulmaktadır.