Моделі та платформи ШІ

OpenEvidence запускає сімейство медичних AI‑моделей з попереднім переглядом Darwin

mm
Додайте Unite.AI до бажаних джерел у Google

OpenEvidence випустила нову сімейство медичних AI‑моделей 3 вересня 2026 року, зробивши три виробничі моделі доступними безкоштовно для перевірених клініцистів та відкривши четверту, яку вона описує як найпросунутішу, лише для дослідників за процесом подання заявки.

Три виробничі моделі названі на честь видатних постатей в історії медицини. Osler, яку компанія описує як найшвидшу модель — приблизно п’ять секунд на відповідь, є наступницею моделі, що раніше забезпечувала відповіді OpenEvidence, і стає типовою для платформи. Sackett позиціонується як модель глибшого пошуку, що займає близько 30 секунд на відповідь для питань, де важливий вагомий доказ. Snow, наступник функції OpenEvidence Deep Consult, є найглибшою виробничою моделлю — приблизно п’ять хвилин на відповідь, проводячи повне дослідження медичної літератури перед створенням звіту.

Моделі розгортаються для всіх користувачів OpenEvidence на сайті openevidence.com та в мобільних додатках для iOS і Android, при цьому клініцисти можуть обирати їх за допомогою селектора моделей в інтерфейсі. OpenEvidence заявила, що кожна модель у сімействі відповідає одному стандарту клінічної точності, різниця між ними полягає лише у тривалості роздумів моделі та глибині пошуку.

Назви походять від Вільяма Ослера, який переніс навчання медицини з лекційної зали до ліжка пацієнта; Девіда Сакета, якого пам’ятають як батька доказової медицини; та Джона Сноу, який простежив спалах холери 1854 року на Брод‑стріт до однієї водяної помпи і допоміг заснувати сучасну епідеміологію.

Дарвін у дослідницькому прев’ю

Четверта модель, Дарвін, перебуває у дослідницькому прев’ю і не випускається загально. У оголошенні OpenEvidence описує Дарвіна як найпросунутішу медичну AI‑модель у світі та стверджує, що це перша AI‑модель, яка досягла ідеального результату в MedQA, який компанія називає провідним повністю незалежним бенчмарком медичного AI. Компанія також повідомляє, що Дарвін є передовим у MedXpertQA зі 72,8 % , HealthBench Professional — 82,7 % і NOHARM — 87,2 %, випереджаючи наступні кращі моделі, які називаються Claude Fable 5 та Gemini 3.7.

Доступ надається лише за поданням заявки. OpenEvidence зазначила, що його міркування стосуються ризику подвійного використання: модель, яка може розмірковувати на межі вірусології, імунології та генетики людини, у неправильних руках могла б прискорити роботу, що суворо регулюється, наприклад дослідження, пов’язані з біологічною зброєю, та редагування зародкових клітин поза основним науковим контролем. Поточний доступ охоплює інституційних партнерів, таких як Національна організація рідкісних захворювань, яка надає Дарвіну найскладніші випадки, дослідницьких співробітників та акредитованих AI‑дослідників в академічних установах, які оцінюють точність і безпеку AI у клінічній медицині. Компанія заявила, що можливості Дарвіна будуть інтегровані в Osler, Sackett і Snow у міру підтвердження їхніх захисних механізмів цими партнерами.

Методологія бенчмарку

У супровідному технічному дописі OpenEvidence детально описала налаштування оцінки. Для MedQA компанія почала з повторних анотацій лікарями бенчмарку, що складається з 1 273‑питань з чотирма варіантами відповідей, і застосувала критерії виключення за відсутньою інформацією, неоднозначністю та помилками міток, після чого у серпні 2026 року провела другий перегляд трьома лікарями OpenEvidence, які перевірили кожне питання, на яке будь‑яка оцінювана модель відповіла неправильно. Це дало остаточний набір з 660 питань, на які Дарвін відповів без помилок. Компанія публікує свої анотації та повні відповіді Дарвіна для всіх чотирьох бенчмарків.

У MedXpertQA Дарвін був оцінений на повному наборі з 2 450 питань Text, виключивши мультимодальний піднабір. Для HealthBench Professional компанія використала загальнодоступний тестовий набір, виключивши багатокрокові випадки, залишивши 410 із 525 завдань, і оцінювала відповіді за конфігурацією LLM‑as‑a‑judge, опублікованою Anthropic, використовуючи Claude Opus 4.8 з максимальним бюджетом роздумів у 32 000 токенів. NOHARM, бенчмарк, що оцінює частоту та тяжкість шкідливих рекомендацій у реальних консультаційних випадках, був оцінений за допомогою офіційного відкритого пакету на відкритому піднаборі з 30 випадків.

Базові моделі запускалися як claude-fable-5 з адаптивним мисленням, gpt-5.6-sol з типово встановленим рівнем роздумів та gemini-3.7-flash з типово встановленим рівнем роздумів, використовуючи стандартні налаштування API кожного постачальника без інструментів чи кастомних системних підказок. Оцінки HealthBench Professional усереднювалися за щонайменше п’ятьма незалежними пробами для кожної моделі, тоді як інші набори даних оцінювалися одним проходом, а середні значення повідомляються протягом усього тесту.

За даними допису, результат Дарвіна у MedXpertQA перевищує найсильніший базовий результат на 7,7 балів, його результат HealthBench Professional — на 12,1 балів вище наступної кращої моделі, а його NOHARM, зважений за тяжкістю, F1 склав 0,872 проти 0,740 у найближчого базового. Компанія зазначила, що незважена точність Дарвіна у NOHARM нижча, ніж у кількох базових моделей, пояснюючи, що метрика враховує кожну рекомендацію, відсутню в рубриці, як хибний позитив, і що Дарвін налаштований на надання лікарям повного набору релевантних варіантів. Вони повідомили, що зважена за тяжкістю точність становить 0,9.

Доступність та наступні кроки

Osler, Sackett і Snow доступні з необмеженим використанням для всіх перевірених клініцистів безкоштовно. Дарвін доступний для дослідників через процес подання заявки на сайті компанії.

OpenEvidence заявила, що продовжуватиме покращувати, розширювати та збільшувати доступ до сімейства моделей з часом, включаючи моделі, створені для спеціалізованих практик, починаючи з онкології, радіології та клінічної генетики.

Арія Блум - журналістка, створена штучним інтелектом, яка досліджує, як штучний інтелект трансформує біотехнології та геномні дослідження. Її письмо поєднує точність з глибоким інтересом до майбутнього життєвих наук.
Від синтетичної біології до персоналізованої медицини Арія аналізує, як машинне навчання прискорює інновації в галузі охорони здоров'я людини.
Статті, написані Арією Блум, створюються штучним інтелектом та перевіряються редакційною командою Unite.AI за точністю та відповідністю вимогам.