Модели и платформы ИИ
OpenEvidence запускает семейство медицинских ИИ‑моделей с предварительным просмотром Darwin

OpenEvidence выпустила новое семейство медицинских ИИ‑поисковых моделей 3 сентября 2026 г., предоставив три производственные модели бесплатно проверенным врачам и открыв четвертую, которую компания описывает как самую продвинутую, только для исследователей по заявке.
Три производственные модели названы в честь фигур из истории медицины. Osler, которую компания характеризует как самую быструю модель — примерно пять секунд на ответ, является преемником модели, ранее обеспечивавшей ответы OpenEvidence, и становится моделью по умолчанию на платформе. Sackett позиционируется как более глубокая поисковая модель, требующая около 30 секунд на ответ для вопросов, где важен вес доказательств. Snow, преемник функции OpenEvidence Deep Consult, является самой глубокой производственной моделью — примерно пять минут на ответ, проводя полное исследование медицинской литературы перед формированием отчёта.
Модели распространяются всем пользователям OpenEvidence на сайте openevidence.com и в мобильных приложениях компании для iOS и Android, при этом врачи могут выбирать их через селектор моделей в интерфейсе. OpenEvidence заявила, что каждая модель в семействе соответствует тем же стандартам клинической точности, а различия между ними заключаются в том, сколько времени модель «размышляет» и насколько глубоко она ищет.
Именами моделей стали Уильям Ослер, который перенёс обучение медицине из лекционных залов к постели пациента; Дэвид Сакетт, считающийся отцом доказательной медицины; и Джон Сноу, который проследил вспышку холеры 1854 года на Брод-стрит к единственной водяной помпе и помог заложить основы современной эпидемиологии.
Darwin в исследовательском предварительном просмотре
Четвёртая модель, Darwin, находится в исследовательском предварительном просмотре и не выпускается в широком доступе. В анонсе OpenEvidence описывает Darwin как самую продвинутую медицинскую ИИ‑модель в мире и утверждает, что это первая ИИ‑модель, получившая идеальный результат в MedQA, который компания называет ведущим полностью независимым бенчмарком медицинского ИИ. Компания также сообщает, что Darwin демонстрирует передовые показатели в MedXpertQA — 72,8 %, HealthBench Professional — 82,7 % и NOHARM — 87,2 %, опережая следующие лучшие модели, названные Claude Fable 5 и Gemini 3.7.
Доступ предоставляется только по заявке. OpenEvidence объяснила, что её опасения связаны с риском двойного назначения: модель, способная рассуждать на границе вирусологии, иммунологии и генетики человека, в неправильных руках могла бы ускорить строго регулируемые исследования, такие как разработка биологического оружия или редактирование зародышевых генов вне основного научного надзора. Текущий доступ охватывает институциональных партнёров, например Национальную организацию редких заболеваний, которая предоставляет Darwin самые сложные случаи, исследовательских коллег и аккредитованных ИИ‑исследователей в академических учреждениях, оценивающих точность и безопасность ИИ в клинической медицине. Компания заявила, что возможности Darwin будут интегрированы в Osler, Sackett и Snow по мере подтверждения их надёжности совместно с этими партнёрами.
Методология оценки
В сопутствующем техническом посте OpenEvidence подробно описала процесс оценки. Для MedQA компания начала с переаннотаций врачей к 1 273‑вопросному тесту с четырьмя вариантами ответов, применив критерии исключения для отсутствующей информации, неоднозначности и ошибок меток, а затем провела второй раунд проверки в августе 2026 г. тремя врачами OpenEvidence, охватив каждый вопрос, на который любая оценённая модель ответила неверно. В результате получен окончательный набор из 660 вопросов, на которые Darwin ответил без ошибок. Компания публикует свои аннотации и полные ответы Darwin для всех четырёх бенчмарков.
Для MedXpertQA Darwin оценивалась на полном наборе из 2 450 вопросов Text, исключив мультимодальный подмножество. Для HealthBench Professional компания использовала общедоступный тестовый набор, исключив многократные диалоги, оставив 410 из 525 задач, а ответы оценив с помощью конфигурации LLM‑as‑a‑judge, опубликованной Anthropic, используя Claude Opus 4.8 с максимальным бюджетом размышлений 32 000 токенов. NOHARM, бенчмарк, измеряющий частоту и тяжесть вредных рекомендаций в реальных консультационных случаях, оценивался с помощью официального открытого пакета на открытом подмножестве из 30 случаев.
Базовые линии запускались как claude-fable-5 с адаптивным размышлением, gpt-5.6-sol с настройками рассуждения по умолчанию и gemini-3.7-flash с теми же настройками, используя API‑по‑умолчанию каждого провайдера без инструментов или кастомных системных подсказок. Оценки HealthBench Professional усреднялись по минимуму пяти независимых запусков для каждой модели, тогда как остальные наборы данных оценивались одним проходом, при этом средние показатели указывались в тексте.
Согласно посту, результат Darwin в MedXpertQA превышает сильнейшую базовую линию на 7,7 пункта, результат HealthBench Professional — на 12,1 пункта выше следующей лучшей модели, а взвешенный по тяжести F1 в NOHARM достиг 0,872 против 0,740 у ближайшей базовой линии. Компания отметила, что невзвешенная точность Darwin в NOHARM ниже, чем у нескольких базовых линий, объяснив, что метрика считает каждую рекомендацию, отсутствующую в рубрике, ложноположительной, а Darwin настроен предоставлять врачам полный набор релевантных вариантов. Было также указано, что взвешенная по тяжести точность Darwin составляет 0,9.
Доступность и дальнейшие шаги
Osler, Sackett и Snow доступны с неограниченным использованием для всех проверенных врачей бесплатно. Darwin доступен исследователям через процесс подачи заявки на сайте компании.
OpenEvidence заявила, что будет продолжать улучшать, расширять и повышать доступ к семейству моделей со временем, включая модели, разработанные для специализированной практики, начиная с онкологии, радиологии и клинической генетики.












