Modelos y plataformas de IA
OpenEvidence lanza la familia de modelos de IA médica con la vista previa de Darwin

OpenEvidence lanzó una nueva familia de modelos de búsqueda médica con IA el 3 de septiembre de 2026, poniendo a disposición de los médicos verificados tres modelos de producción de forma gratuita y abriendo un cuarto, que describe como su modelo más avanzado, a investigadores mediante solicitud.
Los tres modelos de producción llevan el nombre de figuras históricas de la medicina. Osler, que la compañía describe como su modelo más rápido con aproximadamente cinco segundos por respuesta, es el sucesor del modelo que previamente alimentaba las respuestas de OpenEvidence y se convierte en el predeterminado de la plataforma. Sackett se posiciona como un modelo de búsqueda más profundo que tarda aproximadamente 30 segundos por respuesta para preguntas que dependen del peso de la evidencia. Snow, sucesor de la función OpenEvidence Deep Consult, es el modelo de producción más profundo con alrededor de cinco minutos por respuesta, realizando una investigación completa de la literatura médica antes de generar un informe.
Los modelos se están desplegando a todos los usuarios de OpenEvidence en openevidence.com y en las aplicaciones iOS y Android de la compañía, y los médicos pueden seleccionar entre ellos mediante un selector de modelo en la interfaz. OpenEvidence afirmó que cada modelo de la familia se mantiene bajo el mismo estándar de precisión clínica, y la diferencia entre ellos radica en cuánto tiempo piensa el modelo y cuán profunda es su búsqueda.
Los nombres hacen referencia a William Osler, quien trasladó la enseñanza médica del aula al lado del paciente; David Sackett, recordado como el padre de la medicina basada en la evidencia; y John Snow, quien rastreó el brote de cólera de Broad Street en 1854 hasta una única bomba de agua y ayudó a fundar la epidemiología moderna.
Darwin en vista previa de investigación
El cuarto modelo, Darwin, está en vista previa de investigación y no se lanza de forma general. En el anuncio, OpenEvidence describe a Darwin como el modelo de IA médica más avanzado del mundo y afirma que es el primer modelo de IA en lograr una puntuación perfecta en MedQA, que la compañía denomina el principal benchmark totalmente independiente de IA médica. La empresa también informa que Darwin está a la vanguardia en MedXpertQA con un 72,8 por ciento, en HealthBench Professional con un 82,7 por ciento y en NOHARM con un 87,2 por ciento, por delante de los siguientes mejores modelos, a los que nombra como Claude Fable 5 y Gemini 3.7.
El acceso es solo mediante solicitud. OpenEvidence indicó que su razonamiento está relacionado con el riesgo de doble uso: un modelo que pueda razonar en la frontera de la virología, la inmunología y la genética humana podría, en manos equivocadas, acelerar trabajos fuertemente regulados, como la investigación relevante para armas biológicas y la edición de la línea germinal fuera de la supervisión científica convencional. El acceso actual cubre a socios institucionales como la National Organization for Rare Disorders, que lleva a Darwin sus casos más complejos, a colaboradores de investigación y a investigadores de IA acreditados en instituciones académicas que evalúan la precisión y seguridad de la IA en la medicina clínica. La compañía dijo que las capacidades de Darwin se transferirán a Osler, Sackett y Snow a medida que sus salvaguardas se validen con estos socios.
Metodología de referencia
En una publicación técnica complementaria, OpenEvidence detalló la configuración de la evaluación. Para MedQA, la empresa partió de reanotaciones realizadas por médicos sobre el conjunto de prueba de 1 273 preguntas con cuatro opciones del benchmark y aplicó criterios de exclusión por información faltante, ambigüedad y errores de etiquetado, seguido de una segunda revisión en agosto de 2026 por tres médicos de OpenEvidence que cubrieron cada pregunta que cualquier modelo evaluado respondió incorrectamente. Eso produjo un conjunto final de evaluación de 660 preguntas, que Darwin respondió sin error. La compañía está publicando sus anotaciones y las respuestas completas de Darwin para los cuatro benchmarks.
En MedXpertQA, Darwin se evaluó en el conjunto completo de 2 450 preguntas del segmento Text, excluyendo el subconjunto multimodal. Para HealthBench Professional, la empresa utilizó el conjunto de prueba disponible públicamente con casos de múltiples turnos excluidos, quedando 410 de las 525 tareas, y calificó las respuestas con la configuración LLM‑as‑a‑judge publicada por Anthropic, usando Claude Opus 4.8 con un presupuesto máximo de razonamiento de 32 000 tokens. NOHARM, un benchmark que puntúa la frecuencia y gravedad de recomendaciones dañinas en casos de consulta reales, se calificó con su paquete oficial de código abierto en el subconjunto abierto de 30 casos.
Las líneas base se ejecutaron como claude-fable-5 con razonamiento adaptativo, gpt-5.6-sol con esfuerzo de razonamiento predeterminado y gemini-3.7-flash con esfuerzo de razonamiento predeterminado, utilizando los valores predeterminados de API de cada proveedor sin herramientas ni indicaciones de sistema personalizadas. Las puntuaciones de HealthBench Professional se promediaron en al menos cinco pruebas independientes por modelo, mientras que los demás conjuntos de datos se puntuaron en una sola pasada, informándose las medias a lo largo del documento.
Según la publicación, la puntuación de Darwin en MedXpertQA supera en 7,7 puntos al baseline más fuerte, su puntuación en HealthBench Professional supera en 12,1 puntos al siguiente mejor modelo, y su F1 ponderado por severidad en NOHARM alcanzó 0,872 frente a 0,740 del baseline más cercano. La compañía reconoció que la precisión no ponderada de Darwin en NOHARM es inferior a la de varios baselines, explicando que la métrica cuenta cada recomendación ausente del rubro como un falso positivo y que Darwin está afinado para ofrecer a los médicos el conjunto completo de opciones relevantes. Reportó que la precisión ponderada por severidad de Darwin es 0,9.
Disponibilidad y próximos pasos
Osler, Sackett y Snow están disponibles con uso ilimitado para todos los médicos verificados sin costo. Darwin está disponible para investigadores mediante un proceso de solicitud en el sitio web de la compañía.
OpenEvidence dijo que continuará mejorando, ampliando y aumentando el acceso a la familia de modelos con el tiempo, incluidos modelos diseñados para la práctica especializada, comenzando con oncología, radiología y genética clínica.












