Salud

De la predicción a la acción responsable: Diseñando la incertidumbre en la inteligencia artificial de Femtech

mm
Añade Unite.AI a tus fuentes preferidas en Google

En la salud de las mujeres, la precisión es necesaria, pero es solo la primera capa de seguridad del producto. Es importante que el sistema sepa cuándo una predicción es lo suficientemente fuerte como para actuar sobre ella y esté diseñado para decirlo cuando no lo es.

Al abrir la mayoría de las aplicaciones de fertilidad o seguimiento de ciclos, verás un resultado limpio: ovulación en el día 15, una etiqueta de alta fertilidad, una puntuación de confianza del 78%. El número parece preciso. La biología subyacente no lo es.

Una fecha de período es algo que el usuario observó. La ovulación es un evento latente que ningún dispositivo de consumo mide directamente. Se infiere de proxies. La temperatura de la piel refleja no solo la progesterona, sino también el sueño, el alcohol, la enfermedad, las condiciones ambientales y dónde se colocó el sensor esa noche. Una entrada de síntomas combina fisiología con percepción, memoria y la decisión del usuario de registrarla. Cuando todo eso se resuelve en “Día 15, 78%”, varias clases diferentes de incertidumbre se han comprimido silenciosamente en una oración que suena confiada.

En los productos en los que he trabajado a lo largo de la salud de las mujeres, el problema difícil no es la precisión. El patrón al que sigo regresando es la integridad de la decisión. La precisión te dice cómo bien predice un modelo. No dice nada sobre si el producto sabe cuándo una predicción es lo suficientemente fuerte como para actuar sobre ella. En un dominio donde la misma salida puede informar la planificación casual o una decisión anticonceptiva, esa brecha es donde se gana o se pierde la confianza.

Así que mi argumento es que la inteligencia artificial de Femtech no necesita principalmente una mejor predicción. Necesita un mejor diseño de incertidumbre. Y el diseño de incertidumbre no es un aviso que se agrega antes del lanzamiento; es una arquitectura. La estructuro en seis capas que llevan una señal de la entrada cruda a una acción que el sistema puede justificar y auditar. Aplico una versión de seis capas del Método de Producto de Decisión a Acción Calibrada, diseñado para gobernar cómo se convierten las señales de salud inciertas en acciones permitidas y responsables. El método incluye la calificación de los datos, la calibración de la inferencia, el mapeo de las consecuencias, la política de control, la ejecución del flujo de trabajo y un bucle de responsabilidad. Su camino gobernante comienza con los datos de salud, que llevan a la arquitectura de la decisión y culminan en una acción responsable.

1. Calificar los datos antes de confiar en ellos

La primera capa decide lo que el sistema realmente sabe. Los productos de Femtech extraen de fuentes muy diferentes. Puede incluir cosas que el usuario observó directamente, como fechas de período o informes subjetivos como dolor o estado de ánimo, así como características de dispositivos portátiles como la temperatura de la piel y la variabilidad de la frecuencia cardíaca, y variables que el modelo generó por sí mismo. Tratarlos como entradas intercambiables es el pecado original.

Cada señal decae la procedencia que el sistema puede leer: de dónde vino, cuándo, con qué frecuencia se muestrea, qué lo confunde y cómo se relaciona con lo que realmente se está prediciendo. La ovulación es el evento. La temperatura, el moco cervical, la LH y las fechas del ciclo son evidencia sobre ese evento, cada uno con su propio retraso y su propio error.

Los datos que faltan merecen una atención particular porque, en el seguimiento de la salud, rara vez son aleatorios. La gente registra más cuando está preocupada y deja de registrar cuando se siente bien, así que una brecha puede llevar tanto información como una entrada. En un análisis real de más de 600,000 ciclos ovulatorios, la ovulación no se pudo detectar en 665,603 de los 1,4 millones de ciclos considerados inicialmente. Tres cuartos de ellos tenían lecturas de temperatura válidas en menos de la mitad de los días del ciclo. La suficiencia de los datos fue un factor limitante importante en lo que el algoritmo podía inferir. Un producto que emite una etiqueta de fertilidad nítida en esa situación no está siendo confiado. Está fabricando precisión que no tiene.

2. Calibrar la inferencia con la evidencia

Una sola puntuación de confianza no puede representar lo que realmente está sucediendo, porque estos sistemas enfrentan varias fuentes de incertidumbre al mismo tiempo. Estas incluyen la variabilidad biológica en el proceso en sí, la calidad de la medición, la falta de seguimiento de auto-seguimiento, la incertidumbre del modelo de datos de entrenamiento delgados y el cambio de distribución cuando el usuario actual no se parece a la población en la que se validó el modelo.

En ese mismo análisis, solo el 13% de los ciclos tenían 28 días de duración, y la fase folicular promedio duró 16,9 días en un rango lo suficientemente amplio como para hacer que cualquier suposición fija de “día 14” sea engañosa. El Estudio de Salud de Mujeres de Apple encontró que la longitud del ciclo y la variabilidad dentro de la persona se asociaron con la edad, la etnia autoinformada y el índice de masa corporal. La personalización, entonces, no puede significar reemplazar un promedio de población con un solo punto personal. Significa producir una distribución que se estrecha a medida que se acumula la evidencia.

Consideremos dos predicciones basadas en inteligencia artificial que ambas leen “75%”. Una se basa en un año de historial y mediciones densas, y su incertidumbre es principalmente biología real. La otra se basa en dos ciclos, cinco lecturas de temperatura, viajes recientes y medicación desconocida. Aquí, la incertidumbre se debe principalmente a los datos que faltan. Same número. El producto no debe estar permitido para responder a ellos de la misma manera. Esta es también la razón por la cual la calibración tiene que verificarse dentro de subgrupos: el rendimiento agregado puede ocultar un modelo que es excesivamente confiado, particularmente para ciclos irregulares o usuarios perimenopáusicos. La literatura clínica de inteligencia artificial ahora separa discriminación, calibración y utilidad de decisión por esta misma razón. Un modelo puede clasificar a los usuarios bien y todavía producir probabilidades incorrectas para decisiones reales.

3. Mapear la consecuencia de estar equivocado

La tercera capa pregunta qué sucede cuando el sistema está equivocado y vincula la respuesta permitida a ese costo. Un resumen de ciclo, una estimación de ventana fértil, una etiqueta de baja fertilidad leída como orientación anticonceptiva y una interpretación de síntomas que decide si alguien busca atención médica no son el mismo producto, incluso cuando el modelo detrás de ellos es idéntico.

Clasifico las salidas en cuatro niveles por consecuencia: informativa, conductual, reproductiva y clínica. Cada uno tiene su propio umbral de evidencia, lenguaje permitido y camino de escalación. Una probabilidad del 70% podría ser adecuada para adivinar cuándo comenzará un período y no estar cerca de ser suficiente para tranquilizar a alguien que intenta no quedar embarazada.

Este es donde el diseño conoce la regulación. Si el software cruza hacia el territorio de los dispositivos médicos depende de su uso previsto y del papel que su salida juega en una decisión de salud. La guía actual de la FDA sobre software de apoyo a la decisión clínica, actualizada en enero de 2026, es explícita en que las funciones destinadas a pacientes y cuidadores pueden cumplir con la definición de un dispositivo. La posición regulatoria no es una revisión legal al final. Está codificada en sus umbrales, su redacción y su lógica de escalación desde el primer día.

4. Convertir la incertidumbre en una política de control

Un “los resultados pueden ser inexactos” en blanco entrega todo el problema de interpretación de regreso al usuario. Una política de control hace lo contrario. Para un estado de evidencia determinado, decide si el sistema muestra una observación, ofrece un rango limitado, pide otra medición, apunta a un clínico o se niega a responder. La abstención es una capacidad del producto, no un fracaso. “No estamos seguros todavía” debe ser un estado diseñado con un próximo paso, no una pantalla de error.

Concretamente, en lugar de “Ovulación: Día 15, 78%”, una respuesta gobernada lee más como esto: la ovulación es más probable dentro de una ventana de cuatro días; la confianza está limitada por los datos de temperatura que faltan y el sueño perturbado; algunas lecturas más afilarían la estimación, y una prueba de LH podría agregar evidencia prospectiva y estrechar la ventana probable. El usuario obtiene una estimación, la razón por la que es incierta y la acción única que la cambiaría.

5. Apoyar la acción que la salida implica

Incluso una aplicación de consumo crea un flujo de trabajo: registrar otra lectura, repetir una prueba, seguir observando, exportar datos, llamar a un clínico. El sistema debe saber qué acción cada respuesta apunta y si puede apoyar esa acción de manera segura.

El límite entre la orientación del producto y el consejo médico vive aquí, y no es una línea fija. El contenido educativo que explica lo que generalmente significa una señal decae en el lado de la orientación. El producto se mueve hacia un territorio de mayor riesgo en el momento en que interpreta los datos de una persona como enfermedad, dirige el tratamiento o ofrece tranquilidad que lleva un peso clínico real. Ese límite tiene que sostenerse en cada interacción, no solo en los términos del servicio.

6. Cerrar el bucle de responsabilidad

La capa final juzga todo el sistema, no solo el modelo. Las métricas del modelo estándar todavía importan y se centran en la discriminación, la calibración, el rendimiento de subgrupos, la validación externa y temporal. Pero las métricas de nivel de producto importan igual. Deberíamos preguntar con qué frecuencia el sistema tuvo suficiente entrada para actuar, con qué frecuencia se abstuvo. Además, la que insistiría es una tasa de falsa tranquilidad, lo que significa con qué frecuencia le dijo a alguien que todo parecía bien en evidencia que no podía respaldar la afirmación.

Cada respuesta con consecuencias debe ser reconstruible después de los hechos. Los reguladores, los organismos de normalización y las instituciones de gobernanza global de la salud están adoptando cada vez más esta visión de ciclo de vida. Los principios de buena práctica de aprendizaje automático de la IMDRF tratan la inteligencia artificial de confianza médica como una responsabilidad de ciclo de vida total que abarca el diseño, la implementación y el monitoreo, haciendo eco de la guía de la OMS sobre inteligencia artificial para la salud.

Qué aspecto tiene la arquitectura en la práctica

Digamos que un producto tiene tres meses de fechas de período, seis noches de temperatura, una prueba de LH positiva, un desorden de entradas de síntomas y una semana de mal sueño. La probabilidad de ovulación más alta del modelo aterriza en el día 15. Una aplicación de estimación de punto muestra “Ovulación: Día 15, Confianza 78%”.

La arquitectura produce algo diferente. Marca los datos de temperatura como escasos y confundidos por el sueño. Genera una distribución a través de varios días candidatos en lugar de uno. Aplica un umbral suave para la conciencia del ciclo pero uno más estricto si la salida toca la prevención del embarazo. Ofrece un rango más la próxima medición útil. Y almacena todo el estado de evidencia para que la decisión se pueda reconstruir más tarde. Modelo subyacente y un producto muy diferente.

El derecho a actuar

Los sistemas de Femtech solo están volviendo más ricos en datos, con aplicaciones, dispositivos portátiles, pruebas en el hogar, registros médicos y capas de conversación apiladas encima. Más datos pueden afilar la inferencia, pero también amplían la superficie para la precisión falsa. Los equipos que ganan la confianza no serán aquellos con la puntuación de confianza más limpia. Serán aquellos cuyos productos saben lo que no saben y están diseñados para decirlo.

La precisión describe la calidad de una predicción. La integridad de la decisión decide si el producto ha ganado el derecho de actuar sobre ella.

Mariia Kulikovskaia es una profesional de Estrategia de Producto para Productos de Datos Relacionados con la Salud que trabaja en productos de tecnología habilitados por IA, salud ambiental y productos de datos relacionados con la salud. Su trabajo incluye estrategia de producto B2B para sistemas de monitoreo de la salud ambiental y productos de análisis compatibles con la atención médica.