Modelos y plataformas de IA

Resiliencia > Precisión: Por qué la “resiliencia del modelo” debería ser la verdadera métrica para la operacionalización de modelos

mm
Añade Unite.AI a tus fuentes preferidas en Google

Por Ingo Mierswa, Fundador, Presidente y Director de Ciencia de Datos en RapidMiner.

La ciencia de datos ha hecho un gran progreso en los últimos años y muchas organizaciones están utilizando análisis avanzados o modelos de aprendizaje automático para obtener conocimientos más profundos sobre los procesos y, en algunos casos, incluso para predecir resultados probables para el futuro. Para otras “ciencias”, a menudo no está claro si un proyecto tendrá éxito o no, y se han informado que hasta el 87% de los proyectos de ciencia de datos nunca llegan a la producción. Aunque no se puede esperar una tasa de éxito del 100%, hay algunos patrones en los proyectos de ciencia de datos que conducen a tasas de éxito más altas de lo que se consideraría aceptable en el campo. Esos patrones problemáticos parecen existir de forma independiente de cualquier industria o caso de uso en particular, lo que sugiere que hay un problema universal en la ciencia de datos que debe abordarse.

Medir el éxito del aprendizaje automático

Los científicos de datos que crean modelos de aprendizaje automático (ML) confían en criterios matemáticos bien definidos para medir cómo se desempeñan dichos modelos. Qué criterios se aplican depende principalmente del tipo de modelo. Supongamos que un modelo debe predecir clases o categorías para nuevas situaciones, por ejemplo, si un cliente va a abandonar o no. En situaciones como estas, los científicos de datos utilizarían mediciones como la precisión (con qué frecuencia el modelo es correcto) o la precisión (con qué frecuencia los clientes están abandonando si predecimos el abandono).

Los científicos de datos necesitan criterios objetivos como estos porque parte de su trabajo es optimizar esos criterios de evaluación para producir el mejor modelo. De hecho, junto con la preparación de los datos para que estén listos para el modelado, la creación y ajuste de esos modelos es donde los científicos de datos pasan la mayor parte de su tiempo.

El inconveniente de esto es que los científicos de datos no se enfocan mucho en poner esos modelos en producción, lo que es un problema por más de una razón. En primer lugar, los modelos que no producen resultados exitosos no pueden utilizarse para generar impacto empresarial para las organizaciones que los despliegan. En segundo lugar, porque estas organizaciones han invertido tiempo y dinero en el desarrollo, capacitación y operacionalización de modelos que no han producido resultados exitosos cuando se ejecutan en “datos del mundo real”, es probable que consideren que el aprendizaje automático y otras herramientas de ciencia de datos son inútiles para su organización y declinen seguir adelante con futuras iniciativas de ciencia de datos.

La verdad es que a los científicos de datos simplemente les gusta ajustar los modelos y pasan mucho tiempo en esto. Pero sin impacto empresarial, este tiempo no se invierte sabiamente, lo que es particularmente doloroso dado lo escaso que es el recurso de científicos de datos en el mundo de hoy.

El premio de Netflix y el fracaso en la producción

Hemos visto este fenómeno de sobreinversión en la creación de modelos y no en la operacionalización de modelos en los últimos años. El Premio de Netflix (NFLX ) fue una competencia abierta para el mejor algoritmo de filtrado colaborativo para predecir las calificaciones de los usuarios para las películas. Si le das una calificación alta a una nueva película, es probable que hayas disfrutado de esta película, así que utilizando este sistema de calificación, Netflix te recomendará ciertos títulos y si disfrutas del contenido recomendado, es probable que te quedes más tiempo como cliente de Netflix. El gran premio fue la suma de 1 millón de dólares, otorgado al equipo que pudo mejorar el algoritmo de Netflix en al menos un 10%.

El desafío comenzó en 2006 y en los tres años siguientes, las contribuciones de más de 40,000 equipos de científicos de datos en todo el mundo llevaron a una mejora impresionante de más del 10% en el éxito de la recomendación de títulos. Sin embargo, los modelos del equipo ganador nunca se operacionalizaron. Netflix dijo que “el aumento en la precisión no parecía justificar el esfuerzo necesario para llevar esos modelos a la producción”.

Por qué lo óptimo no siempre es óptimo

La precisión del modelo y otros criterios de ciencia de datos se han utilizado durante mucho tiempo como la métrica para medir el éxito de un modelo antes de poner el modelo en cuestión en producción. Como hemos visto, muchos modelos nunca llegan a esta etapa, lo que es un desperdicio de recursos, tanto en términos de energía como de tiempo invertido.

Pero hay más problemas con esta cultura de sobreinversión en la ajuste de modelos. El primero es un ajuste involuntario a los datos de prueba, lo que resultará en modelos que parecen buenos para el científico de datos que los gestiona, pero que en realidad se desempeñan mal una vez en producción, a veces incluso causando daño. Esto sucede por dos razones:

  1. Hay una discrepancia bien conocida entre el error de prueba y el que se verá en producción
  2. El impacto empresarial y los criterios de desempeño de la ciencia de datos a menudo están correlacionados, pero los modelos “óptimos” no siempre entregan el mayor impacto

El primer punto anterior también se llama “ajuste al conjunto de prueba“. Es un fenómeno bien conocido, especialmente entre los participantes de las competencias de ciencia de datos como las de Kaggle. Para estas competencias, se puede ver una versión más fuerte de este fenómeno ya entre las clasificaciones públicas y privadas. De hecho, un participante podría ganar la clasificación pública en una competencia de Kaggle sin haber leído siquiera los datos. De manera similar, el ganador de la clasificación privada y la competencia en general puede no haber producido un modelo que pueda mantener su desempeño en cualquier conjunto de datos que no sea aquel en el que se evaluó.

La precisión no es igual al impacto empresarial

Durante demasiado tiempo hemos aceptado esta práctica, que conduce a la adaptación lenta de los modelos a los conjuntos de datos de prueba. Como resultado, lo que parece ser el mejor modelo resulta ser mediocre como máximo:

  • Mediciones como la precisión predictiva a menudo no equivalen al impacto empresarial
  • Una mejora de la precisión del 1% no se puede traducir en un 1% mejor resultado empresarial
  • Hay casos en los que un modelo de bajo rendimiento supera a otros en términos de impacto empresarial
  • Otros factores como el mantenimiento, la velocidad de puntuación o la robustez contra los cambios con el tiempo (llamada “resiliencia”) también deben tenerse en cuenta.

Este último punto es particularmente importante. Los mejores modelos no solo ganarán competencias o parecerán buenos en el laboratorio de ciencia de datos, sino que se mantendrán en producción y se desempeñarán bien en una variedad de conjuntos de prueba. A estos modelos los llamamos modelos resilientes.

Deriva y la importancia de la resiliencia

Todos los modelos se deterioran con el tiempo. La única pregunta es cuán rápido sucede esto y cuán bien el modelo aún se desempeña en las circunstancias cambiadas. La razón de este deterioro es que el mundo no es estático. Por lo tanto, los datos a los que se aplica el modelo también cambian con el tiempo. Si estos cambios ocurren lentamente, los llamamos “deriva de concepto”. Si los cambios ocurren abruptamente, los llamamos “cambio de concepto”. Por ejemplo, los clientes pueden cambiar su comportamiento de consumo lentamente con el tiempo, influenciados por tendencias y/o marketing. Los modelos de propensión pueden dejar de funcionar en algún momento. Estos cambios pueden acelerarse drásticamente en ciertas situaciones. El COVID-19, por ejemplo, ha impulsado la venta de artículos como el papel higiénico y los desinfectantes, un aumento repentino e inesperado en productos específicos que puede sacar de quicio dicho modelo.

Un modelo resiliente puede no ser el mejor modelo según medidas como la precisión o la precisión, pero se desempeñará bien en una gama más amplia de conjuntos de datos. Por esta razón, también se desempeñará mejor durante un período de tiempo más largo y, por lo tanto, estará mejor equipado para entregar un impacto empresarial sostenido.

Los modelos lineales y otros tipos de modelos simples a menudo son más resilientes porque es más difícil ajustarlos a un conjunto de prueba o momento en el tiempo específico. Los modelos más potentes se pueden y deben utilizar como “desafiantes” para un modelo más simple, lo que permite a los científicos de datos ver si también pueden mantenerse con el tiempo. Pero esto debe emplearse al final, no al principio del viaje del modelado.

Aunque no se ha introducido una KPI formal para medir la resiliencia en el campo de la ciencia de datos, hay varias formas en que los científicos de datos pueden evaluar cuán resilientes son sus modelos:

  • Desviaciones estándar más pequeñas en una ejecución de validación cruzada significan que el desempeño del modelo dependió menos de los detalles específicos de los diferentes conjuntos de prueba
  • Incluso si los científicos de datos no realizan validaciones cruzadas completas, pueden utilizar dos conjuntos de datos diferentes para pruebas y validación. Una menor discrepancia entre las tasas de error para los conjuntos de datos de prueba y validación indica una mayor resiliencia
  • Si el modelo se monitorea adecuadamente en producción, las tasas de error se pueden ver con el tiempo. La consistencia de las tasas de error con el tiempo es un buen indicador de la resiliencia del modelo.
  • Si la solución de monitoreo de modelos elegida tiene en cuenta la deriva, los científicos de datos también deben prestar atención a cómo se ve afectado el modelo por esa deriva de entrada.

Cambiar la cultura de la ciencia de datos

Después de que un modelo se ha desplegado en la etapa de operacionalización, todavía hay amenazas para la precisión del modelo. Los dos últimos puntos anteriores sobre la resiliencia del modelo ya requieren un monitoreo adecuado de los modelos en producción. Como punto de partida para un cambio de cultura en la ciencia de datos, las empresas están bien aconsejadas de invertir en un monitoreo de modelos adecuado y comenzar a hacer que los científicos de datos sean responsables de la falta de desempeño después de que los modelos se pongan en producción. Esto cambiará inmediatamente la cultura de una cultura de creación de modelos a una cultura de creación y sostenimiento de valor para el campo de la ciencia de datos.

Como han demostrado los eventos recientes en el mundo, el mundo cambia rápidamente. Ahora, más que nunca, debemos construir modelos resilientes, no solo precisos, para capturar un impacto empresarial significativo con el tiempo. Kaggle, por ejemplo, está organizando un desafío para galvanizar a los científicos de datos de todo el mundo para ayudar a construir soluciones de modelo para utilizar en la lucha global contra el COVID-19. Anticipó que los modelos más exitosos producidos como resultado de este desafío serán los más resilientes, no los más precisos, como hemos visto cómo los datos del COVID-19 pueden cambiar en un solo día.

La ciencia de datos debería ser sobre encontrar la verdad, no producir el “mejor” modelo. Al mantenernos a nosotros mismos a un estándar más alto de resiliencia sobre la precisión, los científicos de datos podrán entregar un mayor impacto empresarial para nuestras organizaciones y ayudar a dar forma positivamente al futuro.

Ingo Mierswa es un científico de datos veterano de la industria desde que comenzó a desarrollar RapidMiner en la División de Inteligencia Artificial de la Universidad Técnica de Dortmund en Alemania. Mierswa, el científico, ha escrito numerosas publicaciones galardonadas sobre análisis predictivo y big data. Mierswa, el empresario, es el fundador de RapidMiner. Es responsable de la innovación estratégica y se ocupa de todas las grandes preguntas sobre las tecnologías de RapidMiner. Bajo su liderazgo, RapidMiner ha crecido hasta un 300% al año durante los primeros siete años. En 2012, encabezó la estrategia de expansión internacional con la apertura de oficinas en EE. UU., Reino Unido y Hungría. Después de dos rondas de recaudación de fondos, la adquisición de Radoop y el apoyo a la posición de RapidMiner con firmas analistas líderes como Gartner y Forrester, Ingo se enorgullece de haber traído al mejor equipo del mundo a RapidMiner.