Modelos y plataformas de IA
LightAutoML: Una solución AutoML para un gran ecosistema de servicios financieros
Aunque AutoML ganó popularidad hace unos años, el trabajo temprano sobre AutoML se remonta a los primeros años 90, cuando los científicos publicaron los primeros artículos sobre la optimización de hiperparámetros. Fue en 2014 cuando ICML organizó el primer taller de AutoML que AutoML ganó la atención de los desarrolladores de ML. Uno de los principales focos de AutoML a lo largo de los años es el problema de la búsqueda de hiperparámetros, donde el modelo implementa una variedad de métodos de optimización para determinar los hiperparámetros más performantes en un gran espacio de hiperparámetros para un modelo de aprendizaje automático en particular. Otro método comúnmente implementado por los modelos AutoML es estimar la probabilidad de que un hiperparámetro en particular sea el hiperparámetro óptimo para un modelo de aprendizaje automático determinado. El modelo logra esto implementando métodos bayesianos que tradicionalmente utilizan datos históricos de modelos estimados anteriormente y otros conjuntos de datos. Además de la optimización de hiperparámetros, otros métodos intentan seleccionar los mejores modelos de un espacio de alternativas de modelado.
En este artículo, cubriremos LightAutoML, un sistema AutoML desarrollado principalmente para una empresa europea que opera en el sector financiero, junto con su ecosistema. El marco de LightAutoML se despliega en varias aplicaciones, y los resultados demostraron un rendimiento superior, comparable al nivel de los científicos de datos, incluso al construir modelos de aprendizaje automático de alta calidad. El marco de LightAutoML intenta hacer las siguientes contribuciones. Primero, el marco de LightAutoML se desarrolló principalmente para el ecosistema de una gran institución financiera y bancaria europea. Debido a su marco y arquitectura, el marco de LightAutoML es capaz de superar a los marcos AutoML de vanguardia en varios benchmarks abiertos, así como en aplicaciones de ecosistema. El rendimiento del marco de LightAutoML también se compara con modelos que se ajustan manualmente por científicos de datos, y los resultados indicaron un rendimiento más fuerte del marco de LightAutoML.
Este artículo tiene como objetivo cubrir el marco de LightAutoML en profundidad, y exploramos el mecanismo, la metodología, la arquitectura del marco, junto con su comparación con marcos de vanguardia. Así que comencemos.
LightAutoML: Un marco AutoML para servicios financieros
Aunque los investigadores comenzaron a trabajar en AutoML en la década de 1990, AutoML atrajo una gran parte de la atención en los últimos años, con algunas de las soluciones industriales prominentes que implementan modelos de aprendizaje automático construidos automáticamente, como Amazon’s AutoGluon, DarwinAI, H20.ai, IBM Watson AI, Microsoft (MSFT ) AzureML, y muchos más. La mayoría de estos marcos implementan una solución AutoML de propósito general que desarrolla modelos de aprendizaje automático basados en ML en diferentes clases de aplicaciones en servicios financieros, atención médica, educación y más. La suposición clave detrás de este enfoque genérico horizontal es que el proceso de desarrollar modelos automáticos permanece idéntico en todas las aplicaciones. Sin embargo, el marco de LightAutoML implementa un enfoque vertical para desarrollar una solución AutoML que no es genérica, sino que se adapta a las necesidades de aplicaciones individuales, en este caso, una gran institución financiera. El marco de LightAutoML es una solución AutoML vertical que se centra en las necesidades del ecosistema complejo y sus características. Primero, el marco de LightAutoML proporciona una búsqueda de hiperparámetros rápida y casi óptima. Aunque el modelo no optimiza directamente estos hiperparámetros, logra entregar resultados satisfactorios. Además, el modelo mantiene el equilibrio entre la velocidad y la optimización de hiperparámetros de manera dinámica, para garantizar que el modelo sea óptimo en problemas pequeños y lo suficientemente rápido en problemas más grandes. Segundo, el marco de LightAutoML limita intencionalmente el rango de modelos de aprendizaje automático a solo dos tipos: modelos lineales y GBM o árboles de decisión con impulso de gradiente, en lugar de implementar grandes conjuntos de diferentes algoritmos. La razón principal detrás de la limitación del rango de modelos de aprendizaje automático es acelerar el tiempo de ejecución del marco de LightAutoML sin afectar negativamente el rendimiento para el tipo de problema y datos determinados. Tercero, el marco de LightAutoML presenta un método único para elegir esquemas de preprocesamiento para diferentes características utilizadas en los modelos en función de ciertas reglas de selección y metaestadísticas. El marco de LightAutoML se evalúa en una amplia gama de fuentes de datos abiertas en una amplia gama de aplicaciones.
LightAutoML: Metodología y Arquitectura
El marco de LightAutoML consta de módulos conocidos como Presets que están dedicados al desarrollo de modelos de extremo a extremo para tareas de aprendizaje automático típicas. Actualmente, el marco de LightAutoML admite módulos Preset. Primero, el Preset TabularAutoML se centra en resolver problemas de aprendizaje automático clásicos definidos en conjuntos de datos tabulares. Segundo, el Preset White-Box implementa algoritmos simples e interpretables, como la regresión logística, en lugar de la codificación WoE o el peso de la evidencia y las características discretizadas, para resolver tareas de clasificación binaria en datos tabulares. La implementación de algoritmos simples e interpretables es una práctica común para modelar la probabilidad de una solicitud debido a las restricciones de interpretación impuestas por diferentes factores. Tercero, el Preset NLP es capaz de combinar datos tabulares con herramientas de procesamiento de lenguaje natural, incluidos modelos de aprendizaje profundo preentrenados y extractores de características específicos. Finalmente, el Preset CV funciona con datos de imagen con la ayuda de algunas herramientas básicas. Es importante tener en cuenta que, aunque el modelo de LightAutoML admite los cuatro Presets, el marco solo utiliza el TabularAutoML en el sistema de producción.
La tubería típica del marco de LightAutoML se incluye en la siguiente imagen.

Cada tubería contiene tres componentes. Primero, Reader, un objeto que recibe el tipo de tarea y los datos brutos como entrada, realiza cálculos de metadatos cruciales, limpia los datos iniciales y determina las manipulaciones de datos que se deben realizar antes de ajustar diferentes modelos. A continuación, los conjuntos de datos internos de LightAutoML contienen iteradores CV y metadatos que implementan esquemas de validación para los conjuntos de datos. El tercer componente son las múltiples tuberías de aprendizaje automático apiladas y/o combinadas para obtener una sola predicción. Una tubería de aprendizaje automático dentro de la arquitectura del marco de LightAutoML es una de las múltiples tuberías de aprendizaje automático que comparten un solo esquema de validación de datos y preprocesamiento. El paso de preprocesamiento puede tener hasta dos pasos de selección de características, un paso de ingeniería de características o puede estar vacío si no se necesita preprocesamiento. Las tuberías de aprendizaje automático se pueden calcular de forma independiente en los mismos conjuntos de datos y luego combinar utilizando promedio (o promedio ponderado). Alternativamente, se puede utilizar un esquema de ensamblaje apilado para construir arquitecturas de ensamblaje de varios niveles.
Preset Tabular de LightAutoML
Dentro del marco de LightAutoML, TabularAutoML es la tubería predeterminada, y se implementa en el modelo para resolver tres tipos de tareas en datos tabulares: clasificación binaria, regresión y clasificación multiclase para una amplia gama de métricas de rendimiento y funciones de pérdida. Una tabla con las siguientes cuatro columnas: características categóricas, características numéricas, fechas y una sola columna de destino con etiquetas de clase o valores continuos, se alimenta al componente TabularAutoML como entrada. Uno de los objetivos principales detrás del diseño del marco de LightAutoML fue diseñar una herramienta para pruebas de hipótesis rápidas, una razón importante por la cual el marco evita utilizar métodos de fuerza bruta para la optimización de la tubería y se centra solo en técnicas y modelos eficientes que funcionan en una amplia gama de conjuntos de datos.
Auto-Tipificación y Preprocesamiento de Datos
Para manejar diferentes tipos de características de diferentes maneras, el modelo necesita saber cada tipo de característica. En la situación en la que hay una sola tarea con un conjunto de datos pequeño, el usuario puede especificar manualmente cada tipo de característica. Sin embargo, especificar manualmente cada tipo de característica ya no es una opción viable en situaciones que incluyen cientos de tareas con conjuntos de datos que contienen miles de características. Para el Preset TabularAutoML, el marco de LightAutoML necesita asignar características a tres clases: numéricas, categóricas y de fecha. Una solución simple y obvia es utilizar los tipos de datos de la matriz de columnas como tipos de características reales, es decir, asignar columnas de float/int a características numéricas, timestamp o cadena que podría parsearse como una fecha — a fecha, y otros a categóricos. Sin embargo, este mapeo no es el mejor debido a la frecuente ocurrencia de tipos de datos numéricos en columnas categóricas.
Esquemas de Validación
Los esquemas de validación son un componente vital de los marcos AutoML, ya que los datos en la industria están sujetos a cambios con el tiempo, y este elemento de cambio hace que las suposiciones IID o Independientemente e Identicalmente Distribuidas sean irrelevantes al desarrollar el modelo. Los modelos AutoML emplean esquemas de validación para estimar su rendimiento, buscar hiperparámetros y generar predicciones fuera de la muestra. La tubería TabularAutoML implementa tres esquemas de validación:
- Validación Cruzada KFold: La validación cruzada KFold es el esquema de validación predeterminado para la tubería TabularAutoML, incluyendo GroupKFold para modelos de comportamiento y KFold estratificado para tareas de clasificación.
- Validación de Retención: El esquema de validación de retención se implementa si se especifica el conjunto de retención.
- Esquemas de Validación Personalizados: Los esquemas de validación personalizados se pueden crear por los usuarios según sus necesidades individuales. Los esquemas de validación personalizados incluyen esquemas de división de series temporales y esquemas de validación cruzada.
Selección de Características
Aunque la selección de características es un aspecto crucial del desarrollo de modelos según los estándares de la industria, ya que facilita la reducción de los costos de inferencia y implementación del modelo, la mayoría de las soluciones AutoML no se centran mucho en este problema. Por el contrario, la tubería TabularAutoML implementa tres estrategias de selección de características: no selección, selección de corte de importancia y selección de importancia hacia adelante. De las tres, la selección de corte de importancia es la predeterminada. Además, hay dos formas principales de estimar la importancia de las características: importancia de árbol de decisión basada en división y importancia de permutación del modelo GBM o árbol de decisión con impulso de gradiente. El objetivo principal de la selección de corte de importancia es rechazar las características que no son útiles para el modelo, lo que permite al modelo reducir el número de características sin afectar negativamente el rendimiento, un enfoque que podría acelerar la inferencia y el entrenamiento del modelo.

La imagen anterior compara diferentes estrategias de selección en conjuntos de datos bancarios binarios.
Ajuste de Hiperparámetros
La tubería TabularAutoML implementa diferentes enfoques para ajustar hiperparámetros en función de lo que se ajusta.
- Ajuste de Hiperparámetros de Parada Temprana: Selecciona el número de iteraciones para todos los modelos durante la fase de entrenamiento.
- Ajuste de Hiperparámetros de Sistema de Expertos: Es una forma simple de establecer hiperparámetros para los modelos de manera satisfactoria. Evita que el modelo final tenga una disminución significativa en la puntuación en comparación con los modelos ajustados manualmente.
- Estimación de Parzen con Estructura de Árbol o TPE: Para modelos de árbol de decisión con impulso de gradiente. TPE es una estrategia de ajuste mixta que es la elección predeterminada en la tubería de LightAutoML. Para cada marco GBM, el marco de LightAutoML entrena dos modelos: el primero obtiene hiperparámetros de expertos, el segundo se ajusta para adaptarse al presupuesto de tiempo.
- Ajuste de Hiperparámetros de Búsqueda de Rejilla: Se implementa en la tubería TabularAutoML para ajustar los parámetros de regularización de un modelo lineal junto con la parada temprana y el arranque en caliente.
El modelo ajusta todos los parámetros al maximizar la función de métrica, ya sea definida por el usuario o predeterminada para la tarea resuelta.

LightAutoML: Experimento y Rendimiento
Para evaluar el rendimiento, el Preset TabularAutoML dentro del marco de LightAutoML se compara con soluciones de código abierto existentes en varias tareas y cementa el rendimiento superior del marco de LightAutoML. Primero, la comparación se lleva a cabo en el benchmark OpenML que se evalúa en 35 conjuntos de datos de clasificación binaria y multiclase. La siguiente tabla resume la comparación del marco de LightAutoML con los sistemas AutoML existentes.

Como se puede ver, el marco de LightAutoML supera a todos los demás sistemas AutoML en 20 conjuntos de datos dentro del benchmark. La siguiente tabla contiene la comparación detallada en el contexto del conjunto de datos, lo que indica que LightAutoML entrega diferentes rendimientos en diferentes clases de tareas. Para tareas de clasificación binaria, LightAutoML se queda corto en rendimiento, mientras que para tareas con una gran cantidad de datos, el marco de LightAutoML entrega un rendimiento superior.

La siguiente tabla compara el rendimiento del marco de LightAutoML con los sistemas AutoML en 15 conjuntos de datos bancarios que contienen un conjunto de tareas de clasificación binaria. Como se puede observar, LightAutoML supera a todos los sistemas AutoML en 12 de 15 conjuntos de datos, una proporción de victoria del 80.

Pensamientos Finales
En este artículo, hemos hablado sobre LightAutoML, un sistema AutoML desarrollado principalmente para una empresa europea que opera en el sector financiero, junto con su ecosistema. El marco de LightAutoML se despliega en varias aplicaciones, y los resultados demostraron un rendimiento superior, comparable al nivel de los científicos de datos, incluso al construir modelos de aprendizaje automático de alta calidad. El marco de LightAutoML intenta hacer las siguientes contribuciones. Primero, el marco de LightAutoML se desarrolló principalmente para el ecosistema de una gran institución financiera y bancaria europea. Debido a su marco y arquitectura, el marco de LightAutoML es capaz de superar a los marcos AutoML de vanguardia en varios benchmarks abiertos, así como en aplicaciones de ecosistema. El rendimiento del marco de LightAutoML también se compara con modelos que se ajustan manualmente por científicos de datos, y los resultados indicaron un rendimiento más fuerte del marco de LightAutoML.












