Ángulo de Anderson

‘Simple’ IA Puede Predecir las Decisiones de los Gerentes de Banco sobre Préstamos con más del 95% de Precisión

mm
Añade Unite.AI a tus fuentes preferidas en Google

Un nuevo proyecto de investigación ha encontrado que las decisiones discrecionales tomadas por los gerentes de banco humanos pueden ser replicadas por sistemas de aprendizaje automático con una precisión de más del 95%.

Utilizando los mismos datos disponibles para los gerentes de banco en un conjunto de datos privilegiados, el algoritmo mejor performante en la prueba fue una implementación de Random Forest – un enfoque bastante simple que tiene veinte años, pero que aún superó a una red neuronal al intentar imitar el comportamiento de los gerentes de banco humanos que formulan decisiones finales sobre préstamos.

El algoritmo Random Forest, uno de los cuatro que se sometieron a pruebas para el proyecto, logra una alta puntuación equivalente a la humana vs. el rendimiento de los gerentes de banco, a pesar de la relativa simplicidad del algoritmo. Fuente: Gerentes versus Máquinas: ¿Replican los Algoritmos la Intuición Humana en las Calificaciones de Crédito?, https://arxiv.org/pdf/2202.04218.pdf

El algoritmo Random Forest, uno de los cuatro que se sometieron a pruebas para el proyecto, logra una alta puntuación equivalente a la humana vs. el rendimiento de los gerentes de banco, a pesar de la relativa simplicidad del algoritmo. Fuente: Gerentes versus Máquinas: ¿Replican los Algoritmos la Intuición Humana en las Calificaciones de Crédito?, https://arxiv.org/pdf/2202.04218.pdf

Los investigadores, que tuvieron acceso a un conjunto de datos propietario de 37,449 calificaciones de préstamos en 4,414 clientes únicos en “un gran banco comercial”, sugieren en varios puntos del artículo preimpreso que el análisis de datos automatizado que se les da a los gerentes para tomar su decisión se ha vuelto tan preciso que los gerentes de banco rara vez se desvían de él, lo que podría significar que la parte de los gerentes de banco en el proceso de aprobación de préstamos consiste principalmente en retener a alguien para despedir en caso de incumplimiento de un préstamo.

El artículo establece:

‘Desde una perspectiva práctica, es digno de destacar que nuestros resultados pueden indicar que el banco podría procesar préstamos más rápido y a menor costo en ausencia de gerentes de préstamos humanos con resultados muy comparables. Mientras que los gerentes naturalmente realizan una variedad de tareas, es difícil argumentar que son esenciales para esta tarea en particular y que un algoritmo relativamente simple puede realizar el mismo trabajo.

‘También es importante destacar que con más datos y potencia computacional, estos algoritmos pueden mejorar aún más.’

El artículo se titula Gerentes versus Máquinas: ¿Replican los Algoritmos la Intuición Humana en las Calificaciones de Crédito?, y proviene del Departamento de Economía y Departamento de Estadística de la Universidad de California en Irvine y del Banco de Comunicaciones BBM en Brasil.

Comportamiento Humano Robótico en las Evaluaciones de Calificación de Crédito

Los resultados no significan que los sistemas de aprendizaje automático sean necesariamente mejores para tomar decisiones sobre préstamos y calificaciones de crédito, sino que incluso los algoritmos ahora considerados bastante “bajos” son capaces de llegar a las mismas conclusiones que los humanos a partir de los mismos datos.

El informe caracteriza implícitamente a los gerentes de banco como una especie de “cortafuegos de carne” cuya función principal es aumentar las puntuaciones de riesgo que les presenta el sistema de puntuación estadística y analítica (una práctica conocida en el sector bancario como “notching”).

‘Con el tiempo, parece que los gerentes están empleando menos discreción, lo que podría indicar un mejor desempeño o confianza en los medios algorítmicos, como la puntuación.’

Los investigadores también observaron:

‘Los resultados en este artículo muestran que esta tarea en particular ejecutada por gerentes de banco altamente capacitados puede en realidad ser fácilmente replicada por algoritmos relativamente simples. El rendimiento de estos algoritmos podría mejorar mediante la afinación para tener en cuenta las diferencias entre industrias y, por supuesto, podría extenderse fácilmente para incluir objetivos adicionales, como la incorporación de consideraciones de equidad en las prácticas de préstamos o para promover otros objetivos sociales.’

¿Cuál es la diferencia? La evaluación de riesgo de las calificaciones de la puntuación (automáticas) se incrementan estadísticamente ('notch') por los gerentes de banco cuyas decisiones se estudiaron en el trabajo – un procedimiento replicable.

¿Cuál es la diferencia? La evaluación de riesgo de las calificaciones de la puntuación (automáticas) se incrementan estadísticamente (‘notch’) por los gerentes de banco cuyas decisiones se estudiaron en el trabajo – un procedimiento replicable.

Dado que los datos sugieren que los gerentes de banco lo hacen de una manera casi algorítmica y predecible, sus ajustes no son difíciles de replicar. El proceso simplemente “segunda suposición” de los datos originales de la puntuación y ajusta la calificación de riesgo hacia arriba dentro de márgenes predecibles.

Método y Datos

El objetivo declarado del proyecto era anticipar qué decisiones tomarían los gerentes de banco, en función del sistema de puntuación y otras variables disponibles para ellos, en lugar de desarrollar sistemas alternativos innovadores diseñados para reemplazar los marcos de procedimiento de solicitud de préstamos actuales.

Los métodos de aprendizaje automático probados para el proyecto fueron Regresión Logística Multinomial LASSO (MNL-LASSO), redes neuronales y dos implementaciones de Árboles de Clasificación y Regresión (CART): Random Forest y Gradient Boosting.

El proyecto consideró tanto los datos de la puntuación para una tarea de calificación de crédito en el mundo real, como su resultado, tal como se conoce en los datos. La puntuación es una de las prácticas algorítmicas más antiguas, donde se calculan variables clave para el préstamo propuesto en una matriz de riesgo, a menudo mediante medios tan simples como la regresión logística.

Resultados

MNL-LASSO se desempeñó peor entre los algoritmos probados, clasificando con éxito solo el 53% de los préstamos, en comparación con el gerente de la vida real en los casos evaluados.

Los otros tres métodos (con CART que abarca Random Forest y Gradient Boosting) todos obtuvieron al menos un 90% en términos de precisión y Error Cuadrático Medio (RMSE).

Sin embargo, la implementación de Random Forest de CART obtuvo un impresionante casi 96%, seguido de cerca por Gradient Boosting.

Incluso con la calificación de la puntuación eliminada de las pruebas durante los estudios de ablación (sección inferior de la tabla), los algoritmos logran un rendimiento extraordinario al replicar la discriminación de los gerentes de banco humanos para la calificación de crédito.

Incluso con la calificación de la puntuación eliminada de las pruebas durante los estudios de ablación (sección inferior de la tabla), los algoritmos logran un rendimiento extraordinario al replicar la discriminación de los gerentes de banco humanos para la calificación de crédito.

Sorprendentemente, los investigadores encontraron que su red neuronal implementada solo obtuvo un 93%, con una brecha de RMSE más amplia, produciendo valores de riesgo varios “notch” alejados de las estimaciones producidas por humanos.

Los autores observan:

‘[Estos] resultados no indican que un método supere al otro en términos de una métrica externa de precisión, como la probabilidad de incumplimiento objetivo. Es posible que la Red Neuronal, por ejemplo, sea la mejor para esa tarea de clasificación.

‘Aquí el objetivo es solo replicar la elección del gerente humano y para esta tarea Random Forest parece superar a todos los demás métodos en las métricas investigadas.’

El 5% que el sistema no pudo reproducir se debe, según los investigadores, a la heterogeneidad de las industrias cubiertas. Los autores señalan que el 5% de los gerentes explican casi todas estas divergencias y creen que sistemas más elaborados podrían cubrir eventualmente estos casos de uso y cerrar la brecha.

La Responsabilidad es Difícil de Automatizar

Si se confirma en proyectos relacionados posteriores, la investigación sugiere que el papel de “gerente de banco” podría agregarse a un grupo creciente de posiciones de autoridad y discernimiento que antes eran poderosas y que se están reduciendo a un estado de “supervisión” mientras se prueba la precisión de los sistemas de máquina comparables a largo plazo; y socava la posición comúnmente aceptada de que ciertas tareas críticas no pueden ser automatizadas.

Sin embargo, la buena noticia para los gerentes de banco parecería ser que, desde un punto de vista político, la necesidad de responsabilidad humana en procesos sociales críticos como la evaluación de la calificación de crédito probablemente preservará sus roles actuales – incluso si las acciones de los roles se vuelven completamente reproducibles por sistemas de aprendizaje automático.

 

Publicado por primera vez el 18 de febrero de 2022.

Escritor sobre aprendizaje automático, especialista en síntesis de imágenes humanas. Antiguo jefe de contenido de investigación en Metaphysic.ai, hasta su disolución en DNEG's Brahma.ai.
Portfolio site: martinanderson.ai
Contact: martin@martinanderson.ai