Angle d’Anderson
‘Simple’ IA peut anticiper les décisions de prêt des directeurs de banque à plus de 95% de précision

Un nouveau projet de recherche a découvert que les décisions discrétionnaires prises par les directeurs de banque humains peuvent être reproduites par des systèmes d’apprentissage automatique avec une précision de plus de 95 %.
En utilisant les mêmes données disponibles aux directeurs de banque dans un ensemble de données privilégiées, l’algorithme le plus performant dans le test était une mise en œuvre de Random Forest – une approche assez simple qui a vingt ans, mais qui a surpassé un réseau neuronal lors de la tentative de mimiquer le comportement des directeurs de banque humains formulant des décisions finales sur les prêts.

L’algorithme Random Forest, l’un des quatre mis à l’épreuve pour le projet, obtient un score équivalent à celui des humains par rapport à la performance des directeurs de banque, malgré la simplicité relative de l’algorithme. Source: Managers versus Machines: Do Algorithms Replicate Human Intuition in Credit Ratings?, https://arxiv.org/pdf/2202.04218.pdf
Les chercheurs, qui ont eu accès à un ensemble de données propriétaire de 37 449 notations de prêt sur 4 414 clients uniques dans une grande banque commerciale, suggèrent à divers moments dans le document de prépublication que l’analyse de données automatisée que les directeurs reçoivent pour prendre leur décision est maintenant si précise que les directeurs de banque ne s’en écartent rarement, ce qui pourrait signifier que le rôle des directeurs de banque dans le processus d’approbation de prêt consiste principalement à conserver quelqu’un à licencier en cas de défaut de prêt.
Le document indique:
‘D’un point de vue pratique, il est important de noter que nos résultats peuvent indiquer que la banque pourrait traiter les prêts plus rapidement et à moindre coût en l’absence de directeurs de prêt humains avec des résultats très comparables. Alors que les directeurs effectuent naturellement une variété de tâches, il est difficile de soutenir qu’ils sont essentiels pour cette tâche particulière et qu’un algorithme relativement simple peut fonctionner tout aussi bien.
‘Il est également important de noter que, avec des données supplémentaires et une puissance de calcul accrue, ces algorithmes peuvent être améliorés encore.’
Le document est intitulé Managers versus Machines: Do Algorithms Replicate Human Intuition in Credit Ratings?, et provient du département d’économie et du département de statistiques de l’UoC Irvine et de la Banque de communications BBM au Brésil.
Comportement humain robotique dans les évaluations de notation de crédit
Les résultats ne signifient pas que les systèmes d’apprentissage automatique sont nécessairement meilleurs pour prendre des décisions sur les prêts et les notations de crédit, mais plutôt que même les algorithmes maintenant considérés comme assez « bas niveau » sont capables de tirer les mêmes conclusions que les humains à partir des mêmes données.
Le rapport caractérise implicitement les directeurs de banque comme une sorte de « pare-feu logiciel » dont la fonction principale restante est d’augmenter les scores de risque que le système de scorecard leur présente (une pratique connue dans la banque sous le nom de « notching »).
‘Au fil du temps, il semble que les directeurs utilisent moins de discrétionion qui pourrait indiquer les performances améliorées ou la dépendance à l’égard des moyens algorithmiques tels que le scorecard.’
Les chercheurs ont également noté:
‘Les résultats de ce document montrent que cette tâche particulière exécutée par des directeurs de banque très qualifiés peut en fait être facilement reproduite par des algorithmes relativement simples. Les performances de ces algorithmes pourraient être améliorées en les affinant pour tenir compte des différences entre les industries et, bien sûr, pourraient être facilement étendues pour inclure des objectifs supplémentaires tels que l’intégration de considérations d’équité dans les pratiques de prêt ou pour promouvoir d’autres objectifs sociaux.’

Repérez la différence: l’évaluation des risques des notations de scorecard (automatiques) sont statistiquement augmentées (‘notchées’) par les directeurs de banque dont les décisions ont été étudiées dans le travail – une procédure reproductible.
Puisque les données suggèrent que les directeurs de banque le font d’une manière presque algorithmique et prévisible, leurs ajustements ne sont pas si difficiles à reproduire. Le processus se contente de « seconde-guesser » les données d’origine de scorecard et d’ajuster la notation de risque vers le haut dans des marges prévisibles.
Méthode et données
L’intention déclarée du projet était d’anticiper les décisions que les directeurs de banque prendraient, sur la base du système de notation et d’autres variables disponibles pour eux, plutôt que de développer des systèmes alternatifs innovants conçus pour remplacer les cadres de procédure d’application de prêt actuels.
Les méthodes d’apprentissage automatique testées pour le projet étaient Multinomial Logistic LASSO (MNL-LASSO), réseaux neuronaux, et deux mises en œuvre de Classification and Regression Trees (CART): Random Forest et Gradient Boosting.
Le projet a pris en compte à la fois les données de scorecard pour une tâche de notation de crédit dans le monde réel et son résultat, tel qu’il est connu dans les données. La notation de scorecard est l’une des pratiques algorithmiques les plus anciennes, où les variables clés pour le prêt proposé sont calculées dans une matrice de risque, souvent par des moyens aussi simples que la régression logistique.
Résultats
MNL-LASSO s’est comporté de la manière la moins performante parmi les algorithmes testés, classifiant avec succès seulement 53 % des prêts, par rapport au directeur de banque dans les cas évalués.
Les trois autres méthodes (avec CART englobant Random Forest et Gradient Boosting) ont toutes obtenu un score d’au moins 90 % en termes de précision et d’erreur quadratique moyenne (RMSE).
Cependant, la mise en œuvre de Random Forest de CART a obtenu un score impressionnant de près de 96 %, suivi de près par Gradient Boosting.

Même avec la notation de scorecard supprimée des tests pendant les études d’ablation (section de tableau inférieure), les algorithmes réalisent une performance extraordinaire en reproduisant le discernement des directeurs de banque humains pour la notation de crédit.
Étonnamment, les chercheurs ont constaté que leur réseau neuronal mis en œuvre n’a obtenu qu’un score de 93 %, avec un écart RMSE plus large, produisant des valeurs de risque plusieurs crans éloignées des estimations produites par l’homme.
Les auteurs observent:
‘[Ces] résultats ne montrent pas qu’une méthode surpasse l’autre en termes de métrique externe de précision telle que la probabilité de défaut objective. Il est tout à fait possible que le réseau neuronal, par exemple, soit le meilleur pour cette tâche de classification.
‘Ici, l’objectif est uniquement de reproduire le choix du directeur de banque et, pour cette tâche, Random Forest semble surpasser toutes les autres méthodes sur les métriques étudiées.’
Les 5 % que le système ne pouvait pas reproduire sont comptabilisés, selon les chercheurs, par l’hétérogénéité des industries couvertes. Les auteurs notent que 5 % des directeurs comptent pour presque toutes ces divergences et croient que des systèmes plus élaborés pourraient finalement couvrir de tels cas d’utilisation et combler le déficit.
La responsabilité est difficile à automatiser
Si cela est confirmé par des projets ultérieurs liés, la recherche suggère que le rôle de « directeur de banque » pourrait être ajouté à un nombre croissant de postes d’autorité et de discernement qui sont réduits au statut de « surveillant » tandis que la précision des systèmes de machine comparables est testée à long terme; et remet en question la position couramment admise que certaines tâches critiques ne peuvent pas être automatisées.
Cependant, la bonne nouvelle pour les directeurs de banque serait qu’il est probable, d’un point de vue politique, que le besoin de responsabilité humaine dans des processus sociaux critiques tels que l’évaluation de la notation de crédit préservera leurs rôles actuels – même si les actions de ces rôles deviennent complètement reproductibles par des systèmes d’apprentissage automatique.
Publié pour la première fois le 18 février 2022.












