Andersons Blickwinkel

‘Einfach’ künstliche Intelligenz kann Bankmanagern bei Kreditentscheidungen mit über 95% Genauigkeit vorhersagen

mm
Unite.AI zu deinen bevorzugten Quellen auf Google hinzufügen

Ein neues Forschungsprojekt hat herausgefunden, dass die diskretionären Entscheidungen, die von menschlichen Bankmanagern getroffen werden, von maschinellen Lernsystemen mit einer Genauigkeit von mehr als 95% repliziert werden können.

Mit den gleichen Daten, die auch Bankmanagern in einem privilegierten Datensatz zur Verfügung stehen, war der beste Algorithmus im Test eine Random-Forest-Implementierung – ein relativ einfacher Ansatz, der zwanzig Jahre alt ist, aber immer noch besser abschnitt als ein neuronales Netzwerk, wenn es darum ging, das Verhalten von menschlichen Bankmanagern bei der Formulierung von Kreditentscheidungen nachzuahmen.

Der Random-Forest-Algorithmus, einer von vier, die für das Projekt getestet wurden, erreicht hohe menschliche Äquivalenzwerte im Vergleich zur Leistung von Bankmanagern, trotz der relativen Einfachheit des Algorithmus. Quelle: Managers versus Machines: Do Algorithms Replicate Human Intuition in Credit Ratings?, https://arxiv.org/pdf/2202.04218.pdf

Der Random-Forest-Algorithmus, einer von vier, die für das Projekt getestet wurden, erreicht hohe menschliche Äquivalenzwerte im Vergleich zur Leistung von Bankmanagern, trotz der relativen Einfachheit des Algorithmus. Quelle: Managers versus Machines: Do Algorithms Replicate Human Intuition in Credit Ratings?, https://arxiv.org/pdf/2202.04218.pdf

Die Forscher, die Zugang zu einem proprietären Datensatz von 37.449 Kreditbewertungen über 4.414 einzigartige Kunden bei einer “großen kommerziellen Bank” hatten, deuten an verschiedenen Stellen im Vorabdruck darauf hin, dass die automatisierte Datenanalyse, die den Managern zur Entscheidungsfindung zur Verfügung steht, jetzt so genau ist, dass Bankmanager selten davon abweichen, was darauf hindeuten könnte, dass die Rolle der Bankmanager im Kreditgenehmigungsprozess hauptsächlich darin besteht, jemanden zu haben, den man im Falle eines Kreditverlusts entlassen kann.

Die Studie besagt:

‘Aus praktischer Sicht ist es erwähnenswert, dass unsere Ergebnisse darauf hindeuten könnten, dass die Bank Kredite schneller und günstiger bearbeiten könnte, wenn sie auf menschliche Kreditmanager verzichten würde, mit sehr ähnlichen Ergebnissen. Während Manager natürlich eine Vielzahl von Aufgaben ausführen, ist es schwer zu argumentieren, dass sie für diese spezifische Aufgabe unerlässlich sind und ein relativ einfacher Algorithmus genauso gut funktionieren kann.

‘Es ist auch wichtig zu beachten, dass diese Algorithmen mit zusätzlichen Daten und Rechenleistung weiter verbessert werden können.’

Die Studie trägt den Titel Managers versus Machines: Do Algorithms Replicate Human Intuition in Credit Ratings? und stammt aus dem Department of Economics und Department of Statistics an der UoC Irvine und der Bank of Communications BBM in Brasilien.

Roboter-Verhalten von Menschen bei Kreditbewertungen

Die Ergebnisse bedeuten nicht, dass maschinelle Lernsysteme notwendigerweise besser darin sind, Entscheidungen über Kredite und Kreditbewertungen zu treffen, sondern vielmehr, dass sogar Algorithmen, die als relativ “niedrig” angesehen werden, in der Lage sind, aus den gleichen Daten die gleichen Schlussfolgerungen wie Menschen zu ziehen.

Der Bericht charakterisiert Bankmanager implizit als eine Art “Fleischware-Feuerwand”, deren Kernfunktion darin besteht, die Risikobewertungen, die das statistische und analytische Scorecard-System ihnen präsentiert, zu erhöhen (eine Praxis, die im Bankwesen als “Notching” bekannt ist).

‘Im Laufe der Zeit scheint es, dass Manager weniger Ermessensspielraum haben, was auf die verbesserte Leistung oder Abhängigkeit von algorithmischen Mitteln wie dem Scorecard hindeuten könnte.’

Die Forscher bemerkten auch:

‘Die Ergebnisse in diesem Papier zeigen, dass diese spezifische Aufgabe, die von hoch qualifizierten Bankmanagern ausgeführt wird, tatsächlich leicht von relativ einfachen Algorithmen repliziert werden kann. Die Leistung dieser Algorithmen könnte durch Feinabstimmung verbessert werden, um Unterschiede zwischen Branchen zu berücksichtigen, und könnte leicht erweitert werden, um zusätzliche Ziele wie die Einbeziehung von Fairnessaspekten bei Kreditvergaben oder die Förderung anderer sozialer Ziele zu umfassen.’

Entdecken Sie den Unterschied: Die Risikobewertung der Scorecard-Bewertungen (automatisch) wird statistisch erhöht (,notched') von Bankmanagern, deren Entscheidungen im Rahmen der Studie untersucht wurden – ein replizierbares Verfahren.

Entdecken Sie den Unterschied: Die Risikobewertung der Scorecard-Bewertungen (automatisch) wird statistisch erhöht (,notched’) von Bankmanagern, deren Entscheidungen im Rahmen der Studie untersucht wurden – ein replizierbares Verfahren.

Da die Daten nahelegen, dass Bankmanager dies auf fast algorithmische und vorhersehbare Weise tun, sind ihre Anpassungen nicht besonders schwierig zu replizieren. Der Prozess,zweifelt’ die ursprünglichen Scorecard-Daten einfach und passt die Risikobewertung innerhalb vorhersehbarer Grenzen nach oben an.

Methode und Daten

Das erklärte Ziel des Projekts bestand darin, vorherzusagen, welche Entscheidungen Bankmanager treffen würden, basierend auf dem Bewertungssystem und anderen verfügbaren Variablen, anstatt innovative alternative Systeme zu entwickeln, die bestehende Kreditantragsverfahren ersetzen sollen.

Die für das Projekt getesteten maschinellen Lernmethoden waren Multinomiale Logistische LASSO (MNL-LASSO), Neuronale Netze und zwei Implementierungen von Klassifizierungs- und Regressionsbäumen (CART): Random Forest und Gradient Boosting.

Das Projekt berücksichtigte sowohl die Scorecard-Daten für eine reale Kreditbewertungsaufgabe als auch deren Ergebnis, wie es in den Daten bekannt ist. Scorecard-Bewertung ist eine der ältesten algorithmischen Praktiken, bei der Schlüsselvariablen für den vorgeschlagenen Kredit in eine Risikomatrix berechnet werden, oft durch einfache Mittel wie logistische Regression.

Ergebnisse

MNL-LASSO schnitt mit 53% der erfolgreich klassifizierten Kredite am schlechtesten unter den getesteten Algorithmen ab, im Vergleich zu den realen Managern in den ausgewerteten Fällen.

Die anderen drei Methoden (mit CART, das Random Forest und Gradient Boosting umfasst) erreichten alle eine Genauigkeit von mindestens 90% und einen mittleren quadratischen Fehler (RMSE).

Random Forests Implementierung von CART erreichte jedoch eine beeindruckende Nahe-96%-Genauigkeit, gefolgt von Gradient Boosting.

Selbst wenn die Scorecard-Bewertung aus den Tests während der Ablationsstudien (unterer Tabellenteil) entfernt wurde, erreichen die Algorithmen eine außergewöhnliche Leistung bei der Replikation der Urteilsvermögen von menschlichen Bankmanagern für Kreditbewertungen.

Selbst wenn die Scorecard-Bewertung aus den Tests während der Ablationsstudien (unterer Tabellenteil) entfernt wurde, erreichen die Algorithmen eine außergewöhnliche Leistung bei der Replikation der Urteilsvermögen von menschlichen Bankmanagern für Kreditbewertungen.

Überraschenderweise fanden die Forscher heraus, dass ihr implementiertes neuronales Netz nur 93% erreichte, mit einer größeren RMSE-Lücke, die Risikowerte mehrere Notches von den menschlichen Schätzungen entfernt produzierte.

Die Autoren bemerken:

‘[Diese] Ergebnisse zeigen nicht, dass eine Methode die andere in Bezug auf eine externe Genauigkeitsmetrik wie die objektive Ausfallwahrscheinlichkeit übertrifft. Es ist durchaus möglich, dass das neuronale Netz beispielsweise für diese Klassifizierungsaufgabe am besten geeignet ist.

‘Hier ist das Ziel nur, die Wahl des menschlichen Managers zu replizieren, und für diese Aufgabe scheint Random Forest alle anderen Methoden in den untersuchten Metriken zu überbieten.’

Die 5%, die das System nicht reproduzieren konnte, werden von den Forschern durch die Heterogenität der Branchen erklärt, die abgedeckt werden. Die Autoren bemerken, dass 5% der Manager fast alle diese Abweichungen ausmachen, und glauben, dass komplexere Systeme letztendlich diese Fälle abdecken und die Lücke schließen könnten.

Verantwortlichkeit ist schwierig zu automatisieren

Wenn diese Forschung in nachfolgenden verwandten Projekten bestätigt wird, deutet sie darauf hin, dass die Rolle des Bankmanagers zu einer wachsenden Gruppe von einst mächtigen Autoritäts- und Urteilspositionen hinzugefügt werden könnte, die auf “Aufseher”-Status reduziert werden, während die Genauigkeit vergleichbarer maschineller Systeme über einen längeren Zeitraum getestet wird; und untergräbt die allgemein anerkannte Position, dass bestimmte kritische Aufgaben nicht automatisiert werden können.

Es gibt jedoch gute Nachrichten für Bankmanager: Aus politischer Sicht ist es wahrscheinlich, dass der Bedarf an menschlicher Verantwortlichkeit in kritischen sozialen Prozessen wie der Kreditbewertung ihre aktuellen Rollen erhalten wird – selbst wenn die Handlungen dieser Rollen vollständig von maschinellen Lernsystemen repliziert werden können.

 

Erstveröffentlichung: 18. Februar 2022.

Schriftsteller über maschinelles Lernen, Domänen-Spezialist für menschliche Bildsynthese. Ehemaliger Leiter der Forschungsinhalte bei Metaphysic.ai, bis zu dessen Auflösung in DNEG's Brahma.ai.
Portfolio-Website: martinanderson.ai
Kontakt: martin@martinanderson.ai