Andersons vinkel
‘Enkel’ AI kan förutse bankchefernas kreditbeslut med över 95% noggrannhet

En ny forskningsprojekt har funnit att de diskretionära besluten som fattas av mänskliga bankchefer kan replikeras av maskinlärningssystem till en noggrannhet på över 95%.
Med hjälp av samma data som är tillgänglig för bankchefer i en privilegerad dataset, var den bäst presterande algoritmen i testet en Random Forest-implementering – en ganska enkel metod som är tjugo år gammal, men som ändå presterade bättre än ett neuronnät när det gäller att härma beteendet hos mänskliga bankchefer som formulerar slutliga beslut om lån.

Random Forest-algoritmen, en av fyra som testades i projektet, uppnår hög mänsklig-ekvivalent poäng jämfört med prestationen hos bankchefer, trots algoritmens relativa enkelhet. Källa: Managers versus Machines: Do Algorithms Replicate Human Intuition in Credit Ratings?, https://arxiv.org/pdf/2202.04218.pdf
Forskarna, som hade tillgång till en proprietär dataset med 37 449 kreditbetyg över 4 414 unika kunder hos “en stor kommersiell bank”, föreslår på flera punkter i förhandsversionen av artikeln att den automatiserade dataanalys som cheferna får för att fatta sina beslut nu har blivit så exakt att bankcheferna sällan avviker från den, vilket potentiellt tyder på att bankchefernas roll i kreditgodkännandeprocessen främst består i att ha någon att avskeda i händelse av en kreditförlust.
Artikeln säger:
‘Från ett praktiskt perspektiv är det värt att notera att våra resultat kan tyda på att banken kunde behandla lån snabbare och billigare i avsaknad av mänskliga kreditchefer med mycket jämförbara resultat. Medan cheferna naturligtvis utför en mängd olika uppgifter, är det svårt att hävda att de är absolut nödvändiga för denna specifika uppgift och att en relativt enkel algoritm kan prestera lika bra.
‘Det är också viktigt att notera att med ytterligare data och beräkningskraft kan dessa algoritmer förbättras ytterligare.’
Den artikeln heter Managers versus Machines: Do Algorithms Replicate Human Intuition in Credit Ratings? och kommer från institutionen för nationalekonomi och institutionen för statistik vid UoC Irvine och Bank of Communications BBM i Brasilien.
Robotic Human Behavior in Credit Rating Assessments
Resultaten betyder inte att maskinlärningssystem är nödvändigtvis bättre på att fatta beslut om lån och kreditbetyg, utan snarare att även algoritmer som anses vara ganska “lågnivå” kan dra samma slutsatser som människor från samma data.
Rapporten karakteriserar implicit bankchefer som en sorts “köttvaruföretag” vars kvarvarande funktion är att höja riskpoängen som det statistiska och analytiska poängsystemet presenterar för dem (en praxis som kallas “notching” inom bankväsendet).
‘Över tiden verkar det som att cheferna använder mindre diskretion, vilket kan tyda på den förbättrade prestationen av eller beroendet av algoritmiska medel som poängsystemet.’
Forskarna noterade också:
‘Resultaten i denna artikel visar att denna specifika uppgift som utförs av högt kvalificerade bankchefer kan faktiskt replikeras av relativt enkla algoritmer. Prestandan hos dessa algoritmer kunde förbättras genom finjustering för att ta hänsyn till skillnader mellan branscher och kunde naturligtvis utökas för att omfatta ytterligare mål, såsom att införliva hänsyn till rättvis lånepolitik eller främja andra sociala mål.’

Hitta skillnaden: riskbedömningen av poängsystemets (automatiska) betyg är statistiskt förhöjda (‘notchade’) av bankchefer vars beslut studerades i arbetet – en replikerbar procedur.
Eftersom datan tyder på att bankchefer gör detta på ett nästan algoritmiskt och förutsägbart sätt, är deras justeringar inte så svåra att replikera. Processen “tvivlar” helt enkelt på den ursprungliga poängsystemets data och justerar riskbetyget uppåt inom förutsägbara gränser.
Method and Data
Projektets uttalade syfte var att förutse vilka beslut bankchefer skulle fatta, baserat på poängsystemet och andra variabler som var tillgängliga för dem, snarare än att utveckla innovativa alternativa system som är avsedda att ersätta nuvarande låneprocessramverk.
De maskinlärningsmetoder som testades för projektet var Multinomial Logistic LASSO (MNL-LASSO), neurala nätverk och två implementeringar av Classification and Regression Trees (CART): Random Forest och Gradient Boosting.
Projektet beaktade både poängsystemets data för en verklig kreditbetygsuppgift och dess resultat, som är kända i datan. Poängsystem är en av de äldsta algoritmiska metoderna, där nyckelvariabler för det föreslagna lånet beräknas till en riskmatris, ofta med hjälp av metoder som logistisk regression.
Results
MNL-LASSO presterade sämst bland de testade algoritmerna, och klassificerade korrekt endast 53% av lånen, jämfört med den verkliga chefen i de utvärderade fallen.
De övriga tre metoderna (med CART som omfattar Random Forest och Gradient Boosting) presterade alla minst 90% i termer av noggrannhet och Root Mean Square Error (RMSE).
Random Forests implementation av CART presterade dock en imponerande nästan 96%, följt nära av Gradient Boosting.

Även med poängsystemets betyg borttagna från testerna under ablationsstudier (lägre tabellsektion), uppnår algoritmerna en extraordinär prestanda i att replikera mänskliga bankchefernas omdöme för kreditbetyg.
Forskarna fann överraskande att deras implementerade neuronnät endast presterade 93%, med ett större RMSE-gap, och producerade riskvärden som var flera “notcher” bort från de mänskligt producerade uppskattningarna.
Författarna observerar:
‘[Dessa] resultat indikerar inte att en metod presterar bättre än den andra när det gäller en extern noggrannhetsmätning, såsom den objektiva default-sannolikheten. Det är fullt möjligt att neuronnätverket till exempel är bäst för den klassificeringsuppgiften.
‘Här är målet endast att replikera valet av den mänskliga chefen och för denna uppgift verkar Random Forest prestera bättre än alla andra metoder över de undersökta måtten.’
De 5% som systemet inte kunde reproducera tillskrivs, enligt forskarna, den heterogenitet som finns i de branscher som täcks. Författarna noterar att 5% av cheferna står för nästan alla dessa avvikelser och tror att mer avancerade system slutligen kan täcka sådana användningsfall och minska underskottet.
Accountability Is Difficult to Automate
Om resultaten bekräftas i efterföljande relaterade projekt, tyder forskningen på att “bankchefens” roll kan läggas till en växande grupp av tidigare mäktiga auktoritets- och diskretionspositioner som reduceras till “invigilator”-status medan noggrannheten hos jämförbara maskinsystem testas under en längre tid; och undergräver den allmänt accepterade uppfattningen att vissa kritiska uppgifter inte kan automatiseras.
Men det goda nyheterna för bankchefer verkar vara att, från ett politiskt perspektiv, behovet av mänskligt ansvar i kritiska sociala processer som kreditbetygsutvärdering sannolikt kommer att bevara deras nuvarande roller – även om handlingarna i rollerna kan bli fullständigt reproducerbara av maskinlärningssystem.
Publicerad första gången den 18 februari 2022.












