Andersonの視点

‘シンプル’ AIは銀行マネージャーのローン決定を95%以上の精度で予測できる

mm
Unite.AI を Google の優先ソースに追加

新しい研究プロジェクトにより、人間の銀行マネージャーが行う裁量的な決定が、機械学習システムによって95%以上の精度で再現できることが発見された。

銀行マネージャーが利用できる特権データセットと同じデータを使用して、テストで最も優れたアルゴリズムは、ランダムフォレストの実装であった。これは、比較的シンプルなアプローチであり、20年前に開発されたものであるが、ローンについての最終的な決定を下す銀行マネージャーの行動を模倣する際には、ニューラルネットワークを上回った。

ランダムフォレストアルゴリズムは、銀行マネージャーのパフォーマンスと比較して高いスコアを達成している。

ランダムフォレストアルゴリズムは、銀行マネージャーのパフォーマンスと比較して高いスコアを達成している。 ソース:マネージャーとマシン:アルゴリズムは信用評価における人間の直感を再現するか?、https://arxiv.org/pdf/2202.04218.pdf

研究者たちは、37,449件のローン評価と4,414件のユニーク顧客に関する特権データセットにアクセスしていた。これは、「大手商業銀行」からのものであった。研究者たちは、プレプリントの論文の中で、銀行マネージャーが決定を下すために使用する自動データ分析が非常に正確になっているため、銀行マネージャーがそれからほとんど外れない可能性があると示唆している。つまり、銀行マネージャーの役割は、ローンの承認プロセスにおいて、主にローンのデフォルト時に解雇される人を維持することである可能性がある。

論文では次のように述べられている。

‘実用的観点から言えば、私たちの結果は、銀行が人間のローンマネージャーなしでローンをより迅速かつ低コストで処理できる可能性があることを示唆している。マネージャーは自然に多様なタスクを実行するが、この特定のタスクに対しては、比較的シンプルなアルゴリズムが同等の結果を達成できることを主張することは難しい。 ‘

‘さらに、追加のデータと計算能力を使用することで、これらのアルゴリズムをさらに改善できることも重要である。’

論文は、こちらで閲覧できる。マネージャーとマシン:アルゴリズムは信用評価における人間の直感を再現するか?というタイトルの論文は、UoCアイルビューの経済学部と統計学部、およびブラジルのBank of Communications BBMから発行された。

ロボットによる人間の行動の信用評価

結果は、機械学習システムがローンや信用評価についての決定を下すことが人間よりも優れていることを示唆しているのではない。むしろ、現在「低レベル」と考えられているアルゴリズムでも、人間と同じ結論を同じデータから導き出すことができることを示している。
レポートは、銀行マネージャーを「肉体のファイアウォール」として特徴付けている。彼らの主な機能は、統計的および分析的なスコアカードシステムによって提示されるリスクスコアを上げることである(銀行では「ノッチング」と呼ばれる)。

‘時間の経過とともに、マネージャーはアルゴリズミックな手段であるスコアカードへの依存度が高まっている可能性がある。’

研究者たちはまた、次のように述べている。

‘この論文の結果は、高度に熟練した銀行マネージャーによって実行される特定のタスクが、比較的シンプルなアルゴリズムによって容易に再現できる可能性があることを示している。アルゴリズムのパフォーマンスは、業界間の違いを考慮してファインチューニングすることで改善できる。また、公平性の考慮や社会的目標の促進などの追加の目標を含めることで拡張することもできる。’

違いを探せ:スコアカード(自動)評価のリスク評価は、研究対象となった銀行マネージャーの決定によって統計的に「ノッチング」される – 再現可能な手順。

違いを探せ:スコアカード(自動)評価のリスク評価は、研究対象となった銀行マネージャーの決定によって統計的に「ノッチング」される – 再現可能な手順。

データが示唆するように、銀行マネージャーはこれをほぼアルゴリズミックかつ予測可能な方法で行っているため、彼らの調整は再現することが容易ではない。

方法とデータ

プロジェクトの目的は、スコアリングシステムと他の銀行マネージャーが利用できる変数に基づいて、銀行マネージャーが行う決定を予測することであった。現行のローン申請手続きフレームワークを置き換えるための革新的な代替システムの開発ではなかった。

プロジェクトでテストされた機械学習方法は、多項ロジスティックLASSO(MNL-LASSO)ニューラルネットワーク、および分類および回帰ツリー(CART)の2つの実装:ランダムフォレストとグラディエントブースティングであった。

プロジェクトでは、スコアカードデータとその結果が、現実世界の信用評価タスクにおける既知のデータとして考慮された。スコアカード評価は、最も古いアルゴリズミックな慣行の一つであり、提案されたローンの重要な変数がリスクマトリックスに計算されることが多い。たとえば、ロジスティック回帰などの手法によって行われる。

結果

MNL-LASSOは、テストされたアルゴリズムの中で最も悪く、53%のローンのみを正しく分類した。一方、他の3つの方法(CARTにはランダムフォレストとグラディエントブースティングが含まれる)は、すべて90%以上の精度とルート平均二乗誤差(RMSE)を達成した。

しかし、ランダムフォレストのCART実装は、約96%という印象的なスコアを達成し、グラディエントブースティングに次いで2番目の高さであった。

アルゴリズムは、スコアカード評価をテストから除外した場合(下部のテーブル)でも、人間の銀行マネージャーの信用評価における判断を再現するための非凡なパフォーマンスを達成している。

アルゴリズムは、スコアカード評価をテストから除外した場合(下部のテーブル)でも、人間の銀行マネージャーの信用評価における判断を再現するための非凡なパフォーマンスを達成している。

驚くことに、研究者たちは、実装したニューラルネットワークは93%のスコアしか達成できず、RMSEのギャップも広かった。リスク値は人間によって生成された推定値からいくつかのノッチ離れていた。

著者たちは次のように述べている。

‘結果は、外部の精度メトリック(たとえば、客観的なデフォルト確率)に関して、一方の方法が他方を上回っていることを示唆していない。たとえば、ニューラルネットワークはその分類タスクに最適である可能性がある。 ‘

‘ここでは、人間のマネージャーの選択を再現することが目的であり、このタスクではランダムフォレストが調査されたメトリックすべてで他の方法を上回っている。 ‘

システムが再現できない5%は、研究者によると、カバーされている業界の多様性によるものである。著者たちは、5%のマネージャーがこれらの乖離のほとんどを占めていると指摘し、より複雑なシステムが最終的にこれらのユースケースをカバーし、ギャップを埋めることができる可能性があると考えている。

説明責任は自動化するのが難しい

これらの研究結果が将来の関連プロジェクトで裏付けられれば、「銀行マネージャー」の役割が、権威と判断力を持った権限の役割の増え続ける行列に追加される可能性があることを示唆している。つまり、人間のマネージャーが「監視者」の役割に限定される可能性がある。また、これらの研究結果は、特定の重要なタスクが自動化できないという一般的な見方を弱めるものである。

しかし、銀行マネージャーにとっての良いニュースは、政治的な観点から見ると、信用評価などの重要な社会的プロセスにおける人間の説明責任の必要性が、彼らの現在の役割を維持する可能性があることである。つまり、役割の行動が機械学習システムによって完全に再現可能であってもである。

 

2022年2月18日に初めて公開されました。

機械学習のライターであり、ヒューマンイメージシンセシスのドメインスペシャリスト。Metaphysic.aiの研究コンテンツ責任者を務めていたが、DNEGのBrahma.aiへの統合により解散した。
Portfolio site: martinanderson.ai
Contact:martin@martinanderson.ai