Взгляд Anderson

‘Простой’ ИИ может предсказать решения менеджеров банков по кредитам с точностью более 95%

mm
Добавьте Unite.AI в избранные источники в Google

Новый исследовательский проект показал, что дискреционные решения, принимаемые человеческими менеджерами банков, могут быть воспроизведены системами машинного обучения с точностью более 95%.

Используя те же данные, которые доступны менеджерам банков в привилегированном наборе данных, лучшим алгоритмом в тесте оказался Random Forest – довольно простой подход, который уже двадцать лет существует, но который все же превосходит нейронную сеть при попытке имитировать поведение человеческих менеджеров банков при принятии окончательных решений о кредитах.

Алгоритм Random Forest, один из четырех, прошедших тестирование в проекте, достигает высокого уровня человеческой оценки vs. производительности менеджеров банков, несмотря на относительную простоту алгоритма. Источник: Managers versus Machines: Do Algorithms Replicate Human Intuition in Credit Ratings?, https://arxiv.org/pdf/2202.04218.pdf

Алгоритм Random Forest, один из четырех, прошедших тестирование в проекте, достигает высокого уровня человеческой оценки vs. производительности менеджеров банков, несмотря на относительную простоту алгоритма. Источник: Managers versus Machines: Do Algorithms Replicate Human Intuition in Credit Ratings?, https://arxiv.org/pdf/2202.04218.pdf

Исследователи, имевшие доступ к проприетарному набору данных из 37 449 кредитных рейтингов по 4 414 уникальным клиентам в «большом коммерческом банке», предполагают на различных этапах предпечатной статьи, что автоматизированный анализ данных, который менеджеры получают для принятия решений, стал настолько точным, что менеджеры банков редко отклоняются от него, потенциально указывая на то, что роль менеджеров банков в процессе одобрения кредитов в основном состоит в том, чтобы сохранить кого-то, whom можно уволить в случае дефолта кредита.

В статье говорится:

‘С практической точки зрения стоит отметить, что наши результаты могут указывать на то, что банк может обработать кредиты быстрее и дешевле в отсутствие человеческих менеджеров кредитов с очень сравнимыми результатами. Хотя менеджеры естественно выполняют множество задач, трудно утверждать, что они необходимы для этой конкретной задачи, и относительно простой алгоритм может выполнить задачу не хуже.

‘Также важно отметить, что с дополнительными данными и вычислительной мощностью эти алгоритмы можно еще больше улучшить.’

Статья называется Managers versus Machines: Do Algorithms Replicate Human Intuition in Credit Ratings? и исходит из Департамента экономики и Департамента статистики Университета Калифорнии в Ирвайне и Банка коммуникаций BBM в Бразилии.

Роботизированное человеческое поведение в оценках кредитного рейтинга

Результаты не означают, что системы машинного обучения обязательно лучше принимают решения о кредитах и кредитных рейтингах, а скорее то, что даже алгоритмы, которые сейчас считаются довольно «низкоуровневыми», способны вывести те же выводы, что и люди, из одних и тех же данных.

Отчет隐но характеризует менеджеров банков как своего рода «мясо-огненный файервол», чья основная оставшаяся функция заключается в том, чтобы повысить рейтинги риска, представленные им статистической и аналитической системой оценки (практика, известная в банковском деле как «нотирование»).

‘Со временем кажется, что менеджеры используют меньше усмотрения, что может указывать на улучшение производительности или зависимость от алгоритмических средств, таких как система оценки.’

Исследователи также отметили:

‘Результаты в этой статье показывают, что эта конкретная задача, выполняемая высококвалифицированными менеджерами банков, может фактически быть легко воспроизведена относительно простыми алгоритмами. Производительность этих алгоритмов можно улучшить, настраивая их для учета различий между отраслями и, конечно, можно легко расширить их для включения дополнительных целей, таких как учет соображений справедливости в кредитных практиках или содействие другим социальным целям.’

Разница в оценке: оценка риска системы оценки (автоматическая) повышается ('нотируется') менеджерами банков, чьи решения были изучены в работе – воспроизводимая процедура.

Разница в оценке: оценка риска системы оценки (автоматическая) повышается (‘нотируется’) менеджерами банков, чьи решения были изучены в работе – воспроизводимая процедура.

Поскольку данные показывают, что менеджеры банков делают это почти алгоритмическим и предсказуемым образом, их корректировки не так сложны для воспроизведения. Процесс просто «переоценивает» исходные данные системы оценки и корректирует рейтинг риска вверх в предсказуемых пределах.

Метод и данные

Заявленная цель проекта заключалась в том, чтобы предсказать, какие решения примут менеджеры банков, на основе системы оценки и других переменных, доступных им, а не в разработке инновационных альтернативных систем, предназначенных для замены существующих процедур одобрения кредитов.

Методы машинного обучения, протестированные в проекте, включали Multinomial Logistic LASSO (MNL-LASSO), нейронные сети и две реализации Classification and Regression Trees (CART): Random Forest и Gradient Boosting.

Проект учитывал как данные системы оценки для реальной задачи кредитного рейтинга, так и ее результат, как известно в данных. Оценка системы оценки является одной из самых старых алгоритмических практик, где ключевые переменные для предложенного кредита рассчитываются в матрицу риска, часто простыми средствами, такими как логистическая регрессия.

Результаты

MNL-LASSO показал худшие результаты среди протестированных алгоритмов, успешно классифицировав только 53% кредитов по сравнению с реальным менеджером в рассматриваемых случаях.

Остальные три метода (с CART, включающим Random Forest и Gradient Boosting) все показали не менее 90% точности и среднеквадратической ошибки (RMSE).

Однако реализация Random Forest CART показала впечатляющую точность gầnко 96%, за которой последовательно следовал Gradient Boosting.

Даже при удалении рейтинга системы оценки из тестов в ходе абляционных исследований (нижняя часть таблицы) алгоритмы показывают необыкновенную производительность при воспроизведении человеческого суждения менеджеров банков по кредитному рейтингу.

Даже при удалении рейтинга системы оценки из тестов в ходе абляционных исследований (нижняя часть таблицы) алгоритмы показывают необыкновенную производительность при воспроизведении человеческого суждения менеджеров банков по кредитному рейтингу.

Удивительно, что исследователи обнаружили, что их реализованный нейронный сеть показал только 93% точности, с более широким разрывом RMSE, производя значения риска, несколько отклоняющихся от человеческих оценок.

Авторы отмечают:

‘[Эти] результаты не указывают на то, что один метод превосходит другой с точки зрения внешнего метрика точности, такого как объективная вероятность дефолта. Возможно, что нейронная сеть, например, лучше всего подходит для этой классификационной задачи.

‘Здесь цель состоит только в том, чтобы воспроизвести выбор человеческого менеджера, и для этой задачи Random Forest, кажется, превосходит все остальные методы по исследованным метрикам.’

5% того, что система не смогла воспроизвести, объясняется, по мнению исследователей, гетерогенностью отраслей, охваченных данными. Авторы отмечают, что 5% менеджеров составляют почти все эти расхождения и считают, что более сложные системы в конечном итоге могут покрыть такие случаи и ликвидировать пробел.

Ответственность трудно автоматизировать

Если это подтвердится в последующих связанных проектах, исследование предполагает, что роль «менеджера банка» может быть добавлена к растущему списку когда-то влиятельных позиций власти и суждения, которые сводятся к «надзирателю» при проверке точности сравнимых машинных систем в долгосрочной перспективе; и подрывает распространенное мнение, что определенные критические задачи не могут быть автоматизированы.

Однако хорошая новость для менеджеров банков заключается в том, что, с политической точки зрения, необходимость человеческой ответственности в критических социальных процессах, таких как оценка кредитного рейтинга, вероятно, сохранит их текущие роли – даже если действия этих ролей могут стать полностью воспроизводимыми системами машинного обучения.

 

Опубликовано впервые 18 февраля 2022 года.

Писатель о машинном обучении, специалист в области синтеза человеческого изображения. Бывший руководитель исследовательского контента в Metaphysic.ai, до его распада в DNEG's Brahma.ai.
Портфолио: martinanderson.ai
Контакт: martin@martinanderson.ai