Лидеры мнений

Объяснимость: следующий рубеж для искусственного интеллекта в страховании и банкинге

mm
Добавьте Unite.AI в избранные источники в Google

Автор: доктор Ори Кац, научный исследователь аналитических данных, Earnix.

«Любая достаточно развитая технология неотличима от магии», — утверждал писатель-фантаст Артур Кларк. Действительно, иногда передовая технология, такая как новые алгоритмы машинного обучения, кажется магией. Эволюционирующие применения машинного обучения, включая классификацию изображений, распознавание голоса и его использование в страховании и банковской сфере, имеют, казалось бы, потусторонние свойства.

Многие компании боятся менять свои традиционные аналитические модели — и не без оснований. Магия опасна, особенно если она не хорошо понята. Нейронные сети и алгоритмы ансамбля деревьев — «черные ящики», их внутренняя структура может быть чрезвычайно сложной. В то же время несколько исследований [1] показали, как нейронные сети и дерево-основанные алгоритмы могут превосходить даже самые тщательно настроенные традиционные модели страхового риска, созданные опытными актуариями. Это связано с их способностью автоматически выявлять скрытую структуру в данных. Загадочность и полезность нейронных сетей и дерево-основанных алгоритмов находятся в противоречии. Существует внутренний компромисс между точностью аналитической модели и ее уровнем «объяснимости». Как мы можем доверять моделям, если не можем понять, как они приходят к своим выводам? Должны ли мы просто сдаться на милость магии, жертвовать нашим доверием и контролем над чем-то, что мы не можем полностью понять, ради точности?

Менеджеры и аналитики не единственные, кто обеспокоен этим компромиссом. В течение последних нескольких лет регулирующие органы начали исследовать темную сторону магии, чтобы повысить свою способность контролировать эти отрасли. Страхование и банковское дело сильно регулируются во многих аспектах, и текущие тенденции регулирования включают более близкий взгляд на модели, используемые для прогнозирования. Например, пункт 71 Общего регламента по защите данных (GDPR) гласит, что клиенты должны иметь право получить объяснение единого автоматического решения после его принятия. С момента его создания этот элемент регламента был в центре бурных академических дискуссий.

Срочная необходимость объяснения «черных ящиков» аналитических моделей привела к появлению новой области исследований: Объяснимый Искусственный Интеллект. Эксперты разрабатывают инструменты, которые позволяют нам заглянуть внутрь черного ящика и распутать, по крайней мере, часть магии. Два типа инструментов, которые создали исследователи, включают «Глобальные инструменты объяснимости», которые могут помочь нам понять ключевые особенности, определяющие общее прогнозирование модели, и «Локальные инструменты объяснимости», предназначенные для объяснения конкретного прогноза.

Следующий график является примером локальной объяснимости. Он основан на идеях лауреата Нобелевской премии по экономике Ллойда Шепли, который разработал метод игровой теории для расчета вклада нескольких игроков, сотрудничающих в одной задаче. В Объяснимом Искусственном Интеллекте «игроками» являются особенности модели, а «задачей» является прогнозирование модели. Числа, описывающие вклад каждой особенности, называются «Значениями Шепли». Исследователи недавно разработали методы быстрой оценки значений Шепли [2], что позволяет нам справедливо распределить прогноз среди различных особенностей.

Использование значений Шепли для объяснения прогнозируемой потребности в продлении для конкретного клиента

График, основанный на симулированных данных, показывает результат модели спроса, которая прогнозирует вероятность продления полиса автострахования. Это локальное объяснение для конкретного клиента. Модель спроса основана на сложном ансамбле деревьев решений, но график представляет отдельный вклад каждой особенности в окончательный прогноз. В этом примере модель прогнозирует, что средний человек в данных продлится полис с вероятностью 0,64. Однако для этого конкретного клиента прогнозируемая вероятность намного выше, 0,72. График позволяет увидеть причину этой разницы.

Хотя мы не можем полностью понять внутреннюю структуру этой сложной модели, значения Шепли позволяют нам увидеть, какие особенности наиболее важны для конкретного прогноза, распутывая часть магии. Усреднение индивидуальных значений Шепли по популяции позволяет нам увидеть, какие особенности наиболее важны и получить глобальную объяснимость модели. Другие популярные инструменты объяснимости включают «Перестановочную важность особенностей», простые суррогатные модели, которые подгоняются локально, и контрфактические примеры, чтобы назвать несколько [3].

Новые инструменты объяснимости являются необходимым следующим шагом в эволюции машинного обучения. Они могут позволить страховым компаниям и банкам понять и доверять своим моделям машинного обучения, соблюдать новые правила и предоставлять своим клиентам ценную информацию. Мы теперь можем частично преодолеть компромисс между точностью и объяснимостью и наслаждаться преимуществами новых моделей машинного обучения с меньшими опасениями по поводу их «черного ящика».

В нашем быстро цифровизирующемся мире становление полностью аналитически-ориентированным является базовым критерием выживания для страховщиков и банков. Эта способность всегда была важной — но она стала жизненно важной с волатильными рыночными условиями, которые 2020 год принес нам. Страховщикам и банкам нужны более умные аналитические данные, чтобы смоделировать сложную новую реальность, на которую они могут основывать свои бизнес-решения и обслуживать своих клиентов быстрее и лучше. Инструменты объяснимости могут позволить страховщикам и банкам достичь этого. Со временем мы придем к тому, что модели машинного обучения больше не будут считаться магией, а важным инструментом в ядре любого данных-ориентированного бизнеса.

Источники:

[1] Bärtl, M., & Krummaker, S. (2020). Прогнозирование претензий в экспортном кредитном финансировании: сравнение четырех методов машинного обучения. Risks, 8(1), 22.

Noll, A., Salzmann, R., & Wuthrich, M. V. (2020). Кейс-стади: французские претензии по третьему лицу. Доступно на SSRN 3164764.

Fauzan, M. A., & Murfi, H. (2018). Точность XGBoost для прогнозирования страховых претензий. Int. J. Adv. Soft Comput. Appl, 10(2).

Weerasinghe, K. P. M. L. P., & Wijegunasekara, M. C. (2016). Сравнительное исследование алгоритмов данных в прогнозировании автостраховых претензий. European International Journal of Science and Technology, 5(1), 47-54.

[2] Lundberg, S. M., & Lee, S. I. (2017). Унифицированный подход к интерпретации прогнозов моделей. В Advances in neural information processing systems (стр. 4765-4774).

[3] Подробнее: https://christophm.github.io/interpretable-ml-book/index.html

Ori Katz является аналитическим исследователем в Earnix, глобальным поставщиком передовых решений для тарификации, ценообразования и персонализации продуктов для страховщиков и банков. Доктор Katz проводит исследования по передовым разработкам в области Data Science и Machine Learning и их применению в страховании и финансах, чтобы разработать будущие направления для продуктов Earnix. Он имеет степень доктора экономических наук, магистра экономических наук и бакалавра промышленной инженерии Тель-Авивского университета. До присоединения к Earnix Ori преподавал экономику в Тель-Авивском университете и Брауновском университете и работал в нескольких исследовательских учреждениях. У него более 10 лет опыта эмпирических исследований.