Модели и платформы ИИ
Устойчивость > Точность: Почему «устойчивость модели» должна быть истинной метрикой для операционализации моделей
Инго Мирсва, Основатель, Президент и Главный Ученый-Датасаентист в RapidMiner.
Датасайенс сделал значительный прогресс в последние несколько лет, и многие организации используют продвинутый анализ или модели машинного обучения, чтобы получить более глубокие знания о процессах и, в некоторых случаях, даже предсказать вероятные результаты будущего. Для других “наук” часто неясно, будет ли проект успешным или нет, и были сообщения о том, что до 87% проектов по науке о данных никогда не доходят до производства. Хотя ожидать 100% успеха нельзя, есть некоторые закономерности в проектах по науке о данных, которые приводят к более высоким показателям успеха, чем должно быть допустимо в этой области. Эти проблемные закономерности, кажется, существуют независимо от любой конкретной отрасли или случая использования, что предполагает, что существует универсальная проблема в науке о данных, которую необходимо решить.
Измерение успеха машинного обучения
Ученые-датасаентисты, создающие модели машинного обучения, полагаются на хорошо определенные математические критерии для измерения того, насколько хорошо эти модели работают. Какой из этих критериев применяется, в основном зависит от типа модели. Допустим, модель должна предсказывать классы или категории для новых ситуаций – например, уйдет ли клиент или нет. В таких ситуациях ученые-датасаентисты используют измерения, такие как точность (насколько часто модель правильна) или точность (насколько часто клиенты действительно уходят, если мы предсказываем уход).
Ученые-датасаентистам нужны объективные критерии, такие как этот, потому что часть их работы заключается в оптимизации этих оценочных критериев для создания лучшей модели. На самом деле, кроме подготовки данных для моделирования, построение и настройка этих моделей – это где ученые-датасаентисты тратят большую часть своего времени.
Недостатком этого является то, что ученые-датасаентисты не сосредотачиваются на том, чтобы поставить эти модели в производство, что является проблемой по нескольким причинам. Прежде всего, модели, которые не дают успешных результатов, не могут быть использованы для генерации бизнес-импакта для организаций, которые их развертывают. Во-вторых, поскольку эти организации потратили время и деньги на разработку, обучение и операционализацию моделей, которые не дали успешных результатов при запуске на “реальных” данных, они с большей вероятностью будут считать, что машинное обучение и другие инструменты науки о данных бесполезны для их организации и откажутся от дальнейших инициатив по науке о данных.
Правда в том, что ученые-датасаентисты просто любят настраивать модели и тратят на это много времени. Но без бизнес-импакта это время не тратится мудро, что особенно болезненно, учитывая, насколько редким ресурсом являются ученые-датасаентисты в современном мире.
Приз Нетфликс и производственная неудача
Мы наблюдали это явление переинвестирования в построение моделей и не в их операционализацию в последние годы. Приз Нетфликс был открытым конкурсом для лучшего алгоритма коллаборативной фильтрации для предсказания пользовательских рейтингов фильмов. Если вы дадите новому фильму высокий рейтинг, вы, скорее всего, наслаждались этим фильмом – поэтому, используя эту систему рейтингов, Нетфликс будет рекомендовать вам определенные названия, и если вы наслаждаетесь рекомендуемым контентом, вы с большей вероятностью останетесь клиентом Нетфликс в течение более длительного периода. Гран-при составил сумму 1 миллион долларов США, которая была вручена команде, которая смогла улучшить алгоритм Нетфликс на 10%.

Конкурс начался в 2006 году, и в течение следующих трех лет вклад более 40 000 команд ученых-датасаентистов во всем мире привел к впечатляющему улучшению более 10% успеха рекомендации названий. Однако модели победившей команды никогда не были операционализированы. Нетфликс заявил, что “увеличение точности не казалось оправданным усилиями, необходимыми для того, чтобы эти модели были введены в производство.”
Почему оптимальное не всегда оптимально
Точность модели и другие критерии науки о данных давно используются в качестве метрики для измерения успеха модели перед тем, как ввести модель в производство. Как мы видели, многие модели никогда даже не доходят до этой стадии – что является расточительством ресурсов, как в плане энергии, так и в плане времени, потраченного.
Но есть еще больше проблем с этой культурой переинвестирования в настройку моделей. Первая проблема заключается в непреднамеренном переобучении на тестовых данных, что приведет к моделям, которые выглядят хорошо для управляющего ученого-датасаентиста, но на самом деле работают плохо, когда они вводятся в производство – иногда даже причиняя вред. Это происходит по двум причинам:
- Существует хорошо известное расхождение между ошибкой тестирования и той, которую вы увидите в производстве
- Бизнес-импакт и критерии производительности науки о данных часто коррелируют, но “оптимальные” модели не всегда дают наибольший импакт
Первая причина выше также называется “переобучением на тестовом наборе“. Это хорошо известное явление, особенно среди участников конкурсов по науке о данных, таких как те, что проводит Kaggle. Для этих конкурсов можно увидеть более сильную версию этого явления уже между публичной и частной досками лидеров. На самом деле, участник мог выиграть публичную доску лидеров в конкурсе Kaggle, не читая данные. Аналогично, победитель частной доски лидеров и общего конкурса может не иметь модели, которая может поддерживать свою производительность на любом другом наборе данных, кроме того, на котором она была оценена.
Точность не равна бизнес-импакту
Слишком долго мы принимали эту практику, которая приводит к медленной адаптации моделей к тестовым наборам данных. В результате то, что кажется лучшей моделью, оказывается посредственной в лучшем случае:
- Измерения, такие как предсказательная точность, часто не равны бизнес-импакту
- Улучшение точности на 1% не может быть переведено в 1% лучший бизнес-результат
- Существуют случаи, когда модель с низкой производительностью превосходит другие модели по бизнес-импакту
- Другие факторы, такие как обслуживание, скорость оценки или устойчивость к изменениям во времени (называемая “устойчивостью”), также должны быть приняты во внимание.
Эта последняя причина особенно важна. Лучшие модели не только выигрывают конкурсы или выглядят хорошо в лаборатории науки о данных, но также будут работать хорошо в производстве и показывать хорошую производительность на различных тестовых наборах. Эти модели – это то, что мы называем устойчивыми моделями.
Дрейф и важность устойчивости
Все модели ухудшаются со временем. Единственный вопрос – как быстро это происходит и насколько хорошо модель все еще работает при измененных обстоятельствах. Причина этого ухудшения заключается в том, что мир не статичен. Следовательно, данные, на которые применяется модель, также изменяются со временем. Если эти изменения происходят медленно, мы называем это “дрейфом концепции”. Если изменения происходят внезапно, мы называем это “сдвигом концепции”. Например, клиенты могут изменить свое потребительское поведение медленно со временем, под влиянием тенденций и/или маркетинга. Модели склонности могут больше не работать в определенный момент. Эти изменения могут быть резко ускорены в определенных ситуациях. COVID-19, например, привел к продаже товаров, таких как туалетная бумага и дезинфицирующие средства – неожиданному резкому увеличению конкретных продуктов, что может полностью выбросить такую модель из строя.
Устойчивая модель может не быть лучшей моделью по критериям, таким как точность или точность, но она будет работать хорошо на более широком наборе данных. По этой причине она также будет работать лучше в течение более длительного периода времени и, следовательно, будет лучше способна обеспечить устойчивый бизнес-импакт.
Линейные и другие простые модели часто более устойчивы, потому что их более трудно переобучить на конкретный тестовый набор или момент времени. Более мощные модели можно и должны использовать как “претендентов” для более простой модели, позволяя ученым-датасаентистам увидеть, может ли она также выдержать испытание временем. Но это должно быть использовано в конце пути, а не в начале пути моделирования.
Хотя формальный показатель для измерения устойчивости еще не был введен в область науки о данных, существуют несколько способов, которыми ученые-датасаентисты могут оценить, насколько устойчивы их модели:
- Меньшие стандартные отклонения в кросс-валидации означают, что производительность модели зависела меньше от конкретных тестовых наборов
- Даже если ученые-датасаентисты не выполняют полную кросс-валидацию, они могут использовать два разных набора данных для тестов и валидации. Меньшая расхождение между скоростями ошибок для тестовых и валидационных наборов данных указывает на более высокую устойчивость
- Если модель правильно отслеживается в производстве, скорости ошибок можно увидеть со временем. Последовательность скоростей ошибок со временем является хорошим знаком устойчивости модели.
- Если решение мониторинга модели учитывает дрейф, ученые-датасаентисты также должны обратить внимание на то, насколько хорошо модель пострадала от этого входного дрейфа.
Изменение культуры науки о данных
После того, как модель была развернута на стадии операционализации, все еще существуют угрозы точности модели. Две последние причины, касающиеся устойчивости модели, уже требуют правильного мониторинга моделей в производстве. Как начало изменения культуры науки о данных, компании хорошо посоветуют инвестировать в правильный мониторинг моделей и начать привлекать ученых-датасаентистов к ответственности за нехватку производительности после того, как модели вводятся в производство. Это сразу же изменит культуру с культуры построения моделей на культуру создания и поддержания ценности для области науки о данных.
Как недавние мировые события показали нам, мир меняется быстро. Теперь, больше чем когда-либо, нам нужно строить устойчивые модели – не только точные. Чтобы захватить значимый бизнес-импакт во времени, Kaggle, например, проводит конкурс, чтобы сплотить ученых-датасаентистов во всем мире и помочь построить решения моделей для использования в глобальной борьбе с COVID-19. Я ожидаю, что наиболее успешные модели, полученные в результате этого конкурса, будут наиболее устойчивыми, а не наиболее точными, как мы видели, насколько быстро данные COVID-19 могут измениться за один день.
Наука о данных должна быть о нахождении истины, а не о производстве “лучшей” модели. Придерживаясь более высокого стандарта устойчивости над точностью, ученые-датасаентисты смогут обеспечить больший бизнес-импакт для наших организаций и помочь положительно формировать будущее.












