Лидеры мнений

Три метода сохранения конфиденциальности в машинном обучении, решающие самую важную проблему этого десятилетия

mm
Добавьте Unite.AI в избранные источники в Google

Автор: Амог Таркар, исследователь машинного обучения и искусственного интеллекта, Persistent Systems.

Согласно мнению экспертов из различных областей, конфиденциальность данных станет самой важной проблемой этого десятилетия. Это особенно актуально для машинного обучения, где алгоритмам подвергаются огромные объемы данных.

Традиционно методы машинного обучения полагались на централизацию данных из нескольких источников в одном центре данных. Однако этот подход сопряжен с рядом проблем, связанных с конфиденциальностью. Сбор данных из различных источников стал менее возможным из-за нормативных требований, таких как HIPAA, GDPR и CCPA. Кроме того, централизация данных увеличивает риск несанкционированного доступа и утечки данных.

Чтобы преодолеть эти проблемы, были разработаны несколько методов сохранения конфиденциальности в машинном обучении, которые снижают риск утечки данных и обеспечивают их безопасность. Вот некоторые из наиболее важных методов:

1. Федеративное обучение

Федеративное обучение – это метод обучения машинного обучения, который меняет подход к проблеме сбора данных. Вместо сбора данных для создания единой модели машинного обучения, федеративное обучение объединяет сами модели. Это обеспечивает, что данные не покидают своего источника, и позволяет нескольким сторонам сотрудничать и создавать общую модель машинного обучения без прямого обмена конфиденциальными данными.

Работает это следующим образом. Вы начинаете с базовой модели машинного обучения, которую затем передают каждому клиентскому узлу. Эти узлы затем выполняют локальное обучение на этой модели, используя свои собственные данные. Обновления модели периодически передаются координирующему узлу, который обрабатывает эти обновления и объединяет их, чтобы получить новую глобальную модель. Таким образом, вы получаете информацию из различных наборов данных, не делясь этими данными.

Источник: Persistent Systems

В контексте здравоохранения это невероятно мощный и конфиденциальный инструмент для защиты данных пациентов, одновременно предоставляя исследователям возможность использовать коллективные знания. Не собирая данные, федеративное обучение создает дополнительный уровень безопасности. Однако модели и обновления моделей сами по себе все еще представляют риск, если они не защищены.

2. Дифференциальная конфиденциальность

Модели машинного обучения часто подвергаются атакам на определение принадлежности. Предположим, что вы поделились своими медицинскими данными с больницей, чтобы помочь разработать вакцину против рака. Больница сохраняет ваши данные в безопасности, но использует федеративное обучение для обучения общедоступной модели машинного обучения. Через несколько месяцев хакеры используют атаку на определение принадлежности, чтобы определить, были ли ваши данные использованы при обучении модели или нет. Затем они передают информацию страховой компании, которая, основываясь на вашем риске заболеть раком, может повысить ваши страховые премии.

Дифференциальная конфиденциальность гарантирует, что атаки на модели машинного обучения не смогут определить конкретные данные, использованные при обучении, тем самым снижая риск раскрытия конфиденциальных данных при обучении машинного обучения. Это достигается путем добавления “статистического шума” для нарушения данных или параметров модели машинного обучения во время обучения, что затрудняет проведение атак и определение того, были ли данные конкретного человека использованы при обучении модели.

Например, Facebook недавно выпустил Opacus, высокоскоростную библиотеку для обучения моделей PyTorch с использованием алгоритма дифференциальной конфиденциальности, называемого дифференциально-приватным стохастическим градиентным спуском (DP-SGD). Анимация ниже показывает, как он использует шум для маскировки данных.

 

Этот шум управляется параметром, называемым Эпсилон. Если значение Эпсилон низкое, модель имеет идеальную конфиденциальность данных, но плохую полезность и точность. Если у вас высокое значение Эпсилон, конфиденциальность данных снижается, а точность увеличивается. Секрет в том, чтобы найти баланс, чтобы оптимизировать оба показателя.

3. Гомоморфное шифрование

Стандартное шифрование традиционно несовместимо с машинным обучением, поскольку после шифрования данных они больше не могут быть поняты алгоритмом машинного обучения. Однако гомоморфное шифрование – это специальный вид шифрования, который позволяет выполнять определенные виды вычислений.

Источник: OpenMined

Сила этого заключается в том, что обучение может происходить в полностью зашифрованном пространстве. Это не только защищает владельцев данных, но и защищает владельцев моделей. Владелец модели может выполнять вывод на зашифрованных данных, не видя их и не злоупотребляя ими.

Когда это применяется к федеративному обучению, слияние обновлений моделей может происходить безопасно, поскольку они происходят в полностью зашифрованной среде, что значительно снижает риск атак на определение принадлежности.

Десятилетие конфиденциальности

Когда мы вступаем в 2021 год, сохранение конфиденциальности в машинном обучении – это развивающаяся область с активными исследованиями. Если прошлое десятилетие было о разрушении барьеров для данных, это десятилетие будет о разрушении барьеров для моделей машинного обучения, сохраняя при этом конфиденциальность основных данных с помощью федеративного обучения, дифференциальной конфиденциальности и гомоморфного шифрования. Эти методы представляют собой перспективный новый способ продвижения решений машинного обучения в конфиденциальной манере.

Amogh является исследователем в области машинного обучения и является частью лаборатории исследований искусственного интеллекта в Persistent Systems. Его текущие исследования сосредоточены на применении федеративного обучения и создании инструментов обработки естественного языка для извлечения знаний.