Интервью
Бейли Каксмар, кандидат на получение степени PhD в Университете Ватерлоо – Серия интервью

Бейли Каксмар – кандидат на получение степени PhD в Школе компьютерных наук Университета Ватерлоо и будущий преподаватель Университета Альберты. Ее исследовательские интересы связаны с разработкой технологий, повышающих конфиденциальность и осведомленность пользователей, посредством параллельного изучения технических подходов для частных вычислений и соответствующих восприятий, проблем и понимания пользователей этих технологий. Ее работа направлена на выявление потенциала и ограничений конфиденциальности в приложениях машинного обучения.
Ваши исследовательские интересы связаны с разработкой технологий, повышающих конфиденциальность и осведомленность пользователей, почему конфиденциальность в ИИ так важна?
Конфиденциальность в ИИ так важна, прежде всего потому, что ИИ в нашем мире не существует без данных. Данные, хотя и являются полезной абстракцией, в конечном итоге описывают людей и их поведение. Мы редко работаем с данными о популяциях деревьев и уровне воды; поэтому, всякий раз, когда мы работаем с чем-то, что может повлиять на реальных людей, нам нужно быть осведомленными об этом и понимать, как наша система может принести пользу или нанести вред. Это особенно верно для ИИ, где многие системы получают пользу от огромных количеств данных или надеются использовать высокочувствительные данные (например, данные о здоровье), чтобы попытаться получить новые знания о нашем мире.
Какие способы предательства конфиденциальности пользователей вы видели в машинном обучении?
Предательство – это сильное слово. Однако, всякий раз, когда система использует информацию о людях без их согласия, без информирования их и без учета потенциального вреда, она рискует предать индивидуальную или социальную норму конфиденциальности. По сути, это результат предательства тысячами мелких шагов. Такие практики могут включать обучение модели на почтовых ящиках пользователей, обучение на текстовых сообщениях пользователей или на данных о здоровье; все без информирования субъектов данных.
Можете ли вы определить, что такое дифференциальная конфиденциальность, и какие ваши взгляды на нее?
Дифференциальная конфиденциальность – это определение или техника, которая приобрела известность в плане использования для достижения технической конфиденциальности. Технические определения конфиденциальности, вообще говоря, включают два ключевых аспекта; что защищается и от кого. В технической конфиденциальности гарантии конфиденциальности – это защиты, которые достигаются при условии выполнения определенных предположений. Эти предположения могут быть связаны с потенциальными противниками, сложностью системы или статистикой. Это невероятно полезная техника, которая имеет широкий спектр применения. Однако, что важно помнить, так это то, что дифференциальная конфиденциальность не эквивалентна конфиденциальности.
Конфиденциальность не ограничивается одним определением или понятием, и важно быть осведомленными о понятиях, выходящих за рамки этого. Например, контекстная целостность – это концептуальное понятие конфиденциальности, которое учитывает такие вещи, как то, как разные приложения или организации изменяют восприятие конфиденциальности человека в отношении ситуации. Также существуют правовые понятия конфиденциальности, такие как те, которые охватываются законами Канады о защите данных (PIPEDA), Общим регламентом по защите данных (GDPR) в Европе и законом о защите потребителей (CCPA) в Калифорнии. Все это говорит о том, что мы не можем рассматривать технические системы как если бы они существовали в вакууме, свободном от других факторов конфиденциальности, даже если используется дифференциальная конфиденциальность.
Другой тип машинного обучения, повышающий конфиденциальность, – это федеративное обучение. Можете ли вы определить, что это такое, и какие ваши взгляды на него?
Федеративное обучение – это способ выполнения машинного обучения, когда модель обучается на коллекции наборов данных, распределенных по нескольким владельцам или местам. Оно не является по своей сути типом машинного обучения, повышающим конфиденциальность. Тип машинного обучения, повышающий конфиденциальность, должен формально определять, что защищается, кто защищается от и условия, которые должны быть выполнены для того, чтобы эти защиты действовали. Например, когда мы думаем о простом дифференциально-приватном вычислении, оно гарантирует, что тот, кто смотрит на выход, не сможет определить, был ли определенный пункт данных внесен или нет.
Более того, дифференциальная конфиденциальность не дает этой гарантии, если, например, существует корреляция между пунктами данных. Федеративное обучение не имеет этого свойства; оно просто обучает модель на коллекции данных без требования к владельцам этих данных直接 предоставлять свои наборы данных друг другу или третьей стороне. Хотя это звучит как функция конфиденциальности, то, что нужно, – это формальная гарантия того, что нельзя узнать защищенную информацию, учитывая посредников и выходы, которые будут наблюдать недостоверные стороны. Эта формальность особенно важна в федеративной среде, где недостоверные стороны включают всех, кто предоставляет данные для обучения коллективной модели.
Каковы некоторые из текущих ограничений этих подходов?
Текущие ограничения можно лучше всего описать как характер компромисса между конфиденциальностью и полезностью. Даже если вы сделаете все остальное, сообщите о последствиях конфиденциальности тем, кто затронут, оцените систему для того, что вы пытаетесь сделать и т. д., все равно сводится к достижению идеального компромисса. Как мы определяем “идеальный” компромисс? Как мы находим правильную точку и строим к ней, чтобы все еще достигать желаемой функциональности, обеспечивая необходимые защиты конфиденциальности.
Вы сейчас стремитесь разработать технологии, повышающие конфиденциальность и осведомленность пользователей, посредством параллельного изучения технических решений для частных вычислений. Можете ли вы рассказать о некоторых из этих решений?
То, что я имею в виду под этими решениями, – это то, что мы можем, свободно говоря, разработать любое количество технических систем конфиденциальности. Однако, делая это, важно определить, достигают ли гарантии конфиденциальности тех, кто затронут. Это может означать разработку системы после того, как мы узнаем, какие виды защиты ценятся населением. Это может означать обновление системы после того, как мы узнаем, как люди фактически используют систему, учитывая их реальные угрозы и соображения риска. Техническое решение может быть правильной системой, удовлетворяющей определению, которое я упомянул ранее. Решение, ориентированное на пользователя, будет проектировать свою систему на основе ввода от пользователей и других, затронутых в предполагаемой области применения.
Вы сейчас ищете заинтересованных аспирантов, чтобы они начали работать в сентябре 2024 года, почему, по вашему мнению, студенты должны быть заинтересованы в конфиденциальности ИИ?
Я думаю, что студенты должны быть заинтересованы, потому что это то, что будет только расти в своей распространенности в нашем обществе. Чтобы иметь представление о том, как быстро эти системы развиваются, посмотрите на недавнее усиление Chat-GPT через новостные статьи, социальные сети и дебаты о его последствиях. Мы существуем в обществе, где сбор и использование данных так глубоко укоренились в нашей повседневной жизни, что мы почти постоянно предоставляем информацию о себе различным компаниям и организациям. Эти компании хотят использовать данные, в некоторых случаях для улучшения своих услуг, в других – для прибыли. На данный момент кажется нереалистичным думать, что эти корпоративные практики использования данных изменятся. Однако, существование систем, повышающих конфиденциальность, которые защищают пользователей, позволяя при этом проводить определенный анализ, желаемый компаниями, может помочь сбалансировать компромисс между рисками и выгодами, который стал такой неявной частью нашего общества.
Спасибо за отличное интервью, читателям, которые хотят узнать больше, следует посетить страницу Бейли Каксмар на Github.












