Моделі та платформи ШІ
Що таке диференціальна приватність?
Ми живемо в епоху великих даних, яка ще більше звернула увагу на тему захисту даних. Люди виробляють величезну кількість даних кожну секунду, а компанії використовують ці дані для широкого спектра застосувань. Зберігання та обмін даними відбуваються з безпрецедентною швидкістю, тому необхідно розробляти нові методи захисту приватності.
Диференціальна приватність – це один із таких підходів до захисту персональних даних, і вона виявилися більш ефективною, ніж багато традиційних методів. Її можна визначити як систему публічного обміну інформацією про набір даних шляхом опису закономірностей груп у наборі даних, при цьому приховуючи інформацію про окремих осіб у наборі даних.
Диференціальна приватність дозволяє дослідникам і аналітикам баз даних отримувати цінну інформацію з баз даних без розкриття персональної ідентифікаційної інформації про окремих осіб. Це важливо, оскільки багато баз даних містять різноманітну персональну інформацію.
Інший спосіб розгляду диференціальної приватності полягає в тому, що вона створює анонімні дані шляхом введення шуму в набори даних. Введений шум допомагає захистити приватність, залишаючись при цьому достатньо обмеженим, щоб аналітики могли надійно використовувати дані.
У вас можуть бути два майже ідентичні набори даних. Один із вашими персональними даними, інший – без них. З диференціальною приватністю ви можете забезпечити, щоб імовірність того, що статистичний запит дасть певний результат, була однаковою незалежно від того, над яким базом даних він виконувався.
Як працює диференціальна приватність?
Диференціальна приватність працює шляхом введення параметра приватного збитку або бюджету приватності, який часто позначається грецькою літерою епсилон (ε), до набору даних. Ці параметри контролюють, скільки шуму або випадковості додається до сирого набору даних.
Наприклад, уявіть, що у вас є стовпець у наборі даних з відповідями “Так” чи “Ні” від окремих осіб.
Тепер припустимо, що ви підкидаєте монету для кожного окремого особи:
- Орел: відповідь залишається без змін.
- Решка: ви підкидаєте монету вдруге, записуючи відповідь як “Так”, якщо орел, і “Ні”, якщо решка, незалежно від справжньої відповіді.
За допомогою цього процесу ви додаєте випадковість до даних. З великою кількістю даних і інформацією від механізму введення шуму набір даних залишається точним щодо агрегатних вимірювань. Приватність забезпечується тим, що кожна окрема особа може правдоподібно заперечувати свою справжню відповідь завдяки процесу рандомізації.
Хоча це простий приклад диференціальної приватності, він надає базове розуміння. У реальних застосунках алгоритми більш складні.
Також важливо зазначити, що диференціальну приватність можна реалізувати локально, де шум додається до індивідуальних даних до їх централізації в базі даних, або глобально, де шум додається до сирих даних після їх збору з окремих осіб.
Приклади диференціальної приватності
Диференціальна приватність застосовується в широкому спектрі застосувань, таких як системи рекомендацій, соціальні мережі та послуги, засновані на розташуванні.
Ось кілька прикладів того, як великі компанії використовують диференціальну приватність:
- Apple (AAPL ) використовує цей метод для збору анонімних даних про використання пристроїв, таких як iPhone та Mac.
- Facebook (META ) використовує диференціальну приватність для збору даних про поведінку, які можна використовувати для цільової рекламної кампанії.
- Amazon (AMZN ) використовує цю техніку для отримання інформації про персоналізовані вподобання під час покупок, приховуючи при цьому чутливу інформацію.
Apple була особливо відкритою щодо використання диференціальної приватності для отримання інформації про користувачів, зберігаючи при цьому їх приватність.
“Apple прийняла і подальше розвинула техніку, відому в академічному світі як локальна диференціальна приватність, щоб зробити щось дуже цікаве: отримати інформацію про те, що роблять багато користувачів Apple, зберігаючи при цьому приватність окремих користувачів. Це техніка, яка дозволяє Apple дізнатися про спільноту користувачів, не дізнавшись про окремих осіб у цій спільноті. Диференціальна приватність перетворює інформацію, яку користувачі поділилися з Apple, до того, як вона залишить пристрій користувача, так, що Apple ніколи не зможе відновити справжні дані.”
– Огляд диференціальної приватності Apple
Застосування диференціальної приватності
Оскільки ми живемо в епоху великих даних, відбуваються численні порушення даних, які загрожують урядам, організаціям і компаніям. Одночасно сучасні застосування машинного навчання залежать від методів навчання, які вимагають великої кількості навчальних даних, часто отриманих з окремих осіб. Дослідницькі установи також використовують і діляться даними з конфіденційною інформацією. Неправильне розкриття цих даних яким би то ні було способом може спричинити численні проблеми як для окремої особи, так і для організації, а в серйозних випадках це може привести до цивільної відповідальності.
Формальні моделі приватності, такі як диференціальна приватність, вирішують усі ці проблеми. Вони використовуються для захисту персональної інформації, інформації про розташування в реальному часі та іншого.
Використовуючи диференціальну приватність, компанії можуть отримувати доступ до великої кількості чутливої інформації для досліджень або бізнесу без компрометації даних. Дослідницькі установи також можуть розробляти спеціальні технології диференціальної приватності для автоматизації процесів приватності в спільнотах обміну в хмарі, які стають все більш популярними.
Чому використовувати диференціальну приватність?
Диференціальна приватність пропонує кілька основних властивостей, які роблять її відмінною основою для аналізу приватних даних, забезпечуючи при цьому приватність:
- Квантифікація втрати приватності: механізми та алгоритми диференціальної приватності можуть вимірювати втрату приватності, що дозволяє порівнювати її з іншими методами.
- Композиція: оскільки можна квантифікувати втрату приватності, можна також аналізувати та контролювати її над декількома обчисленнями, що дозволяє розробляти різні алгоритми.
- Груповий захист приватності: окрім індивідуального рівня, диференціальна приватність дозволяє аналізувати та контролювати втрату приватності серед більших груп.
- Безпека після обробки: диференціальна приватність не може бути пошкоджена після обробки. Наприклад, аналітик даних не може обчислити функцію виводу алгоритму диференціальної приватності та зробити його менш диференційно приватним.
Переваги диференціальної приватності
Як ми вже зазначали, диференціальна приватність краща, ніж багато традиційних методів захисту приватності. Наприклад, якщо вся доступна інформація є ідентифікуючою інформацією, диференціальна приватність робить її легшою для ідентифікації всіх елементів даних. Вона також стійка до атак на приватність, заснованих на допоміжній інформації, запобігаючи атакам, які можуть бути здійснені на деідентифіковані дані.
Однією з найбільших переваг диференціальної приватності є те, що вона є композиційною, тобто можна обчислити втрату приватності проведення двох різних приватних аналізів над одними й тими ж даними. Це робиться шляхом підсумовування індивідуальних втрат приватності для двох аналізів.
Хоча диференціальна приватність є новим інструментом і може бути важкою для реалізації поза дослідницькими спільнотами, легші для реалізації рішення для захисту даних стають все більш доступними. У найближчому майбутньому ми повинні побачити зростаючу кількість цих рішень, доступних ширшій публіці.












