Anderson의 관점

기계 학습 모델이 당신을 잊어버리게 하는 방법

mm
Unite.AI를 Google의 선호 소스에 추가

기계 학습 모델에서 특정 데이터를 제거하는 것은 커피에 설탕을 넣은 후 두 번째匙의 설탕을 제거하는 것과 비슷합니다. 데이터는 이미 모델 내의 많은 뉴런과 내在地 연결되어 있습니다. 만약 데이터 포인트가 초기에 높은 차원에서 훈련에 참여한 ‘정의’ 데이터를 나타낸다면, 그것을 제거하면 모델의 기능을 근본적으로 재정의하거나 재훈련을 요구할 수 있습니다.

유럽에서는 GDPR(일반 데이터 보호 규정)의 17조에 따라 회사들이 사용자 데이터를 요청에 따라 제거해야 합니다. 이 법은 데이터 제거가 단순한 데이터베이스 쿼리일 것으로 가정하여 制定되었으며, Draft EU 인공 지능 법은 GDPR의 정신을 인공 지능 시스템에 적용하는 법으로 制定될 것입니다.

전 세계적으로 기계 학습 시스템에서 개인 데이터를 삭제할 수 있는 권리를 부여하는 법률이 고려되고 있으며, 2018年の 캘리포니아 소비자 개인 정보 보호법(CCPA)은 이미 이러한 권리를 제공하고 있습니다.

왜 중요한가

데이터셋이 기계 학습 모델로 훈련될 때, 데이터의 특성은 일반화되고 추상화되어 모델이 데이터에서 원칙과 широк한 경향을 추론하여 특정하고 일반화되지 않은 데이터를 분석할 수 있는 알고리즘을 생성합니다.

그러나 모델 반전과 회원 추론 공격 등의 기술은 기계 학습 모델에서 데이터를 재식별할 수 있는 가능성을 보여주었습니다. 이러한 공격은 데이터의 원본을 노출할 수 있으며, 익명성에 대한 약속으로만 포함된 민감한 데이터도 포함될 수 있습니다.

기계 학습 모델의 기억 소거

따라서 우리는 커피에서 설탕을 제거하는 문제에 직면합니다. 이는 최근 몇 년 동안 연구자들을 괴롭혀 왔습니다. 2021년 EU 지원 논문은 얼굴 인식 알고리즘에서 개인 정보 위험을 비교한 연구로, 몇몇 얼굴 인식 알고리즘이 성별이나 인종 기반의 차별을 가능하게 하는 재식별 공격에 취약하다는 것을 발견했습니다. 2015년 콜롬비아 대학교의 연구는 데이터의 일부를 업데이트하여 기계 학습 모델을 ‘잊어버리게’ 하는 방법을 제안했습니다. 2019년 스탠퍼드 연구자들은 K-평균 클러스터링 구현을 위한 새로운 삭제 알고리즘을 제안했습니다.

최근 중국과 미국의 연구 컨소시엄은 데이터 삭제 접근 방식의 성공을 평가하기 위한統一된 지표와 함께 새로운 ‘잊어버리기’ 방법을 제안했습니다. 이 방법은 Forsaken이라고 불리며, 연구자들은 90% 이상의忘却률을 달성할 수 있으며, 모델의 전체 성능에 대한 정확도 손실은 5% 미만이라고 주장합니다.

논문은 ‘Learn to Forget: Machine Unlearning via Neuron Masking’이라고 불리며, 중국과 버클리 대학교의 연구자들이 참여했습니다.

뉴런 마스킹은 Forsaken의 원리입니다. 이는 특정 데이터를 모델에서 제거하기 위한 필터로 작용하며, 모델을 재훈련하지 않고 업데이트합니다.

생물학적 기원

연구자들은 이 접근 방식이 생물학적过程인 ‘적극적인忘却’에서 영감을 받았다고 합니다. 이는 사용자가 특정 기억의 모든 세포를 제거하기 위해 도파민을 조작하는 것입니다.

Forsaken은 이 과정을 모방하며, 비대상 데이터의 災難적인忘却을 피하기 위해 이 과정의 속도를 늦추거나 중지하는 안전 장치가 있습니다.

효과 제한

기여한 데이터의 삭제는 기계 학습 알고리즘의 기능에 잠재적으로 유해한 영향을 미칠 수 있습니다. 이를 피하기 위해 연구자들은 노름 정규화를 사용했습니다. 이는 일반적인 신경망 훈련에서 과적합을 피하기 위해 사용되는 기능입니다.

데이터셋에 대한 테스트

이 방법은 8개의 표준 데이터셋에서 테스트되었으며, 일반적으로 재훈련보다 높은忘却률을 달성했습니다. 모델의 정확도에 대한 영향은 매우 적었습니다.

모델은 이미 삭제된 데이터의 특성을 추상화하여 알고리즘을 생성했습니다. 따라서 모델을 완전히 재훈련하지 않고는 삭제된 데이터의 영향력을 완전히 제거할 수 없습니다.

기계 학습 분야 작가, 인간 이미지 합성 분야 전문가입니다. Metaphysic.ai의 연구 콘텐츠 책임자였으며, DNEG의 Brahma.ai로의 합병으로 해체될 때까지 그 역할을 수행했습니다.
포트폴리오 사이트: martinanderson.ai
연락처: martin@martinanderson.ai