Anderson의 관점
실제 세계 이메일 주소를 사전 학습된 자연어 모델에서 가져오기

미국에서 수행된 새로운 연구에 따르면 GPT-3와 같은 사전 학습된 언어 모델(PLM)은 실제 세계 이메일 주소를 성공적으로 추출할 수 있다고 합니다. 이러한 모델은 이메일 주소를 포함한大量의 데이터로 학습되었습니다.
현재, 언어 모델에 특정 사람에 대한 정보를 질의하여 실제 이메일 주소를 얻는 것은 어렵습니다. 그러나 연구에 따르면, 언어 모델의 크기가 클수록 이러한 종류의 데이터를 추출하기가 더 쉽습니다. 또한, 질의가 더 구체적이고 정보가 풍부할수록, 기능적인 이메일 주소를 얻을 수 있는 가능성이 더 높습니다.
연구 논문은 다음과 같이 말합니다:
‘결과는 PLM이 많은 이메일 주소를 기억하고 있지만, 이름과 이메일 주소 간의 정확한 연관성을 이해하지 못한다는 것을 보여줍니다. 따라서, 이메일 주소의 맥락을 고려할 때, PLM은 상당수의 이메일 주소를 회복할 수 있지만, 이름으로 질의할 때 정확하게 예측되는 이메일 주소는 몇 개뿐입니다.’
이론을 테스트하기 위해, 연구자들은 점점 커지는 크기와 매개변수를 가진 세 개의 PLM을 학습시키고, 공격자가 사용할 가능성이 있는 템플릿과 방법에 따라 질의했습니다.
논문은 PLM이 실제 세계 개인 정보를 포함하는大量의 훈련 데이터에 대한 위험에 대한 세 가지 주요 통찰력을 제공합니다.
첫째, 긴 텍스트 패턴(질의에서)이 개인에 대한 사적인 정보를 얻을 가능성을 증가시킵니다. 둘째, 공격자가 이미 알고 있는 정보를 사용하여 공격을 강화할 수 있습니다. 셋째, 더 큰 자연어 처리 모델은 공격자가 더 많은 정보를 추출할 수 있도록 허용할 수 있습니다.
마지막으로, 연구자들은 개인 정보가 실제로 모델의 기억을 통해 유지되고 누출될 수 있다고 결론지었습니다.
연구자들은 다음과 같이 말합니다:
‘맥락 설정 결과, 가장 큰 GPT-Neo 모델은 8.80%의 이메일 주소를 기억을 통해 올바르게 회복할 수 있습니다.’
‘이 설정은 다른 설정보다 덜 위험하지만, 사용자가 공공 데이터가 아닌 경우 맥락을 알 수 없기 때문에, 이메일 주소가 우발적으로 생성될 수 있고, 이러한 위협을 무시할 수 없습니다.’
연구는 이메일 주소를 예로 들어, 이러한 종류의 개인 정보가 어떻게 취약할 수 있는지 보여줍니다. 연구자들은 이메일 주소가 아닌 다른 종류의 개인 정보도 취약할 수 있다고 주장합니다.
연구 논문은 Are Large Pre-Trained Language Models Leaking Your Personal Information?라는 제목으로, 일리노이 주 어바나-샴페인 대학교의 세 명의 연구자에 의해 작성되었습니다.
기억과 연관
연구는 기억된 정보가 연관되는 정도에 중점을 두었습니다. 훈련된 언어 모델은 훈련 데이터를 완전히 추상화할 수 없습니다. 그렇지 않으면, 모델은 논리적인 논증을 유지하거나 사실 데이터를 제공할 수 없습니다. 따라서, 모델은 기억하고 보호할 수 있는 데이터의 작은 단위로 작동합니다.
큰 질문은 모델이 기억된 정보를 다른 종류의 정보, 예를 들어 이름과 같은 엔티티를 사용하여 회복할 수 있는지입니다. 예를 들어, 모델은 엘론 머스크의 이메일 주소와 같은 개인 정보를 포함할 수 있습니다.
최악의 경우, 모델에 엘론 머스크의 이메일 주소를 묻는 질의를 하면, 모델은 이메일 주소를 제공할 수 있습니다.
그러나, 이러한 경우는 거의 발생하지 않습니다. 모델은 기억된 정보를 회복하기 위해 더 많은 맥락이 필요합니다.
추가로, 연관성은 임의적이지 않지만, 예측 가능한 선형적이지도 않습니다. 연관성은 다른 손실 목표를 사용하여 훈련된 가중치에 따라 발생할 수 있습니다.
PLM 테스트
연구자들은 GPT-Neo 언어 모델의 세 가지 버전을 테스트했습니다. 각 모델은 125 백만, 13 억, 27 억 매개변수를 가지고 있었습니다.
연구자들은 Pile 데이터셋을 사용하여 모델을 훈련시켰습니다. Pile 데이터셋은 공공 데이터셋의 모음입니다. Enron 데이터베이스는 이메일 교환에 기반한 소셜 네트워크 정보를 포함합니다.
연구자들은 이메일 주소와 이름의 페어를 필터링했습니다. 이름과 이메일 주소가 같은 토큰을 포함하는 페어는 필터링했습니다.
연구자들은 맥락 설정, 제로샷 설정, 그리고 몇 샷 설정을 사용하여 모델을 테스트했습니다.

제로샷 프롬프트 템플릿
마지막으로, 연구자들은 규칙 기반 방법을 사용하여 이메일 주소를 회복했습니다. 이 방법은 표준 이메일 주소 패턴의 28 가지 변형을 사용했습니다.

규칙 기반 패턴
결과
맥락 설정 실험에서, GPT-Neo 모델은 8.80%의 이메일 주소를 올바르게 회복했습니다.

맥락 설정 결과
제로샷 설정 실험에서, PLM은 표준 패턴에 따라 이메일 주소를 올바르게 예측했습니다.

제로샷 결과
연구자들은 0-샷 설정에서 더 긴 프레픽스를 사용하여 더好的 결과를 얻을 수 있었다는 것을 발견했습니다.
‘이것은 PLM이 기억된 시퀀스를 기반으로 예측을 하는 것을 보여줍니다. 연관성을 기반으로 예측을 하는 경우, 0-샷 설정에서 더好的 결과를 얻을 수 있습니다.’
더 큰 모델, 더 높은 위험
연구자들은 더 큰 모델이 개인 정보를 추출할 수 있는 위험을 증가시킬 수 있다고 주장합니다.
‘모든 알려진 도메인, неизвест 도메인, 및 맥락 설정에서, 125M 모델에서 1.3B 모델로 변경할 때 정확도가 향상됩니다. 대부분의 경우, 1.3B 모델에서 2.7B 모델로 변경할 때도 정확도가 향상됩니다.’
연구자들은 두 가지 가능한 설명을 제공합니다. 첫째, 더 큰 모델은 더 많은 훈련 데이터를 기억할 수 있습니다. 둘째, 더 큰 모델은 더 복잡하고, 공격자가 제작한 프롬프트를 이해할 수 있습니다.
연구자들은 현재 상태에서 개인 정보는 비교적 안전하다고 주장합니다.
연구자들은 또한 공격을 방어하기 위한 몇 가지 방법을 제안합니다. 첫째, 모델을 훈련하기 전에 개인 정보를 필터링해야 합니다. 둘째, 차별적으로 사적인 그래디언트 하강법을 사용하여 모델을 훈련해야 합니다. 셋째, 모델을 사용하는 환경에서 필터를 추가해야 합니다.
연구자들은 또한 표준 패턴에 따라 이메일 주소를 사용하지 말 것을 권고합니다.
* 저자의 인용을 위한 하이퍼링크를 추가했습니다.
最初에 2022년 5월 26日に 게시되었습니다.












