사상 리더

생성적 인공지능에 대한 명확한 솔루션은 무엇인가?

mm
Unite.AI를 Google의 선호 소스에 추가

생성적 인공지능에 따른 개인 정보 보호 위험은 매우 실제적입니다. 증가한 감시와 노출, 그리고 이전보다 더 효과적인 피싱과 보이스 피싱 캠페인 등, 생성적 인공지능은 대규모로, 차별 없이 개인 정보를 침해하며, 악의적인 행위자들에게 개인과 집단을 표적으로 하는 도구를 제공합니다.

이 문제에 대한 가장 명확한 해결책은 소비자와 사용자가 kolektiv로 인공지능에 대한 열기를 거부하고, 인공지능 기능을 개발하거나 구현하는 사람들로부터 투명성을 요구하며, 정부 기관으로부터 효과적인 규제를 요구하는 것입니다. 이러한 해결책은 가치 있지만, 곧 실현되지는 않을 것입니다.

남는 것은 생성적 인공지능의 개인 정보 보호 위험을 완화하는 합리적이고, 비록 불완전한 접근법입니다. 장기적으로, 공공이 데이터 개인 정보 보호에 대해 더 많이 교육을 받을수록, 생성적 인공지능의 대규모 채택으로 인한 개인 정보 보호 위험은 줄어들 것입니다.

우리가 모두 생성적 인공지능에 대한 개념을 올바르게 이해하고 있는가?

인공지능에 대한 열기는 너무나 普遍적이므로, 사람들이 생성적 인공지능을 무엇이라고 하는지 조사하는 것은 거의 필요하지 않습니다. 물론, 이러한 “인공지능” 기능, 기능 및 제품은 실제로 인공지능의 예를 나타내지 않습니다. 대신,它们은 주로 기계 학습(ML), 딥 러닝(DL), 및 대규모 언어 모델(LLM)입니다.

생성적 인공지능, 이름에서 알 수 있듯이, 새로운 콘텐츠를 생성할 수 있습니다. 텍스트(프로그래밍 언어 포함), 오디오(음악 및 인간과 같은 목소리 포함), 비디오(사운드, 대화, 컷, 카메라 변경 포함) 등이 모두 포함됩니다. 이것은 LLM을 훈련시켜 인간이 생성한 콘텐츠에서 패턴을 식별, 일치시켜 재생산하는 것을 통해 달성됩니다.

ChatGPT를 예로 들어 보겠습니다. 많은 LLM과 마찬가지로, 이는 세 가지 광범위한 단계로 훈련됩니다.

  • 사전 훈련: 이 단계에서, LLM은 인터넷, 책, 학술 저널 등에서 텍스트 자료를 “먹입니다”.
  • 감독된 지시 미세 조정: 모델은 인간이 제공한 높은 품질의 지시-응답 쌍을 사용하여 지시에 더 일관되게 응답하도록 훈련됩니다.
  • 인간 피드백에서 강화 학습: ChatGPT와 같은 LLM은 종종 추가 훈련 단계를 거치며, 여기서 인간 사용자와의 상호작용을 사용하여 모델의 일반적인 사용 사례와의 일치를 tinh chỉnh합니다.

모든 훈련 단계는 데이터를 포함합니다. 사전 훈련에 사용되는 대규모 사전 수집된 데이터 또는 강화 학습에서 사용되는 거의 실시간으로 수집 및 처리되는 데이터 등이 모두 포함됩니다. 생성적 인공지능에서 개인 정보 보호 위험을 초래하는 것은 바로 이러한 데이터입니다.

생성적 인공지능에 따른 개인 정보 보호 위험

개인 정보 보호는 개인 정보가 개인의 동의 없이 다른 개인이나 단체에 공개될 때 침해됩니다. LLM은 개인 데이터를 포함할 수 있는 매우 광범위한 데이터로 사전 훈련되고 미세 조정됩니다. 이러한 데이터는 일반적으로 공개적으로 उपलब있는 출처에서 수집되지만, 항상 그런 것은 아닙니다.

공개적으로 उपलब있는 출처에서 가져온 데이터라도, LLM의 인터페이스를 통해 검색할 수 있도록 집계되고 처리되면, 이는 개인 정보 보호의 추가적인 침해로 간주될 수 있습니다.

인간 피드백에서 강화 학습 단계는 상황을 복잡하게 만듭니다. 이 훈련 단계에서, 실제 인간 사용자와의 상호작용을 사용하여 LLM의 응답을 반복적으로 수정하고 tinh chỉnh합니다. 이는 사용자의 LLM과의 상호작용이 데이터에 접근할 수 있는 사람들에 의해 볼 수 있고, 공유되고, 전파될 수 있음을 의미합니다.

대부분의 경우, 이는 개인 정보 보호 침해가 아닙니다. 대부분의 LLM 개발자는 개인 정보 보호 정책과 서비스 약관을 포함하여 사용자가 LLM과 상호작용하기 전에 동의하도록 요구합니다. 그러나 여기에는 개인 정보 보호 위험이 있습니다. 많은 사용자가 이러한 데이터 수집 및 사용에 동의했다는 사실을 인식하지 못합니다. 이러한 사용자는 이러한 시스템과 상호작용할 때 개인 정보 및 민감한 정보를 공개할 가능성이 있습니다.

이렇게 해서, 우리는 생성적 인공지능이 개인 정보 보호 위험을 세 가지 주요 방법으로 초래한다는 것을 알 수 있습니다.

  • 사전 훈련 데이터의 대규모 저장소는 개인 정보를 포함할 수 있으며, 위협에 노출될 수 있습니다.
  • 사전 훈련 데이터에 포함된 개인 정보는 LLM의 응답을 통해 다른 사용자에게 누출될 수 있습니다.
  • LLM과의 상호작용에서 제공된 개인 및 기밀 정보는 LLM의 직원 및 가능하면 제3자 계약자에게 전달될 수 있으며, 그곳에서 볼 수 있거나 누출될 수 있습니다.

이 모든 것은 사용자의 개인 정보 보호에 대한 위험입니다. 그러나 개인 식별 정보가 잘못된 손에 넘어가는可能性은 아직 낮아 보입니다. 그러나 데이터 브로커가 등장하면, 이러한 개인 데이터가 공개되는可能性은 훨씬 더 높아집니다.

개인 식별 정보와 기타 개인 데이터는 상품이 되어, 데이터 브로커 산업이 이를 수집, 집계, 전파하기 위해 등장했습니다. 이러한 개인 데이터가 “공개”되면, 데이터 브로커에 의해 수집되고,廣く 확산될可能性이 있습니다.

생성적 인공지능의 개인 정보 보호 위험을 이해하는 맥락

생성적 인공지능이 개인 정보 보호에 미치는 위험을 제품, 서비스, 기업 파트너십의 맥락에서 살펴보기 전에, 생성적 인공지능의 전체적인 위험을 구조적으로 살펴보겠습니다. IAPP의 Moraes와 Previtali는 Solove의 2006년 “개인 정보 보호의 분류”를 데이터 기반 접근 방식으로 재정의하여, 16개의 개인 정보 보호 위험을 12개의 인공지능 관련 개인 정보 보호 위험으로 축소했습니다.

이 12개의 개인 정보 보호 위험은 다음과 같습니다.

  • 감시: 인공지능은 개인 데이터 수집의 규모와 普遍성을 증가시켜 감시 위험을 악화시킵니다.
  • 식별: 인공지능 기술은 다양한 데이터 소스에서 개인 식별을 자동으로 연결하여 개인 식별 노출에 대한 위험을 증가시킵니다.
  • 집계: 인공지능은 개인에 대한 다양한 데이터를 결합하여 추론을 생성하여 개인 정보 보호 침해의 위험을 증가시킵니다.
  • 프레놀로지와 피지오노미: 인공지능은 물리적 특징에서 성격 또는 사회적 속성을 추론하여 새로운 개인 정보 보호 위험을 생성합니다.
  • 이용: 인공지능은 개인 데이터를 원래 목적과 다른 목적으로 사용하여 개인 정보 보호 침해의 위험을 증가시킵니다.
  • 제외: 인공지능은 사용자에게 데이터 사용에 대한 통제나 정보를 제공하지 않아 개인 정보 보호 위험을 증가시킵니다.
  • 불안정성: 인공지능은 데이터 유출이나 불법적인 접근의 위험을 증가시킵니다.
  • 노출: 인공지능은 생성적 인공지능 기술을 통해 민감한 정보를 공개할 수 있습니다.
  • 왜곡: 인공지능은 사실과 다른 정보를 생성하여 개인 정보 보호를 침해할 수 있습니다.
  • 공개: 인공지능은 개인 데이터를 다른 사람에게 공개하여 개인 정보 보호를 침해할 수 있습니다.
  • 접근성 증가: 인공지능은 민감한 정보를 더 많은 사람에게 공개할 수 있습니다.
  • 침입: 인공지능은 개인의 사생활을 침해할 수 있습니다.

이것은 khá 심각한 개인 정보 보호 위험입니다. 생성적 인공지능은 사실과 다른 정보를 생성하여 개인 정보 보호를 침해할 수 있습니다. 이러한 현상은 개인 정보 보호를 침해할 수 있습니다.

구체적인 예를 살펴보겠습니다.

텍스트 기반 생성적 인공지능 시스템과 직접 상호작용

가장 간단한 경우는 사용자가 생성적 인공지능 시스템과 직접 상호작용하는 경우입니다. 사용자의 상호작용은 기록되고, 저장되고, 강화 학습 및 사전 훈련에 사용됩니다.

이러한 서비스의 개인 정보 보호 정책을 분석하면, 다른 목적을 위한 데이터 공유 활동이 나타납니다. 이는 생성적 인공지능이巨大한 데이터 수집 통로로 작용하여 사용자 제공 데이터와 상호작용 데이터를 수집합니다.

내장된 생성적 인공지능 시스템과 상호작용

일부 사용자는 내장된 생성적 인공지능 인터페이스와 상호작용할 수 있습니다. 사용자는 “인공지능” 기능을 사용하고 있음을 알지만, 데이터 개인 정보 보호 위험을 인식하지 못할 수 있습니다. 내장된 시스템의 경우, 사용자는 LLM과 상호작용할 때 개인 데이터가 개발자나 데이터 브로커에게 전달될 수 있다는 사실을 인식하지 못할 수 있습니다.

이 경우, 두 가지 정도의 무지함이 존재합니다. 일부 사용자는 생성적 인공지능 제품과 상호작용하고 있음을 인식합니다. 일부 사용자는 생성적 인공지능이 내장된 제품을 사용하고 있음을 인식하지 못합니다. 어느 경우든, 사용자는 기술적으로 인터페이스와의 상호작용에 동의했을 것입니다.

사용자를 생성적 인공지능 시스템에 노출시키는 기타 파트너십

일부 회사들은 소프트웨어에 생성적 인공지능 인터페이스를 내장하거나 포함시킵니다. 이는 사용자가 제3자와 상호작용하고 정보를 공유하는 것을 알지 못하게 할 수 있습니다.幸い, “인공지능”은 판매 포인트가 되어, 이러한 구현을 비밀로 유지하는 것은 어려울 것입니다.

또 다른 현상은 이러한 회사들이 사용자 또는 고객 데이터를 생성적 인공지능 회사와 공유하려고 시도했을 때 발생하는 반발입니다. 데이터 제거 회사인 Optery는 최근 OpenAI와의 사용자 데이터 공유 계획을 취소했습니다.

고객들은 이러한 결정에 대해 불만을 표시했으며, Optery의 데이터 제거 서비스는 Privacy Guides의 추천 목록에서 삭제되었습니다. Optery는 결정을 취소했지만, 이러한 반발이 중요합니다. 사람들은 데이터를 “인공지능” 회사와 공유하는 위험을 인식하기 시작했습니다.

Optery의 경우는 좋은 예입니다. Optery의 사용자는 데이터 제거 서비스를 사용하는 사람들입니다. 이러한 사용자들은 일반적으로 변경된 서비스 약관이나 개인 정보 보호 정책을 주의깊게 살펴봅니다.

생성적 인공지능 데이터 사용에 대한 반발의 증거

개인 정보 보호에 대한 관심이 높은 소비자뿐만 아니라, 입법부에서도 생성적 인공지능 시스템과 관련된 개인 정보 보호 위험에 대한 우려를 표명했습니다. EU의 인공지능법은 위험을 심각성에 따라 분류하며, 대부분의 경우에 데이터 개인 정보 보호가 명시적 또는 암시적인 기준입니다.

미국은 종합적인 데이터 개인 정보 보호 법안을 채택하는 데 느렸지만, 인공지능 기술의 개발과 사용에 대한 안전하고 신뢰할 수 있는 방법을 제공하기 위한 행정 명령이 있습니다. 다시 한번, 데이터 개인 정보 보호가 주요 우려事項입니다.

소비자 수준으로 돌아가면, 개인 정보 보호에 대한 관심이 높은 소비자뿐만 아니라, Microsoft의 “인공지능” 기능에 대한 반발이 있었습니다. Microsoft의 Recall 기능은 Windows 11 운영 체제에 예정되어 있었으나, 개인 정보 보호 및 보안 위험으로 인해 반발이 있었습니다.

Microsoft는 초기에 반발에 대해 후퇴했지만, Recall 기능을 다시 도입하려고 합니다. 초기 반발은 개인 정보 보호에 대한 관심이 증가하고 있음을 보여줍니다.

Microsoft의 Copilot 프로그램은 데이터 개인 정보 보호 및 보안 문제로 인해 비판을 받았습니다. 또한, Microsoft는 프로그래머와 개발자의 소프트웨어 라이선스 계약을 위반한 것으로 비난을 받았습니다. 이는 데이터 개인 정보 보호와 지적 재산권 사이의 경계가模糊해지는 경우입니다.

아마도 가장 큰 표시가 Apple의 초기 인공지능 출시에 대한 대중의 반응입니다. Apple은 데이터 공유 계약에 대한 우려로 인해 인공지능에 대한 관심이 낮았습니다.

일부 해결책

입법자, 개발자, 회사들은 생성적 인공지능의 일부 위험을 완화하기 위한 단계를 취할 수 있습니다. 이러한 접근 방식은 특정 문제에 대한 전문적인 해결책입니다. 하나의 해결책만으로는 충분하지 않지만, 모두 함께 작용하면 실제로 차이를 만들 수 있습니다.

  • 데이터 최소화: 수집 및 저장되는 데이터의 양을 최소화하는 것이 합리적인 목표입니다. 그러나, 생성적 인공지능 개발자의 훈련 데이터에 대한 요구와는 정면으로 충돌합니다.
  • 투명성: 현재의 기계 학습 기술 상태에서, 이는 기술적으로 불가능할 수 있습니다. 생성 출력을 생성할 때 처리되는 데이터와 방법에 대한 통찰력이 투명성의 한 가지 방법입니다.
  • 匿名化: 훈련 데이터에서 제거할 수 없는 개인 식별 정보는匿名화되어야 합니다. 그러나, 많은 匿명화 및 가명화 기술은 쉽게 극복될 수 있습니다.
  • 사용자 동의: 사용자가 데이터 수집 및 공유에 동의하도록 요구하는 것이 필수적입니다. 그러나, 이는 남용에 취약하며, 소비자의 무심코 동의로 인해 효과적이지 않을 수 있습니다.
  • 데이터의 안전한 전송 및 저장: 데이터 개인 정보 보호 및 보안의 또 다른 기초입니다. 데이터를 보호하기 위한 암호화 및 기타 수단을 사용하여 항상 더 효과적으로 만들 수 있습니다. 그러나, 생성적 인공지능 시스템은 인터페이스를 통해 데이터를 누출시키는 경향이 있습니다.
  • 저작권 및 지적 재산권 법의 집행: 인공지능의 맥락에서, 기계 학습은 “블랙 박스”로 작동하여, 저작권 물질 및 지적 재산권이 생성적 인공지능 출력에 포함되는 것을 추적하기 어렵게 만듭니다.
  • 감사: 또 다른 중요한 방어 수단입니다. 그러나, LLM과 생성적 인공지능 시스템의 “블랙 박스” 특성으로 인해, 감사가 개발자의 편의에 따라 수행될 수 있습니다.

이 모든 접근 방식은 유효하며, 필요한 것입니다. 그러나, 입법적 지원이 없으면, 이러한 해결책은 효과적이지 않을 것입니다.

명확한 해결책

생성적 인공지능의 개인 정보 보호 위험에 대한 해결책은 혁신적이거나 흥미롭지 않을 수 있습니다. 그러나, 논리적으로 추론하면, 결과는 혁신적이거나 흥미롭게 될 수 있습니다. 명확한 해결책은 일상적인 소비자가 자신의 데이터의 가치와 데이터 개인 정보 보호의 무가치함을 인식하는 것입니다.

소비자는 개인 정보를 제공하는 원천이자, 현대적인 감시 경제의 원동력입니다. 일단 소비자의 다수가 개인 정보의 흐름을 공개 영역으로부터 차단하기 시작하고, 데이터를 다루는 회사에 책임을 요구하기 시작하면, 시스템은 스스로 수정될 것입니다.

생성적 인공지능의 장점은, 현재의 광고 및 마케팅 모델과 달리, 개인 정보를 포함하지 않아도 된다는 것입니다. 사전 훈련 및 미세 조정 데이터에는 개인 식별 정보나 개인 데이터가 포함될 필요가 없으며, 사용자는 생성적 인공지능 시스템과 상호작용할 때도 개인 정보를 공개할 필요가 없습니다.

사용자는 훈련 데이터에서 자신의 프로필을 제거하여 개인 데이터를 제거할 수 있습니다. 데이터 제거 서비스는 이 과정을 자동화하여 쉽게 만들 수 있습니다. 물론, 이러한 회사에서 데이터를 제거하는 것은 다른ประโยชน도 있습니다.

사용자는 또한 소프트웨어와 상호작용할 때 개인 데이터를 생성합니다. 이러한 데이터의 흐름을 막기 위해서는, 사용자는 온라인 시스템에 공개하는 것을 제한하고, 가능한 경우 온디바이스, 오픈 소스 LLM을 사용해야 합니다. 사람들은 이미 공공에서 논의하는 것을 조절하는 데 хорош게 일을 합니다. 우리는 이러한 본능을 생성적 인공지능의 영역으로 확장해야 합니다.

David Balaban은 17년 이상의 악성 코드 분석 및 안티바이러스 소프트웨어 평가 경험을 가진 컴퓨터 보안 연구자입니다. David는 MacSecurity.net Privacy-PC.com 프로젝트를 운영하며, 사회 공학, 악성 코드, 침투 테스트, 위협 인텔리전스, 온라인 개인 정보 보호, 화이트 해트 해킹을 포함한 현대 정보 보안 문제에 대한 전문가 의견을 제공합니다. David는 강력한 악성 코드 문제 해결 배경을 가지고 있으며, 최근에는 랜섬웨어 대책에 중점을 두고 있습니다.