Anderson의 관점

LLM 데이터 누출로부터 프롬프트 보호

mm
Unite.AI를 Google의 선호 소스에 추가
ChatGPT-4o: 'Orthographic 1792x1024 view of a SIMs-like police officer holding up his hand to a citizen to stop them going any further'

의견 IBM NeurIPS 2024에서 interessante 제출이 2024년 말에 Arxiv에 다시 나타났습니다. 이는 사용자가 대화형 에이전트와 상호 작용할 때 개인 정보나 민감한 정보를 메시지에 제출하는 것을 자동으로 방지할 수 있는 시스템을 제안합니다. 예를 들어, ChatGPT와 같은 대규모 언어 모델(LLM)입니다.

사용자 연구에서 프롬프트 개입 서비스와 상호 작용하는 방법을 결정하기 위해 사용된 모의 예시. 출처: https://arxiv.org/pdf/2502.18509

사용자 연구에서 프롬프트 개입 서비스와 상호 작용하는 방법을 결정하기 위해 사용된 모의 예시. 출처: https://arxiv.org/pdf/2502.18509

위에 표시된 모의 예시는 IBM 연구자들이 이러한 종류의 ‘간섭’에 대한 잠재적인 사용자 마찰을 테스트하기 위해 사용되었습니다.

GUI 구현에 대한 자세한 정보는 제공되지 않지만, 이러한 기능은 브라우저 플러그인과 로컬 ‘방화벽’ LLM 프레임워크와 통신하거나 OpenAI API와 직접 연결하여 OpenAI의 자체 다운로드 가능한 独立 프로그램을 재현할 수 있습니다. 그러나 이 경우에는 추가적인 안전 기능이 포함됩니다.

그렇지만, ChatGPT 자체는 자동으로 중요한 정보를 포함하는 것으로 인식되는 프롬프트에 대한 응답을 자체적으로 검열합니다. 예를 들어, 은행 계좌 정보와 같은 경우입니다.

ChatGPT는 중요 보안 정보를 포함하는 프롬프트와 상호 작용하기를 거부합니다. 위의 프롬프트에 있는 세부 정보는 허구적이며 비기능적입니다. 출처: https://chatgpt.com/

ChatGPT는 중요 보안 정보를 포함하는 프롬프트와 상호 작용하기를 거부합니다. 출처: https://chatgpt.com/

그러나 ChatGPT는 다른 유형의 개인 정보에 대해서는 훨씬 더 관대합니다. 이러한 정보를 어떤 방식으로든 공개하는 것이 사용자의 최선의 interes에 반하는 경우에도 마찬가지입니다(이 경우에는 다양한 이유로 인해 작업 및 공개와 관련된 경우입니다).

위의 예시는 허구적이지만, ChatGPT는 잠재적인 평판 또는 수익 위험을 구성하는 민감한 주제에 대한 사용자와의 대화에 주저하지 않습니다. 위의 예시는 완전히 허구적입니다.

위의 예시는 허구적이지만, ChatGPT는 잠재적인 평판 또는 수익 위험을 구성하는 민감한 주제에 대한 사용자와의 대화에 주저하지 않습니다.

위의 경우, 다음과 같이 작성하는 것이 더 좋았을 것입니다. ‘백혈병 진단이 사람의 글쓰기 능력과 이동성에 미치는 영향은 무엇입니까?’

IBM 프로젝트는 이러한 요청을 ‘개인’에서 ‘일반’ 입장으로 식별하고 재해석합니다.

민감한 자료가 포함된 잠재적인 프롬프트에서 로컬 LLM 또는 NLP 기반 유추를 사용하는 IBM 시스템의 스키마.

민감한 자료가 포함된 잠재적인 프롬프트에서 로컬 LLM 또는 NLP 기반 유추를 사용하는 IBM 시스템의 스키마.

이것은 온라인 LLM에 의해 수집된 자료가 향후 모델이나 광고 프레임워크에 제공되지 않을 것이라고 가정합니다. 이러한 광고 프레임워크는 사용자 기반 검색 쿼리를 사용하여 타겟 광고를 제공할 수 있습니다.

그러나 이러한 시스템이나安排은 현재 알려지지 않았지만, 인터넷 초기 채택 시에도 이러한 기능은 아직 제공되지 않았습니다. 그 이후로, 정보를 개인화된 광고를 위해 공유하는 것은 다양한 스캔들 및 패러노이아를 초래했습니다.

따라서, 이러한 데이터가大量으로 축적되기 전에 LLM 프롬프트 입력을 제거하는 것이 좋습니다. 또한 이러한 제출이 영구적인 사이클릭 데이터베이스 및 모델 또는 다른 정보 기반 구조 및 스키마에 끝나기 전에 제거하는 것이 좋습니다.

나를 기억해줘?

‘일반’ 또는 제거된 LLM 프롬프트를 사용하는 것에 반대하는 한 가지 요인은, 솔직히, 비싼 API 전용 LLM인 ChatGPT를 사용자 지정하는 기능이 현재 기술 수준에서 매우 매력적이라는 것입니다. 그러나 이것은 개인 정보의 장기 노출을 포함할 수 있습니다.

나는 ChatGPT에게 윈도우 PowerShell 스크립트와 BAT 파일을 자동화하는 데 도움을 주고, 기술적인 문제에 대해 자주 질문합니다. 이를 위해, 시스템이 영구적으로 내 하드웨어, 기술적인 스킬, 환경 요인 및 사용자 정의 규칙에 대한 정보를 기억하는 것이 유용하다고 생각합니다.

ChatGPT는 사용자가 미래의 프롬프트에 대한 응답을 고려할 때 적용할 '기억' 캐시를 개발할 수 있도록 합니다.

ChatGPT는 사용자가 미래의 프롬프트에 대한 응답을 고려할 때 적용할 ‘기억’ 캐시를 개발할 수 있도록 합니다.

이것은 결국 외부 서버에 정보를 저장하게 되며, 이는 시간이 지남에 따라 변경될 수 있는 조건과 약관에 따라 저장됩니다. OpenAI(또는 다른 주요 LLM 제공업체)는 이러한 조건을 존중할 것이라는 보장이 없습니다.

일반적으로, ChatGPT에서 기억 캐시를 구축하는 능력은 LLM의 제한된 주의 창으로 인해 가장 유용합니다. 이러한 캐시가 없으면, 사용자는 기억력 결핍을 가진 엔티티와 대화하는 것처럼 느끼게 됩니다.

이것은 새로운 모델이 캐시된 기억 없이 유용한 응답을 제공할 수 있을지, 또는 온라인에서 저장된 사용자 지정 GPT를 생성할 수 있을지 difficile로 말할 수 있습니다.

일시적인 기억 상실

ChatGPT 대화가 ‘일시적’으로 설정할 수 있지만, 참조로 사용할 수 있는 채팅 기록이 있고, 시간이 허락한다면, 더 일관된 로컬 기록으로 요약할 수 있습니다. 그러나 우리는 이러한 ‘ 폐기’된 채팅이 어떻게 처리되는지 정확히 알 수 없습니다(OpenAI는 명시했지만, 이러한 채팅이 삭제되지 않는다고 명시하지는 않았습니다). 채팅 기록에 더 이상 나타나지 않는다는 사실만 알고 있습니다.

最近의 논란은 OpenAI와 같은 API 기반 제공업체가 사용자의 개인 정보를 보호하는 것을 맡겨서는 안 된다는 것을 나타냅니다. 이는 emergent memorization의 발견을 포함하여, 더 큰 LLM이 일부 훈련 예제를 전체로 기억할 가능성이 높아지고, 사용자별 데이터를 공개하는 위험이 증가하는 것을 포함합니다.

다르게 생각해봐

LLM의 극단적인 유용성과 명백한 잠재적인 위험 사이의 긴장은 창의적인 해결책을 필요로 할 것입니다. IBM 제안은 이러한 해결책의 intéressant한 기본 템플릿으로 보입니다.

유틸리티와 데이터 개인 정보 보호를 균형잡는 세 가지 IBM 기반 재구성. 가장 낮은(분홍색) 밴드에서, 시스템이 의미 있게 제거할 수 없는 프롬프트를 볼 수 있습니다.

유틸리티와 데이터 개인 정보 보호를 균형잡는 세 가지 IBM 기반 재구성.

IBM 접근 방식은 네트워크 수준에서 LLM으로 나가는 패킷을 가로채고, 원래 제출되기 전에 필요한 경우 다시 작성합니다. 이 접근 방식은 더 복잡한 GUI 통합을 포함할 수 있습니다.

물론, 사용자가 알지 못하는 경우, 사용자는 원래 제출과 다르게 수정된 제출에 대한 응답을 받을 수 있습니다. 이것은 운영 체제의 방화벽이 사용자에게 알리지 않고 웹사이트나 서비스에 대한 액세스를 차단하는 것과 동일한 투명성 결핍입니다.

프롬프트로서의 보안 취약점

‘프롬프트 개입’은 윈도우 OS 보안과 유사합니다. 이는 1990년대에 선택적으로 설치된 상업용 제품의 패치워크에서 시작하여, 사용자에게 표준으로 제공되는 네트워크 방어 도구로 발전했습니다. 이러한 도구는 일부 노력을 통해 비활성화하거나 완화할 수 있습니다.

프롬프트 제거가 네트워크 방화벽과 같이 발전한다면, IBM 논문의 제안은 미래를 위한 청사진으로 служ을 수 있습니다. 이는 사용자의 기계에 완전히 로컬 LLM을 배치하여 알려진 LLM API로 направ되는 나가는 프롬프트를 필터링하는 것을 포함합니다. 이 시스템은 GUI 프레임워크와 알림을 통합하여 사용자에게 제어를 제공해야 합니다.

연구자들은 사용자별 프롬프트를 분석하여 실제 시나리오에서 어떻게 souvent 개인 정보 보호가 위반되는지 이해하기 위해 공개된 ShareGPT 데이터 세트를 분석했습니다.

Llama-3.1-405B-Instruct는 컨텍스트적 무결성을 위반하는 것을 감지하기 위한 ‘판결’ 모델로 사용되었습니다. 대화의 큰 세트에서, 단일 턴 대화의 하위 세트가 길이 기준으로 분석되었습니다. 판결 모델은 컨텍스트, 민감한 정보, 작업 완성을 위한 필요성을 평가하여 컨텍스트적 무결성 위반이 포함된 대화를 식별했습니다.

이러한 대화의 작은 하위 세트는 명확한 컨텍스트적 개인 정보 보호 위반이 포함된 대화를 더 자세히 분석했습니다.

프레임워크 자체는 일반적인 채팅 에이전트보다 작은 모델을 사용하여 로컬 배포를 가능하게 하기 위해 Ollama를 사용하여 구현되었습니다.

프롬프트 개입 시스템의 스키마.

프롬프트 개입 시스템의 스키마.

평가된 세 가지 LLM은 Mixtral-8x7B-Instruct-v0.1, Llama-3.1-8B-Instruct, 및 DeepSeek-R1-Distill-Llama-8B입니다.

사용자 프롬프트는 프레임워크에서 세 단계로 처리됩니다. 컨텍스트 식별, 민감한 정보 분류, 및 재구성입니다.

민감한 정보 분류를 위한 두 가지 접근 방식이 구현되었습니다. 동적구조화된 분류입니다. 동적 분류는 특정 대화에서 사용되는 세부 정보를 기반으로 필수적인 세부 정보를 결정합니다. 구조화된 분류는 항상 비 필수적인 것으로 간주되는 민감한 속성의 사전 정의된 목록을 지정할 수 있습니다. 모델은 민감한 정보를 포함하는 프롬프트를 감지하면, 민감한 세부 정보를 제거하거나 다시 작성하여 개인 정보 보호 위험을 최소화하면서 사용성을 유지하기 위해 프롬프트를 재구성합니다.

집안 규칙

구조화된 분류는 IBM 논문에서 잘 설명되지 않았지만, Private Prompts 이니셔티브의 ‘Private Data Definitions’ 방법과 가장 유사합니다. 이는 사용자 입력 텍스트에 대한 대체 치환의 목록을 제공하는 독립 실행형 프로그램을 다운로드할 수 있습니다. 그러나 이 프로그램은 네트워크 수준에서 직접 개입하는 IBM 접근 방식과는 달리, 사용자가 수정된 프롬프트를 복사하여 붙여넣어야 합니다.

Private Prompts 실행 가능한 파일은 사용자 입력 텍스트의 대체 치환 목록을 제공합니다.

Private Prompts 실행 가능한 파일은 사용자 입력 텍스트의 대체 치환 목록을 제공합니다.

위의 이미지에서, Private Prompts 사용자는 민감한 정보의 인스턴스에 대한 자동 대체를 프로그래밍할 수 있습니다. 두 경우 모두, Private Prompts와 IBM 방법은, 이러한 목록을 큐레이팅할 수 있는 사용자가 실제로 이 제품을 필요로 할 가능성이 낮습니다. 그러나 이러한 목록은 시간이 지남에 따라 사건이 축적됨에 따라 구축될 수 있습니다.

관리자 역할에서, 구조화된 분류는 직원에게 강제되는 방화벽 또는 검열 网으로 작동할 수 있습니다. 또한, 가정 네트워크에서 모든 네트워크 사용자를 위한 국내 네트워크 필터로 작동할 수 있습니다. 그러나, 이러한 방법은 논리적으로 중복된 것으로 간주될 수 있습니다. 사용자가 이러한 목록을 올바르게 설정할 수 있다면, 사용자는 이미 효과적으로 자체적으로 검열할 수 있습니다.

ChatGPT의 의견

ChatGPT는 최근에 심층 연구 도구를 출시했으므로, 이 기능을 사용하여 ChatGPT에게 관련 문헌을 검토하고 IBM 논문에 대한 ‘냉소적인’ 견해를 요청했습니다. 그러나, 시스템은 새로운 출판물을 평가하거나 파싱할 때 가장 방어적이고 조롱적인 응답을 제공했습니다.

ChatGPT-4o는 IBM 프로젝트에 대해 낮은 의견을 가지고 있습니다.

ChatGPT-4o는 IBM 프로젝트에 대해 낮은 의견을 가지고 있습니다.

‘사용자가 OpenAI, Google, 또는 Anthropic를 신뢰하지 않는다면,’ ChatGPT는 주장합니다. ‘왜 사용자가 AI와 사용자 사이에 있는 제3의 소프트웨어 계층을 신뢰하는가? 중간자 자체가 새로운 실패 지점이 됩니다. 데이터를 로깅, 잘못 처리하거나, 심지어 LLM에 도달하기 전에 데이터를 유출할 수 있습니다. 이것은 아무 것도 해결하지 못합니다. 새로운实체를 생성하기만 합니다.’

이 반대는 자기 중심적이고, 이 경우에는 적용되지 않는 것으로 보입니다. 오픈 소스 프로젝트의 역사와, 사용자에게真正한 혜택을 제공하는 커뮤니티 개발자와 기여자의 장기적인 노력, 그리고 모바일 장치가 가벼운 LLM을 실행하고 훈련할 수 있는 잠재력을 고려할 때, 이러한 접근 방식은 사용자에게真正한 혜택을 제공할 수 있습니다.

다음으로, ChatGPT는 자신이 놓친 점을 자신감 있게 무시합니다. 즉, 상업용 LLM에 대한 입력을 giám視하는 가벼운 LLM을 로컬에서 실행하는 것입니다. 이는 로컬에서 실행할 수 없을 정도로 큰 LLM입니다. 또한, 사용자에게 제어를 제공하는 GUI 프레임워크와 알림을 통합해야 합니다.

‘유효한 개인 정보 보호 필터링을 위해서는 입력을 이해해야 합니다. 중간자가 민감한 데이터(이름, 주소, 금융 정보)를 인식할 수 있다면, 이미 이러한 데이터를 처리하고 분석하고 있습니다. 이는 제거해야 하는 것과 동일한 것을 저장하거나 검사해야 한다는 것을 의미합니다. 이것은 역설입니다. a) 기본 필터(기본 정규식 대체)는 효과적이지 않으며, 미묘한 개인 정보 보호 위험을 놓칠 것입니다. b) 스마트 필터(LLM 기반 재구성)는 전체 입력을 처리해야 하므로, 원래 LLM과 동일한 위험을 가집니다.

‘중간자를 신뢰할 수 있다면, 왜 LLM 자체를 신뢰하지 못하는가?’

이 마지막 질문에 대한 답변은, 로컬 LLM은 사용자 측에서 완전히 작동하며, 오픈 소스여야 하며, 네트워크 액세스가 거의 또는 전혀 필요하지 않습니다. 상업적인 버전은 초기에 좋은 의도를 가졌더라도, 기업의 변화와 서비스 약관의 변경에 취약할 것입니다. 그러나, 적절한 오픈 소스 라이선스는 이러한 종류의 ‘부패’를 방지할 것입니다.

ChatGPT는 또한 IBM 제안이 ‘사용자 의도’를 깨뜨린다고 주장합니다. 즉, 프롬프트를 다른 것으로 재해석할 수 있습니다. 그러나, 이것은 프롬프트 제거의 더广い 문제입니다. 또한, 이 경우에는 특정한 사용 사례에 해당하지 않습니다.

마지막으로, ChatGPT는 IBM 방법이 채택에 대한 장벽이 될 것이라고 주장합니다. 이는 사용자 마찰을 유발할 수 있기 때문입니다. 그러나, 이러한 보안 기능이 필요할 수 있습니다. 또한, 사용자 마찰은 향후 규제 또는 PROFITS에 대한 압력으로 인해 필수적인 보안 기능이 될 수 있습니다.

결론

우리는 OpenAI가 IBM 논문에서 제안한 것과 같은 안전 기능을 실제로 구현할 수 있을 것이라고 기대할 수 없습니다. 적어도, 효과적으로는 아닙니다.

그리고, 분명히, 전 세계적으로는 아닙니다. Apple이 iPhone의 특정 기능을 유럽에서 차단하거나 LinkedIn이 사용자의 데이터를 다른 국가에서 다른 규칙으로 사용하는 것과 마찬가지로, AI 회사는 운영하는 국가에서 가장 수익성이 높은 조건과 약관을 기본적으로 사용할 것입니다. 각 경우에, 사용자의 데이터 개인 정보 보호 권리를 희생시키는 대가로입니다.

 

처음 게시됨: 2025년 2월 27일 목요일

업데이트됨: 2025년 2월 27일 목요일, 15:47:11, 잘못된 Apple 관련 링크로 인해 – MA

기계 학습 분야 작가, 인간 이미지 합성 분야 전문가입니다. Metaphysic.ai의 연구 콘텐츠 책임자였으며, DNEG의 Brahma.ai로의 합병으로 해체될 때까지 그 역할을 수행했습니다.
포트폴리오 사이트: martinanderson.ai
연락처: [email protected]