AI 모델 및 플랫폼
LLM에서 저작권 데이터를 잊는 것 – 가능할까?
인공 지능(AI)와 기계 학습(ML)의 영역에서 대규모 언어 모델(LLM)은 성과와 도전을 동시에 보여줍니다. 방대한 텍스트 데이터셋에서 훈련된 LLM 모델은 인간의 언어와 지식을 내포합니다.
그러나 인간의 이해를 흡수하고 모방하는 능력은 법적, 윤리적, 기술적인 도전을 제기합니다. 또한 LLM을 구동하는 거대한 데이터셋은 유해한 자료, 저작권이 있는 텍스트, 부정확성, 또는 개인 데이터를 포함할 수 있습니다.
선택된 데이터를 잊는 것은 법적 준수와 윤리적 책임을 보장하기 위해迫切한 문제가 되었습니다.
LLM에서 저작권 데이터를 잊는 개념을 탐구하여 기본적인 질문에 답해 보겠습니다: 가능할까요?
LLM 언러닝이 필요한 이유
LLM은 종종 논란의 여지가 있는 데이터,包括 저작권 데이터를 포함합니다. 이러한 데이터를 LLM에 포함시키는 것은 개인 정보, 편향된 정보, 저작권 데이터, 거짓 또는 유해한 요소와 관련된 법적 도전을 제기합니다.
따라서 언러닝은 LLM이 개인 정보 보호 규정과 저작권 법을 준수하도록 보장하기 위해 필수적입니다. 이는 책임 있고 윤리적인 LLM을 촉진합니다.

그러나 이러한 모델이 습득한 방대한 지식을 통해 저작권 콘텐츠를 추출하는 것은 어려운 일입니다. 이러한 문제를 해결하기 위한 언러닝 기술이 있습니다:
- 데이터 필터링: 이는 모델의 훈련 데이터에서 저작권 요소, 노이즈 또는 편향된 데이터를 체계적으로 식별하고 제거하는 것을 포함합니다. 그러나 필터링은 필터링 과정에서 귀중한 비저작권 정보를 잃을 수 있습니다.
- 그라디언트 방법: 이러한 방법은 손실 함수의 그라디언트를 기반으로 모델의 매개변수를 조정하여 ML 모델에서 저작권 데이터 문제를 해결합니다. 그러나 조정은 비저작권 데이터에서 모델의 전체 성능에 부정적인 영향을 미칠 수 있습니다.
- 인 컨텍스트 언러닝: 이 기술은 모델의 매개변수를 업데이트하지 않고 특정 훈련 점에 대한 모델의 영향을 효율적으로 제거합니다. 그러나 이 방법은 특히 큰 모델에서 정확한 언러닝을 달성하는 데 제한이 있으며, 그 효과는 추가 평가가 필요합니다.
이러한 기술은 자원 집약적이고 시간이 많이 걸리기 때문에 구현하기 어렵습니다.
사례 연구
LLM 언러닝의 중요성을 이해하기 위해 이러한 실제 사례는 기업들이 대규모 언어 모델(LLM)과 저작권 데이터와 관련된 법적 도전을 어떻게 대처하는지 보여줍니다.
OpenAI 소송: OpenAI, 유명한 AI 회사,는 LLM 훈련 데이터와 관련된 여러 소송을 당했습니다. 이러한 법적 조치는 LLM 훈련에서 저작권 자료의 사용을 질문합니다. 또한 이러한 소송은 각 저작권 작품에 대한 허가 메커니즘을 모델이 어떻게 보장하는지에 대한 조사를 촉발했습니다.
사라 실버만 소송: 사라 실버만 사건은 ChatGPT 모델이 그녀의 책에 대한 요약을 허가 없이 생성했다는 주장을 포함합니다. 이 법적 조치는 AI와 저작권 데이터의 미래와 관련된 중요한 문제를 강조합니다.
기술의 발전과 법적 프레임워크의 업데이트는 AI 모델의 책임 있고 법적 사용을 보장합니다. 또한 연구 커뮤니티는 이러한 도전을 포괄적으로 해결하여 LLM을 윤리적이고 공정하게 만들기 위해 노력해야 합니다.
전통적인 LLM 언러닝 기술
LLM 언러닝은 특정 성분을 복잡한 레시피에서 분리하는 것과 유사하여, 원하는 구성 요소만 최종 결과에 기여하도록 합니다. 전통적인 LLM 언러닝 기술, 즉 커링된 데이터와 함께 세부 조정 및 재훈련, 저작권 데이터를 제거하는 직접적인 메커니즘을 缺하고 있습니다.
이러한 광범위한 접근 방식은 효율적이지 않으며, 선택적인 언러닝 작업에 자원 집약적입니다. 이러한 전통적인 방법은 모델의 매개변수를 조정할 수 있지만, 저작권 콘텐츠를 정확하게 타겟팅하는 데 어려움을 겪으며, 의도하지 않은 데이터 손실과 최적이 아닌 컴플라이언스를 위협합니다.
따라서 전통적인 기술의 제한과 강력한 해결책은 대체 언러닝 기술을 실험해야 합니다.
새로운 기술: 훈련 데이터의 하위 집합을 언러닝
마이크로소프트 연구 논문은 LLM에서 저작권 데이터를 언러닝하는 혁신적인 기술을 소개합니다. Llama2-7b 모델과 해리 포터 책의 예를 중심으로, 이 방법은 저작권 데이터를 언러닝하기 위한 세 가지 핵심 구성 요소를 포함합니다:
- 강화 모델 식별: 강화 모델을 생성하는 것은 목표 데이터(예: 해리 포터)를 세부 조정하여 언러닝할 콘텐츠에 대한 지식을 강화하는 것을 포함합니다.
- 특이적 표현의 대체: 해리 포터의 고유한 표현은 목표 데이터에서 일반적인 표현으로 대체되어 더 일반화된 이해를 촉진합니다.
- 대체 예측에 대한 세부 조정: 기준 모델은 이러한 대체 예측을 기반으로 세부 조정됩니다. 본질적으로, 관련된 컨텍스트에서 원래 텍스트를 효과적으로 삭제합니다.
마이크로소프트 기술은 초기 단계에 있으며 제한이 있을 수 있지만, 더 강력하고 윤리적이며 적응성이 뛰어난 LLM을 향한 약속된 발전을 나타냅니다.
새로운 기술의 결과
LLM에서 저작권 데이터를 언러닝하는 혁신적인 방법은 마이크로소프트 연구 논문에 제시되어 책임 있고 윤리적인 모델을 향한 발전입니다.
새로운 기술은 해리 포터 관련 콘텐츠를 메타의 Llama2-7b 모델에서 삭제하는 것을 포함합니다. 이 모델은 “books3” 데이터셋으로 훈련되었으며 저작권 작품을 포함합니다. 특히, 모델의 원래 응답은 일반적인 프롬프트에서조차도 J.K. 롤링의 세계에 대한 세부적인 이해를 보여주었습니다.
그러나 마이크로소프트의 제안된 기술은 모델의 응답을 크게 변화시켰습니다. 여기에서는 원래 Llama2-7b 모델과 세부 조정된 버전 간의 차이를 보여주는 프롬프트 예가 있습니다.

이 표는 세부 조정된 언러닝 모델이 다양한 벤치마크(예: Hellaswag, Winogrande, piqa, boolq, arc)에서 성능을 유지한다는 것을 보여줍니다.

평가 방법은 모델 프롬프트와 이후 응답 분석을 기반으로 효과적이지만, 더 복잡한 정보 추출 방법을 간과할 수 있습니다.
이 기술은 약속된 발전이지만, 특히 LLM 내에서 더广泛한 언러닝 작업을 해결하기 위해 추가 연구와 확장이 필요합니다.
새로운 언러닝 기술의 도전
마이크로소프트의 언러닝 기술은 약속된 발전을 보여주지만, 몇 가지 AI 저작권 도전과 제한이 있습니다.
주요 제한과 개선 영역은 다음과 같습니다:
- 저작권 정보의 누출: 이 방법은 저작권 정보의 누출 위험을 완전히 완화하지 못할 수 있습니다. 모델은 세부 조정 과정에서 대상 콘텐츠에 대한 일부 지식을 유지할 수 있습니다.
- 다양한 데이터셋의 평가: 효과를 평가하기 위해 이 기술은 다양한 데이터셋에서 평가되어야 합니다. 초기 실험은 해리 포터 책에만 집중했습니다.
- 확장성: 더 큰 데이터셋과 더 복잡한 언어 모델에서 테스트는 실제 시나리오에서 기술의 적용 가능성과 적응성을 평가하기 위해 필수적입니다.
LLM을 대상으로 하는 저작권 소송의 증가, 특히 AI 관련 법적 사례,는 지침의 필요성을 강조합니다. 마이크로소프트가 제안한 언러닝 방법과 같은 약속된 발전은 윤리적이고 법적이며 책임 있는 AI를 향한 길을 열어줍니다.
AI와 ML의 최신 뉴스와 분석을 놓치지 마세요 – unite.ai를 오늘 방문하세요.












