Anderson의 관점

AI 모델 디센서링에 대한 실제 단속이 언제쯤 이루어질까?

mm
Unite.AI를 Google의 선호 소스에 추가
Screen capture from The Matrix (1999), featuring 'warez' on optical media, hidden inside a book, about to be sold to a willing buyer. © Warner Bros. Used for commentary and illustrative purposes.

1995년에서 2010년 사이의 웨어즈 장면을 기억할 정도로 나이가 많다면, 대량의 크랙된 소프트웨어와 복제된 영화(거리에서 도매로 구매하거나, 고속 광대역이 대용량 다운로드를 가능하게 만든 후에 캐주얼 해적들이 모은)들이 여러 개의 삐걱거리는 DVD 컬렉션에 쌓였던 시절, 현재 등장하고 있는 ‘디센서링’된 오픈소스 AI 모델들의 풍경은 익숙한 느낌을 줄 수 있습니다.

From the 'golden age' of casual street trade in software and movies. Credit – Shankar.s. 'Pirated DVDs at PP street market' - https://www.flickr.com/photos/shankaronline/9163248097/in/photostream/ License - https://creativecommons.org/licenses/by/2.0/deed.en

소프트웨어와 영화의 캐주얼 거리 거래가 번성하던 ‘황금기’를 배경으로 합니다. 출처 – Shankar.s. ‘Pirated DVDs at PP street market’출처 / 라이선스

그때는 소프트웨어 대여가 일반적인 소비자 모델이 되기 전으로, ‘씬’ 소프트웨어 애호가들 중 소수이지만 정예인 집단이 애플리케이션을 크랙하는 활동을 시작했고, 이들은 ‘웨어즈’ 뉴스그룹과 이후 토렌트 그룹에 배포되었습니다. 이러한 제한은 부담스럽거나 사소하게 우회될 수 있었지만, 일단 배포되면 그 흔적은 보통 지워지지 않았습니다.

현재 오픈소스 대형 언어 모델(LLM)에서도 같은 일이 일어나고 있습니다. 이 모델들은 지속적으로, 대규모로 훈련된 안전 필터가 제거되고 있으며, 그 결과 디센서링된 모델들이 너무 많은 곳에 공유되어 ‘크랙’의 원천을 차단해도 모델의 가용성에 큰 차이가 없습니다.

수혜자 혹은 악당

문제는: 이러한 활동을 어떤 관점에서 보느냐 입니다. 웨어즈 장면과 달리, 20~30년 전 소규모 소프트웨어 제작자들이 겪었던 것처럼 명확히 수입을 박탈당하는 사람은 없습니다.

물론, 원래 라이선스 조건이 종종 위반되고 있습니다*; 하지만 Black Forest Labs와 같은 생성 AI 모델 제작자들의 부분 가중치 공개와 달리, 원 배포자는 ‘품질이 낮은’ 버전을 더 강력한 API 전용 모델로 유도하는 업셀 경로로 취급하지 않고 전체 모델을 그대로 공개하고 있습니다.

대부분의 경우, 초기 릴리스를 로컬에서 실행할 수 있는 사람은 거의 없습니다. 16~24GB VRAM을 갖춘 고성능 GPU조차도 파라미터 수가 너무 많아 실행하기 어렵기 때문입니다.

따라서 초기 릴리스는 모델 양자화를 통해, 그리고 가중치를 GGUF, AWQ, PTQ, EXL2, 혹은 Apple 중심의 MLX와 같은 가벼운 형식으로 변환함으로써 소비자용 하드웨어에서도 실행 가능한 슬림 버전으로 빠르게 전환됩니다.

이러한 슬림 모델은 원본 풀 사이즈 모델만큼 성능이 뛰어나지는 않지만(대부분은 다양한 GPU 팜을 통해 상업적으로 제공됩니다), 최소한 사용자가 직접 제어할 수 있으며, ‘더 좋은’ 모델이 제공하지 못하는 방식으로 특정 사용자에 맞게 커스터마이징할 수 있습니다.

당신이 원하는 대로

이러한 방법 중 일부는 명백히 합법적이며, 일반적으로 원본 라이선스 범위 내에 있습니다. 예를 들어 파인튜닝을 통해 모델의 가중치를 사용자가 지정한 특정 작업이나 도메인에 맞게 조정할 수 있습니다. 이 경우 디스크 공간이 허락한다면, 하나의 오픈소스 모델을 여러 인스턴스로 파인튜닝하여 다양한 작업에 활용할 수 있습니다. 이는 전체 가중치를 가진 원본 모델의 ‘스위스 군용 나이프’와는 달리, 전용 전통 도구들의 배열과 같습니다.

또한, 설정은 호환되지만 학습 데이터가 다른 모델들을 병합할 수 있으며, 혹은 경량 LoRA 필터를 사용해 추가 기능을 모델에 겹쳐 넣을 수 있습니다. 이렇게 하면 파인튜닝으로 기본 모델의 원래 능력을 손상시킬 위험이 없습니다.

하지만 많은 사용자가 가장 관심을 갖는 수정 작업은 앞서 언급한 안전 필터, 즉 가드레일을 제거하는 것으로, 이는 앞의 어떤 방법보다도 쉽게 수행할 수 있게 되었습니다.

물론 이로 인해 포르노 콘텐츠나 악성코드 제작을 출력하는 모델이 생길 수 있지만, 동시에 많은 사용자가 과도하게 제한적이며 (자주 오류가 발생하는) 제약으로 인식하는 것을 제거하게 됩니다.

One of many hilarious examples of Llama-2-7b-chat refusing reasonable requests on safety grounds, available at the source URL. Source - https://www.lesswrong.com/posts/pYcEhoAoPfHhgJ8YC/refusal-mechanisms-initial-experiments-with-llama-2-7b-chat

Llama-2-7b-chat이 안전상의 이유로 합리적인 요청을 거부한 많은 웃긴 사례 중 하나이며, 원본 URL에서 확인할 수 있습니다. 출처

이단자

최근 모델 디센서링에 혁신을 일으킨 소프트웨어인 Heretic의 경우, 모델이 경향을 보이는 ‘화려하고’ 장황한 문체 수준을 낮추는 것도 가능합니다.

Heretic gets to work on decensoring gpt-oss, though admittedly on a very well-specced machine that's unlikely to grace the average consumer's home – though it could be rented cheaply online, for the necessary duration of the process. Source - https://github.com/p-e-w/heretic

Heretic은 gpt-oss 디센서링 작업을 수행하지만, 이는 평균 소비자 가정에 설치되기 어려운 고사양 머신에서 진행됩니다. 다만 필요한 기간만큼 온라인에서 저렴하게 임대할 수 있습니다. 출처

더 중요한 점은, Heretic이 거부를 억제하면서 모델의 원래 행동에 대한 손상을 최소화하는 억제 방안을 자동으로 탐색해, 최종 사용자의 입장에서 비교적 어려운 디센서링 작업을 단 한 줄의 명령으로 축소한다는 것입니다.

위 스크린샷에서 알 수 있듯이, Heretic은 일반 가정에 설치된 GPU보다 더 강력한 GPU를 필요로 합니다. 그러나 사용자는 2002년 소프트웨어를 직접 크랙하던 시절처럼 가정용 하드웨어에서 실행할 필요는 없습니다. 웨어즈 시절과 마찬가지로, 해당 하드웨어에 접근하거나 비용을 투자할 의향이 있는 상위 씬 제공자(주로 비상업적인 캐주얼 애호가)들이 탈옥 작업을 수행하고 디센서링된 모델을 커뮤니티에 배포합니다.

표적에

‘논란이 되는’ 디지털 행위가 더 이상 어려워지지 않을 때는, 보통 나이트랩(Napster)이나 PopCornTime과 같은 하룻밤 사이의 기술 도약을 통해 해당 행위와 이를 억제하려는 ‘공식’ 관심 수준이 동시에 급격히 확대됩니다.

Ollama와 같은 플랫폼의 인기도와 사용 편의성이 높아짐에 따라, Heretic은 아직 완전한 ‘바보도 못 쓰게’ 하는 방법은 없지만 비전문가도 디센서링된 모델에 접근할 수 있게 만들고 있습니다.

이것은 앞서 제기한 이 활동이 ‘문제’에 해당하는가에 대한 질문으로 돌아갑니다. 어제 Arxiv에 올라온 논문은 최근 기술 소비자 자유에 대한 억제와 단속 추세를 근거로, 디센서링이 점점 더 주목받게 되고 전 세계적으로 규제 입법 사례가 늘어날 가능성이 높다고 시사합니다.

10a Labs의 보고서인 새로운 논문은 디센서링 움직임을 부정적으로 묘사하고, 역사적 사례와 현재 추세가 시사하듯, 억제로 이어질 소수의 악용 사례들을 제시합니다.

이 연구는 디센서링된 모델이 배포·재배포된 후의 상황을 추적했으며, 비검열 모델을 통합하거나 추천하거나 기본값으로 사용하는 1,643개의 GitHub 애플리케이션을 확인했습니다.

해당 모델들은 일반 목적 챗봇 및 문서 처리 도구부터 NSFW 롤플레이·스토리텔링, 성인 콘텐츠 서비스, 해킹·공격 보안 도구, 사기 애플리케이션 및 악성코드 생성기에 이르기까지 다양하며, 연구에 따르면 이 중 25%가 ‘명백히 악의적’으로 분류되었습니다:

Breakdown of how uncensored AI models are being used after release. The study traced 1,643 GitHub applications that integrate, recommend or default to models whose safety restrictions have been removed, finding that 37% were general-purpose uncensored chatbots, while cybersecurity and document-processing tools each accounted for 16%, alongside smaller categories spanning voice assistants, NSFW roleplay, creative writing, coding and other uses. The paper found that around 25% of the applications identified could be classified as 'explicitly malicious'.

디센서링된 AI 모델이 배포된 후 어떻게 활용되는지에 대한 분석입니다. 연구는 안전 제한이 제거된 모델을 통합·추천·기본값으로 사용하는 1,643개의 GitHub 애플리케이션을 추적했으며, 37%가 일반 목적의 비검열 챗봇, 사이버보안 및 문서 처리 도구가 각각 16%를 차지하고, 음성 비서, NSFW 롤플레이, 창작 글쓰기, 코딩 등 소규모 카테고리도 포함되었습니다. 논문에 따르면 식별된 애플리케이션 중 약 25%가 ‘명백히 악의적’으로 분류될 수 있습니다. 출처

영국이 최근 도입한 웹 접근 제한(그리고 현재 중단된 VPN 접근 제한 의도), 캘리포니아가 2027년에 대부분 운영 체제에 사용자 연령대를 수집해 애플리케이션에 제공하도록 요구하는 규정, 성인 온라인 콘텐츠 접근을 위한 연령 확인 제도인 EU의 계획, 그리고 16세 미만을 위한 소셜 미디어 계정 금지 조치를 시행 중인 호주의 정책을 고려하면, 새로운 논문은 관심이 높아질수록 감독·규제·선별적 혹은 전면 금지로 이어지는 패턴에 부합하는 것으로 보입니다.

여기서는 일어나지 않을 것

아니요, 여기서도 확실히 일어날 수 있습니다. 새로운 연구 저자들이 추정한 악의적 사용 비율이 높기 때문이며, 또한 규제가 로컬 AI 실행 추세에 추가적인 제한을 가하게 되면 정부와 기관이 이를 위협으로 인식할 가능성이 있기 때문입니다. 특히 모델이 제약에서 벗어날수록 그 위험성은 커집니다.

디센서링 활동을 NSFW 출력 및 악성 해킹을 ‘촉진’하는 것으로 규정하면, 디센서링을 이분법적으로 제시하게 됩니다. 즉, 악용될 수 있기 때문에 규제에 복종해야 한다는 논리죠. 실질적으로는 사용 사례가 너무 다양해 전면 금지 외에 현실적인 규제 방안이 없어 보입니다.

또한, 디센서링된 LLM이 CSAM(아동 성착취물) 소설과 같은 콘텐츠를 생성할 수 있는 경우, 제한적인 규제가 확실한 해결책처럼 보입니다. 왜냐하면 규제에 반대하는 사람은 디센서링된 모델의 악용을 묵인하는 것으로 간주될 수 있기 때문입니다.

하지만 파인튜닝이나 LoRA가 적용된 모델은 사용자가 원하는 특정 분야를 훨씬 효율적으로 생성할 수 있다는 점을 간과합니다. 모델의 기본 가중치가 해당 작업에 크게 왜곡되어 원래의 안전 보호 장치를 완전히 무력화하기 때문입니다.

편리함에 관한 모든 것

사용 편의성은 대규모 채택을 촉발하고, 대규모 채택은 정부가 입법하도록 압력을 가합니다(공공 압력 단체, 산업 로비스트, 혹은 정부 간 압력 등).

파인튜닝과 LoRA는 단순히 FOSS 기반 모델을 해제하는 것보다 훨씬 더 목표 지향적인 결과를 얻을 수 있지만, 이를 구현하려면 일정 수준의 규율과 노력이 필요합니다.

디센서링/양자화된 모델을 로컬에서 실행하는 것이 몇 번의 클릭만으로 가능해지면(사용자는 Heretic으로 직접 크랙하기보다 ‘미리 해제된’ 모델을 다운로드하게 되므로), 이 활동은 괴짜들의 은밀한 영역을 벗어나 공공 영역에 진입하게 되고, 그 악용이 정치적 논쟁거리가 될 가능성이 높아집니다.

올해 여름, NVIDIA는 무거운 기술 파트너들과 함께 오픈소스 모델에 대한 정부 규제를 선제적으로 방지하기 위한 공개 서한을 발표했으며, 기술의 소수 악용이 그 잠재적 일반 이익을 위협해서는 안 된다는 입장을 다시 제시했습니다. 그러나 최근 몇 년간 이 입장은 크게 호응을 얻지 못했습니다.

 

*모델 제작자들이 사용자의 활동을 제한하려는 의도가 진실인지 자주 의심받고 있으며, 가드레일 보호조치조차도 ‘연극’에 불과하다고 일축되는 경우가 있습니다.

기계 학습 분야 작가, 인간 이미지 합성 분야 전문가입니다. Metaphysic.ai의 연구 콘텐츠 책임자였으며, DNEG의 Brahma.ai로의 합병으로 해체될 때까지 그 역할을 수행했습니다.
포트폴리오 사이트: martinanderson.ai
연락처: martin@martinanderson.ai