사상 리더
생성적 AI 시대에 대한 오픈 소스의 재고찰

오픈 소스 모델 – 소스 코드를 공개적으로 재배포 또는 수정할 수 있는 소프트웨어 개발 이데올로기 – 는 오랜 시간 동안 혁신의 촉매제로 작용해왔다. 이 아이디어는 1983년 리처드 스톨만이라는 소프트웨어 개발자가 자신의 닫힌 소스 프린터가 고장나면서 시작되었다.
그의 비전은 자유 소프트웨어 운동을 탄생시키며, 오늘날의 인터넷과 소프트웨어 혁신을 뒷받침하는 오픈 소스 생태계를铺陳했다.
하지만 그건 40년 전的事情이다.
오늘날, 생성적 AI는 고유의 기술적 및 윤리적 도전을 제기하며, 우리가 오픈 소스 패러다임을 재고하고 적응해야 한다.
AI와 오픈 소스 자유
오픈 소스 소프트웨어의 4가지 기본 자유 – 소프트웨어 코드를 실행, 연구, 수정, 재배포할 수 있는 능력 – 는 생성적 AI의 본질과 여러 가지 측면에서 충돌한다:
- 실행: AI 모델은 매우 높은 인프라와 계산 비용을 요구하기 때문에, 자원 제약으로 인해 접근이 제한된다.
- 연구 및 수정: AI 모델은 매우 복잡하여, 코드와 데이터에 접근하지 못하면 이해하고 수정하기가 어려운挑戰이다.
- 재배포: 많은 AI 모델은 재배포를 제한하며, 특히 훈련된 가중치와 독점 데이터셋을 소유한 플랫폼 제공업체의 경우이다.
이러한 핵심 원칙의 침식은 악의적인 의도 때문이 아니라, 현대 AI 시스템의 엄청난 복잡성과 비용 때문이다. 실제로, 최첨단 AI 모델을 훈련시키는 비용은 최근 몇 년 동안 급격히 증가했으며, OpenAI의 GPT-4는 훈련 비용이 7,800만 달러에 이를 것으로 보고 있으며, 총 비용은 1억 달러를 초과할 것으로 예상된다.
오픈 소스 AI의 복잡성
진정한 오픈 AI 모델은 추론 소스 코드, 훈련 소스 코드, 모델 가중치, 훈련 데이터의 전체 투명성을 요구한다. 그러나 많은 모델은 “오픈”이라고標示하지만, 추론 코드 또는 부분 가중치만 공개하거나, 상업적 사용을 제한한다.
이러한 중立적인 개방성은 오픈 소스 원칙의 환상을 창조하지만, 실제로는 부족하다.
오픈 소스 이니셔티브(Open Source Initiative, OSI)의 분석에 따르면, 여러 인기 있는 대형 언어 모델 – Llama2, Llama 3.x(Meta), Grok(X), Phi-2(Microsoft), Mixtral(Mistral AI) – 는 오픈 소스 원칙과 구조적으로 불일치한다.
지속 가능성 및 동기 부여의 도전
대부분의 오픈 소스 소프트웨어는 자원봉사자 또는 보조금 기반의 노력에 의해 구축되었으며, 컴퓨팅 집약적이고 고비용 인프라스트럭처가 아닌 경우가 많다. 반면에, AI 모델은 훈련과 유지 보수에 많은 비용이 들며, 비용은 계속 증가할 것으로 예상된다. Anthropic의 CEO인 Dario Amodei는, 앞으로 최첨단 모델을 훈련시키는 비용이 $100억 달러에 이를 수 있다고 예측한다.
지속 가능한 자금 조달 모델이나 동기 부여 구조가 없으면, 개발자는 접근을 제한하는 닫힌 소스 또는 비상업적 라이선스를 선택하거나, 재정적 붕괴를冒할 수밖에 없다.
“오픈 가중치”와 라이선스에 대한 오해
AI 모델의 접근성은 점점 더 혼란스러워지고 있으며, 많은 플랫폼이 “오픈”이라고 광고하지만, 실제로는 제한을 두고 있다. 이러한 “마술”은 여러 가지 방법으로 나타난다:
- “오픈 가중치”로 표시된 모델은 상업적 사용을 완전히 금지할 수 있으며, 이는 실제 비즈니스 도구가 아닌 학술적 호기심에 불과하다.
- 일부 제공업체는 사전 훈련된 모델에 대한 접근을 제공하지만, 훈련 데이터셋과 방법론을 엄격히 보호하여, 그들의 발견을 의미 있게 재현하거나 검증할 수 없다.
- 많은 플랫폼은 재배포를 제한하여 개발자가 모델을 개선하거나 커뮤니티에 빌드할 수 없게 한다.
이러한 경우, “연구를 위한 오픈”은 사실상 “비즈니스용 닫힘”을 의미한다. 결과는 개발자와 조직이 투자한 시간과 자원을 낭비하며, 확장 또는 상업화를 시도할 때 중요한 제한을 발견하게 된다.
이러한 혼란은 개발자만이 아니라, AI 생태계에 대한 신뢰를 저해한다. 이는 오픈 소스 소프트웨어 커뮤니티와 비교할 때, 투명성, 수정 권한, 상업적 자유가 존중되는 것을 기대하는 이해당사자에게 불리한 영향을 미친다.
법적 지연
GenAI의 빠른 발전은 법적 프레임워크의 개발을 추월하며, 지적 재산권에 대한 도전을 제기한다.
첫 번째 주요 법적 전투는 훈련 데이터의 사용에 관한 것이다. 딥 러닝 모델은 인터넷에서 큰 데이터셋을 수집하며, 이는 저작권법에 대한 논쟁을 불러일으킨다. 기술 회사들은 그들의 AI 시스템이 저작권된 자료를 연구하고 학습하여 새로운 변형된 콘텐츠를 생성한다고 주장한다. 그러나 저작권 소유자는 이러한 AI 회사들이 그들의 작품을 불법적으로 복사하여, 그들의 생계를 위협하는 경쟁 콘텐츠를 생성한다고 주장한다.
AI 생성물의 소유권은 또 다른 법적 모호성을 представляет한다. AI가 완전히 콘텐츠를 생성하는 경우, 미국 저작권 사무소는 “저작권으로 보호할 수 없다”고 밝혔다.
GenAI에 대한 법적 불확실성, 특히 저작권 침해, AI 생성물의 소유권, 훈련 데이터의 라이선스에 관한 문제는, 기초 AI 모델이 지緣政治적 중요성을 갖는 도구로 등장하면서更加 복잡해진다: 상급 AI 능력을 개발하기 위해 경쟁하는 국가들은 데이터 접근을 제한하지 않을 수 있으며, 이는 지적 재산권 보호가 더 엄격한 국가에 불리한 영향을 미칠 수 있다.
AI 시대에 오픈 소스가 되어야 할 것
GenAI 열차는 이미 출발했으며, 속도를 늦출 기미가 없다. 우리는 AI가 혁신을 억제하는 것이 아니라, 촉진하는 미래를 건설하기를 희망한다. 이를 위해서는 기술 리더들이 안전하고 투명한 상업적 사용을 보장하는 프레임워크가 필요하다.
새로운 개념인 오픈 상업용 라이선스(Open Commercial Source License)는 비상업적 사용을 위한 무료 접근, 상업적 사용을 위한 라이선스 접근, 데이터의 기원과 소유권에 대한 인식과 존중을 제안함으로써, 앞으로 나아갈 수 있는 길을 제시한다.
이 새로운 현실에 적응하기 위해서, 오픈 소스 커뮤니티는 AI 특화 오픈 라이선스 모델을 개발하고, 이러한 모델을资助하기 위한 공공-민간 파트너십을 형성하며, 투명성, 안전성, 윤리성을 위한 신뢰할 수 있는 표준을 설정해야 한다.
오픈 소스는 한 번 세계를 바꾸었다. 생성적 AI는 다시 세계를 바꾸고 있다. 오픈 소스의 정신을 보존하기 위해서, 우리는 AI의 고유한 요구를 인정하고, 도전을 직접적으로 해결하여, 포용적이고 지속 가능한 생태계를 창조해야 한다.












