사상 리더
중국 AI의 신기루: “오픈 소스”가 가장 중요한 것을 어떻게 가리는가

Google, Microsoft와 같은 대형 기술 기업들과 함께 (MSFT )그리고 Meta가 AI 시장 장악을 위해 경쟁하는 가운데, 중국의 High Flyer, Baidu, Moonshot, Alibaba는 각각 DeepSeek, ERNIE 4.5, Kimi K2, Qwen3 대형 언어 모델을 오픈 소스로 공개하며 화제를 모았다. 보호된 독점 GenAI 모델을 공개하는 이러한 전환은 중국 AI 산업이 오픈 소스의 힘을 받아들여 AI 개발을 민주화하고 혁신을 촉진한다는 신호로 받아들여졌다.
많은 기업이 자사의 제품을 오픈 소스로 내세우고 심지어 회사 이름에까지 넣고 있지만, High Flyer, Baidu, Moonshot은 실제로 모델의 핵심인 데이터셋과 같은 중요한 요소를 공유하지 않았다. 이러한 대형 모델이 개발자들이 의존하는 상품이 되려면, 테스트·조사·반복이 가능한 진정한 오픈 소스의 투명성이 편향되지 않고 윤리적이며 모두가 신뢰할 수 있는 유익한 기술을 만드는 데 필수적이다. 이 “오픈 소스” 모델들은 실제로는 “오픈 웨이트”에 불과해 다운로드와 사용은 가능하지만 데이터를 제외하고는 의미 있게 검토할 수 없다.
미국 기업인 Open AI와 Meta가 오픈 소스에서 물러나는 듯 보이는 가운데, Baidu가 자유롭게 이용할 수 있는 ERNIE 4.5 모델군을 활용하도록 공개 초청한 것은 소형이면서도 강력한 애플리케이션을 만들고자 하는 개발자들의 혁신과 협업을 촉진할 수 있다. 동시에, 중국의 Google에 비견되는 이 회사는 채택을 장려하고 모델을 급성장 중인 AI 생태계에 깊이 자리잡게 함으로써 경쟁 우위를 확보했다.
DeepSeek, 저가형 Kimi K2, 그리고 업데이트된 Qwen3도 마찬가지이며, 이 모델은 Claude Opus 4와 GPT-4o-0327과 같은 폐쇄형 모델에 도전하는 벤치마크를 자랑한다.
이들 AI 기업은 선택받는 상품 모델이 되기 위한 경쟁에서 좋은 위치를 차지했으며, Qwen3의 최신 혁신 업데이트는 오픈 소스 커뮤니티의 피드백에서 영감을 받았다.
많은 기업이 대형 AI 모델을 오픈 소스로 내세우지만, 중국 AI 커뮤니티는 실제로 데이터나 시스템의 다른 핵심 요소를 공유하지 않는다. 대신 전 세계 개발자들에게 이해하거나 조사할 수 없는 모델에 대한 맹목적인 신뢰를 요구하고 있다.
오픈 소스 상품 AI 모델로 미래에 대한 주장을 제기하다
2007년 iPhone이 시장에 등장했을 때, 일부는 Mac이 iOS와 함께 스마트폰 시장을 장악할 것이라 예상했지만, 오픈 소스 참여는 스타트업에 필수적이며 전 세계적으로 기업가 정신과 경제 성장을 촉진한다. 그리고 2005년 Google이 인수한 스타트업 Android는 이 길을 따라 승리했다.
볼 수 있고, 수정·채택·공유할 수 있는 오픈 소스 소프트웨어를 공개함으로써 Android는 학계, 개발자, 심지어 경쟁자까지 소프트웨어 협업에 초대했다. 이는 혁신 과정을 가속화하고 경쟁 환경을 민주화하며 궁극적으로 가격을 낮추었다. Android는 첫 iPhone이 출시된 지 1년 뒤에 시장에 진입했으며, 올해 초에 전 세계 시장의 71.88%를 차지하며 iOS의 27.65%에 비해 우위를 보였다.
하룻밤 사이에 일어난 듯한 기술 혁신으로 스마트폰은 일상이 되었으며, 소프트웨어·하드웨어·사용자 인터페이스 개선이 계속되면서도 업계는 스마트폰 작동 방식을 혁신하려는 수준을 넘어 성장했다. 이제 휴대폰이 상품이 된 만큼, 오늘날의 혁신은 그 위에서 실행되는 앱에 있으며, 경쟁자가 되려면 스마트폰 제공업체는 개발자를 초대하는 생태계를 유지해야 한다.
ChatGPT 출시 3년이 채 지나지 않아 AI 산업은 유사한 위기에 처했다. 전 세계 AI 기업들은 자사 모델을 차세대 Android 혹은 iOS로 만들려는 경쟁을 벌이고 있으며, DeepSeek, ERNIE 4.5, Kimi K2 모델을 오픈 소스로 공개함으로써 중국 혁신가들은 성장 중인 생태계에 자신의 주장을 제기하려 하고 있다.
이러한 접근이 그들에게 유리하게 작용할 수는 있지만, 이는 혁신을 촉진할 뿐만 아니라 신뢰할 수 있는 혁신을 만들기 위해 필수적인 진정한 오픈 소스 투명성을 촉진하지는 않는다.
데이터는 대부분 오픈 소스 AI에서 빠진 조각
AI 모델은 전통적인 소프트웨어보다 훨씬 복잡하게 제작·공유되므로 완전한 오픈 소스 AI를 요구하는 일은 작은 일이 아니다. 단순한 소스 코드만이 아니라 AI 시스템은 일곱 가지 구성 요소—소스 코드, 모델 파라미터, 데이터셋, 하이퍼파라미터, 학습 소스 코드, 난수 생성, 소프트웨어 프레임워크—로 이루어진다.
각 요소가 조화를 이루어야 모델이 원하는 결과를 제공할 수 있으므로 개발자는 시스템을 공유·수정·채택하고 무슨 일이 일어나고 있는지 이해하기 위해 전체 가시성이 필요하다. 재현성이 과학적 방법의 기반이지만, AI 산업은 습관적으로 오픈 소스라는 용어를 퍼즐의 일부만 접근 가능한 무료 또는 저가 릴리스를 지칭하는 데 사용한다.
예를 들어 바이두는 ERNIE 4.5 모델 10개를 무료로 공개했습니다. 모델과 파라미터를 공유함과 동시에, 회사는 ERNIEKit과 FastDeploy 배포 툴킷도 오픈소스로 제공했습니다. 이를 통해 개발자는 산업 수준의 기능, 자원 효율적인 학습 및 추론 워크플로, 다중 하드웨어 호환성을 제공받아 강력한 AI 애플리케이션을 구축할 수 있습니다.
다시 말해, 바이두는 개발자에게 혁신을 보다 빠르게 발휘하도록 돕는 흥미로운 도구들을 제공했으며, 이를 통해 개발자들이 경쟁 제품보다 ERNIE 4.5를 선택하도록 유도하고자 합니다.
하지만 ERNIE 4.5를 활용하는 개발자는 모델을 맹목적으로 신뢰하도록 요구받고 있습니다. 이는 바이두가 모델에 정보를 제공하고 학습시키는 데이터셋을 포함해 많은 부분을 숨겨두었기 때문입니다.
투명한 오픈소스 AI 모델의 힘
AI 퍼즐의 각 조각이 모델 작동에 필수적이지만, AI 프로젝트의 80%가 실패하고, 데이터가 문제의 핵심에 있습니다. 부정확하고 불완전하며 편향된 데이터셋은 모델이 예측 가능하거나 원하는 대로 동작하지 않게 만듭니다.
The 최근 공개된 2023년 테슬라 완전 자율 주행(FSD) 치명적 사고 영상 (TSLA ), 예를 들어 데이터셋과 모델이 부족할 때 발생할 수 있는 최악의 시나리오를 드러냈습니다. 테슬라 모델 Y가 밝은 석양 속으로 가속하면서, 부분 자동화 시스템은 카메라가 포착한(또는 포착하지 못한) 상황을 제대로 이해하거나 적절히 반응하지 못했습니다. 인간이 운전한 차량은 속도를 줄이고 차를 세웠지만, FSD의 혼란으로 인해 한 여성의 사망 사고가 발생했습니다.
이 충격적인 실패는 불완전한 시각 데이터와 이러한 사각지대를 고려한 안전 메커니즘의 부재를 반영합니다. 개발자가 데이터에 대한 통찰이 없으면 데이터가 모델과 어떻게 상호작용하는지 파악할 수 없으며, 따라서 이러한 오류를 발견하고 견고한 성능을 위해 반복 개선할 수 없습니다.
더욱 우려되는 점은, 모델을 구동하는 데이터가 없으면 개발자는 모델을 맹목적으로 신뢰해야 한다는 것입니다.
하지만 데이터셋이 오픈소스일 경우, AI 커뮤니티는 문제를 근절할 수 있음을 입증했습니다. 예를 들어 LAION 5B에서 검증된 아동 성학대 자료를 포함한 1,000개 이상의 URL을 발견했습니다. AI 텍스트‑투‑이미지 생성 모델에 사용되는 이 데이터셋은 Stable Diffusion과 Midjourney 같은 앱을 만드는 기반이므로, 사용자가 불법적인 사진‑실사 이미지를 생성하기 시작했다면 AI 산업에 큰 타격이었을 것입니다. 그러나 이 데이터셋의 개방성 덕분에 커뮤니티가 위험한 콘텐츠를 발견하고 수정하도록 동기를 부여할 수 있었습니다, Liaison B.
게다가 최초 데이터셋의 대부분은 거대한 Common Crawl이 수행한 웹 스크래핑을 기반으로 했으며, 이는 ChatGPT와 LLAMA 모델에도 활용되었습니다. AI 크롤러가 저작권, 프라이버시, 편향 및 인종차별 라벨링에 대한 우려를 지속적으로 제기하고 있음에도, AI 커뮤니티의 개발자들은 Common Crawl이 지속적으로 확장하는 오픈소스 데이터셋의 일부를 보다 안전하게 사용하기 위해 정화하는 방안을 모색하고 있습니다.
개발자들이 강력한 AI뿐만 아니라 신뢰할 수 있는 AI를 구축하려는 목표를 갖는 한, 사용자와 산업 모두는 진정한 오픈소스의 투명성과 협업으로 보호받게 됩니다.
오픈소스 경로 수용하기
많은 이들이 아직도 이 급성장하는 기술을 경계하고 있는 가운데, 대형 AI 상용 모델의 iOS 또는 Android가 되기 위한 경쟁이 진행 중입니다. 전 세계 AI 커뮤니티가 미래의 표준이 될 것을 실제로 구축하고 있으며, AI 시스템이 이미 자동차를 운전하고 의료 평가를 제공하고 있는 상황에서, 편향 없고 신뢰할 수 있으며 안전한 AI를 만들어 신뢰를 구축하는 일은 그 어느 때보다 중요합니다.
중국 AI 커뮤니티가 스스로를 개방형 혁신의 선두주자로 자리매김하려는 상황에서, 안전한 AI로 가는 길은 수십 년간의 소프트웨어 혁신을 통해 입증된 진정한 오픈소스의 투명성 안에만 존재합니다. 데이터와 같은 핵심 요소를 공유하지 않는 시스템에 ‘오픈소스’라는 용어를 얹는 것은 개발자가 조사·재현·반복 개선을 할 수 없게 만듭니다. DeepSeek, ERNIE 4.5, Kimi K2, Qwen3와 같이 즉시 활용 가능한 모델들의 매력은 부인할 수 없지만, 이를 활용하는 개발자는 협업과 혁신을 촉진하는 투명성을 편리함과 교환하게 됩니다.
AI 커뮤니티는 선택해야 합니다: 진정한 오픈소스를 통한 급진적 투명성을 수용할지, 아니면 오늘날의 블랙박스 위에 내일의 핵심 시스템을 구축하는 위험을 감수할지.












