AI 모델 및 플랫폼
웹 스크래핑된 AI 데이터셋과 개인 정보: CommonPool을 왜 고려해야 하는가

인공 지능 (AI)은 일상 생활의 일부가 되었습니다. 의료 챗봇이 환자를 안내하고 생성 도구가 예술가, 작가, 개발자를 지원하는 데 사용됩니다. 이러한 시스템은 발전된 것으로 보이지만 하나의 필수 자원에 의존합니다: 데이터.
AI 시스템을 훈련하는 데 사용되는 대부분의 데이터는 공공 인터넷에서 가져옵니다. 자동화된 프로그램이 온라인 플랫폼에서 대량의 텍스트, 이미지 및 오디오를 수집합니다. 이러한 수집은 잘 알려진 모델인 GPT-4, Stable Diffusion 및 기타 모델의 기초를 형성합니다. 그러나 이러한 거대한 수집은 개인 정보, 소유권 및 정보 동의와 관련된 해결되지 않은 문제를 제기합니다.
훈련 데이터셋 시장은 이러한 활동의 규모를 반영합니다. 현재 글로벌 AI 데이터셋의 가치는 32억 달러로 추정됩니다. 예측에 따르면 2034년까지 163억 달러로 증가할 수 있으며 연간 성장률은 20.5%입니다. 이러한 수치 뒤에는 중요한 도전이 있습니다. 수집된 자료의 상당 부분은 명시적인 허가 없이 얻어졌습니다. 종종 개인 데이터, 저작권이 있는 작품 및 기계 학습 시스템에서 사용되지 않은 다른 민감한 내용을 포함합니다.
이러한 문제에 대응하여 데이터 거버넌스에 대한 대안 접근 방식이 탐색되고 있습니다. 하나의 예는 CommonPool입니다. 2023년 4월에 DataComp 벤치마크의 일부로 출시되었습니다. 이는 멀티모달 AI 연구를 위한 128억 개의 이미지-텍스트 쌍으로 구성된 대규모 데이터셋입니다. 전통적인 스크래핑 노력과 달리 필터링 방법을 적용하고 투명성을 강조하며 개발에 커뮤니티 참여를 포함합니다. 아직 논란의 여지가 있지만 CommonPool은 더 책임감 있게 관리되는 AI 훈련 데이터를 구축하려는 시도를 나타냅니다. 이러한 이니셔티브는 미래의 인공 지능에서 윤리적 표준의 필요성을 강조합니다.
웹 스크래핑된 데이터의 인공 지능 발전에 대한 역할
데이터는 AI의 핵심입니다. 시스템 성능은 사용 가능한 훈련 정보의 양과 다양성에密接적으로 연결되어 있습니다. 최근 몇 년 동안 웹 스크래핑은 대규모 데이터셋을 구축하는 표준 방법이 되었습니다. 공개적으로 액세스할 수 있는 온라인 콘텐츠를 수집하여 연구자와 개발자는 방대한 양의 데이터 자원을 얻을 수 있습니다.
人気 있는 예는 Common Crawl입니다. 2025년까지 250테라바이트 이상의 텍스트를 수집하여 매월 크롤링을 통해 페타바이트의 텍스트를 저장했습니다. 이 데이터셋은 텍스트 기반 AI 모델을 훈련하는 데 널리 사용됩니다. 또 다른 예는 LAION-5B로, 약 58.5억 개의 이미지-텍스트 쌍을 포함하고 있습니다. Stable Diffusion과 같은 응용 프로그램에서 쓸모가 있습니다. Stable Diffusion은 텍스트 프롬프트에서 현실적인 이미지를 생성할 수 있습니다.
이러한 데이터셋은 모델의 정확도를提高하고 다양한 콘텐츠를 통해 일반화하는 데 도움이 되며, 대학을 포함한 더 작은 그룹이 AI 개발에 참여할 수 있도록 합니다. 스탠퍼드 AI 지수 2025에 따르면 대부분의 고급 모델은 여전히 스크래핑된 데이터에 의존하며, 데이터셋은 빠르게 증가하고 있습니다. 이 수요는 또한 데이터 센터와 컴퓨팅 파워에 대한 투자를 추진하여 2024년에는 570억 달러에 달했습니다.
그러나 웹 스크래핑은 도전 без입니다. 개인 정보, 소유권 및 법적 권리에 대한 질문을 제기합니다. 수집된 콘텐츠는 원래 기계 사용을 위해 생성되지 않았기 때문입니다. 법원 사건과 정책 논의는 이러한 도전이 더욱 긴급해지고 있음을 보여줍니다. AI 데이터 수집의 미래는 발전과 윤리적 책임 사이의 균형을 찾는 데 달려 있습니다.
스크래핑된 데이터의 개인 정보 문제
웹 스크래핑 도구는 일반 콘텐츠와 민감한 세부 정보를 명확하게 구분하지 않고 정보를 수집합니다. 텍스트와 이미지와 함께 개인 식별 정보(PII)와 같은 이름, 이메일 주소 및 얼굴 사진을 종종 캡처합니다.
감사에 따르면 2025년 7월에 CommonPool 데이터셋은 필터링 후에도 여전히 0.1%의 샘플에 식별 가능한 얼굴, 정부 ID 및 문서(이력서 및 여권 등)가 포함되어 있었습니다. 비율은 작아 보이지만, 수십억 개의 레코드에서는 수백만 명의 개인에게 영향을 미칩니다. 검토와 안전 감사는 이러한 자료의 존재가 비정상적이지 않으며, 그 위험에는 개인 정보 보호 위반, 표적화된 괴롭힘 및 사적인 데이터의 의도하지 않은 노출이 포함됨을 확인합니다.
법적 분쟁도 증가하고 있습니다. 데이터 소유권과 공정 사용에 대한 우려가 법정으로 옮겨가고 있습니다. 2023년과 2024년 사이에 OpenAI 및 Stability AI와 같은 회사들은 개인 및 저작권 데이터를 동의 없이 사용한 것으로 소송을 당했습니다. 2025년 2월, 미 연방 법원은 라이센스되지 않은 개인 정보를 AI에 훈련하는 것이 침해에 해당한다고 판결했습니다. 이 결정으로 인해 더 많은 집단 소송이 발생했습니다. 저작권도 주요 문제입니다. 많은 스크래핑된 데이터셋에는 책, 기사, 미술 및 코드가 포함되어 있습니다. 작가와 예술가는 자신의 작품이 승인이나 지불 없이 사용되고 있다고 주장합니다. 진행 중인 뉴욕 타임즈 대 OpenAI 사건은 AI 시스템이 보호된 콘텐츠를 불법적으로 복제하는지 여부를 묻고 있습니다. 시각 예술가들도 유사한 불만을 제기하며, AI가 개인적인 스타일을 복사한다고 주장합니다. 2025년 6월, 미국 법원은 한 AI 회사에 대해 공정 사용을 지지했지만, 전문가들은 판결이 일관적이지 않으며 법적 프레임워크는 아직 불분명하다고 말합니다.
스크래핑된 데이터셋을 대체하기 어려운 이유
개인 정보 및 동의와 관련된 우려에도 불구하고, 스크래핑된 데이터셋은 여전히 AI 훈련에 필요합니다. 이유는 규모입니다. 현대의 AI 모델은 텍스트, 이미지 및 기타 미디어에서 수조 개의 토큰을 필요로 합니다. 라이센스된 소스나 큐레이션된 소스만을 통해 이러한 데이터셋을 구축하는 것은 수백만 달러의 비용이 듭니다. 이것은 대부분의 스타트업이나 대학에게는 실용적이지 않습니다.
큰 비용은 큐레이션된 데이터셋의唯一 도전이 아닙니다. 종종 특정 언어, 지역 또는 커뮤니티에 초점을 맞추고 있으며, 이는 AI 모델이 균형을 잃을 수 있습니다. 반대로, 스크래핑된 데이터는 다소 잡음이 있지만, 더 넓은 범위의 문화, 주제 및 관점을 포착합니다. 이러한 다양성은 AI 시스템이 실제 사용에 더 잘 작동하도록 합니다.
그러나 위험은 엄격한 규제로 인해 스크래핑된 데이터에 대한 접근이 제한될 수 있다는 것입니다. 이것이 발생하면 더 작은 조직이 경쟁하기 어렵게 될 수 있습니다. 구글이나 메타와 같은 대규모 회사들은 사적 또는 독점적인 데이터셋을 가지고 있기 때문에 발전을 계속할 수 있습니다. 이러한 불균형은 경쟁을 줄이고 AI의 개방형 혁신을 늦출 수 있습니다.
현재, 스크래핑된 데이터셋은 AI 연구의 핵심입니다.同时, CommonPool과 같은 프로젝트는 광범위하고 윤리적으로 출처된 수집을 탐색하는 방법을 찾고 있습니다. 이러한 노력은 AI 생태계를 더 개방적이고 공정하며 책임감 있게 유지하는 데 필요합니다.
CommonPool: 대규모 데이터 엔지니어링을 위한 책임감 있는 접근
CommonPool은 대규모 멀티모달 데이터셋을 구축하기 위한 가장 기술적으로雄心적인 시도 중 하나입니다. 약 128억 개의 이미지-텍스트 쌍으로 구성된 이 데이터셋은 LAION-5B와 같은 규모를 가지지만, 더 강력한 데이터 엔지니어링 및 거버넌스 메커니즘을 통합합니다. 주요 설계 목표는 규모를 최대화하는 것뿐만 아니라, 재현성, 데이터 출처 및 규제 준수를 고려하는 것이었습니다.
CommonPool 데이터셋의 구축은 구조화된 3단계 파이프라인을 따릅니다. 첫 번째 단계는 2014년과 2022년 사이에 수집된 Common Crawl 스냅샷에서 원시 샘플을 추출하는 것입니다. 이미지와 관련된 텍스트(캡션 또는 주변 문장 등)가 모두 수집됩니다. 의미적 정렬을 평가하기 위해 유지 관리자는 CLIP 기반 유사성 점수를 적용하여 이미지와 텍스트 임베딩 사이의 상관관계가 약한 쌍을 버립니다. 초기 필터링 단계는 순수한 스크래핑 파이프라인과 비교하여 잡음을 크게 줄입니다.
두 번째 단계에서는 데이터셋이 대규모 중복 제거를 거칩니다. 지각적 해싱 및 MinHash 기술을 사용하여 거의 중복된 이미지를 식별하고 제거하여 모델 훈련에서 중복을 방지합니다. 추가 필터를 적용하여 손상된 파일, 손상된 링크 및 저해상도 이미지를 제외합니다. 이 단계에서는 또한 텍스트 정규화 및 자동 언어 식별을 포함하여 도메인별 또는 언어별 하위 집합을 생성할 수 있습니다.
세 번째 단계는 안전성 및 규정 준수를 중점으로 합니다. 자동 얼굴 감지 및 블러링을 적용하고, 아동 관련 이미지 및 개인 식별자(이름, 이메일 주소, 우편 주소 등)를 제거합니다. 파이프라인은 또한 저작권 자료를 감지하려고 합니다. 웹 규모에서 완벽한 필터링을 보장하는 자동화된 방법은 없지만, 이러한 안전 장치는 LAION-5B와 비교하여 기술적인 개선입니다.
데이터 처리를 넘어서, CommonPool은 정적 데이터셋 릴리스와 구별되는 거버넌스 모델을 도입합니다. 버전화된 릴리스, 구조화된 메타데이터 및 문서화된 업데이트 주기를 통해 라이브 데이터셋으로 유지 관리됩니다. 각 샘플에는 사용 가능한 경우 라이센스 정보가 포함되어 저작권 규정 준수를 지원합니다. 제거 프로토콜을 통해 개인과 기관은 민감한 콘텐츠의 제거를 요청할 수 있으며, EU AI 법과 관련 규제 프레임워크에서 제기된 우려에 대응합니다. 메타데이터(소스 URL 및 필터링 점수 등)는 투명성과 재현성을 개선하여 연구자가 포함 및 제외 결정의 추적을 가능하게 합니다.
DataComp 이니셔티브의 벤치마크 결과는 이러한 설계 선택의 기술적 영향을 보여줍니다. 동일한 비전-언어 아키텍처를 LAION-5B와 CommonPool에 훈련했을 때, 후자는 더 안정적인 다운스트림 성능을 보여주었습니다. 특히 미세한 검색 및 제로샷 분류 작업에서 그렇습니다. 이러한 결과는 CommonPool의 더 높은 정렬 품질이 일부 필터링되지 않은 데이터셋의 규모优势을 보상한다는 것을 시사합니다. 그러나 2025년의 독립적인 감査는 여전히 잔류 위험이 있음을 보여주었습니다. 약 0.1%의 데이터셋에는 여전히 블러되지 않은 얼굴, 민감한 개인 문서 및 의료 기록이 포함되어 있었습니다. 이는 자동화된 필터링 파이프라인의 한계를 강조합니다.
전반적으로, CommonPool은 데이터셋 엔지니어링에서 원시 규모를 우선하는 것에서 규모, 품질 및 규정 준수를 균형 있게 하는 방향으로의 전환을 나타냅니다. 연구자에게는 더 재현 가능하고 비교적 안전한 대규모 사전 훈련의 기초를 제공합니다. 규제 기관에게는 개인 정보 및 책임성 메커니즘을 직접 데이터셋 구축에 통합할 수 있음을 보여줍니다. LAION과 비교하여, CommonPool은 필터링 파이프라인, 거버넌스 관행 및 벤치마크 프레임워크를 통해 대규모 웹 데이터를 더 기술적으로 강력하고 윤리적으로 책임감 있는 멀티모달 AI를 위한 자원으로 변형할 수 있음을 보여줍니다.
CommonPool과 전통적인 웹 스크래핑된 데이터셋의 비교
CommonPool은 LAION-5B(5.85억 샘플), COYO-700M(700M 샘플) 및 WebLI(400M 샘플)와 같은 이전의 대규모 웹 스크래핑된 데이터셋과 달리, 구조, 재현성 및 거버넌스를 강조합니다. 메타데이터(URL 및 타임스탬프 등)를 유지하며, 추적 가능성 및 일부 라이센스 확인을 지원합니다. 또한, CLIP 기반 의미 필터링을 적용하여 저품질 또는 약하게 정렬된 이미지-텍스트 쌍을 제거하여 데이터 품질을 개선합니다.
비교하면, LAION-5B와 COYO는 제한된 필터링 및 자세한 라이센스 문서화 없이 Common Crawl에서 조립되었습니다. 이러한 데이터셋은 종종 민감한 자료를 포함하며, 의료 기록, 신분증명서 및 블러되지 않은 얼굴이 포함됩니다. OpenAI에서 내부적으로 사용되는 WebLI도 투명성이 부족하여 외부 검토 또는 복제를 위해 공개되지 않았습니다.
CommonPool은 이러한 문제를 해결하기 위해 개인 정보 및 성인 콘텐츠를 제외하는 것을 목표로 합니다. 그러나 사용자 동의는 여전히 해결되지 않은 문제입니다. 이는 이전의 대안보다 비교적 더 신뢰할 수 있고 윤리적으로 일치합니다.
결론
CommonPool의 개발은 대규모 AI 데이터셋이 구상되고 유지되는 방식에서 중요한 전환을 반영합니다. 이전의 수집물은 제한된 감독과 함께 규모를 우선시했지만, CommonPool은 투명성, 필터링 및 거버넌스를 데이터셋 구축에 통합할 수 있음을 보여줍니다. 이는 연구를 위한 더 재현 가능하고 책임감 있는 자원을 제공합니다. 동시에, 독립적인 감査는 자동화된 안전 장치가 완전히 위험을 제거할 수 없음을 상기시킵니다. 이는 지속적인 주의가 필요하다는 것을 강조합니다.
메타데이터를 유지하고, 의미 정렬 점수를 적용하고, 개인 정보 보호를 위한 안전 장치를 포함함으로써, CommonPool은 더 재현 가능하고 책임감 있는 자원을 제공합니다. 동시에, 독립적인 감査는 자동화된 안전 장치가 완전히 위험을 제거할 수 없음을 상기시킵니다. 이는 지속적인 주의가 필요하다는 것을 강조합니다.












