사상 리더
AI의 데이터 딜레마: 개인 정보 보호, 규제, 그리고 윤리적인 AI의 미래

AI 기반 솔루션은 매일 다양한 산업, 서비스, 제품에 걸쳐 빠르게 채택되고 있습니다. 그러나 이러한 솔루션의 효과는它们가 학습한 데이터의 품질에 완전히 의존합니다. 이는 데이터셋 생성 과정에서 종종 오해되거나 간과되는 측면입니다.
데이터 보호 당국이 AI 기술이 개인 정보 보호 및 데이터 보호 규정과 일치하는지에 대한 감시를 강화함에 따라, 기업들은 데이터를 수집, 주석 처리, 정제하는 데 있어 규제 준수 및 윤리적인 방법을 사용하도록 점점 더 큰 압력을 받고 있습니다.
진정한 의미에서 윤리적인 접근으로 AI 데이터셋을 구축할 수 있을까요? 기업들이 직면하는 가장 큰 윤리적인 도전은 무엇이며, 어떻게 이러한 도전을 해결하고 있나요? 또한 법적 프레임워크의 발전은 어떻게 훈련 데이터의 가용성과 사용에 영향을 미칠까요? 이러한 질문을 탐구해ボきましょう.
데이터 개인 정보 보호와 AI
AI는 본질적으로 많은 개인 데이터를 필요로 하여 작업을 수행합니다. 이는 데이터 수집, 저장, 사용에 대한 우려를 불러일으킵니다. 세계各地의 많은 법률은 개인 데이터의 사용을 규제하고 제한합니다. 유럽의 GDPR 및 새로 도입된 AI 법과 미국의 HIPAA 등이 있습니다.
세계各地의 데이터 보호 법률 엄격성에 대한 참조 / DLA Piper
예를 들어, 현재 14개의 미국 주는 포괄적인 데이터 개인 정보 보호 법률을 가지고 있으며, 6개 주에서는 2025년과 2026년 초에 법률이 시행될 예정입니다. 새로운 행정부는 데이터 개인 정보 보호 시행에 대한 접근 방식을 변경하는 신호를 보냈습니다. 주요 초점은 AI 규제이며, 이노베이션을 촉진하는 것보다 제한을 강조하지 않는 것입니다. 이러한 변화에는 이전의 AI에 관한 행정 명령을 폐지하고 개발 및 적용을 안내하는 새로운 지침을 도입하는 것이 포함됩니다.
데이터 보호 법률은 다양한 국가에서 발전하고 있습니다. 유럽에서는 법률이 더 엄격한 반면, 아시아나 아프리카에서는 덜 엄격합니다.
그러나 대부분의 국가에서는 개인 식별 정보(PII) — 얼굴 이미지, 여권과 같은 공식 문서, 또는 기타 민감한 개인 데이터 —를 제한합니다. UN 무역 및 개발에 따르면, 소비자의 동의나 통지 없이 개인 정보를 수집, 사용, 제3자에게 공유하는 것은 대부분의 국가에서 주요 우려 사항입니다. 194개 국가 중 137개가 데이터 보호 및 개인 정보 보호를 보장하는 규정을 가지고 있습니다. 따라서 대부분의 글로벌 기업은 모델 훈련에 PII를 사용하지 않도록 주의합니다. 이러한 규정은 EU에서 엄격히 금지하며, 법 집행과 같은 규제된 분야에서만 예외적으로 허용됩니다.
시간이 지남에 따라 데이터 보호 법률은 더 포괄적이고 세계적으로 시행되고 있습니다. 기업들은 법적 도전을 피하고 새로운 법적 및 윤리적 요구 사항을 충족하기 위해 자신의 관행을 조정하고 있습니다.
기업들이 데이터를 얻는 방법
모델을 훈련시키기 위한 데이터 보호 문제를 연구할 때, 기업들이 데이터를 얻는 방법을 이해하는 것이 중요합니다. 주로 세 가지 방법이 있습니다.
- 데이터 수집
이 방법은 크라우드소싱 플랫폼, 미디어 스톡, 오픈소스 데이터셋에서 데이터를 수집하는 것을 가능하게 합니다.
공개 미디어 스톡은 서로 다른 라이선스 계약의 대상이 될 수 있습니다. 상업적 사용 라이선스조차도 콘텐츠를 모델 훈련에 사용할 수 없다고 명시적으로 규정합니다. 이러한 기대는 플랫폼마다 다르며, 기업은 필요한 방식으로 콘텐츠를 사용할 수 있는지 확인해야 합니다.
AI 기업이 콘텐츠를 합법적으로 얻었더라도 여전히 몇 가지 문제에 직면할 수 있습니다. AI 모델 훈련의 빠른 발전은 법적 프레임워크를 앞질러갔습니다. 즉, AI 훈련 데이터를 둘러싼 규칙과 규정은 여전히 발전 중입니다. 따라서 기업은 법적 개발을 주의 깊게 모니터링해야 하며 라이선스 계약을 사용하기 전에 주의 깊게 검토해야 합니다.
- 데이터 생성
데이터셋을 준비하는 가장 안전한 방법 중 하나는 고유한 콘텐츠를 생성하는 것입니다. 예를 들어, 스튜디오나 야외 장소와 같은 제어된 환경에서 사람들을 촬영하거나, 행동을 녹화합니다. 참여자들은 데이터가 AI 훈련에 사용되는 것에 대한 동의서에 서명하며, 수집되는 데이터, 사용 방법, 접근할 수 있는 사람 등을 명시합니다. 이는 법적 보호를 보장하며, 기업은 불법적인 데이터 사용에 대한 주장을 피할 수 있습니다.
이 방법의 주요 단점은 비용입니다. 특히 에지 케이스 또는 대규모 프로젝트를 위한 데이터를 생성하는 경우 비용이 많이 듭니다. 그러나 대기업과 기업은 이 접근 방식을 사용하고 있습니다. 첫째, 모든 표준과 법적 규정에 대한 완전한 준수를 보장합니다. 둘째, 기업은 자신의 시나리오와 요구 사항에 완전히 맞춤형 데이터를 제공받을 수 있습니다. 이는 모델 훈련에서最高의 정확도를 보장합니다.
- 합성 데이터 생성
소프트웨어 도구를 사용하여 주어진 시나리오에 따라 이미지, 텍스트 또는 비디오를 생성하는 것입니다. 그러나 합성 데이터에는 제한이 있습니다. 즉, 미리 정의된 매개변수에 따라 생성되며 실제 데이터의 자연스러운 변异성을 결핍합니다.
이 결핍은 AI 모델에 부정적인 영향을 미칠 수 있습니다. 모든 경우에 관련이 있거나 항상 발생하는 것은 아니지만, 기억해야 할 중요한 점입니다. 특히 “모델 붕괴” — 과도한 합성 데이터 의존으로 인해 모델이 퇴화하여 품질이 낮은 출력을 생성하는 지점입니다.
합성 데이터는 여전히 기본 작업에 효과적일 수 있습니다. 예를 들어, 일반적인 패턴을 인식하거나, 객체를 식별하거나, 기본적인 시각적 요소인 얼굴을 구분하는 데 사용할 수 있습니다.
그러나 모델을 처음부터 완전히 훈련시키거나 드문 또는 매우 구체적인 시나리오를 다루는 경우에는 최선의 선택이 아닙니다.
가장 계시적인 상황은 운전석 내부 환경에서 발생합니다. 예를 들어, 운전 중인 사람을 촬영하거나, 운전 중에 아이를 돌보는 사람, 또는 무모한 운전을 하는 사람과 같은 경우입니다. 이러한 데이터 포인트는 공개 데이터셋에 일반적으로 사용할 수 없으며, 실제 개인을 사적인 환경에서 포함하기 때문에 사용할 수 없습니다. AI 모델은 훈련 데이터에 따라 합성 출력을 생성하므로, 실제로遭遇하지 못한 시나리오를 정확하게 표현하는 데 어려움을 겪습니다.
합성 데이터가 실패할 때, 제어된 환경에서 실제 배우와 함께 수집된 데이터가 해결책이 됩니다.
데이터 솔루션 제공업체인 Keymakr은 자동차에 카메라를 설치하고, 배우를 고용하여, 아기 돌보기, 물병으로 마시기, 또는 피로의 징후를 보이는 것과 같은 행동을 녹화합니다. 배우들은 데이터가 AI 훈련에 사용되는 것에 대한 동의서에 서명하며, 이는 개인 정보 보호 법률을 준수함을 보장합니다.
데이터셋 생성 과정에서의 책임
과정에 참여하는 각 당사자는 계약에 따라 특정 책임을 집니다. 첫 번째 단계는 계약을 체결하는 것입니다. 이는 관계의 성격, 기밀 유지 및 지적 재산권에 대한 조항을 포함합니다.
첫 번째 옵션, 즉 데이터를 처음부터 생성하는 경우를 고려해 보겠습니다. 지적 재산권 규정에 따르면, 제공자가 생성한 모든 데이터는 고용 회사에 속한다는 것을 의미합니다. 즉, 제공자는 데이터가 합법적으로 얻어졌으며, 적절하게 사용될 수 있음을 보장해야 합니다.
데이터 솔루션 회사인 Keymakr은 데이터를 생성하는 지역의 관할을 확인하고, 모든 관련 개인으로부터 적절한 동의를 얻으며, 데이터가 AI 훈련에 법적으로 사용될 수 있음을 보장함으로써 데이터 준수를 보장합니다.
또한, 데이터가 AI 모델 훈련에 사용된 후에는, 특정 데이터가 모델에 기여한 것인지를 결정하기가 거의 불가능합니다. AI는 모든 것을 혼합하기 때문입니다. 특히 수백만 개의 이미지와 같은 경우입니다.
이 분야는 아직 명확한 지침을 설정하고 있으므로, 책임을 분산하는 데에는 여전히 복잡성이 있습니다. 이는 자율 주행 자동차와 관련된 복잡성과 유사합니다. 운전자, 제조사, 또는 소프트웨어 회사와 같은 책임에 대한 질문은 여전히 명확한 분배를 필요로 합니다.
다른 경우에는, 주석 제공업체가 주석을 위한 데이터셋을 받았을 때, 클라이언트가 데이터를 합법적으로 얻었다고 가정합니다. 데이터가 불법적으로 얻었다는 명백한 징조가 있는 경우, 제공업체는 이를 보고해야 합니다. 그러나 그러한 명백한 경우는 극히 드뭅니다.
또한, 자신의 평판을 소중히 여기는 대기업, 기업, 브랜드는 데이터를 어디서 가져오는지 매우 주의합니다. 데이터가 처음부터 생성되지 않고 다른 법적 출처에서 가져온 경우에도 마찬가지입니다.
요약하면, 데이터 작업 과정에서 각 참가자의 책임은 계약에 따라 달라집니다. 이를 더 широк은 “지속 가능성 체인”의 일부로 간주할 수 있습니다. 여기서 각 참가자는 법적 및 윤리적 표준을 유지하는 데 중요한 역할을 합니다.
AI 개발의 백엔드에 대한 오해
AI 개발에 대한 주요 오해는 AI 모델이 검색 엔진과 유사하게 작동한다는 것입니다. 즉, 사용자에게 학습된 지식을 기반으로 정보를 수집하고 집계하여 제공합니다. 그러나 AI 모델, 특히 언어 모델은, 실제 이해보다는 확률에 기반하여 작동합니다. 이전 데이터에서 본 패턴에 따라 단어 또는 용어를 예측하며, 통계적 가능성에 따라 조정합니다. AI는 아무것도 “알지” 못합니다. 즉, 외삽합니다, 추측하며, 확률을 조정합니다.
또한, 많은 사람들이 AI 훈련에 엄청난 데이터셋이 필요하다고 생각하지만, AI가 인식해야 하는 대부분의 것 — 예를 들어, 개, 고양이, 인간 —은 이미 잘 정립되어 있습니다. 현재의 초점은 정확도를 개선하고 모델을 세부적으로 다루는 것입니다. 오늘날의 많은 AI 개발은 인식 능력을 재창조하는 것보다 정확도의 마지막 작은 간격을 닫는 데 중점을 두고 있습니다.
윤리적 도전과 유럽 연합 AI 법 및 미국 규제 완화의 영향
데이터의 윤리성과 합법성을 논의할 때, “윤리적인 AI”의 정의를 명확하게 이해하는 것이 중요합니다.
현재 기업들이 직면하는 가장 큰 윤리적 도전은 AI가 무엇을 하거나 무엇을 가르칠 수 있는지에 대한 기준을 설정하는 것입니다. 윤리적인 AI는 인간을 도와야 하며, 기만을 피해야 한다는 广泛한 합의가 있습니다. 그러나 AI 시스템은 오류를犯하거나 “환각”을 경험할 수 있으며, 이러한 오류가 기만 또는 피해로 간주되는지 여부를 결정하는 것은 도전입니다.
AI 윤리는 유네스코와 같은 조직이 참여하는 주요 논쟁입니다. 핵심 원칙은 감사 가능성 및 추적 가능성을 포함합니다.
데이터 액세스 및 AI 훈련을 둘러싼 법적 프레임워크는 AI의 윤리적 지형을 형성하는 데 중요한 역할을 합니다. 데이터 사용에 대한 제한이 적은 국가에서는 더 많은 훈련 데이터에 액세스할 수 있습니다. 반면, 데이터 법률이 더 엄격한 국가에서는 AI 훈련에 사용할 수 있는 데이터가 제한됩니다.
예를 들어, AI 법을 채택한 유럽과 많은 AI 규제를 폐지한 미국은 대조적인 접근 방식을 보여줍니다. 이는 현재의 글로벌 지형을 나타냅니다.
유럽 연합 AI 법은 유럽에서 운영되는 기업에重大한 영향을 미치고 있습니다. 이는 엄격한 규제 프레임워크를 시행하며, 기업이 특정 AI 모델을 사용하거나 개발하는 것을 어렵게 만듭니다. 기업은 특정 기술을 작업하기 위해 특정 라이선스를 얻어야 하며, 많은 경우 규정은 규칙을 준수하는 것을 거의 불가능하게 만듭니다.
결과적으로, 일부 스타트업은 유럽을 떠나거나 전혀 운영하지 않을 수 있습니다. 이는 암호화 규제와 유사한 영향을 미칩니다. 규제 요구 사항을 충족하는 데 필요한 투자를 감당할 수 있는 대기업은 적응할 수 있습니다. 그러나 법은 유럽에서 AI 혁신을 미국이나 이스라엘과 같은 규제가 덜 엄격한 시장으로 몰아갈 수 있습니다.
미국의 AI 개발에 더 많은 자원을 투자하고 규제를 완화하는 결정은 단점이 있지만, 시장에 더 많은 다양성을 가져올 수 있습니다. 유럽 연합은 안전性과 규제 준수를 중시하는 반면, 미국은 더 많은 위험을 감수하고, 최첨단 실험을 촉진할 가능성이 있습니다.













