사상 리더
인공지능/기계학습 전략을 죽일 수 있는 편향성과 그 대책
‘편향성’은 어떤 유형의 모델에서도 모델이 충분한 양의 고품질, 다양한 데이터로 훈련되지 않아 입력 데이터나 프롬프트에 대해 정확하게 반응하지 않는 상황을 설명합니다. 예를 들어, 애플의 얼굴 인식 휴대폰 잠금 해제 기능은 더 어두운 피부 톤을 가진 사람들에게서 훨씬 더 높은 실패율을 보였습니다. 모델은 더 어두운 피부를 가진 사람들의 이미지로 충분히 훈련되지 않았기 때문입니다. 이것은 비교적 낮은 위험의 편향성 예이지만, EU 인공지능법이 시장에 나갈 때 모델의 효능과 제어를 증명하는 요구를 제시한 이유입니다. 비즈니스, 금융, 건강, 또는 개인 상황에 영향을 미치는 출력을 가진 모델은 신뢰할 수 있어야 합니다. 그렇지 않으면 사용되지 않을 것입니다.
데이터로 편향성에 대처하기
고품질 데이터의 대량
인공지능/기계학습 모델에서 편향성과 최소화를 극복하고 줄이는 데 중요한 데이터 관리 관행 중 하나는 다양한 고품질 데이터의 대량을 얻는 것입니다. 이것은 그러한 데이터를 가지고 있는 여러 조직과 협력하는 것을 필요로 합니다. 전통적으로, 데이터 수집과 협력은 개인 정보 보호 및 지적 재산 보호 문제로 인해 어려움을 겪습니다. 민감한 데이터는 모델 소유자에게 보낼 수 없으며, 모델 소유자는 자신의 지적 재산을 데이터 소유자에게 누설할 위험이 있습니다. 일반적인 해결책은 모의 또는 합성 데이터를 사용하는 것입니다. 이것은 유용하지만 실제 데이터와 비교하여 제한이 있습니다. 이것이 개인 정보 보호 강화 기술(PETs)이 필요한答案을 제공하는 곳입니다.
합성 데이터: 가깝지만 아직 부족합니다
합성 데이터는 실제 데이터를 모방하기 위해 인공적으로 생성됩니다. 이것은 어렵지만 인공지능 도구로 조금 더 쉽게 만들 수 있습니다. 좋은 품질의 합성 데이터는 실제 데이터와 같은 특징 거리를 가져야 하며, 그렇지 않으면 유용하지 않을 것입니다. 좋은 품질의 합성 데이터는 훈련 데이터의 다양성을 효과적으로 높일 수 있습니다. 작은, 소수자 인구 또는 인공지능 제공자가 충분한 데이터를 가지고 있지 않은 인구를 위해 데이터의 간격을 채우는 데 사용할 수 있습니다. 합성 데이터는 또한 실제 세계에서 충분한 양으로 찾기 어려운 에지 케이스를 다루는 데 사용할 수 있습니다. 또한, 조직은 데이터 거주지 및 개인 정보 보호 요구 사항을 충족하기 위해 실제 데이터에 접근할 수 없을 때 합성 데이터 세트를 생성할 수 있습니다. 이것은 좋게 들리지만, 합성 데이터는 퍼즐의 한 조각에 불과하며, 해결책은 아닙니다.
합성 데이터의 한 가지 명백한 제한은 실제 세계와의 단절입니다. 예를 들어, 합성 데이터만으로 훈련된 자율 주행 자동차는 실제, 예상치 못한 도로 조건에 어려움을 겪을 것입니다. 또한, 합성 데이터는 실제 데이터에서 생성된 편향성을 물려받습니다. 이는 우리의 논의 목적을 무효화합니다. 결론적으로, 합성 데이터는 세부 사항을 다루고 에지 케이스를 다루는 데 유용한 옵션입니다. 그러나 모델의 효능과 편향성 최소화를 크게 개선하려면 실제 데이터에 접근하는 것이 필요합니다.
더好的 방법: PETs를 사용한 실제 데이터
PETs는 데이터를 사용하는 동안 보호합니다. 인공지능/기계학습 모델의 경우, 모델을 실행하는 동안 모델의 지적 재산도 보호할 수 있습니다. “두 마리 토끼를 한 번에 잡는” 해결책입니다. PETs를 사용하는 솔루션은 이전에는 개인 정보 보호 및 보안 문제로 인해 접근할 수 없었던 실제, 민감한 데이터 세트로 모델을 훈련할 수 있는 옵션을 제공합니다. 실제 데이터에 대한 접근을 잠금 해제하는 이것이 편향성을 줄이는 최상의 옵션입니다. 그러나 실제로 어떻게 작동할까요?
현재, 주요 옵션은 기밀 컴퓨팅 환경에서 시작합니다. 그런 다음, PETs 기반 소프트웨어 솔루션과 통합하여 즉시 사용할 수 있도록 합니다. 이 솔루션은 표준 신뢰할 수 있는 실행 환경(TEE)에 포함되지 않은 데이터 거버넌스 및 보안 요구 사항을 해결합니다. 모델과 데이터는 모두 보안 컴퓨팅 환경으로 보내기 전에 암호화됩니다. 환경은 어디에서 호스팅할 수 있으며, 이는 데이터 지역화 요구 사항을 해결할 때 중요합니다. 이는 모델의 지적 재산과 입력 데이터의 보안이 계산 중에 유지됨을 의미합니다. 즉, 신뢰할 수 있는 실행 환경 제공자는 환경 내의 모델이나 데이터에 접근할 수 없습니다. 암호화된 결과는 검토를 위해 반환되고, 로그는 검토를 위해 사용할 수 있습니다.
이 흐름은 데이터가 어디에 있거나 누구에게 속하든지 상관없이 최고의 품질의 데이터에 대한 경로를 제공하며, 편향성을 최소화하고 신뢰할 수 있는 모델을 만드는 데 도움이 됩니다. 이 흐름은 EU 인공지능법에서 설명한 인공지능 규제 샌드박스의 요구 사항을 충족합니다.
윤리적 및 법적 준수를 촉진하기
좋은 품질의 실제 데이터를 얻는 것은 어렵습니다. 데이터 개인 정보 보호 및 지역화 요구 사항은 즉시 접근할 수 있는 데이터 세트를 제한합니다. 혁신과 성장이 발생하려면 데이터가 가치 추출을 위해 사용할 수 있는 사람에게 흐르기 위해 데이터가 흐르기 위해야 합니다.
EU 인공지능법의 제54조는 “고위험” 모델 유형에 대한 요구 사항을 규정합니다. 즉, 시장에 나갈 수 있도록 충분한 모델 효능과 모든 제어를 증명해야 합니다. 요약하면, 팀은 실제 세계 데이터를 인공지능 규제 샌드박스 내에서 사용하여 모델의 효능과 제어를 충분히 증명해야 합니다. 제어에는 모니터링, 투명성, 설명 가능성, 데이터 보안, 데이터 보호, 데이터 최소화, 모델 보호가 포함됩니다. DevSecOps + Data Ops를 생각해 보십시오.
첫 번째 도전은 실제 세계 데이터 세트를 찾는 것입니다. 이는 고위험 모델 유형에 민감한 데이터이기 때문입니다. 기술 보장이 없으면 많은 조직이 모델 제공업체에 데이터를 신뢰하거나 제공할 수 없습니다. 또한, 법이 인공지능 규제 샌드박스를 정의하는 방식은 자체적으로 도전입니다. 일부 요구 사항에는 모델이 실행된 후 시스템에서 데이터가 제거되고, 거버넌스 제어, 시행, 보고를 증명하는 것이 포함됩니다.
많은 조직은 데이터 클린 룸(DCR)과 신뢰할 수 있는 실행 환경(TEE)을 사용하려고 시도했습니다. 그러나 이러한 기술은 데이터 및 인공지능 규제 요구 사항을 충족하기 위해 작동하기 위해 상당한 전문 지식과 노력이 필요합니다. DCR은 더 단순하게 사용할 수 있지만, 아직 더 강력한 인공지능/기계학습 요구 사항에 유용하지 않습니다. TEE는 보안 서버이지만, 유용하게 사용하기 위해 빠르게 통합된 협력 플랫폼이 필요합니다. 그러나 이것은 PETs 플랫폼이 TEE와 통합하여 설정 및 사용을 간소화하고, 인공지능 규제 샌드박스 및 민감한 데이터의 취득 및 사용을 가능하게 하는 기회를 식별합니다.
다양하고 포괄적인 데이터 세트를 개인 정보 보호를 유지하면서 사용할 수 있도록 허용함으로써, 이러한 기술은 인공지능 및 기계학습 관행이 데이터 개인 정보 보호와 관련된 윤리적 표준 및 법적 요구 사항을 준수하는 것을 보장합니다. 예를 들어, GDPR 및 EU 인공지능법이 있습니다. 요약하면, 요구 사항은 종종 들을 수 있는 투덜거림과 한숨으로 반응하지만, 이러한 요구 사항은 우리가 중요한 데이터 기반 의사 결정에 신뢰하고 의존할 수 있는 더 나은 모델을 구축하는 것을 안내하는 것입니다.同時에 모델 개발 및 사용자 지정에 사용된 데이터 주체의 개인 정보를 보호합니다.












