윤리

스타트업 언바이어스드, 블록체인 통해 데이터 투명성 높이고 데이터 편향성 극복하기

mm
Unite.AI를 Google의 선호 소스에 추가

인공지능에서 데이터 편향의 영향은 잘 문서화되어 있으며, 인공지능과 기계 학습 알고리즘이 사회의 모든 구석으로 더 깊이 침투함에 따라, 인공지능 회사들은 개발한 알고리즘이 인간의 편향을 물려받지 않도록 하는 새로운 방법을 찾고 있습니다. 인공지능과 기계 학습 분야에서 새로운 플레이어 중 하나인 스타트업 언바이어스드(Unbiased)는 데이터 편향을 줄이기 위해 노력하고 있습니다. 언바이어스드는 새로운 데이터 마켓플레이스를 출시했으며, 활발한 블록체인 플랫폼인 텔로스(Telos)에서 데이터 과학 및 인공지능을 위한 분산형, 개인 정보 우선 도구와 애플리케이션을 제공하려고 합니다.

전 세계 인공지능 시장은 향후 10년 동안 빠른 성장세를 유지할 것으로 예상되며, 2027년까지 약 2,660억 달러에 달할 것으로 예상됩니다. 향후 4년 내에 인공지능 시스템과 관련 구성 요소에 대한 세계적인 지출은 약 1,100억 달러로 두 배로 증가할 것으로 예상되며, 이는 IDC에 따르면 2024년까지 달성될 것입니다. 인공지능 알고리즘이 더 많은 산업에 적용됨에 따라 인공지능 시스템의 투명성, 개인 정보 보호, 공정성, 대표성에 대한 우려가 증가하고 있습니다.

투명성을 통해 편향 줄이기

最近에 발표된 카프제미니 연구소의 보고서에 따르면, 인공지능의 윤리적 사용이 IT 리더들에게 주요 관심사로 부상하고 있습니다. 대부분의 IT 리더들은 인공지능 시스템의 잠재적인 오남용에 대해 우려를 표명하고 있으며, 약 9명 중 8명의 IT 조직은 인공지능 시스템의 적용으로 인해 발생한 적어도 하나의 윤리적 문제를 인식하고 있습니다. 약 3분의 2의 IT 경영진은 인공지능 시스템에서 잠재적인 차별적 편향을 인식하고 있으며, 약 절반의 IT 조직은 인공지능 개발을 위한 윤리 헌장을 가지고 있으며, 이는 2019년의 5%에 비해 크게 증가한 것입니다.

인공지능 알고리즘이 더 공정해질 수 있는 방법에 대한 연구가 계속되는 동안, 많은 윤리학자와 인공지능 전문가들은 인공지능을 훈련하는 데 사용되는 데이터에 초점을 두고 있습니다. 인공지능 알고리즘이 더 普遍하고 표준화됨에 따라, 모델을 훈련하는 데 필요한 데이터를 얻는 데 초점이 맞춰지고 있습니다.

인공지능 알고리즘에서 데이터 편향을 줄이는 방법은 여러 가지 있습니다. 일부 기술은 모델이나 훈련 데이터를 조정하는 것을 포함하며, 이러한 기술은 “처리 중” 편향 교정 기술입니다. 이러한 기술에는 적대적 훈련 기술이 포함되며, 이는 민감한 특征/변수(예: 성별 또는 인종)를 제어하기 위해 모델의 예측 능력을 벌칙으로 처리하는 것입니다. 이는 모델의 오류를 최소화하는 것과 동시에 수행됩니다. 반면에, 데이터셋에서 편향을 제거하는 것은 전처리 기술입니다. 기계 학습 모델을 위한 훈련 데이터는 종종 수동으로 레이블이 지정되며, 블록체인의 적용은 회사들이 데이터의 레이블 지정 과정을 추적하여 데이터셋이 대표적임을 보장하는 데 도움이 될 수 있습니다.

언바이어스드는 데이터셋과 데이터 마켓플레이스 내에서 투명한 문화를 조성하기 위해 블록체인을 활용하려고 합니다. 인공지능 시스템과 기계 학습 알고리즘을 위한 데이터셋을 생성하는 대부분의 도구는 중앙화되어 있으며, 따라서 투명성이 부족합니다. 언바이어스드는 블록체인의 특성을 활용하여 데이터 마켓플레이스에서 발생하는 모든 동작(데이터 교환, 작업 및 프로젝트 할당, 작업자 기여)을 기록하려고 합니다. 목표는 텔로스 블록체인의 분산형 특성이 투명성을 제공하여 사용자가 데이터 과학의 본질에 대한 중요한 정보를 얻을 수 있도록 하는 것입니다. 사용자는 데이터셋을 검증하고 특정 윤리 원칙(공정성 및 개인 정보 보호 등)에 따라 주석이 처리되었는지 확인할 수 있습니다.

텔로스 블록체인의 수석 아키텍트에 따르면, 인공지능/기계 학습과 블록체인의 교차는 데이터를 처리하는 새로운 방법으로 변革될 수 있습니다. 언바이어스드의 호른은 AIthority에서 인용했습니다.

“언바이어스드는 이러한 산업에 높은 성능, 수수료가 없는 블록체인인 텔로스를 사용하여 데이터를 기록하는 것이 투명성, 불변성, 미세 지불, 거버넌스를 제품에 추가하여 모든 이해관계자에게ประโยชน을 제공할 수 있음을 보여줄 것입니다.”

훈련 데이터의 투명성을 넘어, 일부 과학자와 연구자들은 알고리즘, 모델, 코드에 대한 더 많은 투명성을 주장했습니다. 국제 과학자 팀은 컴퓨터 과학 연구자들이 더 높은 투명성 표준을遵守하도록 과학 저널에 요구했습니다. 연구자들은 알고리즘 및 코드에 대한 더 많은 투명성이 연구의 재현성을 도울 뿐만 아니라 연구 그룹 간의 협력을 도울 것이라고 주장했습니다. 많은 과학적 연구는 재현할 수 없으며, 이는 블록체인이 인공지능 분야의 연구 추적 및 평가를 개선하는 데 사용될 수 있는 훨씬 더 큰 문제입니다.

블로거이자 프로그래머로 Machine Learning Deep Learning 주제에 전문가입니다. 다니엘은 다른 사람들이 AI의 힘을 사회적善으로 사용하는 것을 돕기를 희망합니다.