윤리

5개의 기초적인 책임있는 AI를 위한 기둥

mm
Unite.AI를 Google의 선호 소스에 추가

새로운 디지털 경제에서 생성되는 데이터의 海를 처리하기 위한 AI/ML 시스템의 성장은 압도적입니다. 그러나 이러한 성장과 함께, AI의 윤리적 및 법적 영향에 대해 심각하게 고려해야 합니다.

예를 들어 자동 대출 승인을 포함하여 점점 더 복잡하고 중요한 작업을 AI 시스템에 맡길 때, 이러한 시스템이 책임감 있고 신뢰할 수 있는지에 대해 절대적으로 확신해야 합니다. AI에서 편향을 줄이는 것은 많은 연구자들에게巨大한 영역이 되었으며, 이러한 시스템에 주는 자율성의 양과 함께巨大한 윤리적 의미를 가지고 있습니다.

책임있는 AI의 개념은 AI 배포에 대한 신뢰를 구축하는 데 도움이 되는 중요한 프레임워크입니다. 책임있는 AI에는 5개의 핵심 기둥이 있습니다. 이 기사에서는 이러한 기둥을 탐구하여 더 나은 시스템을 구축하는 데 도움을 줄 것입니다.

1. 재현성

소프트웨어 개발 세계에는 “hey, it works on my machine”라는 옛말이 있습니다. ML과 AI에서는 이 문구를 “hey, it works on my dataset”으로 바꿀 수 있습니다. 즉, 기계 학습 모델은 종종 블랙 박스와 같습니다. 많은 훈련 데이터 세트에는 샘플링 편향 또는 확인 편향과 같은 내재된 편향이 있을 수 있으며, 이는 최종 제품의 정확성을 낮출 수 있습니다.

AI/ML 시스템을 더 재현 가능하고, 따라서 정확하고 신뢰할 수 있게 하기 위해 첫 번째 단계는 MLOps 파이프라인을 표준화하는 것입니다. 가장 똑똑한 데이터 과학자들도 각자의 선호하는 기술과 라이브러리가 있으므로, 특성 엔지니어링과 결과 모델은 사람마다 균일하지 않습니다. MLflow와 같은 도구를 사용하면 MLOps 파이프라인을 표준화하여 이러한 차이를 줄일 수 있습니다.

AI/ML 시스템을 더 재현 가능하게 만드는 또 다른 방법은 “골드 데이터 세트”라고 하는 것을 사용하는 것입니다. 이러한 데이터 세트는 새로운 모델을 프로덕션에 출시하기 전에 테스트와 검증으로 작용하는 대표적인 데이터 세트입니다.

2. 투명성

앞서 언급했듯이, 많은 ML 모델, 특히 신경망은 블랙 박스입니다. 이러한 모델을 더 책임감 있게 만들기 위해, 더 해석 가능하게 만들어야 합니다. 의사 결정 트리와 같은 단순한 시스템의 경우, 시스템이 특정 결정을 내린 이유와 방법을 이해하기는 khá 쉽습니다. 그러나 AI 시스템의 정확도와 복잡도가 증가할수록, 해석 가능성은 종종 낮아집니다.

신경망과 딥 러닝과 같은 복잡한 AI 시스템에도 투명성을 제공하려고 하는 새로운 연구 분야가 있습니다. 이 분야는 “설명 가능성”이라고 하며, 프록시 모델을 사용하여 신경망의 성능을 복사하면서, 중요한 특징에 대한 유효한 설명을 제공하려고 합니다.

이 모든 것이 공정성으로 이어집니다. 특정 결정을 내린 이유를 알고, 그 결정이 공정한지 확인하고 싶습니다. 또한 편향이 모델에 침투하지 않도록 부적절한 특징이 고려되지 않도록 해야 합니다.

3. 책임성

책임있는 AI의 가장 중요한 측면은 책임성입니다. 이 주제에 대한 많은 논의가 있으며, 정부 부문에서도 AI 결과를 추동하는 정책에 대해 논의하고 있습니다. 이 정책 기반 접근 방식은 인간이 루프에 포함되어야 하는 단계를 결정합니다.

책임성은 정책을 안내하고 AI/ML 시스템을 제어하는 데 도움이 되는 강력한 모니터링과 메트릭이 필요합니다. 책임성은 재현성과 투명성을 결합하지만, 효과적인 감시가 필요하며, 이는 AI 윤리 위원회를 통해 제공될 수 있습니다. 이러한 위원회는 정책 결정, 측정할 항목을 결정하고, 공정성 검토를 수행할 수 있습니다.

4. 보안

AI 보안은 데이터의 기밀성과 무결성을 중점으로 합니다. 시스템이 데이터를 처리할 때, 안전한 환경에서 처리되기를 원합니다. 데이터가 데이터베이스에 저장되어 있을 때와 파이프라인을 통해 호출될 때 암호화되어야 합니다. 그러나 모델에 평문으로 입력되는 동안 취약점이仍然 존재합니다. 호모모르픽 암호화와 같은 기술은 암호화된 환경에서 기계 학습 훈련을 허용하여 이 문제를 해결합니다.

또 다른 측면은 모델 자체의 보안입니다. 예를 들어, 모델 반전 공격으로 해커가 모델을 빌드하는 데 사용된 훈련 데이터를 학습할 수 있습니다. 또한 모델 중독 공격이 있으며, 모델이 훈련되는 동안 나쁜 데이터를 삽입하여 모델의 성능을 완전히 손상시킬 수 있습니다. 이러한 적대적 공격에 대한 모델을 테스트하면 모델을 안전하고 보안되게 유지할 수 있습니다.

5. 개인 정보 보호

구글과 오픈마인드는 최근에 AI 개인 정보 보호를 우선하고 있으며, 오픈마인드는 이 주제에 대한 최근 컨퍼런스를 개최했습니다. GDPR과 CCPA와 같은 새로운 규정 및 향후 추가 규정으로 인해 개인 정보 보호는 기계 학습 모델을 훈련하는 방식에서 핵심 역할을 할 것입니다.

고객의 데이터를 개인 정보 보호에 주의하여 처리하는 방법 중 하나는 연합 학습을 사용하는 것입니다. 이 분산 기계 학습 방법은 모델을 로컬로 훈련한 다음 중앙 허브에서 각 모델을 집계하면서 데이터를 안전하고 보안되게 유지합니다. 또 다른 방법은 통계적 노이즈를 도입하여 고객의 개별 값을 누출하지 않도록 하는 것입니다. 이렇게 하면 집계를 작업하면서 고객의 데이터가 알고리즘에 노출되지 않도록 유지할 수 있습니다.

책임있는 AI 유지

 최종적으로, 책임있는 AI를 유지하는 것은 AI/ML 시스템을 설계하는 각 조직의 책임입니다. 이 5가지 책임있는 AI의 측면에서 기술을 의도적으로 추구함으로써, 조직은 인공 지능의 힘을 활용할 수 있을 뿐만 아니라, 신뢰할 수 있고 직설적인 방식으로 조직, 고객, 및 규제 기관을 안심시킬 수 있습니다.

Dattaraj Rao, Persistent Systems의 Chief Data Scientist는 “Keras to Kubernetes: The Journey of a Machine Learning Model to Production”이라는 책의 저자입니다. Persistent Systems에서 Dattaraj는 컴퓨터 비전, 자연어 이해, 확률적 프로그래밍, 강화 학습, 설명 가능한 AI 등 최첨단 알고리즘을 탐구하는 AI 연구소를 이끌며 의료, 금융, 산업 분야에서 적용 가능성을 보여줍니다. Dattaraj는 기계 학습과 컴퓨터 비전 분야에서 11개의 특허를 보유하고 있습니다.