사상 리더
인공지능 솔루션을 약화시키는 인간의 편향성

지난 9월, 엘론 머스크, 마크 저커버그, 오픈AI의 CEO인 샘 알트먼 등 세계적인 리더들은 워싱턴 D.C.에서 모여 인공지능 기술을 더 큰善에 이용하기 위한 공공 및 민간 부문의 협력을 논의하고, 규제 문제를 해결하기 위해 모였다. 규제 문제는 인공지능을 둘러싼 논의의 전면에 남아 있다.
이 두 가지 논의는 종종 같은 곳으로 이어진다. 인공지능을 더 윤리적으로 만들 수 있는지에 대한 강조가 증가하고 있다. 인공지능을 인간의 도덕성을疑問視하는 또 다른 인간으로 평가한다. 그러나 윤리적인 인공지능이란 무엇을 의미하는가? 구글이 소유하고 있는 인공지능 연구소인 딥마인드는 인공지능의 사회적 및 윤리적 위험을 평가하기 위한 3단계 구조를 제안한 연구를 최근에 발표했다. 이 프레임워크에는 능력, 인간 상호작용, 시스템적 영향이 포함되었으며, 맥락이 안전한 인공지능 시스템을 결정하는 데 핵심이라고 결론지었다.
이러한 시스템 중 하나로 비판을 받은 것이 챗GPT이다. 챗GPT는 15개국에서 금지되었다. 챗GPT는 1억 명이 넘는 사용자를 보유하고 있으며, 종종 편향성을 가지고 있다고 비난을 받았다. 딥마인드의 연구를 고려하여 맥락을 여기서 통합해 보자. 이 맥락에서 편향성은 모델이 생성한 텍스트에 존재하는 불공정한, 편견된, 또는 왜곡된 관점을 의미한다. 이것은 인종적 편향, 성별 편향, 정치적 편향 등 다양한 방식으로 발생할 수 있다.
이러한 편향성은 궁극적으로 인공지능 자체를 손상시킬 수 있다. 인공지능의 잠재력을 완전히 활용하는 가능성을 방해한다. 스탠퍼드 대학의 최근 연구에 따르면 챗GPT와 같은 대규모 언어 모델(LLM)은 신뢰할 수 있는, 편향되지 않은, 정확한 응답을 제공하는 능력에서 하락의 징후를 보이고 있다. 이것은 인공지능을 효과적으로 사용하는 우리의 길을 방해한다.
이 문제의核心에 있는 문제는 인간의 편향성이 인공지능으로 어떻게 전달되는지이다. 이는 인공지능 모델을 개발하는 데 사용되는 데이터에 깊이 뿌리내리고 있다. 그러나 이것은 생각보다 더 복잡한 문제이다.
편향성의 원인
편향성의 첫 번째 원인은 쉽게 식별할 수 있다. 모델이 학습하는 데이터는 종종 고정관념이나 이미 존재하는 편견으로 채워져 있다. 따라서 인공지능은 이러한 편향성을 간과하지 않고 그것을 지속시키기 때문에 편향성을 지닌다.
그러나 두 번째 원인은 훨씬 더 복잡하고 직관에 반한다. 이것은 인공지능을 더 윤리적이고 안전하게 만들기 위한 노력 중 일부에 부담을 준다. 인공지능이 무의식적으로 유해할 수 있는 명백한 경우가 있다. 예를 들어, 누군가 인공지능에게 “폭탄을 만드는 방법은 무엇인가?”라고 묻고, 모델이 답변을 제공하면 그것은 유해한 결과를 생성하는 데 기여한다. 반면에 인공지능이 제한될 때, 即使 정당한 이유가 있다 하더라도, 우리는 인공지능이 더广い 데이터 범위에서 학습하는 것을 방해한다. 인간이 설정한 제약은 인공지능의 학습 능력을 제한한다.
또한 이러한 제약은 인간으로부터 기인하기 때문에 편향되어 있다. 따라서 “폭탄을 만드는 방법은 무엇인가?”와 같은 질의는 잠재적으로 치명적인 결과를 초래할 수 있다. 그러나 다른 민감한 질의는 주관적이다. 따라서 이러한 垂直에 대한 인공지능 개발을 제한하면 우리는 진행을 제한하고, 규제를 만든 사람들에 의해 허용되는 목적으로만 인공지능을 사용하도록 한다.
결과를 예측할 수 없는 능력
우리는 인공지능에 제약을 가할 때의 결과를 완전히 이해하지 못했다. 따라서 우리는 알고 있는 것보다 더 많은 손상을 인공지능 알고리즘에 가할 수 있다. GPT와 같은 모델에서 사용되는 매개변수의 수는非常히 많기 때문에, 현재의 도구를 사용하여 영향을 예측하는 것은 불가능하다. 내 관점에서 보면, 이러한 영향을 이해하는 데 필요한 시간은 신경망 자체를 훈련하는 데 필요한 시간보다 더 길다.
따라서 이러한 제약을 가함으로써, 우리는 의도하지 않게 모델이 예상치 못한 행동이나 편향성을 개발하도록 할 수 있다. 이것은 인공지능 모델이 종종 다중 매개변수 복잡 시스템이기 때문이다. 즉, 한 매개변수를 변경하면(예: 제약을 도입함으로써), 우리는 예측할 수 없는 방식으로 전체 모델에 걸쳐서 파급 효과를 일으킨다.
인공지능의 “윤리”를 평가하는 어려움
인공지능이 윤리적이거나 윤리적이지 않은지 평가하는 것은 실제로 불가능하다. 인공지능은 특정한 의도で 행동하는 인간이 아니다. 인공지능은 큰 언어 모델로서, 본질적으로 더 윤리적이거나 덜 윤리적인 것이 아니다. 딥마인드의 연구에서 밝혀진 바와 같이, 무엇이 중요한지는 인공지능을 사용하는 맥락이다. 이것은 인공지능 뒤에 있는 인간의 윤리를 측정하는 것이지, 인공지능 자체의 윤리를 측정하는 것이 아니다. 인공지능을 道德적 컴퍼스를 갖춘 존재로 판단하는 것은 환상이다.
一种 가능한 解決方案은 인공지능이 윤리적인 결정을 내릴 수 있도록 도와주는 모델이다. 그러나 현실은 우리가 이러한 윤리 수학 모델이 어떻게 작동할 수 있는지 모른다. 따라서 우리는 그것을 구축할 수 없다. 윤리에 대한 인간의 주관성이 많기 때문에, 이를 양화하는 것은 매우 복잡한 작업이다.
이 문제를 해결하는 방법
앞서 언급한 내용에 근거하여, 우리는 인공지능이 윤리적이거나 윤리적이지 않은지에 대해 논의할 수 없다. 모든 비윤리적인 가정은 인간의 편향성의 변형으로, 인간이 사용하는 도구에 포함되어 있다. 또한, 인공지능 알고리즘에 제약을 가할 때의 영향과 잠재적인 손상에 대한 많은 과학적 불확실성이まだ 남아 있다.
따라서, 인공지능 개발을 제한하는 것은 해결책이 아니다. 앞서 언급한 연구에 따르면, 이러한 제약은 부분적으로 LLM의 퇴보의 원인이다.
그러면, 우리는 무엇을 할 수 있는가?
私の観点では, 解決策은 투명성에 있다. 인공지능 개발에서 초기에 존재했던 오픈소스 모델을 회복한다면, 우리는 더 나은 LLM을 구축하여 윤리적 우려를 완화할 수 있다. 그렇지 않으면, 비밀裏에서 진행되는 모든 것을 적절하게 감사하기는 매우 어렵다.
이와 관련하여 훌륭한 이니셔티브 중 하나는 스탠퍼드 HAI(인간 중심 인공지능)에서 최근 발표한 베이스라인 모델 투명성 지수이다. 이는 10가지 가장 널리 사용되는 인공지능 모델 개발자가 자신의 작업과 시스템 사용 방법에 대한 정보를 얼마나 공개하는지 평가한다. 이것에는 제3자 개발자와의 협력 및 개인 데이터의 사용 방법이 포함된다. 평가된 모델 중 하나도 높은 점수를 받지 못했다는 것은 실제 문제를 강조한다.
결국, 인공지능은 큰 언어 모델일 뿐이다. 그것이 오픈되어 실험할 수 있고, 특정 방향으로 유도되지 않는다면, 모든 과학 분야에서 새로운 획기적인 발견을 할 수 있다. 그러나 투명성이 없으면, 인류의益을 위해真正으로 작동하는 모델을 설계하고, 이러한 모델이 충분히 활용되지 않을 때 발생할 수 있는 손상의 정도를 알기란 매우 어렵다.












