Anderson의 관점

2020년 미국 대선 기간 동안 스팸 필터링 알고리즘이 정치적 편향을 보였다는 연구

mm
Unite.AI를 Google의 선호 소스에 추가

새로운 연구에 따르면, 세계에서 가장 큰 3개의 이메일 제공업체의 스팸 필터링 알고리즘(SFAs)은 2020년 미국 대선 기간 동안 정치적 편향을 보였다.구글의 지메일은 왼쪽으로 기울었고, 마이크로소프트 아웃룩과 야후 메일은 오른쪽 候補를 선호했다.

연구 논문은 다음과 같이 말한다:
“우리의 관찰 결과는 모든 SFAs가 2020년 미국 대선 직전 몇 개월 동안 정치적 편향을 보였다는 것을 보여주었다. 지메일은 왼쪽(민주당)으로 기울었고, 아웃룩과 야후는 오른쪽(공화당)으로 기울었다. 지메일은 오른쪽 候補의 이메일을 59.3% 더 많이 스팸으로 표시했고, 아웃룩과 야후는 왼쪽 候補의 이메일을 각각 20.4%와 14.2% 더 많이 스팸으로 표시했다.”

연구자들은 이 분석이 SFAs의 ‘집계 편향’을 보여준다고 주장한다.

연구 논문은 또한 ‘가짜 스팸 표시’의 가능성을 인정한다. 여기서 배우들이 반대파의 목소리를 잠재우려는 목적으로 공식적인 의사소통을 얻거나 보고 스팸으로 표시하여 알고리즘을 影響할 수 있다.

그러나 연구자들은 이메일 제공업체가 사용자 피드백에 따라 행동을 구성하는 방식의 차이를 설명하지 못한다고 관찰한다:
“논리적으로, 일부 유권자가 특정 캠페인 이메일을 스팸으로 표시한 후 이메일 서비스의 SFAs가 그와 유사한 캠페인 이메일을 스팸으로 표시하기 시작했을 가능성도 있다. 우리는 이러한 편향을 유권자에게 影響하려는 의도적인 시도가 있었다는 증거는 없지만, 사실은 이메일 서비스의 SFAs가 한 정치적 소속의 이메일을 다른 소속의 이메일보다 더 많이 스팸으로 표시했다는 것이다.”

“이러한 이메일 서비스는 많은 유권자가 사용하고 있으며, 많은 유권자들이 온라인에서 볼 수 있는 정보(또는 볼 수 없는 정보)에 의존하기 때문에, 이러한 편향은 선거 결과에 큰 影響을 미칠 수 있다.”

연구 논문은 A Peek into the Political Biases in Email Spam Filtering Algorithms During US Election 2020라는 제목으로, 노스 캐롤라이나 주립 대학교 컴퓨터 과학부의 4명의 연구자에 의해 작성되었다.

Round the Houses

연구자들은 2020년 7월부터 11월까지 5개월 동안 3개의 이메일 플랫폼에서 102개의 새로운 이메일 주소를 생성하고, 2개의 대통령 候補와 78개의 상원 候補, 156개의 하원 候補의 이메일 알림 목록을 구독했다.

이메일 계정은 다양한 인구 통계학적 특성을 가진 가상의 최종 사용자로 생성되었으며, 두 가지 스트림으로 나누어졌다. 첫 번째 스트림은 모든 이메일 서비스에 대한 일반적인 편향 경향을 연구했으며, 두 번째 스트림은 사용자 상호작용(예: 사용자가 스팸으로 표시하거나 표시하지 않음)이 알고리즘 스팸 필터의 행동에 미치는 영향을 조사했다.

연구 동안 몇 가지 주요 관찰 결과가 나타났다. 연구자들은 지메일이 왼쪽으로 기울었고, 아웃룩과 야후는 오른쪽으로 기울었다고 보고했다. 야후는 사용자의 받은 편지함에 모든 정치 이메일의 55.2%를 유지했으며, 아웃룩은 모든 정치 候補의 이메일 중 71.8%를 스팸으로 필터링했다.

“지메일은 왼쪽 候補의 이메일을 받은 편지함에 유지했으며(10.12%이하가 스팸으로 표시됨), 오른쪽 候補의 이메일은 대부분 스팸 폴더로 이동했다(77.2%가 스팸으로 표시됨).”

“우리는 또한 오른쪽 候補의 이메일이 스팸으로 표시되는 비율이 선거일이 다가올수록 지메일에서 점점 증가하는 것을 관찰했다. 반면에 왼쪽 候補의 이메일이 스팸으로 표시되는 비율은 거의 동일하게 유지되었다.”

Picking Candidates

연구자들은 대통령 候補를 조 바이든과 도널드 트럼프로限定했지만, 상원과 하원 候補의 경우 대표적인 선택을 하기 위해 노력했다.

첫째, 각 주의 인구 수에 따라 하원의석 수가 다르다. 둘째, 각 주의 상원과 하원 候補의 수는 두 주요 정당에서 다르다. 셋째, 일부 候補는 공식.gov 웹사이트만을 사용하여 캠페인 이메일을 보낼 수 없었다. 마지막으로, 일부 候補의 구독 목록은 CAPTCHAs로 보호되어 연구자의 사용자 정의 데이터 수집 프레임워크로 자동화할 수 없었다.

상원과 하원 候補의 정치적 소속에 따른 이메일 구독의 분포

상원과 하원 候補의 정치적 소속에 따른 이메일 구독의 분포 출처: https://arxiv.org/pdf/2203.16743.pdf

연구자들은 왼쪽과 오른쪽 候補의 수를 같게 하기 위해 각 주에서 최대 수의 候補를 구독했다. 최종적으로 50개의 주를 대표하는 78개의 상원 候補 구독(36개 주, 44개의 민주당과 34개의 공화당)과 156개의 하원 候補 구독(42개 주, 81개의 민주당과 75개의 공화당)을 얻었다.

Analyzing the Data

연구자들은 연구 기간 동안 3개의 이메일 서비스에서 318,108개의 이메일을 수집했다. 수집된 데이터에는 MIME-Version, Content Type, Subject, From, To, Date, Message-ID, Delivered-To, Received-SPF, 및 Received-By가 포함되었다.

인구 통계학적 요인을 대표하기 위해, 연구자들은 불균형한 데이터에서 공변량을 생성하는 추정 점수 분석(PSA)을 사용했다.

연구자들은 다음과 같이 결론을 내렸다:
“SFAs는 정치적 편향을 보였다. 초기에는 상대적으로 일관된 편향이 시간이 지남에 따라 더 구체적인 행동으로 발전했다.”

구글은 오른쪽 候補의 이메일을 67.6%로 스팸으로 표시했으며, 왼쪽 候補의 이메일은 8.2%로 스팸으로 표시했다. 아웃룩은 왼쪽 候補의 이메일을 95.8%로 스팸으로 표시했으며, 오른쪽 候補의 이메일은 75.4%로 스팸으로 표시했다. 야후는 왼쪽 候補의 이메일을 14.2% 더 많이 스팸으로 표시했다.

각 이메일 서비스의 받은 편지함에서 민주당과 공화당 이메일의 스팸 분포

각 이메일 서비스의 받은 편지함에서 민주당과 공화당 이메일의 스팸 분포

さらに, 결과는 지메일이 모든 정치적 소속의 이메일을 스팸으로 표시하는 비율이 증가하는 경향을 보인다는 것을 보여주었다. 야후는 왼쪽 候補의 이메일을 스팸으로 표시하는 비율이 캠페인이 진행될수록 증가하는 반면, 오른쪽 候補의 이메일을 스팸으로 표시하는 비율은 감소했다. 아웃룩은 두 정당의 이메일 모두에서 스팸으로 표시하는 비율이 상대적으로 일정했다.

3개의 이메일 제공업체에서 두 정당의 이메일을 스팸으로 표시하는 비율

3개의 이메일 제공업체에서 두 정당의 이메일을 스팸으로 표시하는 비율

Response to User Interaction

스팸 이메일을 ‘스팸이 아님’으로 표시할 때, 이메일 시스템이 tương似的 이메일을 스팸으로 표시하지 않도록 훈련하는 것이 목적이다.

연구 결과는 3개의 이메일 제공업체 중 지메일만이 사용자의 ‘스팸이 아님’ 입력에 대하여 현저하게 반응한다는 것을 보여주었다. 반면, 아웃룩과 야후에서는 사용자 상호작용이 거의 영향을 미치지 않았다.

연구자들은 다음과 같이 말한다:
“[스팸이 아님] 상호작용으로 인해 지메일의 정치적 편향이 크게 감소했다. 그러나 예상과는 달리, 아웃룩과 야후에서는 사용자의 의지에 따라 스팸으로 표시하지 않도록 하는 상호작용에 거의 반응하지 않았다.”

Conclusion

연구자들은 지메일이 아웃룩과 야후에 비해 사용자 상호작용에 더 크게 반응한다고 결론지었다.

연구자들은 다음과 같이 말한다:
“지메일의 정치적 편향은 사용자 상호작용으로 인해 크게 감소했다. 그러나 지메일은 왼쪽 候補를 선호하는 편향을 유지했다.”

“아웃룩과 야후는 오른쪽 候補를 선호하는 편향을 유지했다.”

연구자들은 사용자가 스팸 필터가 사용자 개입에 따라 행동을 변경할 수 있을 것이라는 일반적인 기대를 인정한다. 그러나 이 메커니즘은 신뢰할 수 없으며, 3개의 이메일 제공업체에서 일관성이 없다.

연구 논문은 다음과 같이 말한다:
“[우리는] 사용자가 스팸 필터의 편향을 줄이기 위해 취할 수 있는 일관된 행동을 발견하지 못했다.”

 

最初에 2022년 4월 4일에 게시되었습니다.

머신러닝 분야 작가이자 인간 이미지 합성 도메인 전문가. Metaphysic.ai에서 연구 콘텐츠 책임자를 역임했으며, DNEG의 Brahma.ai로 통합될 때까지 근무했습니다.
웹사이트: martinanderson.ai
연락처: martin@martinanderson.ai