Anderson의 관점

JPEG 압축이 비카우카시안 얼굴의 얼굴 인식 오류率을 증가시킨다, 연구 결과

mm
Unite.AI를 Google의 선호 소스에 추가
Main image: DALL-E 2.

영국에서 수행된 새로운 연구에 따르면 JPEG 이미지의 손실 압축 기술이 얼굴 인식 시스템의 효과에 부정적인 영향을 미쳐 비카우카시안 인을 더 잘못 식별할 가능성이 높아진다.

연구 논문은 다음과 같이 말한다:

‘광범위한 실험 설정을 통해 우리는 일반적인 손실 압축 이미지 접근 방식이 특정 인종 현상학 범주(예: 더 어두운 피부 톤)에 대한 얼굴 인식 성능에 더 큰 부정적인 영향을 미친다는 것을 보여주었다. 최대 34.55%까지.’

결과는 또한 색상 하위 샘플링이 얼굴 이미지의 색상 정보(밝기 정보가 아닌)를 줄여서 다양한 테스트 데이터셋에서 잘못된 일치율(FMR)을 증가시킨다는 것을 나타낸다. 이러한 데이터셋 중 많은 수가 컴퓨터 비전의 표준 저장소이다.

원본 이미지에 대한 색상 하위 샘플링 작업, 다양한 속도에서 수행한 결과, 세부 사항이 얼마나 보존되고 하위 톤이 서로 블렌딩되는지에 대한 영향이 명확하다. 이 이미지 자체는 압축될 수 있으므로 정확한 해상도를 위해 원본 논문을 참조하십시오. 출처: https://arxiv.org/pdf/2208.07613.pdf

원본 이미지에 대한 색상 하위 샘플링 작업, 다양한 속도에서 수행한 결과, 세부 사항이 얼마나 보존되고 하위 톤이 서로 블렌딩되는지에 대한 영향이 명확하다. 이 이미지 자체는 압축될 수 있으므로 정확한 해상도를 위해 원본 논문을 참조하십시오.. 출처: https://arxiv.org/pdf/2208.07613.pdf

색상 하위 샘플링은 JPEG 압축에서 추가적인 경제적 조치로 적용된다. 왜냐하면 사람들은 컴퓨터 비전 시스템보다 색상 밴드의 복잡성과 범위의 감소를 덜 잘 감지할 수 있기 때문이다.

연구자들은 새로운 연구에서 색상 하위 샘플링을 압축 과정에서 제거하면 이 부정적인 영향을 최대 15.95%까지 줄일 수 있다는 것을 발견했다.

연구는 또한 압축되지 않은(또는 덜 압축된) 데이터로 훈련하면 문제를 해결하지 못한다는 것을 주장한다. 즉, 덜 압축된 이미지로 얼굴 인식 모델을 훈련하면 최종 생산 모델에 이미지 압축 문제가 있는 경우 편향을 해결하지 못한다.

연구자들은 다음과 같이 보고한다:

‘손실 압축 이미지를 사용하여 훈련하면 현대적인 얼굴 인식 접근 방식의 성능에 부정적인 영향을 미친다. 이는 인종 관련 얼굴 현상학 그룹(예: 더 어두운 피부 톤, 눈꺼풀 모양)에 영향을 받는다.

이 연구는 컴퓨터 비전 연구 분야에 대한 이미지 압축의 결과를 강조한다. 이는 2021년 메릴랜드 대학교와 페이스북 AI의 연구에서 자세히 설명되었다.

이 문제를 해결하는 것은 어려운 문제이다. 即使 저장소와 대역폭 문제가 사라져도, 또한 20년 이상의 데이터셋에 있는 모든 저품질 이미지를 높은 품질의 이미지로 재압축한다 하더라도, 이는 학술 벤치마크 도구의 연속성을 재설정하는 것을 의미한다. 컴퓨터 비전 커뮤니티는 사실 이 문제에 익숙해져 있다. 즉, 이는 기술 부채를 나타낸다.

얼굴 인식에서 인종 편향은 최근 몇 년 동안 뜨거운 미디어 주제가 되었다. 이는 영향을 받는 시스템에서 이를 제거하기 위한 연구 커뮤니티의 집중적인 노력을 촉발했다. 그러나 글로벌 연구 体가 인종적으로 균형이 잡히지 않은 ‘금표준’ 데이터셋에過度로 의존하는 것은 이 문제를 해결하는 것을 더 어렵게 만든다.

연구자들은 또한 다음과 같이 지적한다:

‘얼굴 인식 시스템을 위한 이미지 수집 표준은 ISO/IEC 19794-5와 ICAO 9303을 제안한다. 이는 이미지 기반(즉, 조명, 가리기) 및 주체 기반(즉, 姿勢, 表情, 액세서리) 품질 표준을 보장하기 위해 얼굴 이미지의 품질을 보장한다.

‘따라서 얼굴 이미지는 JPEG 또는 JPEG2000와 같은 손실 압축 표준을 사용하여 저장되어야 하며, 성별, 눈 색상, 머리 색상, 表情, 속성(즉, 안경), 姿勢각(yaw, pitch, roll), 랜드마크 위치에 따라 식별 가능해야 한다.

‘그러나 일반적인 얼굴 인식 벤치마크는 ISO/IEC 19794-5와 ICAO 9303 표준을 준수하지 않는다. 또한, 야외 샘플은 제안된 솔루션을 도전하기 위해 다양한 카메라와 환경 조건에서 얻어진다.

‘그러나 이러한 데이터셋 내의 대부분의 얼굴 이미지 샘플은 손실 JPEG 압축을 통해 압축된다.’

연구자들은 향후의 노력을 통해 다양한 얼굴 인식 프레임워크에 대한 손실 이미지 양자화의 영향을 조사하고, 이러한 시스템의 공정성을 개선할 수 있는 방법을 제안할 계획이다.

새로운 연구 논문은 손실 압축이 얼굴 인식 내의 인종 편향에 영향을 미치는가?라는 제목으로, 임페리얼 칼리지 런던의 세 명의 연구자와 인사이트페이스 딥페이스 분석 라이브러리의 한 명의 연구자가 수행했다.

데이터 및 방법

연구자들은 실험을 위해 ImageMagick과 libjpeg 오픈 소스 라이브러리를 사용하여 다양한 압축 수준에서 원본 데이터 이미지의 버전을 생성했다.

압축의 효과에 대한 초기 개요를 위해 연구자들은 Racial Faces in-the-Wild(RFW) 데이터셋에서 네 가지 다른 JPEG 압축 수준의 피크 신호 대 노이즈 비율(PSNR)에 대한 영향을 연구했다.

압축 이미지를 사용할 때 인식 기능에 영향을 미치는 정도를 보여주는 RFW 데이터셋의 PSNR 점수

압축 이미지를 사용할 때 인식 기능에 영향을 미치는 정도를 보여주는 RFW 데이터셋의 PSNR 점수

다른 테스트 중에 연구자들은 인종적으로 불균형한 데이터셋과 인종적으로 균형된 데이터셋을 사용했다. 인종적으로 균형된 집합을 위해 연구자들은 VGGFace2 벤치마크 데이터셋의 원래 ResNet101v2와 함께 Additive Angular Margin Loss(ArcFace) 함수를 사용했다. VGGFace2 데이터셋에는 3.3백만 개의 이미지와 8631개의 인종적으로 불균형한 주체가 포함되어 있다.

테스트를 위해 연구자들은 RFW 데이터셋을 사용했다. 시스템은 네 번 훈련되었으며, 각 훈련은 네 가지 다른 압축 수준에서 수행되었다. 이를 통해 네 개의 ArcFace 모델이 생성되었다.

인종적으로 균형된 집합을 위해 연구자들은 동일한 프레임워크를 원래 정렬된 BUPT-Balanced 벤치마크 데이터셋에서 사용했다. 이 데이터셋에는 아프리카인, 아시아인, 인도인, 카우카시안인 각 7000개의 이미지가 포함되어 있으며, 총 28000개의 얼굴 이미지가 있다. 인종적으로 불균형한 데이터셋과 마찬가지로, 네 개의 ArcFace 모델이 얻어졌다.

추가로 연구자들은 색상 하위 샘플링을 제거하여 압축 및 비압축 훈련의 효과를 재현하여 성능에 미치는 영향을 측정했다.

결과

생성된 데이터셋에서 잘못된 일치율(FMR)을 연구했다. 연구자들이 찾고 있던 기준은 인종 특성과 관련된 사전 정의된 현상학 특성이었다. 즉, 피부 타입(1, 2, 3, 4, 5 또는 6), 눈꺼풀 타입(단일 눈꺼풀/기타), 코 모양(넓은/좁은), 입 모양(만족/작은), 머리 타입(직모/웨이브/큰고리/대머리), 머리 색상 – 2019년 논문 얼굴 인식 내의 숨겨진 편향을 인종 현상학을 통해 측정에서 가져온 지표이다.

연구 논문은 다음과 같이 말한다:

‘우리는 모든 다운선택된 압축 수준 q = {5, 10, 15, 95}에서 FMR이 증가함을 관찰했으며, 압축 수준 5(가장 높은 압축률)에서 가장 큰 성능 감소를 보인다. 반면에 압축 수준 95(가장 낮은 압축률)에서는 성능 차이가 없다.’

연구 논문의 광범위한 결과 차트의 샘플, 너무 크고 많아 여기에 모두 재현할 수 없다. 원본 논문을 참조하십시오. 여기서 우리는 점점 더 저하/압축된 얼굴 이미지에 대한 VGGFace2의 FMR 성능 범위를 볼 수 있다.

연구 논문의 광범위한 결과 차트의 샘플, 너무 크고 많아 여기에 모두 재현할 수 없다. 원본 논문을 참조하십시오. 여기서 우리는 점점 더 저하/압축된 얼굴 이미지에 대한 VGGFace2의 FMR 성능 범위를 볼 수 있다.

연구 논문은 다음과 같이 결론을 내린다:

‘전반적으로 우리의 평가에 따르면 손실 압축된 얼굴 이미지 샘플을 사용하여 추론을 수행하면 특정 현상학 특성(예: 더 어두운 피부 톤, 넓은 코, 곱슬머리, 단일 눈꺼풀)에 대한 성능이 더 크게 감소한다.

‘그러나 훈련에 압축된 이미지를 사용하면 결과 모델이 더 강건해지고 성능 저하를 제한한다. 그러나 특정 인종적으로 정렬된 하위 그룹에서 성능이 더 낮게 유지된다. 또한 색상 하위 샘플링을 제거하면 특정 현상학 특성에 대한 FMR을 개선한다.’

 

* 저자의 인라인 인용을 하이퍼링크로 변환한 것입니다.

最初에 2022년 8월 22일에 게시되었습니다.

기계 학습 분야 작가, 인간 이미지 합성 분야 전문가입니다. Metaphysic.ai의 연구 콘텐츠 책임자였으며, DNEG의 Brahma.ai로의 합병으로 해체될 때까지 그 역할을 수행했습니다.
포트폴리오 사이트: martinanderson.ai
연락처: martin@martinanderson.ai