Anderson의 관점

‘탐정’ AI는 여러 출처에서 희박한 사람을 식별할 수 있다

mm
Unite.AI를 Google의 선호 소스에 추가

옥스포드 대학의 연구자들은 비디오에서 사람을 포괄적으로 식별할 수 있는 AI 기반 시스템을 개발했으며, 탐정과 같은 다중 도메인 조사로 그들이 누구인지, 맥락에서, 그리고 인터넷에서 오디오 소스와 시각적 자료의 일치를 포함한 다양한 공개적으로 사용 가능한 2차 출처에서 조사합니다.

연구는 공인, 텔레비전 프로그램 및 영화에 출연하는 사람들의 식별을 중심으로 하지만, 맥락에서 신원 추론의 원리는 이론적으로 온라인 출처에서 얼굴, 목소리 또는 이름이 나타나는 누구에게나 적용될 수 있습니다.

실제로, 논문의 자신의 유명인 정의는 쇼 비즈니스 직원에게만 국한되지 않으며, 연구자들은 ‘우리는 온라인에서 자신에 대한 많은 이미지를 가진 사람들을 유명인이라고 표시합니다’라고 선언합니다.

직접 비디오로

옥스포드 공학 과학부의 시각 기하학 그룹의 연구자들은 인간 스타일의 조사 접근 방식을 설명하며, 이 접근 방식은 다음과 같습니다:

‘새로운 사람을 만나는 비디오를 상상해 보세요. 그들을 확신하기 위해 먼저 비디오에서 이름의 단서를 찾을 것입니다. 화면에 표시된 텍스트, 말하는 동안 이름이 언급된 경우 또는 인터넷 아카이브의 캐스트 멤버 목록에서 이름을 찾을 수 있습니다. 그런 다음 이름이 올바른지 확인하기 위해 사람을 온라인에서 검색할 수 있습니다.’

제안된 방법론은 완전히 자동화되어 있으며, 추가적인 수동 레이블링을 모두 제거합니다(온라인 소스의 제공자가 수행한 경우를 제외하고). 시스템은 또한 도메인 적응이 필요 없이 세 개의 무관련 데이터셋에서 잘 작동하는 것으로 입증되었습니다.

연구자들은 이 연구의 적용에 대해 논의하며, 레이블이 없는 불투명한 비디오 데이터의 지수적 성장과 수동 인간 주도 주석 없이 신원 정보를 파생할 수 있는 새로운 시스템의 필요성을 강조합니다:

‘데이터의 규모와 관련 메타데이터의 부족으로 인해 콘텐츠를 색인화, 분석 및 탐색하는 것이 점점 더 어려운 작업이 됩니다. 추가적인 수동 인간 주석에 의존하는 것은 더 이상 실현 가능하지 않으며, 이러한 비디오를 탐색할 수 있는 효과적인 방법이 없으면 이 지식의 저장소는 대부분 접근할 수 없습니다.’

이런 식의 색인 엔진은 비디오에서 검색 주제가 나타나는 지점으로 직접 도착하는 검색 결과 하이퍼링크의 가능성을 열어줍니다. 이는 프로젝트에서 제공하는 증명된 웹 검색에서 보여집니다.

옥스포드 시스템은 식별된 사람의 인스턴스를 검색할 수 있습니다. 검색 결과는 식별된 사람이 나타나는 비디오의 지점으로 직접 이동하며, 비디오는 그 지점에서 재생할 수 있습니다. 출처: https://www.robots.ox.ac.uk/~vgg/research/person_id_in_video/

옥스포드 시스템은 식별된 사람의 인스턴스를 검색할 수 있습니다. 검색 결과는 식별된 사람이 나타나는 비디오의 지점으로 직접 이동하며, 비디오는 그 지점에서 재생할 수 있습니다. 출처: https://www.robots.ox.ac.uk/~vgg/research/person_id_in_video/

시스템이 ‘희박한’ 사람을 식별하는 방법 중 하나는 다른 사람과의 연관성의 맥락입니다. 따라서 검색 엔진은 같은 비디오에 나타나는 여러 신원을 검색하는 데 잘 구성되어 있습니다:

대형 및 소형 물고기

시스템은 처음에 ‘낙하산’ – 공공 네트워크 자원에서 잘 색인이 된 사람들을 다룹니다. 식별이 상대적으로 간단합니다. 시스템은 비디오에서 메타데이터 또는 OCR’d 텍스트를 공공 데이터 자원과 일치시키거나 IMDB 목록과 일치시킵니다. 비디오 캡션, 크레딧 및 기타 래스터화된 텍스트도 식별을 위해 사용됩니다.

검색에 대한 후보 이름은 시스템에서 자동으로 발견될 수 있습니다. 이는 래스터화된 텍스트 또는 다른 출처의 실제 텍스트의 광학 문자 인식(OCR)에 기반합니다. 따라서 사용자별로 이름에 대한 쿼리를 실행하지 않고도 개인을 자동으로 색인화할 수 있습니다. 출처: https://www.robots.ox.ac.uk/~vgg/publications/2021/Brown21/brown21.pdf

검색에 대한 후보 이름은 시스템에서 자동으로 발견될 수 있습니다. 이는 래스터화된 텍스트 또는 다른 출처의 실제 텍스트의 광학 문자 인식(OCR)에 기반합니다. 따라서 사용자별로 이름에 대한 쿼리를 실행하지 않고도 개인을 자동으로 색인화할 수 있습니다. 출처: https://www.robots.ox.ac.uk/~vgg/publications/2021/Brown21/brown21.pdf

인터넷에서 확인되는 사람의 신원 확인이 압도적일 때, 시스템은 신원을 확인합니다. 그러나 사람의 신원이 더 희박한 경우, 다른 방법이 사용됩니다. 비디오 트랙에서 오디오를 사용하여 신원을 확인하는 데 사용될 수 있습니다. 논문에서 다루지 않았지만, 이 프레임워크는 순수한 오디오 소스와 비디오의 오디오 구성 요소를 사용할 수 있습니다.

자체 확장 신원 파노프티콘

래스터화된 텍스트 또는 순수한 텍스트에서 후보 이름을 생성하는 것 외에도, 옥스포드 프로젝트는 오디오 콘텐츠에서 이름이 언급되는지 여부를 확인하기 위해 음성 인식 기술을 사용합니다. 따라서 신원은 이름이 언급된 두 사람에 의해 초기화될 수 있습니다.

옥스포드 프로젝트가 도입한 안전 장치는 후보가 IMDB 데이터베이스에 나타나야 한다는 것입니다. 그러나 이 임의의 조건을 제거하면 시스템의 기능의 잠재적인 범위가 크게 확장됩니다. 이는 웹에서 스크래핑할 수 있는 자원에만 의존하기 때문입니다.

따라서 래스터화된 텍스트, 실제 텍스트, 음성 기반 언급 및 매우 제한된 시각적 자료를 포함한 다양한 출처의 조합으로, 인터넷에 시각적 네트워크 존재가 낮은 개인을 식별할 수 있습니다.

기술적으로, 아직 이미지 또는 비디오가 연결되지 않은 개인에 대한 프로필을 구축할 수 있으며, 이후 다른 요인이 새로운 비디오 소스와 상관관계가 있을 때 이미지 또는 비디오를 연결할 수 있습니다.

테스트 데이터셋

연구자들은 시스템의 효과를 평가하기 위해 세 개의 데이터셋을 사용했습니다: MediaEval, 2010-2015 사이에 캡처된 크리에이티브 커먼즈 소셜 미디어 파생 및 커뮤니티 이미지 리소스(위키백과 및 플리커 포함)를 특징으로 하는 데이터셋; 옥스포드 그룹의 2017년 셜록 데이터셋, 현대적인 BBC 아드ап테이션의 주인공인 코난 도일의 캐릭터에서 가져온 주석이 달린 비디오 데이터를 특징으로 하는 데이터셋; 프로젝트를 위해 특별히 생성된 BBC 비디오 데이터셋, 다양한 주석이 달린 뉴스 자료를 포함합니다.

시스템은 반사 또는 어둠으로 인해 얼굴이 가려진 경우를 포함하여 다양한 데이터셋 환경에서 성공합니다.

시스템은 반사 또는 어둠으로 인해 얼굴이 가려진 경우를 포함하여 다양한 데이터셋 환경에서 성공합니다.

이 프로세스는 또한 라이브 이미지 검색 순위를 사용합니다.

시스템의 결과는 세 가지 모델 모두에서 높은 정확도를 보였습니다. 셜록 데이터셋의 경우, 연구자들은 새로운 시스템이 이전에 다중 방식 분류기에서 SVM을 사용한 이전 방법보다 3-6% 개선된 것을 발견했으며, 이는 새로운 작업에서 사용된 가장 가까운 이웃 분류기가 덜 강력한 도구임에도 불구하고如此했습니다.

임팩트

옥스포드 프로젝트의 대부분의 윤리적 또는 실제 제약은 연구자들이 자체적으로 설정한 것으로, ‘유명인’을 IMDB에 존재하는 것으로 정의하는 것과, 크리에이티브 커먼즈 라이선스를尊重하는 학술 데이터셋만을 사용하여 시스템을 테스트하는 것입니다.

그러나 프로젝트의 본질적인 아키텍처는 ‘희박한’ 개인을 식별하는 일반적인 방법을 보여주며, 이는 인터넷에 시각적 존재가 낮거나 없으며, 이름이 언급되기만 하면 신원 토큰을 초기화할 수 있습니다. 이는 수요 또는 명시적인 레이블된 데이터(예: 사진 업로드에 포함된 PII 메타데이터를 포함하는 소셜 미디어 업로드)의 존재에 의해 구동되는 것이 아니라, 재귀적이고 기계적인 호기심에 의해 구동됩니다.

프로젝트는 지리 위치 데이터 또는 다른 형태의 광범위하게 사용 가능한 메타데이터를 사용하지 않습니다. 이러한 메타데이터는 기여하는 문서에서 확인할 수 있으며, 지리적 위치 정보는 기본적으로 소셜 미디어 업로드에 포함됩니다(사용자 선호도에 따라 제거되지 않는 경우). 그러나 이러한 추가 차원의 데이터를 사용하여 확인 프로세스를 강화하는 데는 명백한 장애물이 없습니다.

아웃라이어(거의 없는 존재와 함께하지도 않은 존재)를 옥스포드 프로젝트가 자르듯이, 이러한 최소한의 정보는 실제로 많은 대표 정보가 있는 경우보다 더 잘 알려지지 않은 사람을 식별할 수 있습니다. 아웃라이어가 정확히 무엇을 찾고 있다면(예: 네트워크 풋프린트가 거의 없는 개인), 희박한 데이터는 매우 유용할 수 있습니다.

가용성

옥스포드 연구자들은 프로젝트의 기능을 구글과 같은 검색 엔진으로 캡슐화했으며, 이 검색 엔진은 Docker를 통해 로컬 머신에 다운로드하고 설치할 수 있습니다(2021년 5월 논문의 설치 지침에는 현재 Docker 툴 요구 사항에 대한 구식 정보가 포함되어 있으므로 프로세스가 방해를 받을 수 있음).

세 개의 데이터셋 모두에 대한 프로젝트의 구현을 다루는 라이브 온라인 버전은 없지만, BBC 뉴스 데이터셋의 결과는 http://zeus.robots.ox.ac.uk/bbc_search/에서 무료로 조회할 수 있습니다.

기계 학습 분야 작가, 인간 이미지 합성 분야 전문가입니다. Metaphysic.ai의 연구 콘텐츠 책임자였으며, DNEG의 Brahma.ai로의 합병으로 해체될 때까지 그 역할을 수행했습니다.
포트폴리오 사이트: martinanderson.ai
연락처: martin@martinanderson.ai