AI 모델 및 플랫폼

정신 건강 인공지능 도구가 우연히 정확한 딥페이크 감지를 발견한 방법

mm
Unite.AI를 Google의 선호 소스에 추가

기술 기업 OpenAI가 2025년 9월 주력 비디오·오디오 생성 모델 Sora 2를 출시한 뒤 딥페이크 영상이 소셜 미디어에 급속히 퍼졌고, 사람들은 잠재적으로 위험한 초현실적 콘텐츠에 점점 익숙해졌다.

OpenAI는 사용자가 피드에 표시되는 내용과 자신의 초상 사용을 통제할 수 있게 하겠다며 책임 있는 출시를 최우선 과제로 내세웠다. 하지만 2025년 10월 연구에서는 이 모델이 거짓 주장을 담은 영상을 80%의 비율로 생성한 것으로 나타났다.

몰도바 선거 관리자가 투표용지를 파기한다는 가짜 뉴스 영상부터 이민 당국이 유아를 구금하는 조작 장면, Coca-Cola (KO ) 대변인이 슈퍼볼 후원을 중단한다고 발표하는 영상까지, 서로 연결된 세계에서 허위정보가 초래할 위험은 어느 때보다 커졌다.

Sora를 넘어: 보이스 피싱

OpenAI의 도구가 나오기 전부터 딥페이크 파일의 제작과 온라인 유포는 증가하고 있었다. 사이버 보안 기업 DeepStrike의 2025년 9월 보고서에 따르면 딥페이크 콘텐츠는 2023년 50만 건에서 2025년 800만 건으로 급증했으며, 상당수가 사기에 이용됐다.

이 흐름은 멈출 기미가 없다. 미국에서 발생하는 AI 사기 피해만 해도 2027년에는 400억 달러에 이를 것으로 예상된다.

증가한 것은 수량만이 아니다. Sora 2와 Google (GOOGL ) Veo 3 같은 도구 덕분에 AI가 만든 얼굴과 목소리, 전신 동작은 그 어느 때보다 사실적이다. 컴퓨터 과학자이자 딥페이크 연구자인 Siwei Lyu는 최신 모델이 얼굴 왜곡 없이 안정적인 영상을 만들고, 음성 복제도 구분하기 어려운 수준을 넘어섰다고 지적한다.

딥페이크 기술은 탐지 기술보다 빠르게 발전하고 있다. 올림픽 체조 장면이나 정교한 배경 음향을 만드는 재미있는 도구로 판매되지만, 범죄자는 같은 기술로 기업과 개인을 노린다. 2025년 상반기에만 딥페이크 사건으로 기업은 3억5,600만 달러, 개인은 5억4,100만 달러의 손실을 입었다.

워터마크, 지나치게 매끈한 얼굴, 메타데이터를 확인하는 전통적 탐지법은 이미 한계를 보인다. 음성 딥페이크가 AI 사기에서 두 번째로 흔한 유형으로 자리 잡고 2025년 음성 피싱이 442% 급증하면서 피해는 현실이 됐다.

Lyu는 “이제 몇 초 분량의 음성만으로도 자연스러운 억양과 리듬, 강조, 감정, 멈춤, 호흡 소음까지 갖춘 설득력 있는 복제 음성을 만들 수 있다”고 설명했다.

인간의 목소리에 귀 기울이는 과학

Kintsugi는 임상적 우울과 불안의 징후를 찾는 AI 음성 바이오마커 기술을 개발하는 헬스테크 스타트업이다. 이들의 연구는 단순한 전제, 즉 인간의 목소리에 귀를 기울여야 한다는 생각에서 출발했다.

CEO Grace Chang은 Unite.AI와의 대화에서 치료 예약을 잡기 위해 거의 다섯 달 동안 의료기관에 전화했지만 아무도 회신하지 않았던 개인적 경험 때문에 Kintsugi를 시작했다고 말했다. 자신은 계속 시도했지만 아버지나 형제였다면 훨씬 전에 포기했을 것이라는 생각이 들었다고 회상했다.

2019년 설립된 이 캘리포니아 기업은 Chang이 ‘분류 병목’이라고 부른 문제를 해결하려 한다. 증상의 심각도를 더 일찍, 수동적 방식으로 감지하면 환자를 적절한 수준의 치료로 더 빨리 연결할 수 있으며, Kintsugi Voice는 음성 바이오마커로 임상적 우울과 불안을 식별한다.

AI 기반 음성 분석을 정신건강 바이오마커로 사용할 수 있다는 연구는 많다. 2025년 5월 논문은 음향 바이오마커로 정신건강 문제와 신경다양성의 초기 징후를 탐지할 수 있다고 보고했으며, 인지 저하 가능성을 평가하기 위해 임상 환경에서 노래 분석을 활용하자고 제안했다.

미국정신의학회 자료에 따르면 음성 측정으로 우울증 환자와 비우울 집단을 구분하는 정확도는 78~96%에 이른다. 또 다른 연구에서는 특정 범주에 속하는 단어를 1분 동안 최대한 많이 말하는 언어 유창성 검사로 우울과 불안이 함께 있는 사람을 70~83% 정확도로 감지했다.

Kintsugi는 짧은 음성 샘플을 받은 뒤 음높이와 억양, 음색, 멈춤을 분석한다. 이런 표지는 우울증, 불안, 양극성 장애, 치매 등과 연관돼 있다.

Chang이 처음에는 깨닫지 못했던 사실은, 이 기술이 보안 업계의 가장 시급한 과제 중 하나인 ‘인간의 목소리를 인간답게 만드는 요소’를 식별할 수 있게 했다는 점이다.

정신건강 관리에서 사이버 보안으로

2025년 말 뉴욕에서 열린 정상회의에서 Chang은 사이버 보안 업계의 지인에게 팀이 합성 음성을 실험했지만 결과가 기대와 달랐다고 말했다.

그는 “정신건강 모델의 학습 데이터를 늘리기 위해 합성 데이터를 시험했는데, 생성된 목소리가 실제 인간의 말과 너무 달라 거의 100% 구분할 수 있었다”고 설명했다.

지인은 그것이 보안 분야에서 아직 해결되지 않은 문제라고 지적했다. 그 순간 가능성이 분명해졌고, 이후 보안·금융·통신 기업과의 대화를 통해 실시간 통화에서 인간과 합성 음성을 구별해야 할 필요가 얼마나 빠르게 커지는지 확인했다.

지난해 4월 FBI는 미국 고위 공직자의 연락을 가장해 전직 정부 직원과 그 지인을 노리는 악성 문자·음성 메시지 캠페인을 경고했다. 미국 대형 은행들도 하루 평균 5.5건의 음성 조작 사기 시도를 받았고, Vanderbilt University Medical Center 직원들은 친구와 상사, 동료를 사칭한 보이스 피싱 공격을 보고했다.

그러나 딥페이크는 원래 Kintsugi 연구의 목표가 아니었다. 팀은 콜센터 상담원과 발신 업무용 합성 음성을 시험하기 위해 Cartesia, Sesame, ElevenLabs 같은 상용 모델을 사용했을 뿐, Sora를 포함해 접근하기 쉬운 모델이 넘치는 시장에서 딥페이크 사기에 초점을 맞추지 않았다.

목소리의 진위를 드러내는 신호는 바로 인간을 인간답게 만드는 바이오마커이기도 하다. Kintsugi Voice는 언어나 발화 내용과 무관하게 신호 처리와 말의 물리적 지연을 분석하며, 발화가 어떻게 만들어지는지를 보여 주는 미세한 타이밍, 운율 변화, 인지 부하, 생리적 표지를 포착한다.

Chang은 “합성 음성은 유창하게 들릴 수 있지만 동일한 생물학적·인지적 흔적을 지니지 않는다”고 말했다. 이 회사 모델은 불과 3~5초의 음성만으로도 탐지 정확도 상위 10% 수준의 성능을 꾸준히 보인다.

전문 치료를 받는 데 시간과 비용이 많이 드는 지역에서 Kintsugi는 정신건강 지원을 바꿀 수 있다. 동시에 이 기술은 특정 딥페이크의 흔적을 찾는 대신 사람의 진위를 확인하는 방식으로 음성 딥페이크 탐지와 사이버 보안 전반을 바꿀 가능성이 있다.

인간 중심 기술에 달린 미래

사이버 보안은 오랫동안 기술의 악용 방식이나 공격자 자체에 초점을 맞췄다. Kintsugi의 우연한 발견은 그 대신 인간성 자체에 베팅한다.

Chang은 “우리는 완전히 다른 표면, 즉 인간의 진위에서 작동한다. LLM은 LLM이 만든 콘텐츠를 안정적으로 탐지하지 못하고 인공 흔적에 의존하는 방법도 취약하다. 실제 인간의 다양성을 담은 임상 라벨 데이터셋은 수집 비용이 높고 느리며 대부분 보안 회사의 전문 영역 밖에 있어 이 접근법을 복제하기 어렵다”고 말했다.

이 접근은 분야를 넘나드는 혁신이라는 더 큰 흐름도 보여 준다. 의료 분야의 선두 기업이 AI 기반 보이스 피싱 탐지를 이끌 수 있는 것처럼, 우주 기술 혁신이 새로운 재난 대응을 돕거나 게임 기술이 건축과 도시 계획에 기여할 수 있다.

Chang은 앞으로 음성 상호작용에서 실제 사람과 궁극적으로는 실제 의도를 검증하는 표준이 되는 것을 목표로 한다.

그는 “HTTPS가 웹의 기본 신뢰 계층이 된 것처럼 ‘사람임의 증명’이 음성 기반 시스템의 기반 계층이 될 것이라고 믿는다. Signal은 그 인프라의 시작”이라고 말했다.

생성형 AI가 계속 가속하는 시대에 가장 효과적인 보호책은 결국 무엇이 인간을 인간답게 만드는지 이해하는 데서 나올 수 있다.

살로메는 메데인에서 태어난 저널리스트이며 Espacio Media Incubator의 시니어 리포터입니다. 역사와 정치학을 배경으로, 살로메의 작업은 새로운 기술의 사회적 관련성을 강조합니다. 그녀는 알자지라, 라틴 아메리카 리포트, 소사블 등에서 소개되었습니다.