사이버 보안

Perplexity, PII-TRACE 벤치마크 및 PII-Tracer 온디바이스 탐지기 발표

mm
Unite.AI를 Google의 선호 소스에 추가

Perplexity는 2026년 9월 1일, 개인 식별 정보를 탐지하는 모델을 평가하기 위한 벤치마크인 PII-TRACE와 텍스트가 클라우드 모델로 전송되기 전에 사용자의 디바이스에서 PII를 표시하도록 설계된 0.6B 파라미터의 소형 모델인 PII‑Tracer를 발표했습니다. 이번 발표는 두 제품을 회사의 하이브리드 컴퓨팅 아키텍처를 위한 프라이버시 인프라스트럭처로 위치시키며, 클라우드 에이전트가 연구·추론·계획을 담당하고 로컬 모델이 개인 파일을 처리하도록 합니다.

그 아키텍처 하에서는 로컬 프라이버시 게이트가 민감한 콘텐츠를 Mac에 보관하고, 감지된 개인 정보를 삭제하거나, 클라우드로 전송하기 전에 승인을 요청합니다. Perplexity는 텍스트가 원격 모델로 전송되기 전에 디바이스가 PII를 인식할 수 있을 때만 경계가 프라이버시를 보호할 수 있다고 밝혔으며, 동일 식별자가 여러 차례 다른 턴에 나타나는 장황하고 다국어 대화에서는 탐지가 더욱 어려워진다고 설명했습니다. 한 번이라도 놓친 언급은 시스템이 보호하려는 정보를 노출시킬 수 있습니다.

PII‑Tracer는 PII가 포함될 것으로 예측된 구간을 표시함으로써 모델 라우팅을 위한 로컬 제어 신호를 하나 제공합니다. 애플리케이션은 이후 라우팅 정책을 적용하여 관련 입력을 로컬에 유지하거나, 감지된 구간을 삭제하거나, 클라우드 모델로 에스컬레이션하기 전에 명시적인 승인을 요청합니다.

PII-TRACE 벤치마크

PII‑TRACE는 “Tracing Recurring PII Across Conversational Exchanges”의 약자로, 13개 언어와 10가지 문자 체계에 걸친 13,148개의 합성 사용자‑보조 대화를 포함하고 있으며, 9가지 PII 유형에 대해 문자 수준에서 37,431개의 식별자 언급에 라벨을 붙였습니다. 전체 대화의 41%는 구조화된 콘텐츠를 포함합니다. 라벨이 붙은 PII가 있는 5,645개의 대화 중 63.8%는 동일 식별자가 여러 번 등장하고, 28.7%는 식별자가 여러 턴에 걸쳐 나타납니다.

Perplexity는 탐지기가 보조 대화를 검토할 때 중요한 세 가지 행동을 기준으로 벤치마크를 설계했다고 밝혔습니다. 첫 번째는 일관된 커버리지로, 식별자가 여러 번 등장하거나 사용자와 보조 사이를 오갈 경우 탐지기가 모든 언급을 찾아야 합니다. 두 번째는 긴 컨텍스트에 대한 견고성으로, 대화 길이가 1,000자 미만에서 100,000자 이상까지 다양합니다. 세 번째는 다중 언어와 혼합 형식 콘텐츠 처리 능력으로, 대화가 언어를 전환하고 prose와 코드, 표, 구조화된 레코드를 결합할 수 있기 때문입니다.

벤치마크는 두 수준에서 성능을 측정합니다. 식별자 수준에서는 일관된 탐지 점수가 동일 식별자의 모든 언급에 대해 탐지기가 모든 문자를 커버했는지를 묻고, 다중 언급 식별자와 턴을 넘는 반복 식별자를 별도로 보고합니다. 문자 수준에서는 정밀도가 탐지기가 표시한 텍스트 중 실제 PII 비율을, 재현율이 라벨된 PII를 얼마나 찾아냈는지를 측정하며, F1 점수가 두 값을 균형 있게 반영합니다.

데이터셋은 합성 데이터이지만 실제 서비스 대화에서 파생되었습니다. 회사에 따르면 여러 언어 모델이 먼저 실제 사용자‑보조 대화에서 9가지 PII 유형을 마크하고, 규칙 기반 단계가 동일 유형의 반복 식별자를 하나의 엔터티 ID로 그룹화합니다. 각 마크된 값은 타입별 플레이스홀더로 교체되고, 각 턴은 플레이스홀더를 유지한 채로 패러프레이즈되며, 식별자 타입과 형식에 맞는 합성 값이 삽입됩니다. 세 개의 자동 검증 단계가 교체된 구간이 저장된 구간과 일치하는지, 반복 언급이 동일 값을 사용하는지, Presidio와 정규식 재검사에서 마크된 원본 값이 없는지를 확인합니다. 두 번째 언어 모델이 샘플을 감사하고, 인간 검토자가 PII로 플래그된 모든 항목을 검토합니다.

로컬 사용을 위한 소형 탐지기

PII‑Tracer는 Qwen3 백본을 기반으로 조정된 0.6B 양방향 인코더입니다. Perplexity는 프라이버시 스크리닝이 텍스트 생성과 다르게 관련 PII 구간을 찾아 그 경계를 반환해야 하므로, 모델이 Qwen3의 인과 마스크를 패딩 인식 양방향 어텐션으로 교체해 4,096 토큰 윈도우 내에서 각 토큰이 이전 및 이후 턴 모두를 활용하도록 했다고 설명했습니다.

각 토큰에 대해 인코더는 1,024 차원의 표현을 생성하고, 선형 태깅 헤드는 BIOES 스키마에 따라 37개의 가능한 라벨을 점수화합니다. 여기에는 PII 구간 외 텍스트에 대한 하나의 라벨과 9가지 PII 유형 각각에 대해 네 개의 구간 위치 라벨이 포함됩니다. 보조 헤드는 대화에 건강·종교 등 민감한 정보가 포함되었는지를 예측합니다. 회사는 다국어 보조 대화와 단일 레코드 예시를 결합한 약 714,000개의 학습 샘플을 사용해 3 epoch 동안 모델을 학습했다고 밝혔습니다. 추론 시에는 제한된 Viterbi 디코더가 가장 높은 점수의 유효 라벨 시퀀스를 탐색하고, 결과를 정확한 문자 구간으로 매핑해 삭제하거나 로컬 라우팅에 활용합니다.

평가 결과

Perplexity는 PII‑Tracer가 평가된 12개 시스템 중 문자 F1 점수(0.629)에서 가장 높은 성과를 기록했으며, 구간 겹침 F1과 구간 포함 F1에서도 두 번째로 높은 점수를 얻었다고 보고했습니다. 회사는 최첨단 모델인 GPT‑5.6‑sol과 Claude Sonnet 5가 전반적인 성능이 비슷하지만, GPT‑5.6‑sol은 구간 수준 메트릭에서는 더 높고 문자 F1에서는 낮다고 언급했습니다. 이러한 최첨단 모델은 수백억에서 수조 개의 파라미터를 갖는 클라우드 전용 폐쇄형 모델이며, 로컬에 머물러야 하는 텍스트 스크리닝에는 부적합하다고 지적했으며, 다른 오픈소스 PII 탐지기들은 PII‑Tracer보다 현저히 낮은 성능을 보였습니다.

일관성 테스트에서 평가 세트는 한 번만 등장하는 식별자가 899개, 두 번 이상 등장하는 식별자가 959개이며, 그 중 790개는 여러 턴에 걸쳐 나타났습니다. Perplexity는 PII‑Tracer가 반복 식별자 79.4%와 턴을 넘는 식별자 77.6%의 모든 언급을 찾아냈다고 보고했으며, GPT‑5.6‑sol은 동일 지표에서 각각 57.0%와 55.1%에 머물렀습니다. PII‑Tracer의 점수는 단일 언급 식별자에서 0.917에서 6~10회 등장하는 식별자는 0.691로 감소했습니다.

길이는 여전히 제한 요소입니다. 1,000자 미만 대화의 단일 윈도우 재현율은 0.975, 1,000~10,000자 구간은 0.955이지만 10,000자 이상에서는 0.687로 떨어집니다. 회사는 50% 겹침 슬라이딩 윈도우를 적용해 동일 체크포인트를 디코딩하면 전체 문자 재현율이 0.830에서 0.965로, 다중 언급 일관 탐지는 0.794에서 0.954로 상승한다고 밝혔으며, 재학습은 필요하지 않았습니다.

라틴, 키릴, 한글 스크립트를 포함한 6개 언어 슬라이스에서 PII‑Tracer는 독일어(0.735), 프랑스어(0.633), 이탈리아어(0.676), 러시아어(0.651)에서 문자 F1 최고점을 기록했으며, 영어와 한국어에서는 각각 0.016~0.036 차이 내에서 최고 결과에 근접했다고 회사는 보고했습니다. 다섯 개 외부 단일 레코드 벤치마크에서도 Perplexity는 PII‑Tracer가 모든 데이터셋에서 OpenAI Privacy Filter보다 높은 문자 F1을 기록했으며, ai4privacy에서는 0.950 대 0.907, Nemotron‑PII에서는 0.847 대 0.709, 실제 인간 라벨 텍스트로 구성된 유일한 벤치마크인 TAB에서는 0.594 대 0.350을 기록했습니다.

연구 논문은 대화가 실제 서비스 보조 트래픽 구조에서 파생된 합성 재구성임을 경고하며, 결과를 특정 생산 워크로드에 대한 추정이 아니라 대화형 PII 탐지 측정치로 해석해야 한다고 강조합니다. 논문은 또한 도구 호출, 에이전트 간 메시지, 멀티모달 입력은 벤치마크 범위에 포함되지 않으며, 각 베이스라인이 단일 추론 구성에서 평가되었다고 명시합니다. Perplexity는 PII‑TRACE와 PII‑Tracer를 곧 공개할 계획이며, 논문에 따르면 두 제품 모두 MIT 라이선스로 배포될 예정이라고 밝혔습니다.

마일즈 오카다Unite.AI의 AI 생성 분석가로, 인공 지능과 사이버 보안을 다루며 새로운 위협, 방어 구조, 자동화 시스템과 공격자 간의 역동적인 관계에 초점을 맞추고 있습니다. 그의 연구는 보안 운영에 대한 AI의 영향, 자율적인 위협 탐지 및 응답, 그리고 적대적 AI 기술의 부상 등을 조사합니다.
기술적이고 조사적인 관점에서 마일즈는 보안 연구, 사건 공개, 실제 배포를 분석하여 AI가 방어를 강화하는 부분과 새로운 취약성을 도입하는 부분을 이해하기 위해 노력합니다. 그는 특히 모델의 악용, 데이터 중독, 자동화된 공격, 그리고 대규모 AI 기반 시스템의 보안을 위한 운영적 현실에 주목합니다.
마일즈 오카다가 작성한 기사들은 Unite.AI의 편집 팀에 의해 검토되어 빠르게变化하는 AI 보안 환경에 대한 정확성, 엄격성, 책임 있는 보도를 보장합니다.