Kyberturvallisuus
Perplexity esittelee PII-TRACE -vertailuarvion ja PII-Tracer -laitteessa toimivan tunnistimen

Perplexity esitteli 1. syyskuuta 2026 PII-TRACE:n, vertailuarvion, jonka avulla arvioidaan henkilötietojen (PII) tunnistimia, sekä PII-Tracerin, kompaktin 0,6 miljardia parametria sisältävän mallin, joka merkitsee PII:n käyttäjän laitteella ennen kuin teksti lähetetään pilvimalleille. Ilmoitus asettaa molemmat julkaisun osaksi yrityksen hybridilaskenta-arkkitehtuuria, jossa pilvitoimijat hoitavat tutkimuksen, päättelyn ja suunnittelun, kun paikallinen malli käsittelee yksityistiedostoja.
Tässä arkkitehtuurissa paikallinen tietosuojaportti pitää arkaluonteisen sisällön Macissa, poistaa havaitut yksityiset tiedot tai pyytää hyväksyntää ennen pilveen lähettämistä. Perplexity totesi, että raja suojaa yksityisyyttä vain, jos laite pystyy tunnistamaan PII:n ennen kuin teksti lähetetään etämalliin, ja että tunnistus vaikeutuu pitkissä, monikielisissä keskusteluissa, joissa sama tunniste voi esiintyä useita kertoja eri vuoroissa. Yksi huomiotta jäänyt maininta voi paljastaa järjestelmän suojattavan tiedon.
PII-Tracer tarjoaa paikallisen ohjaussignaalin mallin reitittämiseen merkitsemällä PII:tä sisältäviä alueita. Sovellus toteuttaa sitten reitityspolitiikan: se pitää asiaankuuluvan syötteen paikallisena, poistaa havaitut alueet tai pyytää erillistä hyväksyntää ennen kuin siirtyy pilvimalliin.
PII-TRACE -vertailuarvio
PII-TRACE, lyhenne sanoista Tracing Recurring PII Across Conversational Exchanges, sisältää 13 148 synteettistä käyttäjä‑avustaja‑keskustelua 13 kielellä ja 10 kirjoitusjärjestelmällä, ja siinä on 37 431 tunnistemerkin mainintaa, jotka on merkitty merkkitasolla yhdeksän PII-tyypin mukaan. Yhteensä 41 % keskusteluista sisältää rakenteellista sisältöä. Niistä 5 645 keskustelusta, joissa on merkitty PII, 63,8 % sisältää tunnisteen, joka esiintyy useammin kuin kerran, ja 28,7 % sisältää tunnisteen, joka esiintyy useissa vuoroissa.
Perplexity kertoi suunnittelevansa vertailuarvion kolmen käyttäytymisen ympärille, jotka ovat merkityksellisiä, kun tunnistin tarkastelee avustajakeskusteluja. Ensimmäinen on johdonmukainen kattavuus: kun tunniste esiintyy useita kertoja tai ylittää käyttäjän ja avustajan vuorot, tunnistimen on löydettävä jokainen maininta. Toinen on kestävyys pitkälle kontekstille, kun keskustelut vaihtelevat alle 1 000 merkin ja yli 100 000 merkin välillä. Kolmas on monikielisten ja sekamuotoisen sisällön käsittely, sillä keskustelu voi vaihtaa kieliä ja yhdistää proosaa koodiin, taulukoihin tai rakenteellisiin tietueisiin.
Vertailuarvio mittaa suorituskykyä kahdella tasolla. Tunnistetasolla johdonmukainen tunnistuspisteytys kysyy, onko tunnistin kattaa jokaisen merkin jokaisessa saman tunnisteen maininnassa, ja se raportoidaan erikseen tunnisteille, joilla on useita mainintoja, sekä tunnisteille, jotka toistuvat vuorojen yli. Merkkitasolla tarkkuus mittaa, kuinka suuri osa tunnistimen merkitsemästä tekstistä on merkitty PII:ksi, palautus (recall) mittaa, kuinka paljon merkittyä PII:ta se löytää, ja F1 tasapainottaa nämä kaksi.
Tietojoukko on synteettinen, mutta se perustuu tuotantokeskusteluihin. Yrityksen mukaan useat kielimallit merkitsevät ensin yhdeksän PII-tyyppiä tuotantokäyttäjä‑avustaja‑keskusteluissa, ja sääntöpohjainen vaihe ryhmittelee saman tyyppiset toistuvat tunnisteet yhdeksi entiteettitunnisteeksi. Jokainen merkitty arvo korvataan tyypitetyllä paikkamerkillä, jokainen vuoro parafraasataan paikkamerkit säilyttäen, ja synteettiset arvot, jotka vastaavat kunkin tunnisteen tyyppiä ja muotoa, lisätään. Kolme automatisoitua tarkistusta varmistavat, että korvaukset vastaavat tallennettuja alueita, että toistuvat maininnat käyttävät samaa arvoa, ja että merkittyjä lähdearvoja ei ole Presidio‑ ja säännöllinen‑lauseke‑tarkistuksen alla. Toinen kielimalli tarkastaa otoksen, ja ihmiset tarkistavat kaiken, mitä se merkitsee PII:ksi.
Kompakti tunnistin paikalliseen käyttöön
PII-Tracer on 0,6 miljardia parametria sisältävä kaksisuuntainen enkooderi, joka on sovitettu Qwen3‑pohjasta. Perplexity totesi, että tietosuojasuodatus eroaa tekstin generoinnista, koska sen täytyy löytää asiaankuuluvat PII‑alueet ja palauttaa niiden rajat, joten malli korvaa Qwen3:n kausaalimaskeerin täyteherkällä kaksisuuntaisella huomioinnilla, jolloin jokainen token voi hyödyntää sekä aikaisempia että myöhempiä vuoroja 4 096 tokenin ikkunassa.
Jokaiselle tokenille enkooderi tuottaa 1 024‑ulotteisen esityksen, ja lineaarinen merkintäosa pisteyttää 37 mahdollista merkintää BIOES‑kaavaston mukaisesti nimettyjen entiteettien tunnistukseen: yksi merkintä tekstille PII‑alueen ulkopuolella, sekä neljä alueen sijaintimerkintää jokaiselle yhdeksästä PII‑tyypistä. Apuliitos ennustaa, sisältääkö keskustelu arkaluonteista materiaalia, kuten terveys- tai uskonnollista tietoa. Yritys kertoi kouluttaneensa mallin kolmella epookilla noin 714 000 koulutusesimerkillä, jotka yhdistävät monikielisiä avustajakeskusteluja yksittäisiin tietueisiin. Päättelyvaiheessa rajoitettu Viterbi‑dekooderi etsii parhaan pisteytyksen omaavan kelvollisen merkintäjonon ja kartoittaa tuloksen tarkkoihin merkkialueisiin poistamista tai paikallista reititystä varten.
Arviointitulokset
Perplexity raportoi, että PII-Tracer saavutti korkein merkkitasoinen F1‑piste (0,629) 12:n arvioidun järjestelmän joukossa, sekä toiseksi korkein alue‑ylivuoto‑F1 ja alue‑sisältö‑F1. Yritys totesi, että huipputason mallit, nimittäin GPT-5.6-sol ja Claude Sonnet 5, saavuttivat vastaavan kokonaisSuorituskyvyn, jossa GPT-5.6-sol sai korkeamman pistemäärän molemmissa alue‑tasoisissa mittareissa, mutta alempaa merkkitasoista F1‑pistettä. Se huomautti, että nämä huipputason mallit sisältävät satoja miljardeja tai jopa biljoonia parametreja ja ovat suljettuja lähdekoodia, jotka toimivat pilvessä, mikä tekee niistä sopimattomia paikallisesti pysyvän tekstin suodattamiseen, kun taas muut avoimen lähdekoodin PII‑tunnistimet suoriutuivat merkittävästi heikommin kuin PII‑Tracer.
Johdonmukaisuustestissä arviointijoukossa on 899 tunnistetta, jotka esiintyvät kerran, ja 959, jotka esiintyvät useammin, joista 790 kattaa useita vuoroja. Perplexity raportoi, että PII-Tracer löytää jokaisen maininnan 79,4 % toistuvista tunnisteista ja 77,6 % vuorojen yli ulottuvista tunnisteista, kun taas GPT-5.6-sol saavuttaa 57,0 % ja 55,1 % samoissa kahdessa mittarissa. PII-Tracerin pisteytys laskee 0,917:sta yhden maininnan tunnisteille 0,691:een tunnisteille, jotka esiintyvät kuudesta kymmeneen kertaan.
Pituus on edelleen rajoite. Yhden ikkunan palautus (recall) on 0,975 keskusteluissa, jotka ovat alle 1 000 merkkiä, ja 0,955 välillä 1 000–10 000 merkkiä, mutta laskee 0,687:aan 10 000 merkkiä tai enemmän. Yritys kertoi, että saman tarkistuspisteen dekoodaus 50 %:n päällekkäisillä liukuvilla ikkunoilla nostaa kokonaismerkkien palautuksen 0,830:sta 0,965:een ja monen maininnan johdonmukaisen tunnistuksen 0,794:sta 0,954:een ilman uudelleenkoulutusta.
Kuuden kielen leikkauksessa, joka kattaa latinalaiset, kyrilliset ja hangulin aakkostot, PII-Tracer johtaa merkkitasoista F1‑pisteissä saksassa (0,735), ranskassa (0,633), italiassa (0,676) ja venäjässä (0,651), ja on 0,016–0,036 pisteen päässä parhaista tuloksista englannissa ja koreassa, yrityksen mukaan. Viidellä ulkoisella yhden tietueen vertailuarviossa Perplexity kertoi, että PII-Tracer saavutti korkeamman merkkitasoisen F1‑pisteen kuin OpenAI Privacy Filter kaikissa tietoaineistoissa, mukaan lukien 0,950 vs. 0,907 ai4privacyssa, 0,847 vs. 0,709 Nemotron-PII:ssa ja 0,594 vs. 0,350 TAB:ssa, ainoa ryhmän vertailuarvio, joka on rakennettu todellisesta, ihmisten merkitsemästä tekstistä.
Tutkimuspaperi varoittaa, että keskustelut ovat synteettisiä rekonstruointeja, jotka on johdettu tuotantoavustajaliikenteen rakenteesta, joten tuloksia tulisi lukea keskustelupohjaisen PII‑tunnistuksen mittaamisina eikä minkään tietyn tuotantotyön kuormituksen arvioina. Paperi huomauttaa myös, että työkalukutsut, agenttien väliset viestit ja multimodaaliset syötteet eivät kuulu vertailuarvion piiriin, ja että jokainen perusmalli arvioitiin yhden päättelykonfiguraation alla. Perplexity kertoi aikovansa julkaista sekä PII-TRACE:n että PII-Tracerin pian; paperi ilmoittaa, että molemmat julkaistaan MIT‑lisenssin alaisina.












