Кібербезпека

Perplexity представляє бенчмарк PII-TRACE та локальний детектор PII-Tracer

mm
Додайте Unite.AI до бажаних джерел у Google

Perplexity 1 вересня 2026 року представила PII-TRACE, бенчмарк для оцінки детекторів особисто ідентифікованої інформації, та PII‑Tracer, компактну модель з 0,6 млрд параметрів, створену для позначення PII на пристрої користувача до того, як текст надсилається до хмарних моделей. Оголошення позиціонує обидва випуску як інфраструктуру конфіденційності для гібридної обчислювальної архітектури компанії, у якій хмарні агенти виконують дослідження, міркування та планування, а локальна модель працює з приватними файлами.

У рамках цієї архітектури локальний «privacy gate» зберігає чутливий вміст на Mac, редагує виявлену приватну інформацію або запитує схвалення перед надсиланням у хмару. Perplexity зазначила, що межа захищає конфіденційність лише тоді, коли пристрій може розпізнати PII до того, як текст буде переданий віддаленій моделі, і що виявлення ускладнюється в довгих багатомовних розмовах, де один і той самий ідентифікатор може з’являтися кілька разів у різних репліках. Одне пропущене згадування може розкрити інформацію, яку система має захищати.

PII‑Tracer надає один локальний контрольний сигнал для маршрутизації моделей, позначаючи ділянки, передбачені як містять PII. Додаток потім застосовує політику маршрутизації: він залишає відповідний ввід локальним, редагує виявлені ділянки або запитує явне схвалення перед передачею до хмарної моделі.

Бенчмарк PII-TRACE

PII‑TRACE (Tracing Recurring PII Across Conversational Exchanges) містить 13 148 синтетичних розмов користувач‑асистент у 13 мовах і 10 системах письма, з 37 431 згадкою ідентифікаторів, позначених на рівні символів, за дев’ятьма типами PII. У 41 % розмов міститься структурований вміст. Серед 5 645 розмов з позначеним PII, 63,8 % включають ідентифікатор, який з’являється більше одного разу, і 28,7 % — ідентифікатор, що розповсюджується на кілька реплік.

Perplexity зазначила, що бенчмарк розроблено навколо трьох важливих поведінкових аспектів, які мають значення під час перевірки розмов асистентів. Перший — послідовне охоплення: коли ідентифікатор з’являється кілька разів або перетинає репліки користувача та асистента, детектор має знайти кожне його згадування. Другий — стійкість до довгого контексту, оскільки розмови варіюються від менш ніж 1 000 до понад 100 000 символів. Третій — обробка багатьох мов і змішаного формату, оскільки розмова може перемикатися між мовами та поєднувати прозу з кодом, таблицями або структурованими записами.

Бенчмарк вимірює продуктивність на двох рівнях. На рівні ідентифікатора послідовний бал детекції показує, чи виявив детектор кожен символ у кожному згадуванні одного і того ж ідентифікатора, і розрізняє ідентифікатори з кількома згадками та ті, що повторюються у різних репліках. На рівні символу точність вимірює, яку частину позначеного детектором тексту становить справжнє PII, відновлення — яку частину позначеного PII він знаходить, а F1‑баланс поєднує ці два показники.

Набір даних синтетичний, але створений на основі реальних розмов. За словами компанії, кілька мовних моделей спочатку маркують дев’ять типів PII у виробничих розмовах користувач‑асистент, а правило‑базований прохід групує повторювані ідентифікатори одного типу під одним ідентифікатором сутності. Кожне позначене значення замінюється типізованим заповнювачем, кожна репліка перефразовується з незмінними заповнювачами, а синтетичні значення, що відповідають типу та формату ідентифікатора, вставляються. Три автоматизовані перевірки гарантують, що заміни відповідають збереженим ділянкам, що повторювані згадки використовують одне й те саме значення, і що позначені вихідні значення відсутні після повторного сканування за допомогою Presidio та регулярних виразів. Друга мовна модель аудитує вибірку, а людина переглядає все, що система позначила як PII.

Компактний детектор для локального використання

PII‑Tracer — це 0,6 млрд‑параметричний двосторонній енкодер, адаптований від основи Qwen3. Perplexity зазначила, що перевірка конфіденційності відрізняється від генерації тексту, оскільки вимагає знаходження релевантних ділянок PII та повернення їх меж, тому модель замінює каузальну маску Qwen3 на двосторонню увагу, що враховує заповнення, дозволяючи кожному токену використовувати контекст як з попередніх, так і з наступних реплік у вікні у 4 096 токенів.

Для кожного токену енкодер створює 1 024‑вимірне представлення, а лінійна голова тегування оцінює 37 можливих міток за схемою BIOES для розпізнавання іменованих сутностей: одну мітку для тексту поза ділянкою PII та чотири мітки позиції ділянки для кожного з дев’яти типів PII. Додаткова голова передбачає, чи містить розмова конфіденційну інформацію, наприклад про здоров’я чи релігію. Компанія повідомила, що модель навчали протягом трьох епох на приблизно 714 000 навчальних зразків, що поєднують багатомовні розмови асистентів із прикладами одиничних записів. Під час інференсу обмежений декодер Вітербі шукає найвищий бал дійсної послідовності міток і відображає результат назад у точні ділянки символів для редагування або локальної маршрутизації.

Результати оцінювання

Perplexity повідомила, що PII‑Tracer досяг найвищого F1 за символи (0,629) серед 12 оцінених систем, а також другого за F1 у перекритті ділянок та F1 за включення ділянок. Компанія зазначила, що передові моделі, а саме GPT‑5.6‑sol та Claude Sonnet 5, продемонстрували порівнянну загальну продуктивність, причому GPT‑5.6‑sol отримав вищі бали за обидва метрики на рівні ділянок, але нижчий за символний F1. Відмічено, що ці передові моделі мають сотні мільярдів або навіть трильйони параметрів і є закритими моделями, розміщеними в хмарі, що робить їх непридатними для перевірки тексту, який має залишатися локальним, тоді як інші відкриті детектори PII показали значно гірші результати, ніж PII‑Tracer.

У тесті на послідовність набір оцінки містить 899 ідентифікаторів, що з’являються один раз, і 959, що з’являються більше одного разу, 790 з них охоплюють кілька реплік. Perplexity повідомила, що PII‑Tracer знаходить кожне згадування 79,4 % повторюваних ідентифікаторів і 77,6 % ідентифікаторів, що перетинаються між репліками, тоді як GPT‑5.6‑sol досягає 57,0 % і 55,1 % за тими ж двома показниками. Бал PII‑Tracer змінюється з 0,917 для ідентифікаторів з одноразовим згадуванням до 0,691 для ідентифікаторів, що з’являються шість‑десять разів.

Довжина залишається обмеженням. Recall за одним вікном становить 0,975 для розмов менше 1 000 символів і 0,955 для діапазону від 1 000 до 10 000, але падає до 0,687 при 10 000 і більше символах. Компанія зазначила, що декодування того самого чекпоінту з 50 % перекриттям ковзних вікон підвищує загальний recall за символи з 0,830 до 0,965 і послідовне виявлення багатократних згадувань з 0,794 до 0,954 без додаткового навчання.

У шести‑мовному підмножині, що охоплює латинські, кириличні та хангильські скрипти, PII‑Tracer очолює символний F1 у німецькій (0,735), французькій (0,633), італійській (0,676) та російській (0,651), і знаходиться в діапазоні 0,016‑0,036 від кращих результатів у англійській та корейській, за даними компанії. На п’яти зовнішніх одиничних записах PII‑Tracer продемонстрував вищий символний F1, ніж OpenAI Privacy Filter, у всіх наборах даних, включаючи 0,950 проти 0,907 у ai4privacy, 0,847 проти 0,709 у Nemotron‑PII та 0,594 проти 0,350 у TAB — єдиному бенчмарку в групі, створеному на реальному, людським способом розміченому тексті.

Наукова стаття застерігає, що розмови є синтетичними реконструкціями, отриманими зі структури виробничого трафіку асистентів, тому результати слід розглядати як вимірювання виявлення PII у діалогах, а не як оцінки для конкретних виробничих навантажень. У статті також зазначається, що виклики інструментів, міжагентські повідомлення та мультимодальні вводи не входять до сфери бенчмарку, і що кожна базова лінія оцінювалася за єдиної конфігурації інференсу. Perplexity повідомила, що незабаром випустить як PII‑TRACE, так і PII‑Tracer; у статті вказано, що обидва будуть випущені під ліцензією MIT.

Майлз Окада - аналітик, створений штучним інтелектом, у Unite.AI, який висвітлює штучний інтелект та кібербезпеку, з особливим акцентом на нових загрозах, захисних архітектурах та еволюційних динаміках між атакувальниками та автоматизованими системами. Його робота досліджує, як штучний інтелект змінює операції з безпеки, від автономного виявлення загроз та реагування до зростання технік штучного інтелекту.

Він аналізує дослідження безпеки, розголошення інцидентів та реальні розгортання, щоб зрозуміти, де штучний інтелект посилює захист - і де він вводить нові уразливості. Він приділяє особливу увагу експлуатації моделей, отруєнню даних, автоматизації атак та оперативним реаліям захисту систем, що працюють на штучному інтелекті, у великому масштабі.

Статті, написані Майлзом Окадою, створені штучним інтелектом та перевірені редакційною командою Unite.AI, щоб забезпечити точність, суворість та відповідальне висвітлення швидко змінюваного ландшафту безпеки штучного інтелекту.