An ninh mạng

Perplexity Giới Thiệu Tiêu Chuẩn PII-TRACE và Bộ Phát Hiện PII-Tracer Trên Thiết Bị

mm
Thêm Unite.AI vào các nguồn ưu tiên của bạn trên Google

Perplexity vào ngày 1 tháng 9 năm 2026 đã giới thiệu PII-TRACE, một bộ chuẩn để đánh giá các bộ phát hiện thông tin cá nhân nhận dạng được, và PII‑Tracer, một mô hình 0.6B tham số được thiết kế để gắn cờ PII trên thiết bị của người dùng trước khi văn bản được gửi tới các mô hình đám mây. thông báo đặt cả hai bản phát hành này như là hạ tầng bảo mật cho kiến trúc tính toán lai của công ty, trong đó các tác nhân đám mây thực hiện nghiên cứu, suy luận và lập kế hoạch trong khi mô hình cục bộ làm việc với các tệp riêng tư.

Trong kiến trúc đó, cổng bảo mật cục bộ giữ nội dung nhạy cảm trên Mac, xóa bỏ thông tin riêng tư đã được phát hiện, hoặc yêu cầu phê duyệt trước khi gửi lên đám mây. Perplexity cho biết ranh giới này chỉ bảo vệ quyền riêng tư nếu thiết bị có thể nhận diện PII trước khi văn bản được gửi tới mô hình từ xa, và việc phát hiện sẽ trở nên khó khăn hơn trong các cuộc hội thoại dài, đa ngôn ngữ, nơi cùng một định danh có thể xuất hiện nhiều lần trong các lượt khác nhau. Một lần bỏ sót có thể lộ thông tin mà hệ thống dự định bảo vệ.

PII‑Tracer cung cấp một tín hiệu điều khiển cục bộ cho việc định tuyến mô hình bằng cách gắn cờ các đoạn dự đoán chứa PII. Ứng dụng sau đó thực thi chính sách định tuyến: nó giữ đầu vào liên quan ở cục bộ, xóa bỏ các đoạn đã phát hiện, hoặc yêu cầu phê duyệt rõ ràng trước khi nâng cấp lên mô hình đám mây.

Tiêu chuẩn PII-TRACE

PII-TRACE, viết tắt của Tracing Recurring PII Across Conversational Exchanges, chứa 13,148 cuộc hội thoại người‑dùng‑trợ lý tổng hợp bằng 13 ngôn ngữ và 10 hệ thống viết, với 37,431 đề cập định danh được gán nhãn ở mức ký tự trên chín loại PII. Tổng cộng 41% các cuộc hội thoại chứa nội dung có cấu trúc. Trong số 5,645 cuộc hội thoại có PII được gán nhãn, 63.8% bao gồm một định danh xuất hiện hơn một lần, và 28.7% bao gồm một định danh xuất hiện qua nhiều lượt.

Perplexity cho biết họ đã thiết kế bộ chuẩn dựa trên ba hành vi quan trọng khi một bộ phát hiện kiểm tra các cuộc hội thoại trợ lý. Thứ nhất là độ bao phủ nhất quán: khi một định danh xuất hiện nhiều lần hoặc xuyên qua các lượt người dùng và trợ lý, bộ phát hiện cần tìm mọi đề cập. Thứ hai là khả năng chịu đựng ngữ cảnh dài, với các cuộc hội thoại dao động từ dưới 1,000 tới hơn 100,000 ký tự. Thứ ba là xử lý đa ngôn ngữ và nội dung hỗn hợp, vì một cuộc hội thoại có thể chuyển đổi ngôn ngữ và kết hợp văn bản với mã, bảng, hoặc bản ghi có cấu trúc.

Bộ chuẩn đo lường hiệu suất ở hai cấp độ. Ở cấp độ định danh, điểm phát hiện nhất quán hỏi liệu bộ phát hiện có bao phủ mọi ký tự trong mọi đề cập của cùng một định danh, được báo cáo riêng cho các định danh có nhiều đề cập và cho các định danh lặp lại qua các lượt. Ở cấp độ ký tự, độ chính xác đo mức độ văn bản được bộ phát hiện đánh dấu là PII thực sự là PII, độ thu hồi đo mức độ PII đã gán nhãn mà nó tìm thấy, và F1 cân bằng hai chỉ số này.

Bộ dữ liệu là tổng hợp nhưng được tạo ra từ các cuộc hội thoại thực tế. Theo công ty, nhiều mô hình ngôn ngữ đầu tiên đánh dấu chín loại PII trong các cuộc hội thoại người‑dùng‑trợ lý thực tế, và một bước lọc dựa trên quy tắc nhóm các định danh lặp lại cùng loại dưới một ID thực thể. Mỗi giá trị đã đánh dấu được thay thế bằng một placeholder có kiểu, mỗi lượt được diễn đạt lại với các placeholder còn nguyên, và các giá trị tổng hợp phù hợp với kiểu và định dạng của mỗi định danh được chèn vào. Ba cổng tự động kiểm tra việc thay thế khớp với các đoạn đã lưu, các đề cập lặp lại sử dụng cùng một giá trị, và các giá trị nguồn đã đánh dấu không còn xuất hiện sau khi quét lại bằng Presidio và biểu thức chính quy. Một mô hình ngôn ngữ thứ hai kiểm tra mẫu, và con người xem xét bất kỳ mục nào nó đánh dấu là PII.

Một bộ phát hiện gọn nhẹ cho việc sử dụng cục bộ

PII‑Tracer là một bộ mã hoá hai chiều 0.6B tham số được điều chỉnh từ nền tảng Qwen3. Perplexity cho biết việc sàng lọc bảo mật khác với tạo văn bản vì nó yêu cầu tìm các đoạn PII liên quan và trả về ranh giới của chúng, vì vậy mô hình thay thế mặt nạ nhân quả của Qwen3 bằng cơ chế chú ý hai chiều có khả năng đệm, cho phép mỗi token dựa vào cả các lượt trước và sau trong cửa sổ 4,096 token.

Đối với mỗi token, bộ mã hoá tạo ra một biểu diễn 1,024 chiều, và một đầu ra gắn thẻ tuyến tính gán 37 nhãn khả thi theo sơ đồ BIOES cho nhận dạng thực thể có tên: một nhãn cho văn bản ngoài đoạn PII, cộng thêm bốn nhãn vị trí đoạn cho mỗi trong chín loại PII. Một đầu ra phụ dự đoán liệu cuộc hội thoại có chứa tài liệu nhạy cảm, chẳng hạn như thông tin sức khỏe hoặc tôn giáo. Công ty cho biết họ đã huấn luyện mô hình trong ba vòng trên khoảng 714,000 mẫu huấn luyện kết hợp các cuộc hội thoại trợ lý đa ngôn ngữ với các ví dụ bản ghi đơn. Khi suy luận, một bộ giải mã Viterbi bị ràng buộc tìm chuỗi nhãn hợp lệ có điểm cao nhất và ánh xạ kết quả trở lại các đoạn ký tự chính xác để xóa hoặc định tuyến cục bộ.

Kết quả Đánh giá

Perplexity báo cáo rằng PII‑Tracer đạt F1 ký tự cao nhất (0.629) trong số 12 hệ thống được đánh giá, cùng với F1 chồng đoạn thứ hai cao nhất và F1 bao hàm đoạn. Công ty cho biết các mô hình tiên tiến, cụ thể là GPT‑5.6‑sol và Claude Sonnet 5, đạt hiệu suất tổng thể tương đương, trong khi GPT‑5.6‑sol đạt điểm cao hơn trên cả hai chỉ số mức đoạn nhưng lại thấp hơn trên F1 ký tự. Họ lưu ý rằng các mô hình tiên tiến này có hàng trăm tỷ thậm chí hàng nghìn tỷ tham số và là các mô hình đóng nguồn được lưu trữ trên đám mây, khiến chúng không phù hợp để sàng lọc văn bản phải ở cục bộ, trong khi các bộ phát hiện PII mã nguồn mở khác cho kết quả kém hơn đáng kể so với PII‑Tracer.

Trong bài kiểm tra độ nhất quán, tập đánh giá chứa 899 định danh xuất hiện một lần và 959 xuất hiện hơn một lần, trong đó 790 trải dài qua nhiều lượt. Perplexity báo cáo rằng PII‑Tracer tìm mọi đề cập của 79.4% các định danh lặp lại và 77.6% các định danh xuyên lượt, trong khi GPT‑5.6‑sol đạt 57.0% và 55.1% trên cùng hai chỉ số. Điểm của PII‑Tracer giảm từ 0.917 cho các định danh một lần đề cập xuống 0.691 cho các định danh xuất hiện từ sáu đến mười lần.

Độ dài vẫn là một hạn chế. Độ thu hồi trong một cửa sổ đơn là 0.975 cho các cuộc hội thoại dưới 1,000 ký tự và 0.955 từ 1,000 đến 10,000, nhưng giảm xuống 0.687 ở mức 10,000 ký tự trở lên. Công ty cho biết việc giải mã cùng một checkpoint với các cửa sổ trượt 50% chồng lên nhau làm tăng tổng độ thu hồi ký tự từ 0.830 lên 0.965 và độ phát hiện nhất quán đa đề cập từ 0.794 lên 0.954, mà không cần huấn luyện lại.

Trong một lát cắt sáu ngôn ngữ bao gồm các chữ viết Latin, Cyrillic và Hangul, PII‑Tracer dẫn đầu F1 ký tự ở tiếng Đức (0.735), tiếng Pháp (0.633), tiếng Ý (0.676) và tiếng Nga (0.651), và chỉ cách kết quả tốt nhất ở tiếng Anh và tiếng Hàn từ 0.016 đến 0.036, công ty báo cáo. Trên năm bộ chuẩn bản ghi đơn bên ngoài, Perplexity cho biết PII‑Tracer đạt F1 ký tự cao hơn so với OpenAI Privacy Filter trên mọi bộ dữ liệu, bao gồm 0.950 so với 0.907 trên ai4privacy, 0.847 so với 0.709 trên Nemotron‑PII, và 0.594 so với 0.350 trên TAB, bộ chuẩn duy nhất trong nhóm được xây dựng từ văn bản thực tế, được gán nhãn bởi con người.

báo cáo nghiên cứu cảnh báo rằng các cuộc hội thoại là các bản tái tạo tổng hợp được suy ra từ cấu trúc lưu lượng trợ lý thực tế, vì vậy kết quả nên được đọc như các phép đo phát hiện PII trong hội thoại chứ không phải ước lượng cho bất kỳ khối lượng công việc sản xuất cụ thể nào. Báo cáo cũng lưu ý rằng các lời gọi công cụ, tin nhắn giữa các tác nhân và đầu vào đa phương tiện nằm ngoài phạm vi của bộ chuẩn, và mỗi baseline được đánh giá dưới một cấu hình suy luận duy nhất. Perplexity cho biết họ dự định sớm phát hành cả PII‑TRACE và PII‑Tracer; báo cáo nói rằng cả hai sẽ được phát hành dưới giấy phép MIT.

Miles Okada là một nhà phân tích được tạo bởi AI tại Unite.AI, chuyên về trí tuệ nhân tạo và an ninh mạng với trọng tâm vào các mối đe dọa mới nổi, kiến trúc phòng thủ và động lực thay đổi giữa kẻ tấn công và hệ thống tự động. Công việc của ông nghiên cứu cách AI đang thay đổi hoạt động an ninh, từ việc phát hiện và phản ứng tự động với các mối đe dọa đến sự gia tăng của các kỹ thuật AI đối lập.

Với quan điểm kỹ thuật và điều tra, Miles phân tích nghiên cứu an ninh, tiết lộ sự cố và triển khai thực tế để hiểu nơi AI tăng cường phòng thủ - và nơi nó giới thiệu các điểm yếu mới. Ông đặc biệt chú ý đến việc khai thác mô hình, đầu độc dữ liệu, tự động hóa tấn công và thực tế hoạt động của việc bảo mật các hệ thống được cung cấp bởi AI ở quy mô lớn.

Các bài viết được viết bởi Miles Okada được tạo bởi AI và được xem xét bởi nhóm biên tập của Unite.AI để đảm bảo độ chính xác, nghiêm ngặt và phạm vi bảo vệ có trách nhiệm của cảnh quan an ninh AI đang thay đổi nhanh chóng.