Góc nhìn Anderson

Bảo vệ các lời nhắc khỏi rò rỉ dữ liệu LLM

mm
Thêm Unite.AI vào các nguồn ưu tiên của bạn trên Google
ChatGPT-4o: 'Orthographic 1792x1024 view of a SIMs-like police officer holding up his hand to a citizen to stop them going any further'

Ý kiến Một bài nộp thú vị của IBM NeurIPS 2024 đã được công bố vào cuối năm 2024 đã xuất hiện lại trên Arxiv vào tuần trước. Nó đề xuất một hệ thống có thể tự động can thiệp để bảo vệ người dùng khỏi việc gửi thông tin cá nhân hoặc nhạy cảm vào một tin nhắn khi họ đang trò chuyện với một Mô hình Ngôn ngữ Lớn (LLM) như ChatGPT.

Các ví dụ mô hình được sử dụng trong một nghiên cứu người dùng để xác định cách người dùng muốn tương tác với dịch vụ can thiệp lời nhắc. Nguồn: https://arxiv.org/pdf/2502.18509

Các ví dụ mô hình được sử dụng trong một nghiên cứu người dùng để xác định cách người dùng muốn tương tác với dịch vụ can thiệp lời nhắc. Nguồn: https://arxiv.org/pdf/2502.18509

Các mô hình trên được các nhà nghiên cứu của IBM sử dụng trong một nghiên cứu để kiểm tra sự ma sát tiềm năng của người dùng đối với loại “can thiệp” này.

Mặc dù có ít chi tiết về việc triển khai GUI, chúng ta có thể giả định rằng chức năng như vậy có thể được tích hợp vào một tiện ích mở rộng trình duyệt liên lạc với một khung LLM “tường lửa” cục bộ; hoặc một ứng dụng có thể được tạo để có thể gắn trực tiếp vào (ví dụ) API OpenAI, hiệu quả tái tạo chương trình độc lập của OpenAI cho ChatGPT, nhưng với các biện pháp bảo vệ bổ sung.

Đó nói, ChatGPT tự động kiểm duyệt các phản hồi đối với các lời nhắc mà nó nhận thấy chứa thông tin quan trọng, chẳng hạn như chi tiết ngân hàng:

ChatGPT từ chối tham gia vào các lời nhắc chứa thông tin bảo mật quan trọng, chẳng hạn như chi tiết ngân hàng (chi tiết trong lời nhắc trên là hư cấu và không hoạt động). Nguồn: https://chatgpt.com/

ChatGPT từ chối tham gia vào các lời nhắc chứa thông tin bảo mật quan trọng, chẳng hạn như chi tiết ngân hàng (chi tiết trong lời nhắc trên là hư cấu và không hoạt động). Nguồn: https://chatgpt.com/

Tuy nhiên, ChatGPT rất khoan dung hơn trong việc liên quan đến các loại thông tin cá nhân khác – ngay cả khi việc tiết lộ thông tin đó có thể không nằm trong lợi ích tốt nhất của người dùng (trong trường hợp này có thể vì lý do liên quan đến công việc và tiết lộ):

Ví dụ trên là hư cấu, nhưng ChatGPT không ngần ngại tham gia vào một cuộc trò chuyện với người dùng về một chủ đề nhạy cảm có thể gây ra rủi ro về danh tiếng hoặc thu nhập (ví dụ trên hoàn toàn hư cấu).

Ví dụ trên là hư cấu, nhưng ChatGPT không ngần ngại tham gia vào một cuộc trò chuyện với người dùng về một chủ đề nhạy cảm có thể gây ra rủi ro về danh tiếng hoặc thu nhập (ví dụ trên hoàn toàn hư cấu).

Trong trường hợp trên, có thể tốt hơn nếu viết: ‘Ý nghĩa của chẩn đoán ung thư máu đối với khả năng viết và di chuyển của một người là gì?’

Dự án IBM xác định và giải thích lại các yêu cầu như vậy từ một quan điểm “cá nhân” sang một quan điểm “chung chung”.

Sơ đồ cho hệ thống IBM, sử dụng LLM cục bộ hoặc các thuật toán dựa trên NLP để xác định thông tin nhạy cảm trong các lời nhắc tiềm năng.

Sơ đồ cho hệ thống IBM, sử dụng LLM cục bộ hoặc các thuật toán dựa trên NLP để xác định thông tin nhạy cảm trong các lời nhắc tiềm năng.

Điều này giả định rằng vật liệu thu thập được bởi các LLM trực tuyến, trong giai đoạn đầu của việc áp dụng AI trò chuyện của công chúng, sẽ không bao giờ được chuyển đến các mô hình sau này hoặc các khung quảng cáo sau này có thể khai thác các truy vấn tìm kiếm của người dùng để cung cấp quảng cáo được nhắm mục tiêu.

Mặc dù không có hệ thống hoặc sắp xếp nào được biết đến hiện tại, nhưng cũng không có chức năng như vậy vào thời điểm bắt đầu áp dụng internet vào đầu những năm 1990; kể từ đó, chia sẻ thông tin giữa các miền để cung cấp quảng cáo cá nhân hóa đã dẫn đến nhiều vụ bê bối, cũng như hoang mang.

Vì vậy, lịch sử cho thấy rằng sẽ tốt hơn nếu làm sạch các lời nhắc LLM ngay bây giờ, trước khi dữ liệu đó tích lũy với số lượng lớn, và trước khi các bản gửi LLM của chúng tôi kết thúc trong các cơ sở dữ liệu và mô hình chu kỳ vĩnh cửu và/hoặc các cấu trúc và lược đồ thông tin khác.

Nhớ Tôi?

Một yếu tố quan trọng chống lại việc sử dụng các lời nhắc “chung chung” hoặc được làm sạch là rằng,坦率, khả năng tùy chỉnh một API LLM đắt tiền như ChatGPT là khá hấp dẫn, ít nhất là trong tình hình hiện tại – nhưng điều này có thể liên quan đến việc phơi bày thông tin riêng tư trong thời gian dài.

Tôi thường yêu cầu ChatGPT giúp tôi tạo ra các tập lệnh PowerShell và tệp BAT để tự động hóa các quy trình, cũng như các vấn đề kỹ thuật khác. Để làm điều này, tôi thấy hữu ích khi hệ thống nhớ vĩnh viễn các chi tiết về phần cứng mà tôi có sẵn; các kỹ năng kỹ thuật của tôi (hoặc thiếu sót); và các yếu tố môi trường và quy tắc tùy chỉnh khác:

ChatGPT cho phép người dùng phát triển một 'bộ nhớ' sẽ được áp dụng khi hệ thống xem xét phản hồi cho các lời nhắc trong tương lai.

ChatGPT cho phép người dùng phát triển một ‘bộ nhớ’ sẽ được áp dụng khi hệ thống xem xét phản hồi cho các lời nhắc trong tương lai.

Tất yếu, điều này giữ thông tin về tôi được lưu trữ trên các máy chủ bên ngoài, chịu sự điều chỉnh của các điều khoản và điều kiện có thể thay đổi theo thời gian, mà không có bảo đảm rằng OpenAI (mặc dù nó có thể là nhà cung cấp LLM lớn khác) sẽ tôn trọng các điều khoản họ đặt ra.

Nói chung, tuy nhiên, khả năng xây dựng một bộ nhớ trong ChatGPT là hữu ích nhất do cửa sổ chú ý hạn chế của các LLM nói chung; mà không có các bản nhúng vĩnh viễn (cá nhân hóa), người dùng cảm thấy, một cách khó chịu, rằng họ đang trò chuyện với một thực thể bị mất trí nhớ Anterograde.

Điều này khó nói liệu các mô hình mới hơn sẽ trở nên đủ hiệu suất để cung cấp phản hồi hữu ích mà không cần phải nhớ vĩnh viễn, hoặc để tạo các GPT tùy chỉnh được lưu trữ trực tuyến.

Chứng mất trí nhớ tạm thời

Mặc dù người dùng có thể làm cho các cuộc trò chuyện ChatGPT trở nên “tạm thời”, nhưng hữu ích khi có lịch sử trò chuyện như một tài liệu tham khảo có thể được cô đọng, khi thời gian cho phép, thành một bản ghi cục bộ hơn, có thể trên một nền tảng ghi chú; nhưng trong mọi trường hợp, chúng ta không thể biết chính xác những gì xảy ra với các “cuộc trò chuyện bị loại bỏ” (mặc dù OpenAI công bố họ sẽ không được sử dụng để đào tạo, nó không tuyên bố rằng chúng sẽ bị phá hủy), dựa trên cơ sở hạ tầng ChatGPT. Tất cả những gì chúng ta biết là các cuộc trò chuyện không còn xuất hiện trong lịch sử của chúng tôi khi ‘Cuộc trò chuyện tạm thời’ được bật trong ChatGPT.

Các vụ bê bối gần đây cho thấy rằng các nhà cung cấp API như OpenAI không nên được để lại nhiệm vụ bảo vệ quyền riêng tư của người dùng, bao gồm cả việc phát hiện nhớ lại, cho thấy rằng các LLM lớn hơn có nhiều khả năng nhớ lại một số ví dụ đào tạo đầy đủ, và làm tăng nguy cơ tiết lộ dữ liệu người dùng cụ thể – trong số các sự cố công khai khác đã thuyết phục nhiều công ty lớn, như Samsung, để cấm LLM cho sử dụng nội bộ công ty.

Tư duy khác biệt

Sự căng thẳng giữa tính hữu ích cực độ và rủi ro tiềm ẩn của các LLM sẽ cần một số giải pháp sáng tạo – và đề xuất của IBM dường như là một bản mẫu cơ bản thú vị trong dòng này.

Ba bản sửa đổi của IBM, cân bằng giữa tính hữu ích và quyền riêng tư dữ liệu. Trong băng thấp nhất (hồng), chúng ta thấy một lời nhắc mà vượt quá khả năng của hệ thống để làm sạch một cách có ý nghĩa.

Ba bản sửa đổi của IBM, cân bằng giữa tính hữu ích và quyền riêng tư dữ liệu. Trong băng thấp nhất (hồng), chúng ta thấy một lời nhắc mà vượt quá khả năng của hệ thống để làm sạch một cách có ý nghĩa.

Phương pháp của IBM chặn các gói tin đi ra từ LLM ở cấp độ mạng và viết lại chúng khi cần thiết trước khi bản gốc có thể được gửi. Các tích hợp GUI phức tạp hơn được thấy ở đầu bài viết chỉ là minh họa cho nơi mà một phương pháp như vậy có thể đi, nếu được phát triển.

Tất nhiên, mà không có đủ quyền lực, người dùng có thể không hiểu rằng họ đang nhận được phản hồi cho một lời nhắc thay thế cho lời nhắc ban đầu của họ. Sự thiếu minh bạch này tương đương với một tường lửa của hệ điều hành chặn truy cập vào một trang web hoặc dịch vụ mà không thông báo cho người dùng, người có thể sau đó tìm kiếm các nguyên nhân khác cho vấn đề.

Các lời nhắc như trách nhiệm bảo mật

Tiềm năng của “can thiệp lời nhắc” tương tự như bảo mật của hệ điều hành Windows, đã phát triển từ một bản vá của các sản phẩm thương mại (tùy chọn) trong những năm 1990 thành một bộ công cụ phòng thủ mạng không tùy chọn và được áp dụng nghiêm ngặt đi kèm với một cài đặt Windows, và đòi hỏi một số nỗ lực để tắt hoặc giảm thiểu.

Nếu việc làm sạch lời nhắc phát triển như các tường lửa mạng đã làm trong 30 năm qua, đề xuất của bài báo IBM có thể phục vụ như một bản mẫu cho tương lai: triển khai một LLM cục bộ hoàn toàn trên máy của người dùng để lọc các lời nhắc đi ra đến các API LLM được biết. Hệ thống này sẽ tự nhiên cần tích hợp các khuôn khổ GUI và thông báo, cung cấp cho người dùng quyền kiểm soát – trừ khi các chính sách quản trị vượt qua nó, như thường xảy ra trong các môi trường kinh doanh.

Các nhà nghiên cứu đã thực hiện một phân tích của một phiên bản mã nguồn mở của ShareGPT để hiểu rõ hơn về việc vi phạm quyền riêng tư ngữ cảnh trong các kịch bản thực tế.

Llama-3.1-405B-Instruct đã được sử dụng như một mô hình “trọng tài” để phát hiện các vi phạm về tính toàn vẹn ngữ cảnh. Từ một tập hợp lớn các cuộc trò chuyện, một tập con của các cuộc trò chuyện một lượt đã được phân tích dựa trên độ dài. Mô hình trọng tài sau đó đánh giá ngữ cảnh, thông tin nhạy cảm và sự cần thiết cho việc hoàn thành nhiệm vụ, dẫn đến việc xác định các cuộc trò chuyện chứa các vi phạm về tính toàn vẹn ngữ cảnh tiềm ẩn.

Một tập con nhỏ hơn của các cuộc trò chuyện này, những cuộc trò chuyện đã chứng minh các vi phạm về quyền riêng tư ngữ cảnh rõ ràng, đã được phân tích thêm.

Khung này đã được thực hiện bằng cách sử dụng các mô hình nhỏ hơn so với các đại lý trò chuyện thông thường như ChatGPT, để cho phép triển khai cục bộ thông qua Ollama.

Sơ đồ cho hệ thống can thiệp lời nhắc.

Sơ đồ cho hệ thống can thiệp lời nhắc.

Ba LLM được đánh giá là Mixtral-8x7B-Instruct-v0.1; Llama-3.1-8B-Instruct; và DeepSeek-R1-Distill-Llama-8B.

Các lời nhắc của người dùng được xử lý bởi khung này trong ba giai đoạn: xác định ngữ cảnh; phân loại thông tin nhạy cảm; và đổi mới.

Hai phương pháp đã được thực hiện cho việc phân loại thông tin nhạy cảm: độngcấu trúc phân loại: phân loại động xác định các chi tiết quan trọng dựa trên việc sử dụng chúng trong một cuộc trò chuyện cụ thể; phân loại cấu trúc cho phép chỉ định một danh sách các thuộc tính nhạy cảm được định nghĩa trước mà luôn được coi là không cần thiết. Mô hình đổi mới lời nhắc nếu nó phát hiện ra các chi tiết nhạy cảm không cần thiết bằng cách loại bỏ hoặc đổi mới chúng để giảm thiểu rủi ro về quyền riêng tư trong khi duy trì tính hữu ích.

Quy tắc nhà

Mặc dù phân loại cấu trúc như một khái niệm không được minh họa rõ ràng trong bài báo của IBM, nhưng nó tương tự như phương pháp “Định nghĩa dữ liệu riêng tư” trong Private Prompts, cung cấp một chương trình độc lập có thể viết lại các lời nhắc – mặc dù không có khả năng can thiệp trực tiếp vào cấp độ mạng như phương pháp của IBM (thay vào đó, người dùng phải sao chép và dán các lời nhắc đã sửa đổi).

Chương trình Private Prompts cho phép người dùng lập một danh sách các thay thế tự động cho văn bản nhập của người dùng.

Chương trình Private Prompts cho phép người dùng lập một danh sách các thay thế tự động cho văn bản nhập của người dùng.

Trong hình ảnh trên, chúng ta có thể thấy rằng người dùng Private Prompts có thể lập trình các thay thế tự động cho các trường hợp thông tin nhạy cảm. Trong cả hai trường hợp, cho Private Prompts và phương pháp của IBM, dường như không chắc chắn rằng một người dùng có đủ sự hiện diện và tầm nhìn cá nhân để lập một danh sách như vậy sẽ thực sự cần sản phẩm này – mặc dù nó có thể được xây dựng theo thời gian khi các sự cố xảy ra.

Trong vai trò quản trị, phân loại cấu trúc có thể hoạt động như một tường lửa hoặc bộ lọc cho nhân viên; và trong một mạng gia đình, nó có thể, với một số điều chỉnh khó khăn, trở thành một bộ lọc mạng gia đình cho tất cả người dùng mạng; nhưng cuối cùng, phương pháp này có thể là thừa, vì một người dùng có thể thiết lập danh sách như vậy một cách hiệu quả có thể tự kiểm duyệt hiệu quả ngay từ đầu.

Ý kiến của ChatGPT

Vì ChatGPT gần đây đã ra mắt công cụ nghiên cứu sâu cho người dùng trả phí, tôi đã sử dụng tính năng này để yêu cầu ChatGPT xem xét các tài liệu liên quan và đưa ra một “phán xét” hoài nghi về đề xuất của IBM. Tôi đã nhận được phản hồi phòng thủ và khinh thường nhất mà hệ thống từng đưa ra khi được yêu cầu đánh giá hoặc phân tích một ấn phẩm mới:

ChatGPT-4o có quan điểm thấp về dự án IBM.

ChatGPT-4o có quan điểm thấp về dự án IBM.

‘Nếu người dùng không tin tưởng OpenAI, Google hoặc Anthropic để xử lý dữ liệu của họ một cách có trách nhiệm,’ ChatGPT cho rằng. ‘thì tại sao họ lại tin tưởng một lớp phần mềm thứ ba nằm giữa họ và AI? Lớp trung gian này trở thành một điểm thất bại mới – có thể ghi nhật ký, xử lý sai hoặc thậm chí làm rò rỉ dữ liệu trước khi nó thậm chí đến được LLM. Nó không giải quyết được vấn đề nếu nó chỉ tạo ra một thực thể mới để khai thác dữ liệu người dùng.’

Đề xuất này dường như mang tính tự phục vụ và không áp dụng được, xét đến lịch sử của các dự án mã nguồn mở thực sự mang lại lợi ích cho người dùng cuối thông qua sự cố gắng lâu dài của các nhà phát triển và người đóng góp cộng đồng; và xét đến tiềm năng ngày càng tăng của các thiết bị di động để chạy – và thậm chí đào tạo – các LLM nhẹ. Đúng là trong trường hợp này, trường hợp sử dụng không quá đòi hỏi.

Tiếp theo, ChatGPT tự tin bỏ qua điểm của việc có một LLM nhẹ cung cấp sự giám sát của đầu vào hướng đến một LLM thương mại không thể chạy trên một máy cục bộ (vì LLM quá lớn và cho phép truy cập cục bộ quá rủi ro cho công ty tạo ra nó):

‘Làm sạch quyền riêng tư hiệu quả đòi hỏi phải hiểu đầu vào trước khi quyết định những gì cần loại bỏ. Nếu một trung gian đủ thông minh để nhận ra dữ liệu nhạy cảm (tên, địa chỉ, chi tiết tài chính), thì nó đã xử lý và phân tích dữ liệu đó – có nghĩa là nó phải lưu trữ hoặc kiểm tra chính thứ mà nó được cho là xóa.

‘Điều này giới thiệu một nghịch lý: a) Một bộ lọc “ngu” (thay thế regex cơ bản) sẽ không hiệu quả và bỏ lỡ các rủi ro về quyền riêng tư tinh vi. b) Một bộ lọc “thông minh” (trình viết lại LLM) phải xử lý toàn bộ đầu vào, khiến nó trở nên nguy hiểm như chính LLM.

‘Nếu bạn tin tưởng trung gian đủ để đọc và viết lại đầu vào của mình, thì tại sao không chỉ tin tưởng LLM chính?

Câu trả lời cho câu hỏi cuối cùng này là LLM cục bộ được thiết kế để hoàn toàn ở phía người dùng, và cuối cùng là mã nguồn mở, với nhu cầu truy cập mạng tối thiểu hoặc không có; trong khi một phiên bản thương mại tương đương, dù có ý định tốt ban đầu, sẽ dễ bị tổn thương trước các thay đổi của công ty và các điều khoản dịch vụ, trong khi một giấy phép mã nguồn mở phù hợp sẽ ngăn chặn loại “sự tham nhũng không thể tránh khỏi” này.

ChatGPT lập luận thêm rằng đề xuất của IBM “phá vỡ ý định của người dùng”, vì nó có thể giải thích lại một lời nhắc thành một thay thế có thể ảnh hưởng đến tính hữu ích của nó. Tuy nhiên, đây là một vấn đề rộng lớn hơn trong việc làm sạch lời nhắc, và không cụ thể cho trường hợp sử dụng này.

Để kết thúc (bỏ qua đề xuất sử dụng LLM cục bộ “thay vào đó”, điều mà bài báo của IBM thực sự đề xuất), ChatGPT cho rằng phương pháp của IBM đại diện cho một rào cản đối với việc áp dụng do “ma sát người dùng” khi triển khai các phương pháp cảnh báo và chỉnh sửa vào một cuộc trò chuyện.

Ở đây, ChatGPT có thể đúng; nhưng nếu áp lực đáng kể đến từ các sự cố công khai tiếp theo, hoặc nếu lợi nhuận trong một khu vực địa lý bị đe dọa bởi sự điều chỉnh ngày càng tăng (và công ty từ chối đơn giản bỏ khu vực đó hoàn toàn), thì lịch sử của công nghệ tiêu dùng cho thấy rằng các biện pháp bảo vệ cuối cùng sẽ không còn tùy chọn nữa.

Kết luận

Chúng ta không thể mong đợi OpenAI sẽ thực hiện các biện pháp bảo vệ như được đề xuất trong bài báo của IBM, và trong khái niệm trung tâm đằng sau nó; ít nhất là không hiệu quả.

Và chắc chắn không toàn cầu; giống như Apple chặn một số tính năng iPhone ở châu Âu, và LinkedIn có quy tắc khác để khai thác dữ liệu người dùng ở các quốc gia khác nhau, có lý khi cho rằng bất kỳ công ty AI nào cũng sẽ mặc định các điều khoản và điều kiện có lợi nhất mà có thể chấp nhận được đối với bất kỳ quốc gia nào trong đó nó hoạt động – trong mỗi trường hợp, tại chi phí của quyền riêng tư dữ liệu của người dùng, khi cần thiết.

 

Được xuất bản lần đầu vào thứ Năm, ngày 27 tháng 2 năm 2025

Được cập nhật vào thứ Năm, ngày 27 tháng 2 năm 2025 15:47:11 do liên kết liên quan đến Apple không chính xác – MA

Nhà văn về học máy, chuyên gia lĩnh vực tổng hợp hình ảnh con người. Cựu trưởng nhóm nội dung nghiên cứu tại Metaphysic.ai, cho đến khi nó được giải thể vào Brahma.ai của DNEG.
Portfolio site: martinanderson.ai
Contact: [email protected]